論文の概要: FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
- arxiv url: http://arxiv.org/abs/2607.13017v1
- Date: Tue, 14 Jul 2026 17:57:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.244506
- Title: FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
- Title(参考訳): FlowWAM:世界行動モデルのための統一行動表現としての光フロー
- Abstract要約: FlowWAMは、光フローを統合されたビデオネイティブなアクション表現として採用する、デュアルストリーム拡散フレームワークである。
ポリシーモードでは、FlowWAMはアクション予測のためのフローを生成し、ワールドモデルモードでは、将来のビデオ生成を誘導するためにターゲットフローシーケンスを使用する。
私たちは、フローベースのアクション表現が両方のモードで利得をもたらすことを経験的に見つけました。
- 参考スコア(独自算出の注目度): 24.702798568753895
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) are able to leverage pretrained video generators for both world modeling and action prediction. However, directly leveraging such video generators for control raises a new challenge: how to represent actions in a suitable form that aligns with pretrained video generators while carrying enough motion cues for accurate control. Existing numerical actions fail to satisfy the former, and prior visual action representations overlook the temporal motion structure across frames. We address this issue with FlowWAM, a dual-stream diffusion framework that adopts optical flow as a unified, video-native action representation. Flow videos share the same format as RGB videos and encode rich per-pixel displacement. By jointly modeling them within a shared pretrained video generator, FlowWAM can naturally implement two modes of WAMs. In policy mode, FlowWAM generates flow for action prediction, while in world-model mode, it uses target flow sequences to guide future video generation. Moreover, since flow can be easily extracted from raw videos without action labels, FlowWAM can leverage large-scale action-unlabeled video datasets for pretraining. We empirically find that our flow-based action representation delivers gains across both modes. On RoboTwin manipulation, FlowWAM raises the success rate to 92.94% on the Clean setting and 92.14% on Random, outperforming both VLA and WAM baselines. On WorldArena world modeling, it achieves the best overall EWMScore (63.71) with an 18.4% relative improvement in trajectory accuracy. More results can be found on our project website: https://flow-wam.github.io .
- Abstract(参考訳): World Action Models (WAM) は、ワールドモデリングとアクション予測の両方に事前訓練されたビデオジェネレータを利用することができる。
しかし、このようなビデオジェネレータを直接制御するためには、事前訓練されたビデオジェネレータと整合した適切な形式でアクションを表現し、正確な制御に十分なモーションキューを運べばよいという、新たな課題が生じる。
既存の数値的行動は前者を満たすことができず、前者の視覚的行動表現はフレーム間の時間的動き構造を見渡せる。
本稿では,光フローを映像ネイティブなアクション表現として利用した2ストリーム拡散フレームワークであるFlowWAMでこの問題に対処する。
フロービデオはRGBビデオと同じフォーマットを共有し、ピクセルあたりのリッチな変位をエンコードする。
共有事前訓練されたビデオジェネレータ内でそれらを共同でモデリングすることで、FlowWAMは自然に2つのWAMモードを実装することができる。
ポリシーモードでは、FlowWAMはアクション予測のためのフローを生成し、ワールドモデルモードでは、将来のビデオ生成を誘導するためにターゲットフローシーケンスを使用する。
さらに、フローはアクションラベルなしで生のビデオから簡単に抽出できるため、FlowWAMは大規模なアクション未ラベルのビデオデータセットを事前トレーニングに活用することができる。
私たちは、フローベースのアクション表現が両方のモードで利得をもたらすことを経験的に見つけました。
RoboTwinの操作では、FlowWAMはクリーンな設定で92.94%、ランダムで92.14%まで上昇し、VLAとWAMのベースラインを上回ります。
WorldArenaの世界モデリングでは、軌道精度が18.4%向上したEWMScore (63.71) が最高である。
さらなる結果は、プロジェクトのWebサイト(source)で見ることができる。
関連論文リスト
- FlowC2S: Flowing from Current to Succeeding Frames for Fast and Memory-Efficient Video Continuation [4.429835955129622]
本稿では,高速かつメモリ効率のよい連続映像を生成するための新しい手法を提案する。
提案手法はFlowC2Sと呼ばれ,既存のビデオチャンク間のベクトル場を学習するために,事前学習したテキスト・ビデオフローモデルを微調整する。
論文 参考訳(メタデータ) (2026-04-19T21:38:21Z) - FlowMotion: Training-Free Flow Guidance for Video Motion Transfer [18.173266059962845]
ビデオモーション転送は、新しいシーンをレンダリングしながら、ソースビデオから動画パターンを継承するターゲットビデオを生成することを目的としている。
既存のトレーニングフリーアプローチは、事前訓練されたT2Vモデルの中間出力に基づいて、モーションガイダンスを構築することに重点を置いている。
本稿では,高速かつフレキシブルな動き伝達を可能にする新しいトレーニングフリーフレームワークであるFlowMotionを紹介する。
論文 参考訳(メタデータ) (2026-03-06T13:48:01Z) - Transition Matching Distillation for Fast Video Generation [63.1049790376783]
本稿では,ビデオ拡散モデルを効率の良い数ステップ生成器に蒸留するための新しいフレームワークであるTransition Matching Distillation (TMD)を提案する。
TMDは拡散モデルの多段階認知軌道と数段階の確率遷移過程とを一致させる。
TMDは、生成速度と視覚的品質の間の柔軟性と強力なトレードオフを提供する。
論文 参考訳(メタデータ) (2026-01-14T21:30:03Z) - NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows [75.70583906344815]
拡散モデルは、複雑なマルチモーダルな動作分布をモデル化できるため、アクションデコーダとして広く採用されている。
我々は、Vision-Language-Action(VLA)モデルのための拡散型デコーダの高速かつ表現性の高い代替品であるNinAを提案する。
論文 参考訳(メタデータ) (2025-08-23T00:02:15Z) - Taming generative video models for zero-shot optical flow extraction [28.176290134216995]
将来のフレーム予測のためにのみ訓練された自己教師付きビデオモデルは、微調整なしで、出力フローを誘導することができる。
対実世界モデル(CWM)パラダイムに触発されて、我々はこのアイデアを生成型ビデオモデルに拡張する。
KLトラシング(KL-tracing)は、局所摂動を第1フレームに注入し、モデルを第1ステップでロールアウトし、摂動分布と非退化予測分布の間のクルバック・リーブラー分岐を計算する、新しいテストタイムプロシージャである。
論文 参考訳(メタデータ) (2025-07-11T23:59:38Z) - EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models [73.96414072072048]
既存の動き伝達法は、ガイド生成のための参照ビデオの動作表現を探索した。
本稿では,ビデオモーション転送のための新しい,効率的なエンドツーエンドフレームワークであるEfficientMTを提案する。
我々の実験は, フレキシブルな動作制御性を維持しつつ, 既存の手法よりも効率が良いことを示した。
論文 参考訳(メタデータ) (2025-03-25T05:51:14Z) - Improving Video Generation with Human Feedback [105.81833319891537]
我々は,人間のフィードバックを利用して映像生成問題を緩和するシステムパイプラインを開発した。
我々は,多次元ビデオ報酬モデルであるVideoRewardを紹介し,アノテーションと様々なデザイン選択が報奨効果に与える影響について検討する。
論文 参考訳(メタデータ) (2025-01-23T18:55:41Z) - Generalizable Implicit Motion Modeling for Video Frame Interpolation [51.966062283735596]
フローベースビデオフレーム補間(VFI)における動きの重要性
本稿では,動きモデリングVFIの新規かつ効果的なアプローチである一般インプリシット・モーション・モデリング(IMM)を紹介する。
我々のGIMMは、正確にモデル化された動きを供給することによって、既存のフローベースVFIワークと容易に統合できる。
論文 参考訳(メタデータ) (2024-07-11T17:13:15Z) - EAN: Event Adaptive Network for Enhanced Action Recognition [66.81780707955852]
本稿では,映像コンテンツの動的性質を調査するための統合された行動認識フレームワークを提案する。
まず、局所的な手がかりを抽出する際に、動的スケールの時空間カーネルを生成し、多様な事象を適応的に適合させる。
第2に、これらのキューを正確にグローバルなビデオ表現に集約するために、トランスフォーマーによって選択されたいくつかの前景オブジェクト間のインタラクションのみをマイニングすることを提案する。
論文 参考訳(メタデータ) (2021-07-22T15:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。