論文の概要: FACT: Failure-Aware Causal Training for World-Action Models
- arxiv url: http://arxiv.org/abs/2608.10232v1
- Date: Mon, 10 Aug 2026 21:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.811712
- Title: FACT: Failure-Aware Causal Training for World-Action Models
- Title(参考訳): FACT:World-Action Modelの障害対応因果訓練
- Authors: Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang,
- Abstract要約: 最近の世界行動モデルでは、将来の予測と協調学習ポリシーは、アクション生成に物理的な優先順位を与える可能性がある。
FACTは,実行された行動に規定された今後の映像やタスクの進捗を予測する因果的ワールド・アクション・モデルである。
- 参考スコア(独自算出の注目度): 20.123306787874828
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent world-action models (WAMs) show that co-training policies with future prediction can provide physical priors for action generation. Building on the future-prediction ability of video models, many WAMs generate future videos and recover actions with inverse-dynamics models, or use these predicted videos as goal conditions for action generation. In both cases, the world model is trained mostly on successful demonstrations and has little reason to predict the consequences of bad actions. We introduce FACT, a causal World-Action Model that predicts future video and task progress conditioned on the executed action. This action-conditioned interface allows failure rollouts to supervise action consequences, turning bad actions into valid future targets rather than being discarded. Failure-aware training makes the progress predictor aware of both successful and failed action outcomes, which can optionally be used to score sampled action candidates at inference. Extensive experiments on simulation and real-world bimanual manipulation tasks show that FACT outperforms many existing baselines, improves as failure data are incorporated into training, and reduces success-biased future hallucination under bad actions. See more details at https://fact-wam.github.io/
- Abstract(参考訳): 近年の世界行動モデル (WAM) は、将来の予測と協調学習ポリシーが、アクション生成に物理的に先行する可能性を示唆している。
ビデオモデルの将来予測能力に基づいて、多くのWAMは将来のビデオを生成し、逆力学モデルでアクションを回復するか、あるいはこれらの予測されたビデオをアクション生成の目標条件として利用する。
どちらの場合も、世界モデルは主に成功事例に基づいて訓練されており、悪い行動の結果を予測する理由はほとんどない。
FACTは,実行された行動に規定された今後の映像やタスクの進捗を予測する因果的ワールド・アクション・モデルである。
このアクション条件のインターフェースは、障害のロールアウトによってアクションの結果を監視し、悪いアクションを破棄されるのではなく、有効な将来のターゲットに変える。
フェールアウェアトレーニングは、進捗予測器に成功と失敗の両方のアクション結果を認識する。
シミュレーションと実世界のバイマニュアル操作タスクに関する大規模な実験により、FACTは多くの既存のベースラインを上回り、障害データがトレーニングに組み込まれるにつれて改善され、悪行動による成功バイアスのある将来の幻覚を減らすことが示されている。
詳細はhttps://fact-wam.github.io/を参照してください。
関連論文リスト
- DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation [67.08835970838996]
強化学習は模倣学習の限界を超えてロボットポリシーを改善するための大きな約束である。
2つの重要な課題は、さまざまな障害データを大規模に取得し、スパース軌道レベルの成功ラベルを超えて、きめ細かい報酬信号を取得することである。
両課題に対処する高密度ロボット報酬モデルであるDenseRewardを紹介した。
論文 参考訳(メタデータ) (2026-07-14T17:59:29Z) - From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data [71.22409934108924]
人間のビデオは豊富で、豊富な相互作用を捉え、現実世界の操作に多様な意味と物理的な手がかりを提供する。
この調査は、人間のビデオがビジョン・ランゲージ・アクション(VLA)モデルの効果的な知識にどのように変換されるか、統一された視点を提供する。
この領域では、非構造化動画をトレーニング可能なエピソードに構造化すること、エンボディメントと視点の不均一性の下でロボットが実行可能なアクションにビデオから制御すること、現実世界の展開性能と転送効率をよりよく予測する評価プロトコルを設計すること、の3つのオープンな課題を強調している。
論文 参考訳(メタデータ) (2026-05-18T06:19:16Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - World Guidance: World Modeling in Condition Space for Action Generation [39.098315503589895]
アクション生成を容易にするために将来の観測モデルを活用することで、ビジョン・ランゲージ・アクション(VLA)モデルの能力を高めるための有望な道が提示される。
動作推論パイプラインに注入することで、将来の観測結果をコンパクトな条件にマッピングするフレームワークであるWoGを提案する。
この条件空間のモデル化と予測は, きめ細かな動作生成を促進するだけでなく, より優れた一般化能力を示すことを示す。
論文 参考訳(メタデータ) (2026-02-25T15:27:09Z) - Ego-centric Predictive Model Conditioned on Hand Trajectories [52.531681772560724]
自我中心のシナリオでは、次の行動とその視覚的結果の両方を予測することは、人間と物体の相互作用を理解するために不可欠である。
我々は,エゴセントリックなシナリオにおける行動と視覚的未来を共同でモデル化する,統合された2段階予測フレームワークを提案する。
我々のアプローチは、エゴセントリックな人間の活動理解とロボット操作の両方を扱うために設計された最初の統一モデルである。
論文 参考訳(メタデータ) (2025-08-27T13:09:55Z) - DiffAnt: Diffusion Models for Action Anticipation [12.022815981853071]
将来の行動を予測することは本質的に不確実である。現在進行中の行動を含む観察ビデオセグメントを考えると、複数の行動が確実に続く可能性がある。
本研究では, 予測行動の予測を生成的視点から再考し, 拡散モデルを用いて, 様々な将来的行動の予測を行う。
コードとトレーニングされたモデルはGitHubで公開される予定です。
論文 参考訳(メタデータ) (2023-11-27T16:40:09Z) - Learning the Effects of Physical Actions in a Multi-modal Environment [17.757831697284498]
大規模言語モデル(LLM)は、物理的コモンセンス情報を不十分に扱う。
本稿では,現実的な感覚入力のみから行動の結果を予測するマルチモーダルタスクを提案する。
マルチモーダルモデルでは、視覚情報で拡張した場合に、物理的なコモンセンスをキャプチャできることを示す。
論文 参考訳(メタデータ) (2023-01-27T16:49:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。