論文の概要: Overcoming Statistical Bias in Action-Controllable World Models
- arxiv url: http://arxiv.org/abs/2608.04653v1
- Date: Wed, 05 Aug 2026 10:10:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.820047
- Title: Overcoming Statistical Bias in Action-Controllable World Models
- Title(参考訳): 行動制御可能な世界モデルにおける統計的バイアスの克服
- Authors: Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu,
- Abstract要約: アクション条件付き世界モデルは、エージェントのアクションの下で視覚環境がどのように進化するかを予測することを目的としている。
将来のフレームは、しばしば視覚的慣性や反復的な動きパターンから非常に予測可能である。
アクション制御性を高めるために,CoCoという対実整合性フレームワークを紹介した。
- 参考スコア(独自算出の注目度): 18.890337378174678
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Action-conditioned world models aim to predict how visual environments evolve under an agent's actions. Yet future frames are often highly predictable from visual inertia and recurring motion patterns alone. This creates a shortcut: models can fit the data by exploiting statistical biases without making their visible dynamics meaningfully depend on the action. As a result, different actions may produce similar futures, while motion may persist even under zero action. The key question is how to reduce reliance on statistical shortcuts from dominating action-conditioned prediction. We argue that action control requires more than injecting action features; it requires enforcing consistency under counterfactual changes to actions and observations. Based on this insight, we introduce CoCo, a Counterfactual Consistency framework to enhance action controllability through two complementary constraints. Multi-step counterfactual consistency constrains reference, inverse-action, and zero-action rollouts, while action-spatial counterfactual consistency enforces consistent predictions under mirrored scenes and transformed actions. Together, they reduce reliance on statistical shortcuts from substituting for action-dependent dynamics. We further introduce Action Response Consistency (ARC) and Drift Energy (DE) to assess action controllability, together with Mini-SSMB for same-state, multi-action counterfactual evaluation. On Mini-SSMB, our full model achieved ARC_inv of 0.412 and ARC_ref of 0.483, while reducing DE by 17.07% relative to the baseline. On VP2 visual planning, it achieves the highest average success rate among SOTA models, at 73.1%. Experiments on BAIR and RoboNet further show that these gains preserve video prediction quality and transfer across model settings.
- Abstract(参考訳): アクション条件付き世界モデルは、エージェントのアクションの下で視覚環境がどのように進化するかを予測することを目的としている。
しかし、将来のフレームは、視覚的慣性や反復的な動きパターンから、しばしば非常に予測可能である。
モデルは統計バイアスを利用してデータに適合し、目に見えるダイナミクスをアクションに有意義に依存させることなく、そのデータに適合する。
結果として、異なるアクションは同様の未来を生み出すが、動きはゼロアクションでも持続する。
重要な問題は、統計的ショートカットへの依存を、行動条件付き予測の優位性から減らすかである。
我々は、アクション制御はアクション特徴を注入する以上のものを必要とし、アクションや観察に反実的な変化の下で一貫性を強制する必要があると主張している。
この知見に基づいて,2つの相補的制約を通した動作制御性を高めるための相互整合性フレームワークであるCoCoを紹介する。
マルチステップの反ファクト的一貫性は参照、逆作用、ゼロアクションのロールアウトを制約し、アクション空間的反ファクト的一貫性はミラー化されたシーンと変換されたアクションの下で一貫した予測を強制する。
同時に、統計的ショートカットへの依存を、アクション依存力学の代用から軽減する。
さらに,動作制御性を評価するためにARC(Action Response Consistency)とDE(Drift Energy)を導入する。
Mini-SSMBでは, ARC_invが0.412, ARC_refが0.483, DEが17.07%削減された。
VP2のヴィジュアルプランニングでは、SOTAモデルの平均成功率は73.1%である。
BAIRとRoboNetの実験では、これらの向上により、ビデオ予測の品質とモデル設定間の転送が維持されることが示された。
関連論文リスト
- Causally Debiased Latent Action Model for Embodied Action Conditioned World Models [47.281442841934876]
行動条件付き世界モデル(ACWMs)は、身体的行動に基づく将来の観測をシミュレートすることを目的としている。
既存のLAMは、通常、再構築のみの目的で訓練される。
LAMベースのACWMのための因果脱バイアスフレームワークCD-LAMを提案する。
論文 参考訳(メタデータ) (2026-07-10T08:20:27Z) - SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation [73.2142090645987]
SC3-Evalは、事前訓練されたビデオ基盤モデルを正確なポリシー評価器に適合させる自己一貫性のあるビデオ生成レシピである。
SC3-Evalロールアウトは、実世界のロールアウトでポリシーが示す障害モードを再現し、詳細な診断比較をサポートする。
論文 参考訳(メタデータ) (2026-06-17T02:15:46Z) - Feedback World Model Enables Precise Guidance of Diffusion Policy [36.965417653906535]
本稿では,推定時刻における予測と観測のループを閉じる新たなパラダイムであるフィードバック・ワールド・モデルを提案する。
本手法は,分布シフト時の予測精度とポリシー性能を大幅に向上することを示す。
特に、世界モデルの予測誤差を最大76.4%削減し、アウト・オブ・ディストリビューション(OOD)の成功率を30%改善する。
論文 参考訳(メタデータ) (2026-05-15T07:52:13Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models [28.165928090888986]
世界行動モデル(WAM)は、将来の観察と行動を予測することにより、想像上のロールアウトを通じて意思決定を可能にする。
動作状態の整合性、予測された動作と誘導された状態遷移の整合性を、WAMの信頼性の欠如の軸として同定する。
テスト時間選択のための価値のないコンセンサス戦略を導入し、予測される未来間での合意によって、候補のロールアウトをランク付けする。
論文 参考訳(メタデータ) (2026-05-08T09:44:43Z) - World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - ResWM: Residual-Action World Model for Visual RL [0.06999740786886534]
生の視覚観測から予測的世界モデルを学ぶことは強化学習(RL)の中心的課題である
ResWM(Residual-Action World Model、Residual-Action World Model)は、制御変数を絶対作用から残留作用に再構成する新しいフレームワークである。
ResWMはより安定的でエネルギー効率のよい行動軌跡を生み出す。
論文 参考訳(メタデータ) (2026-03-11T11:27:08Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。