論文の概要: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
- arxiv url: http://arxiv.org/abs/2607.09185v1
- Date: Fri, 10 Jul 2026 08:20:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.427336
- Title: Causally Debiased Latent Action Model for Embodied Action Conditioned World Models
- Title(参考訳): 身体的行動条件付き世界モデルに対する因果脱バイアス潜時行動モデル
- Authors: Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang,
- Abstract要約: 行動条件付き世界モデル(ACWMs)は、身体的行動に基づく将来の観測をシミュレートすることを目的としている。
既存のLAMは、通常、再構築のみの目的で訓練される。
LAMベースのACWMのための因果脱バイアスフレームワークCD-LAMを提案する。
- 参考スコア(独自算出の注目度): 47.281442841934876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action-conditioned world models (ACWMs) aim to simulate future observations conditioned on embodied actions, offering a promising foundation for robot planning, policy evaluation, and data augmentation. However, learning controllable ACWMs requires large-scale action-labeled data, which remains costly to collect in the real world. Latent action models (LAMs) mitigate this bottleneck by inferring latent actions from unlabeled videos, but existing LAMs are typically trained with reconstruction-only objectives and therefore entangle action-relevant dynamics with action-irrelevant visual factors such as backgrounds and untouched objects. In this work, we identify this action-irrelevant bias as a key obstacle to controllable ACWMs and introduce evaluation metrics to measure latent-action bias, action following, and robustness. We propose CD-LAM, a causally debiased framework for LAM-based ACWMs. CD-LAM introduces three efficient fine-tuning objectives: embodiment-centric reconstruction, action-centric contrastive learning, and latent space calibration, which together encourage embodiment-focused, action-aware, and calibrated non-collapsed latent action representations. Experiments on 2B and 14B ACWM backbones show that CD-LAM substantially improves latent-action controllability, downstream robot-action following, visual fidelity, and adaptation efficiency, requiring only 6k fine-tuning steps and more than 12$\times$ fewer robot-action adaptation updates than the baseline.
- Abstract(参考訳): 行動条件付き世界モデル(ACWMs)は、ロボット計画、政策評価、データ拡張のための有望な基盤を提供する。
しかし、制御可能なACWMの学習には大規模なアクションラベルデータが必要である。
潜在アクションモデル(LAM)は、ラベルのないビデオから潜在アクションを推論することで、このボトルネックを軽減するが、既存のLAMは、通常、再構成のみの目的で訓練されるため、バックグラウンドや未修正オブジェクトのようなアクション非関連視覚要素と、アクション関連ダイナミクスを絡ませる。
本稿では、この行動非関連バイアスを制御可能なACWMの鍵となる障害として認識し、潜在動作バイアス、行動追従、堅牢性を測定するための評価指標を導入する。
LAMベースのACWMのための因果脱バイアスフレームワークCD-LAMを提案する。
CD-LAMは、エンボディメント中心の再構築、アクション中心のコントラスト学習、潜在空間キャリブレーションという、3つの効率的な微調整の目的を導入している。
2Bと14B ACWMのバックボーンでの実験では、CD-LAMは潜時動作制御性、下流ロボット動作追従、視覚的忠実度、適応効率を大幅に改善し、6kの微調整ステップしか必要とせず、ベースラインよりも12$\times$より少ないロボット動作適応更新が必要である。
関連論文リスト
- ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - Delta-JEPA: Learning Action-Sensitive World Models via Latent Difference Decoding [25.77502065015808]
計画のためのビジュアルワールドモデルを学ぶには、アクションに敏感なコンパクトな潜伏ダイナミクスが必要である。
我々は、遅延差分動作デコーダ(LDAD)を用いて、潜時予測を増強する、エンドツーエンドの復元自由世界モデルであるDelta-JEPAを提案する。
LDADは連続観察間の潜伏変位から実行された動作を再構築する。
論文 参考訳(メタデータ) (2026-06-30T07:08:24Z) - Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model [15.646017114869169]
アクション・コンディショニングは、アクション・コンディショナード・ワールド・モデルでは未発見のままである。
本稿では,グローバル圧縮ではなく構造化プロセスとして動作条件を扱うDexACを提案する。
セマンティックブランチとDexACを組み合わせることで、FID、FVD、PCKが大幅に向上し、視覚的時間的リアリズムと行動追従一貫性が向上することを示す。
論文 参考訳(メタデータ) (2026-06-25T17:36:35Z) - RotVLA: Rotational Latent Action for Vision-Language-Action Model [54.22746299071677]
本稿では,連続的な回転潜在動作表現に基づくVLAフレームワークであるRotVLAを紹介する。
潜在作用はSO(n) の元としてモデル化され、連続性、構成性、および実世界の作用力学と整合した構造的幾何学を提供する。
RotVLAはVLMバックボーンとフローマッチングアクションヘッドで構成される。
論文 参考訳(メタデータ) (2026-05-13T11:58:02Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - ResWM: Residual-Action World Model for Visual RL [0.06999740786886534]
生の視覚観測から予測的世界モデルを学ぶことは強化学習(RL)の中心的課題である
ResWM(Residual-Action World Model、Residual-Action World Model)は、制御変数を絶対作用から残留作用に再構成する新しいフレームワークである。
ResWMはより安定的でエネルギー効率のよい行動軌跡を生み出す。
論文 参考訳(メタデータ) (2026-03-11T11:27:08Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - ActionSink: Toward Precise Robot Manipulation with Dynamic Integration of Action Flow [93.00917887667234]
本稿では,アクション推定のための新しいロボット操作フレームワークであるActionSinkを紹介する。
その名前が示すように、ActionSinkは、アクションフローと呼ばれるビデオからのアクション起因の光学フローとして、ロボットのアクションを再構成する。
我々のフレームワークは,LIBEROベンチマークのSOTAよりも7.9%向上し,長軸視覚課題LIBERO-Longの精度は8%近く向上した。
論文 参考訳(メタデータ) (2025-08-05T08:46:17Z) - Object-Centric Latent Action Learning [70.3173534658611]
本稿では,画素ではなくオブジェクトを対象とする,オブジェクト中心の潜在動作学習フレームワークを提案する。
我々は、自己教師対象中心の事前学習を利用して、行動関連や注意をそらすダイナミクスを歪めている。
その結果, 物体中心の事前学習は, トラクタの負の効果を50%軽減することがわかった。
論文 参考訳(メタデータ) (2025-02-13T11:27:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。