論文の概要: DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models
- arxiv url: http://arxiv.org/abs/2607.25918v1
- Date: Tue, 28 Jul 2026 16:08:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.914669
- Title: DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models
- Title(参考訳): DC-WAM:ワールド・アクション・モデルのためのダイナミック・センター・ビジュアル・スーパービジョンと推論
- Abstract要約: World-Action Modelsは将来の視覚的予測でロボットポリシーを強化する。
視覚的モダリティが制御のために何を学ぶべきかは、いまだに不明である。
本稿では,RGBビデオブランチの監視と計算を再配布する動的中心型WAMフレームワークであるDC-WAMを提案する。
- 参考スコア(独自算出の注目度): 5.7283505332640985
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World-Action Models (WAMs) augment robot policies with future visual prediction, but it remains unclear what the visual modality should learn for control. While photorealistic future prediction provides dense supervision, it also incurs substantial computation and can allocate capacity to texture, illumination, and background variations that are only weakly related to action selection. Recent efficient WAM variants suggest that the main benefit of the video branch may not lie in the rendered future itself, but in the control-relevant visual representations induced during training. In this work, we revisit future video prediction from a dynamic-centric perspective and ask whether an existing RGB-based WAM can be redirected from appearance-dominated reconstruction toward interaction-induced visual dynamics without introducing additional modality-specific predictions or online inputs at deployment. We propose DC-WAM, a dynamic-centric WAM framework that redistributes supervision and computation in the RGB video branch. At the supervision level, DC-WAM combines temporal-difference flow matching with trajectory-guided weighting, emphasizing dense temporal changes and localized regions where the gripper, manipulated objects, and contact areas move. At the reasoning level, DynaRoute predicts token-wise dynamic relevance and converts it into an attention bias, guiding the model toward control-relevant future tokens. Experiments in simulation and on real-world manipulation tasks show that DC-WAM consistently improves policy performance, especially under out-of-distribution perturbations in lighting, object appearance, and background texture.
- Abstract(参考訳): World-Action Models (WAMs) は将来の視覚的予測でロボットのポリシーを強化するが、制御のために視覚的モダリティが何を学べるかは未だ不明である。
フォトリアリスティックな未来の予測は、密集した監視を提供するが、それと同時に相当な計算を行い、行動選択と弱い関係しか持たないテクスチャ、照明、背景の変化にキャパシティを割り当てることができる。
近年の効率的なWAM変種は、ビデオブランチの主な利点は、レンダリングされた未来そのものではなく、トレーニング中に誘導される制御関連視覚表現にあることを示唆している。
本研究では、動的中心的な視点から将来の映像予測を再考し、既存のRGBベースのWAMを、追加のモダリティ特異的な予測やオンラインインプットを導入することなく、外観に支配された視覚的ダイナミクスにリダイレクトできるかどうかを問う。
本稿では,RGBビデオブランチの監視と計算を再配布する動的中心型WAMフレームワークであるDC-WAMを提案する。
監督レベルでは、DC-WAMは時間差流と軌跡誘導重み付けを組み合わせ、密集時間変化とグリップ、操作対象、接触領域が移動する局所化領域を強調する。
推論レベルでは、DynaRouteはトークンのダイナミックな関連性を予測し、それを注意バイアスに変換し、制御関連の将来のトークンに向けてモデルを導く。
シミュレーションおよび実世界の操作タスクにおける実験により、DC-WAMは、特に照明、オブジェクトの外観、背景テクスチャにおける分布外摂動の下で、ポリシー性能を一貫して改善することが示された。
関連論文リスト
- Foresight Without Seeing: Latent Futures for World Action Models [31.423405133926334]
本稿では,動的条件付き直接政治WAMであるForeWAMを提案する。
また、凍結した潜伏行動教師が指導するダイナミクスを導入し、物体の動きや接触変化、タスクの進行といった相互作用によって引き起こされる遷移を、暗黙の未来の状態が捉えることを奨励する。
ロボットデータの事前トレーニングがなければ、ForeWAMの標準版と加速版は平均96.7%、LIBEROは96.9%である。
論文 参考訳(メタデータ) (2026-08-12T03:27:43Z) - Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models [24.27863433568267]
本稿では,ビデオジェネレータを用いたWAMのポストトレーニング手法であるRobust-WAMを提案する。
学習可能な問合せトークンを用いて、将来の接地木フレームのセマンティックフォアフォアに出力された隠れ状態を調整することで、未来のセマンティクスをアクションストリームに組み込む。
分布外一般化シミュレーションベンチマークおよび実ロボット設定実験により、ロバストWAMは分布内性能を犠牲にすることなく、複数のWAMベースラインの成功率を一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-08-06T11:31:56Z) - Self-Supervised Learning of Structured Dynamics from Videos [76.23834498074805]
予め訓練した画像ビジョン変換器の凍結した特徴から、構造化された動き表現を復元できるかどうかを検討する。
本研究では、時間変化の主源を残留力学から明確に分離する構造ダイナミクスモデル(SDM)を提案する。
ProbeMotionのSDMは、カメラモーション、オブジェクトモーション、複合ダイナミクスを備えた合成ビデオと実ビデオにまたがる新しい評価スイートである。
論文 参考訳(メタデータ) (2026-07-23T17:55:07Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models [46.94937828558026]
政策最適化により映像アクションモデルにおける視覚力学を直接改善する後学習フレームワークであるVAMPOを提案する。
私たちのキーとなるアイデアは、シーケンシャルな決定プロセスとしてマルチステップの認知を定式化し、専門家の視覚力学上で定義された認知の報酬を最適化することです。
多様なシミュレートされた実世界の操作タスクにまたがって、VAMPOはタスク関連視覚力学を改善し、より下流でのアクション生成とより強力な一般化をもたらす。
論文 参考訳(メタデータ) (2026-03-19T18:04:03Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z) - DynaRend: Learning 3D Dynamics via Masked Future Rendering for Robotic Manipulation [52.136378691610524]
本稿では、3次元認識と動的インフォームド三面体特徴を学習する表現学習フレームワークDynaRendを紹介する。
マルチビューRGB-Dビデオデータに基づく事前トレーニングにより、DynaRendは空間幾何学、将来のダイナミクス、タスク意味を統合された三面体表現で共同でキャプチャする。
我々は、RLBenchとColosseumという2つの挑戦的なベンチマークでDynaRendを評価し、政策成功率、環境摂動の一般化、様々な操作タスクにおける実世界の適用性などを大幅に改善した。
論文 参考訳(メタデータ) (2025-10-28T10:17:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。