論文の概要: Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models
- arxiv url: http://arxiv.org/abs/2608.05903v2
- Date: Fri, 07 Aug 2026 04:37:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.13004
- Title: Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models
- Title(参考訳): Robust-WAM:ワールド・アクション・モデルにおける生成的事前学習とセマンティック・フォレスト
- Authors: Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li,
- Abstract要約: 本稿では,ビデオジェネレータを用いたWAMのポストトレーニング手法であるRobust-WAMを提案する。
学習可能な問合せトークンを用いて、将来の接地木フレームのセマンティックフォアフォアに出力された隠れ状態を調整することで、未来のセマンティクスをアクションストリームに組み込む。
分布外一般化シミュレーションベンチマークおよび実ロボット設定実験により、ロバストWAMは分布内性能を犠牲にすることなく、複数のWAMベースラインの成功率を一貫して改善することを示した。
- 参考スコア(独自算出の注目度): 24.27863433568267
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mainstream World-Action Models (WAMs) adapt pretrained video generation models (VGMs) for robot control, transferring their learned dynamics prior for action prediction. These VGMs are typically trained in a variational autoencoder (VAE) latent space. However, the VAE latent space is optimized for pixel reconstruction, which rewards fine appearance detail and leaves the action prediction fragile under visual shifts. Recent works build WAMs in semantic latent space, which are more robust to appearance shifts. However, these models cannot leverage the large-scale VGM pretraining that exists only in VAE space. To overcome this dilemma, we propose Robust-WAM, a general post-training method for video-generation-based WAMs that preserves the VAE-based generative path and adds a lightweight semantic foresight alignment objective on the action stream. This retains the large-scale VGM pretraining while grounding actions in appearance-invariant dynamics that stay reliable under illumination shifts and other visual out-of-distribution conditions. Specifically, we employ learnable query tokens to bring future-scene semantics into the action stream by aligning their output hidden states with the semantic foresight of future ground-truth frames. To establish the temporal correspondence between each query and the future step it describes, we give it the positional encoding of the matching action tokens. Experiments on out-of-distribution generalization simulation benchmarks and a real-robot setup show that our Robust-WAM consistently improves the success rates of multiple WAM baselines without sacrificing in-distribution performance.
- Abstract(参考訳): メインストリーム・ワールド・アクション・モデル(WAM)は、ロボット制御に事前訓練されたビデオ生成モデル(VGM)を適用し、動作予測に先立って学習したダイナミクスを転送する。
これらのVGMは通常、変分オートエンコーダ(VAE)潜在空間で訓練される。
しかし、VAE潜伏空間はピクセル再構成に最適化されており、細かい外観の詳細を報酬し、視覚的なシフトの下でアクション予測の脆弱さを残している。
最近の研究は、セマンティック潜在空間でWAMを構築しており、外観シフトに対してより堅牢である。
しかし、これらのモデルは、VAE空間にのみ存在する大規模なVGM事前訓練を利用することはできない。
このジレンマを克服するために、VAEベースの生成経路を保存し、アクションストリームに軽量なセマンティック・フォレストアライメント目的を付加する、ビデオジェネレーションベースのWAMの一般的なポストトレーニング手法であるRobust-WAMを提案する。
これは、照明シフトやその他の視覚的アウト・オブ・ディストリビューション条件下で信頼性が保たれる外観不変の力学において、大規模なVGM事前訓練を継続する。
具体的には、学習可能なクエリトークンを用いて、将来的な地下構造フレームのセマンティックフォレストと、出力された隠れ状態とを一致させることで、未来のセマンティックスをアクションストリームに導入する。
各クエリとそれを記述する将来のステップの時間的対応を確立するために、一致するアクショントークンの位置的エンコーディングを与える。
分布外一般化シミュレーションベンチマークと実ロボット設定実験により、ロバストWAMは分布内性能を犠牲にすることなく、複数のWAMベースラインの成功率を一貫して改善することを示した。
関連論文リスト
- Native Video-Action Pretraining for Generalizable Robot Control [77.59831077077176]
LingBot-VA 2.0は、エンボディメントのためにゼロから構築されたビデオアクション基盤モデルである。
高周波推論の要求を満たすため,本モデルは疎いMOEバックボーンを用いる。
現実のデプロイメントは、堅牢な基盤モデルとしてLingBot-VA 2.0を検証する。
論文 参考訳(メタデータ) (2026-07-09T16:15:43Z) - Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models [58.191567345416836]
世界行動モデル(WAM)は、物理力学のモデリングによるロボット制御のための有望なパラダイムとして登場した。
HarmoWAMは、予測と反応の制御を統一するために世界モデルを完全に活用し、一般的なトランジットと正確な操作を可能にする。
実世界の6つのロボットタスクにまたがる3つのトレーニング未確認テスト環境を構築し、背景、位置、オブジェクトの意味のバリエーションをカバーした。
論文 参考訳(メタデータ) (2026-05-11T17:59:56Z) - DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA [72.9197085473598]
DIALはハイレベルな意思決定と低レベルなモーター実行を、差別化可能な潜在意図ボトルネックを通じてブリッジするフレームワークである。
VLMベースのSystem-2は、VLMのネイティブな特徴空間内で、潜伏した視覚的フォレストによって潜伏世界モデリングを行う。
軽量のSystem-1ポリシーでは、この予測された意図と現在の観測結果を正確にロボットの動作にデコードする。
論文 参考訳(メタデータ) (2026-03-31T15:02:27Z) - mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs [5.109732854501585]
そこで我々は,事前学習したインターネットスケールのビデオモデルと,その潜在表現に条件付けされたフローマッチングに基づくアクションデコーダを組み合わせた,新しいビデオ・アクション・モデル(VAM)を提案する。
提案手法は,シミュレーションおよび実世界のロボット操作タスクにおける最先端性能を実現し,サンプル効率を10倍,収束速度を2倍向上させる。
論文 参考訳(メタデータ) (2025-12-17T18:47:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。