論文の概要: World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
- arxiv url: http://arxiv.org/abs/2608.09730v1
- Date: Mon, 10 Aug 2026 15:30:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.343756
- Title: World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
- Title(参考訳): World Tokens: トレーニング・タイム・ワールド・モデリングによる身体的政策の強化
- Abstract要約: 私たちはWorld Tokensを紹介します。World Adapterを中心に構築された、具体化されたポリシーアーキテクチャです。
World Tokensは視覚言語理解、ワールドダイナミックスモデリング、アクション生成を橋渡しする。
SIMPLEで報告された最高の平均値を取得し、一致したアクションのみのベースラインよりも実世界のR1 Proの成功を大幅に改善し、VLAレベルのレイテンシで各アクションチャンクを生成する。
- 参考スコア(独自算出の注目度): 29.442423651761107
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models are a widely adopted paradigm for embodied policies. They excel at efficient closed-loop control but do not explicitly model how physical scenes evolve as a task unfolds. Recently emerging world-action models (WAMs) leverage pretrained video world models to capture spatiotemporal evolution, yet retaining future generation or a large video backbone in the control loop substantially increases inference cost. We introduce World Tokens, an embodied policy architecture built around a World Adapter that bridges visual-language understanding, world-dynamics modeling, and action generation. It uses world modeling during training to enhance the action policy while preserving efficient deployment. Specifically, the World Adapter transforms VLM features into a fixed set of world tokens, which condition a jointly fine-tuned future-video denoiser and simultaneously serve as the action expert's sole visual-language context. This shared conditioning allows gradients from future-video denoising to directly shape the representation used for action prediction, while exclusive routing prevents the policy from bypassing that representation. At deployment, the world-model branch is removed, leaving only the VLM, World Adapter, and action expert, with no online video-model inference. With a 2B backbone and no embodied action pretraining, World Tokens is highly competitive on LIBERO, attains the best reported averages on SIMPLER, substantially improves real-world R1 Pro success over a matched action-only baseline, and generates each action chunk at VLA-level latency.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、具体化政策のパラダイムとして広く採用されている。
効率的なクローズドループ制御に優れるが、タスクが展開するにつれて物理的なシーンがどのように進化するかを明示的にモデル化しない。
近年の新興世界行動モデル(WAM)は、事前訓練されたビデオワールドモデルを活用して時空間進化を捉えるが、制御ループにおける将来の世代や大きなビデオバックボーンを維持することは、推論コストを大幅に増加させる。
我々は、視覚言語理解、世界力学モデリング、アクション生成を橋渡しするWorld Adapterを中心に構築された、具体化されたポリシーアーキテクチャであるWorld Tokensを紹介する。
トレーニング中にワールドモデリングを使用して、効率的なデプロイメントを維持しながらアクションポリシーを強化する。
具体的には、World Adapterは、VLMの機能を固定された世界トークンのセットに変換する。
この共有条件付けにより、将来のビデオからグラデーションがアクション予測に使用される表現を直接形作ることができ、一方排他的ルーティングは、ポリシーがその表現をバイパスするのを防ぐことができる。
デプロイ時に、ワールドモデルブランチは削除され、VLM、World Adapter、アクションエキスパートのみが残され、オンラインビデオモデル推論は行われない。
2Bバックボーンとエボデードアクション事前トレーニングがないため、World TokensはLIBEROで非常に競争力があり、SIMPLERで最高の報告された平均値に達し、マッチしたアクションのみのベースラインで実世界のR1 Proの成功を大幅に改善し、VLAレベルのレイテンシで各アクションチャンクを生成する。
関連論文リスト
- Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning [28.162567330430928]
我々は、視覚的観察、将来の状態、ハイレベルな決定、共有トークン空間内のエゴアクションを表す統合されたビジョンアクション世界政治フレームワークであるDiscrete-WAMを紹介する。
この離散的なアライメントに基づいて、離散WAMは、マルチタスクとマルチステージ事前トレーニングを通じて、ワールド・モデリング、ワールド・ポリティクス・モデリング、ポリシー・モデリングを共同で訓練する。
実験により、離散WAMは、制御可能な将来の生成、対実評価、サプライズベースのワールドモデル分析、効率的な並列ポリシー復号をサポートしながら、強い計画性能を達成することが示された。
論文 参考訳(メタデータ) (2026-06-04T03:16:31Z) - WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation [31.224842983083803]
航空VLNのための世界初の自己回帰的世界行動モデルであるWorldVLNを提案する。
WorldVLNは、短水平世界状態遷移を予測するために、遅延自己回帰ビデオバックボーンを適用する。
WorldVLNは、既存のVision-Language-Actionベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-15T13:55:39Z) - Learning Vision-Language-Action World Models for Autonomous Driving [15.103497388527943]
VLA(Vision-Language-Action)モデルは最近、エンドツーエンドの自動運転において顕著な進歩を遂げている。
VLAモデルは時相力学と世界整合性の明示的なモデリングを欠いていることが多い。
VLA-World(VLA-World)は、予測的想像力と反射的推論を統一する、シンプルで効果的なVLA世界モデルである。
論文 参考訳(メタデータ) (2026-04-10T07:38:05Z) - Action Images: End-to-End Policy Learning via Multiview Video Generation [70.67042168383638]
我々は、ポリシー学習をマルチビュービデオ生成として定式化する統合世界アクションモデルであるAction Imagesを提案する。
本モデルでは,従来のビデオ空間モデルに比べて,最強のゼロショット成功率を実現し,ビデオアクションジョイント生成品質を向上させる。
論文 参考訳(メタデータ) (2026-04-07T17:59:30Z) - GigaWorld-Policy: An Efficient Action-Centered World--Action Model [50.107640832046464]
GigaWorld-Policyはアクション中心のWAMで、2Dピクセルアクションのダイナミクスを学習し、オプションのビデオ生成で効率的なアクションデコーディングを可能にする。
実世界のロボットプラットフォームでの実験結果によると、GigaWorld-Policyは主要なWAMベースラインであるMotusの9倍高速で動作する。
論文 参考訳(メタデータ) (2026-03-18T00:52:02Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - Co-Evolving Latent Action World Models [57.48921576959243]
学習済みのビデオモデルを潜在アクションを介して制御可能な世界モデルに適応させることは、ジェネラリストの世界モデルを作成するための有望なステップである。
本稿では,この相乗的パラダイムを初めて実現したCoLA-Worldを提案する。
世界モデルは知識のある家庭教師として機能し、高品質のLAMを形成するための勾配を提供する。
論文 参考訳(メタデータ) (2025-10-30T12:28:40Z) - Latent Action Pretraining Through World Modeling [1.988007188564225]
自己教師型手法で模倣学習モデルを事前学習するためのモデルに依存しないフレームワークであるLAWMを提案する。
当社のフレームワークは,タスクや環境,実施環境の移動に有効であるように設計されています。
論文 参考訳(メタデータ) (2025-09-22T21:19:10Z) - Learning Primitive Embodied World Models: Towards Scalable Robotic Learning [50.32986780156215]
我々は,世界モデリングのための新しいパラダイム--Primitive Embodied World Models (PEWM)を提案する。
ビデオ生成を固定的な短地平線に制限することにより,ロボット行動の言語概念と視覚的表現の微妙なアライメントを可能にする。
我々のフレームワークは、きめ細かい物理的相互作用と高レベルの推論のギャップを埋め、スケーラブルで解釈可能で汎用的なインテリジェンスへの道を開く。
論文 参考訳(メタデータ) (2025-08-28T14:31:48Z) - iVideoGPT: Interactive VideoGPTs are Scalable World Models [70.02290687442624]
世界モデルは、現実の意思決定のために想像された環境の中で、モデルベースのエージェントを対話的に探索し、推論し、計画することを可能にする。
マルチモーダルな信号 – 視覚的観察,アクション,報酬 – を統合した,スケーラブルな自己回帰型トランスフォーマーフレームワークであるInteractive VideoGPTを導入する。
iVideoGPTは、高次元の視覚的観察を効率的に識別する新しい圧縮トークン化技術を備えている。
論文 参考訳(メタデータ) (2024-05-24T05:29:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。