論文の概要: Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2610.00575v2
- Date: Mon, 05 Oct 2026 03:46:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.501109
- Title: Token-World: World Modeling in Vision-Language Model Token Space for Robot Manipulation
- Title(参考訳): トケンワールド:ロボット操作のための視覚言語モデルトケン空間における世界モデリング
- Abstract要約: Token-Worldは、VLM機能をコンパクトなトークン状態に圧縮するアクション条件の世界モデルである。
この縮小された空間で将来の力学を学習し、予測された状態が元の方針に向いた表現に戻る。
- 参考スコア(独自算出の注目度): 66.07387385688453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A common approach to world-model simulation for vision-language-action (VLA) systems is to predict future RGB observations and then re-encode them into policy inputs, introducing an indirect interface between simulation and downstream policy execution. We instead investigate whether world dynamics can be modeled in a compact, policy-oriented state derived from VLM visual tokens. A key challenge is that raw VLM visual tokens are high-dimensional, making efficient and accurate autoregressive dynamics modeling challenging. To address this, we introduce Token-World, an action-conditioned world model that compresses VLM features into a compact token state, learns future dynamics in this reduced space, and maps predicted states back to the original policy-facing representation for downstream use. Across manipulation benchmarks, Token-World improves open-loop feature fidelity and policy-action consistency over recent world-model simulators, with slower degradation over long rollout horizons. In closed-loop evaluation, its simulated policy performance correlates more strongly with reference policy performance than Ctrl-World ($r=0.794$ vs.\ $0.583$), while requiring lower simulation latency. Ablations further show that compact-representation design and dimensionality substantially affect future-state prediction. Code will be available at https://chuyaofu.github.io/Token-World/.
- Abstract(参考訳): VLAシステムにおける世界モデルシミュレーションの一般的なアプローチは、将来のRGB観測を予測し、それらをポリシー入力に再エンコードし、シミュレーションと下流ポリシー実行の間に間接的なインターフェースを導入することである。
代わりに、VLM視覚トークンから導かれるコンパクトでポリシー指向の状態で世界ダイナミクスをモデル化できるかどうかを検討する。
重要な課題は、生のVLM視覚トークンが高次元であり、効率的で正確な自己回帰力学モデリングを困難にしていることである。
そこで,本稿では,VLM機能をコンパクトなトークン状態に圧縮し,この縮小された空間で将来のダイナミクスを学習する行動条件付き世界モデルであるToken-Worldを紹介する。
操作ベンチマーク全体を通じて、Token-Worldは、最近のワールドモデルシミュレータよりもオープンループ機能の忠実さとポリシーアクションの一貫性を改善し、長期のロールアウト地平線上での劣化を遅くする。
クローズドループ評価では、シミュレートされたポリシー性能は、Ctrl-World(r=0.794$ vs.)よりも強い相関関係を持つ。
は0.583ドルだが、シミュレーションのレイテンシは低い。
アブレーションにより、コンパクト表現設計と次元性は将来の予測に大きく影響することが示された。
コードはhttps://chuyaofu.github.io/Token-World/.comで入手できる。
関連論文リスト
- GaussianDream++: Efficient 3D Gaussian World Modeling for Robotic Manipulation [55.47130289185285]
VLA(Vision-Language-Action)ポリシーは、高度な言語条件のロボット操作である。
我々は textbfWorld State Tokens と textbfWorld Prediction Tokens を VLA バックボーンに直接挿入する,コンパクトでポリシーネイティブな拡張である textbfMethodname を提示する。
論文 参考訳(メタデータ) (2026-08-26T11:41:55Z) - AWM-VLA: AlignedWorld Modeling for Efficient and Explainable Vision-Language-Action Policies [24.745715007832953]
AWM-VLAは拡散変圧器のポリシーに直接整列世界モデリングを組み込む。
RoboCasaとヒューマノイドテーブルトップ操作ベンチマークでは、AWM-VLAはVLA以前のベースラインとワールドモデルのベースラインを最大21%向上させる。
論文 参考訳(メタデータ) (2026-08-15T04:25:57Z) - GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning [28.596605555817032]
VLA(Vision-Language-Action)モデルは強力なロボット操作性能を実現するが、視覚や環境の変化によって劣化することが多い。
本稿では,VLA学習のための幾何学的な潜在世界モデリングフレームワークであるGWM-VLAを提案する。
論文 参考訳(メタデータ) (2026-08-07T06:41:51Z) - World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning [67.93052893044603]
本研究では,抽象的推論を伴う視覚的未来のシミュレーションを,モデルがどのように実行し,検証し,統合するかを考察する。
PF-OPSDは、教師側の特権的文脈としてのみ、地道な未来のビデオと回答を使用して、政治上の具体的な軌道を評価する。
論文 参考訳(メタデータ) (2026-06-02T13:07:49Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。