論文の概要: Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies
- arxiv url: http://arxiv.org/abs/2609.24682v2
- Date: Tue, 22 Sep 2026 03:02:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.006976
- Title: Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies
- Title(参考訳): まるでVLAのような世界モデル:世界モデル表現を小型ロボットに置き換える
- Abstract要約: 将来の前進は意思決定に数秒かかり、制御ループから除外する。
世界モデルが物理的シーンについて知っていることは、その内部的な特徴の中にあり、未来を生み出すことは、それらを生み出した目的に過ぎない。
凍結した世界モデルはトレーニングフレーム上で一度実行され、キャッシュされるので、学生はそのキャッシュに同意することを学びます。
- 参考スコア(独自算出の注目度): 32.5742452083821
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models map observations to actions with no objective that accounts for how the world responds, so their robustness is bounded primarily by data coverage. World models carry precisely that missing objective and are better grounded for it, yet rolling the future forward costs seconds per decision and rules them out of the control loop. We show the two can be separated. What a world model knows about physical scenes lives in its internal features; generating the future is merely the objective that produced them, so the grounding can be inherited while the generative machinery is left behind. We add one feature-alignment term to ordinary VLA training: a frozen world model is run over the training frames once and cached, and the student learns to agree with that cache. No teacher is loaded during training, the projector is discarded after it, and the deployed policy is identical to the undistilled baseline, running in 32ms and 1.86GB on a consumer RTX5090, so every gain is attributable to the representation rather than to added capacity or test-time compute. A 0.8B student reaches 97.9% on LIBERO, improves from 48.2% to 50.5% on RoboCasa-GR1 humanoid manipulation, and the same objective carries over to real hardware, on both a single-arm and a bimanual platform. The gain survives changes of student scale, backbone, alignment layer, and teacher, indicating a broad representational prior rather than a fragile alignment between two particular networks. Project page: https://thaw-vla.trung-dt.com/.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、世界がどのように反応するかを考慮せずに、観測結果を行動にマッピングする。
世界モデルは、その目標を正確に満たし、それに対してより根ざしていますが、将来は意思決定に数秒かかり、それらを制御ループから除外します。
2つを分離できることを示す。
世界モデルが物理シーンについて知っていることは、その内部的な特徴の中にあり、未来を生み出すことは、それらを生み出す目的に過ぎないため、生成機械が残されている間に基盤を継承することができる。
凍結した世界モデルはトレーニングフレーム上で一度実行され、キャッシュされるので、学生はそのキャッシュに同意することを学びます。
訓練中に教師はロードされず、プロジェクターは後に破棄され、デプロイされたポリシーは32msと1.86GBのコンシューマRTX5090で動作する未蒸留のベースラインと同一であるため、すべての利得は、追加のキャパシティやテストタイム計算ではなく、表現に起因する。
0.8Bの学生は、LIBEROで97.9%に達し、RoboCasa-GR1のヒューマノイド操作で48.2%から50.5%に改善され、同じ目的がシングルアームとバイマニュアルプラットフォームの両方で実際のハードウェアに受け継がれている。
この利得は、学生の規模、バックボーン、アライメント層、教師の変化に残り、2つの特定のネットワーク間の脆弱なアライメントよりも、より広い表現性を示す。
プロジェクトページ: https://thaw-vla.trung-dt.com/
関連論文リスト
- StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models [37.45050514108603]
本稿では,検索した1つのデモを条件付けして,テスト時に適応するフレームワークであるStellaVLAを紹介する。
自動オフラインパイプラインは、各生の軌跡を、例えばタスクプラン、サブゴール記述、言語化された3Dモーションなどの構造化されたデモに変換する。
並列な二重訓練設計は、この推論を共同行動および言語目的を通じて内部化し、推論はアクションエキスパートのみを使用する。
論文 参考訳(メタデータ) (2026-08-12T05:30:53Z) - Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments [53.85970147743299]
専門家によるデモンストレーションは、ロボット模倣学習における金の標準であると広く考えられている。
しかし、挿入、積み重ね、アライメントなどのきめ細かい操作のために、私たちは直感的な失敗モードを発見しました。
視覚言語モデルとアクションエキスパートをブリッジする,コンパクトな動的特徴であるSTAIRを導入する。
論文 参考訳(メタデータ) (2026-06-14T04:15:29Z) - World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis [37.19737492128721]
我々は,新しい基礎モデルのクラスとして,世界言語アクションモデルを提案する。
WLAはテキストのインストラクション、画像、ロボットステートを入力として、テキストのサブタスク、サブゴールイメージ、ロボットアクションを共同で予測する。
We show that WLA-0 achieve a state-of-the-the-art multi-task and long-horizon learning abilities、例えば、RoboTwin2.0 Clean の92.94%、RMBench の56.5%の成功率。
論文 参考訳(メタデータ) (2026-06-04T10:23:01Z) - Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds [11.056626934546507]
本研究では,3次元世界生成モデルを活用することで,一般性を犠牲にすることなく,省力で視覚言語モデルを微調整できることを示す。
生成したディジタルツインの品質によって実現されたシミュレート・トゥ・リアルトランスファーを実証した。
論文 参考訳(メタデータ) (2026-03-19T06:22:11Z) - Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation [58.21084913574353]
我々は,世界力学を暗黙的に理解したVLAモデルを実現するシンプルなアプローチであるPri4Rを紹介する。
Pri4Rは3Dトラックを予測する軽量なポイントトラックヘッドでVLAを強化している。
3Dポイントトラック予測は,アクションワールドダイナミクスを学習するための効果的な監視対象であることを示す。
論文 参考訳(メタデータ) (2026-03-02T07:23:53Z) - World Action Models are Zero-shot Policies [111.91938055103633]
本稿では,予めトレーニングされたビデオ拡散バックボーン上に構築されたワールドアクションモデル(WAM)であるDreamZeroを紹介する。
ビデオとアクションを共同でモデリングすることで、DreamZeroは異種ロボットデータから多様なスキルを効果的に学習する。
ビデオのみによる他のロボットや人間によるデモは、目に見えないタスクのパフォーマンスに対して42%以上の相対的な改善をもたらす。
論文 参考訳(メタデータ) (2026-02-17T15:04:02Z) - GigaBrain-0.5M*: a VLA That Learns From World Model-Based Reinforcement Learning [44.63316677431278]
我々は、世界モデルに基づく強化学習を通して訓練されたVLAモデルである textitGigaBrain-0.5M* を提案する。
textitGigaBrain-0.5M*はTextitGigaBrain-0.5上に構築されている。
論文 参考訳(メタデータ) (2026-02-12T15:55:19Z) - World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy [55.03832008486675]
World-VLA-Loopは、世界モデルとVision-Language-Action (VLA) ポリシーの共同改良のためのクローズドループフレームワークである。
本研究では,将来観測と報奨信号の同時予測により,高忠実度インタラクティブシミュレータとして機能する状態認識型ビデオワールドモデルを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:57:55Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。