論文の概要: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning
- arxiv url: http://arxiv.org/abs/2607.02865v1
- Date: Fri, 03 Jul 2026 02:08:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:21:20.62654
- Title: DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning
- Title(参考訳): DREAMSTEER:後期世界モデルは、どんな微調整もせずに、デプロイ中にVLAポリシーをステアリングできる
- Authors: Hanchen Cui, Sergio Arnaud, Arjun Majumdar, Daniel Dugas, Elie Aljalbout, Karthik Desingh, Krishna Murthy Jatavallabhula, Franziska Meier,
- Abstract要約: DREAMSTEERは、事前訓練された視覚言語アクション(VLA)ポリシーのためのデプロイメント時ステアリングフレームワークである。
Ileverageは、遅れた世界モデルと価値モデルを使って、事前訓練されたVLAポリシーを操縦する。
タスク成功率を 23.75% から 66.25% に改善し、命令追従精度を 38.75% から 56.25% に改善する。
- 参考スコア(独自算出の注目度): 19.23819338884138
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained vision-language-action (VLA) policies show promising zero-shot generalization, but often fail under deployment-time distribution shift, leading to decreased robustness and inconsistent instruction following. While prior work commonly tackles this by finetuning on in-distribution data, it assumes demonstrations collected on tasks in the target environment. In this work, we propose DREAMSTEER, a deployment-time steering framework for pretrained VLAs without any finetuning or parameter modifications. The key insight in DREAMSTEER is to leverage a latent world model and a value model to steer pretrained VLA policies. During deployment, DREAMSTEER samples candidate action chunks from a VLA policy and predefined motion primitives, imagines their outcomes using an action-conditioned latent world model, and ranks the imagined trajectories with a language-conditioned value model. Across four real-world manipulation benchmarks with unseen objects, DREAMSTEER improves task success rate from 23.75% to 66.25% and instruction-following accuracy from 38.75% to 56.25% over the base VLA policy.
- Abstract(参考訳): VLA(Pretrained Vision-Language-action)ポリシは、ゼロショットの一般化が期待できるが、デプロイメント時の分散シフトで失敗することが多く、堅牢性や一貫性のない命令が続く。
従来の作業では、インディストリビューションデータを微調整することでこの問題に対処することが多いが、ターゲット環境のタスクで収集されたデモを想定している。
本研究では,プリトレーニング済みVLAのためのデプロイメント時ステアリングフレームワークであるDREAMSTEERを提案する。
DREAMSTEERにおける重要な洞察は、潜在世界モデルと価値モデルを活用して、事前訓練されたVLAポリシーを操ることである。
デプロイメント中、DREAMSTEERはVLAポリシーと事前定義された動作プリミティブから候補となるアクションチャンクをサンプリングし、アクション条件付き潜在世界モデルを用いて結果を想像し、言語条件付き価値モデルで想定された軌道をランク付けする。
DREAMSTEERは4つの実世界の操作ベンチマークにおいて、タスク成功率を23.75%から66.25%に改善し、命令追従精度を38.75%から56.25%に改善した。
関連論文リスト
- World Pilot: Steering Vision-Language-Action Models with World-Action Priors [21.867210989881016]
Vision-Language-Action(VLA)モデルは、大規模な事前トレーニングからセマンティックグラウンドを継承する。
World Pilotは、World-Action Model(WAM)の事前設定でポリシーを強化する
World PilotはLIBERO-PlusゼロショットOODベンチマークで84.7%という最先端のトータル成功率を達成した。
論文 参考訳(メタデータ) (2026-06-10T17:59:08Z) - Grounded World Model for Semantically Generalizable Planning [94.53923128709965]
我々は、視覚言語対応の潜在空間において、グラウンドドワールドモデル(GWM)を学習する。
提案された各アクションは、タスク命令に対する将来の結果がどの程度近いかに基づいてスコアされる。
提案したWISERベンチマークでは、GWM-MPCはテストセットで87%の成功率を達成した。
論文 参考訳(メタデータ) (2026-04-13T17:25:41Z) - Enhancing Policy Learning with World-Action Model [4.941630596191806]
World-Action Model (WAM) は行動規則化された世界モデルであり、将来の視覚的観察と状態遷移を駆動する行動について共同で理由を定めている。
WAMは、遅延状態遷移からアクションを予測するDreamerV2に、逆ダイナミクスの目的を組み込んでいる。
我々は、CALVINベンチマークから8つの操作タスクにわたるポリシー学習の強化について、WAMを評価した。
論文 参考訳(メタデータ) (2026-03-30T19:56:05Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance [63.33213516925946]
textbfAlign-Then-stEer(textttATE)は,新しいデータ効率,プラグアンドプレイ適応フレームワークである。
我々の研究は、新しいロボットプラットフォームやタスクにVLAモデルをデプロイする実用性を大幅に向上させる、汎用的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2025-09-02T07:51:59Z) - GRAPE: Generalizing Robot Policy via Preference Alignment [58.419992317452376]
GRAPE: 優先度アライメントによるロボット政策の一般化について述べる。
GRAPEはドメイン内および未確認操作タスクにおける成功率をそれぞれ51.79%、58.20%向上させる。
GRAPEは安全性や効率、衝突速度の37.44%、ロールアウト長さの11.15%といった様々な目標に合わせることができる。
論文 参考訳(メタデータ) (2024-11-28T18:30:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。