論文の概要: Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions
- arxiv url: http://arxiv.org/abs/2608.03563v1
- Date: Tue, 04 Aug 2026 12:29:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.721746
- Title: Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions
- Title(参考訳): 統一された視覚運動のターゲット:身体的行動を超えたVLAを監督する
- Authors: Zhenyang Feng, Unnat Jain,
- Abstract要約: VLAモデルは、視覚的および言語的な観察からロボット行動を予測するために訓練されている。
VLMはシーンとゴールのリッチでハイレベルな表現をエンコードしますが、ロボットアクションはタスク構造に制限のある低レベルな信号です。
UVT(Unified Visuomotor Target)は,運動制御と映像の遷移情報を協調的に符号化する潜在予測ターゲットである。
- 参考スコア(独自算出の注目度): 7.055196586502248
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: VLA models are trained to predict robot actions from visual and language observations. This is a natural choice, but it creates a mismatch: VLMs encode rich, high-level representations of scenes and goals, while robot actions are low-level signals with limited task structure. We ask whether changing what the policy is trained to predict, rather than how it is architecturally designed, can yield better and more efficiently trained policies. We propose UVT (Unified Visuomotor Target), a unified latent prediction target that jointly encodes motor control and visual scene transition information, requiring no architectural changes and no additional data. Applied to two representative VLA systems across simulation benchmarks and real bimanual manipulation tasks, UVT improves training efficiency, final task performance, and policy robustness, with particularly strong gains under limited training budgets and challenging environmental conditions. Rollout videos and additional qualitative results are available at our project webpage: https://unified-visuomotor-targets.github.io/
- Abstract(参考訳): VLAモデルは、視覚的および言語的な観察からロボット行動を予測するために訓練されている。
VLMはシーンとゴールのリッチでハイレベルな表現をエンコードしますが、ロボットアクションはタスク構造に制限のある低レベルな信号です。
アーキテクチャ的にどのように設計されているかではなく、そのポリシーが予測するようにトレーニングされているものを変更することで、より良い、より効率的にトレーニングされたポリシーが得られるかどうかを問う。
UVT(Unified Visuomotor Target)は,運動制御と視覚遷移情報を共同で符号化し,構造的変化や追加データを必要としない統合潜在予測ターゲットである。
シミュレーションベンチマークと実際のバイマニュアル操作タスクにわたる2つの代表的なVLAシステムに適用されたUVTは、トレーニング効率、最終タスクパフォーマンス、およびポリシーの堅牢性を改善し、特に訓練予算の制限や環境条件の厳しい状況下での強力な向上を実現している。
ロールアウトビデオと追加の質的な結果がプロジェクトのWebページで公開されている。
関連論文リスト
- Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data [93.7685703383343]
視覚言語モデル(VLM)は強力な汎用推論器であるが、ロボット制御ポリシーに変換することは驚くほど難しい。
このギャップは、適切な中間データで徐々にブリッジできると我々は主張する。
本研究では,タスク関連アウト・オブ・ディストリビューションETCデータと少量のアクションデータとを混合することにより,新しい視覚言語条件に一般化できることを示す。
論文 参考訳(メタデータ) (2026-06-07T08:57:51Z) - Do World Action Models Generalize Better than VLAs? A Robustness Study [25.418384276142223]
視覚言語アクション(VLA)は、様々なロボットタスクで顕著な成功を収めた。
世界行動モデル(WAM)は、将来の状態を予測するために大量のビデオデータに基づいて訓練された世界モデルに基づいて構築される。
LIBERO-Plus と RoboTwin 2.0-Plus のベンチマークにおいて,様々な視覚的・言語的摂動による性能評価を行った。
論文 参考訳(メタデータ) (2026-03-23T15:13:15Z) - cVLA: Towards Efficient Camera-Space VLAs [26.781510474119845]
Vision-Language-Action(VLA)モデルは、複雑なロボット操作タスクに取り組むための魅力的なフレームワークを提供する。
2次元画像上での視覚言語モデルの競合性能を活用する新しいVLA手法を提案する。
我々のモデルは軌道方向の経路を予測し、トレーニングとロボットの実施の両方を効果的に行う。
論文 参考訳(メタデータ) (2025-07-02T22:56:41Z) - HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation [54.03004125910057]
階層型視覚-言語-アクションモデルは、標準的なモノリシックVLAモデルよりも、ドメイン外のデータを利用するのに効果的であることを示す。
階層設計により、高レベルなVLMは、オフドメイン微調整データと実ロボットテストシナリオの間の重要なドメインギャップをまたいで転送可能であることを示す。
論文 参考訳(メタデータ) (2025-02-08T07:50:22Z) - LLaRA: Supercharging Robot Learning Data for Vision-Language Policy [56.505551117094534]
我々はLLaRA: Large Language and Robotics Assistantを紹介した。
まず、既存の行動クローニングデータセットからロボットのための会話スタイルの指導データを生成する自動パイプラインを提案する。
このようなデータセットを限定的に微調整したVLMは、ロボット制御において有意義な行動決定を導出できることを示す。
論文 参考訳(メタデータ) (2024-06-28T17:59:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。