論文の概要: Where Predictive Supervision Goes Shapes What VLA Policies Learn
- arxiv url: http://arxiv.org/abs/2609.36645v2
- Date: Thu, 01 Oct 2026 03:51:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.518589
- Title: Where Predictive Supervision Goes Shapes What VLA Policies Learn
- Title(参考訳): 予測的スーパービジョンは、VLAが学んだことを形作る
- Abstract要約: 将来の予測は、視覚言語アクション(VLA)ポリシーを改善するためにますます使われる。
本稿では,VLA政策で使用される視覚的表現を,予測的監督が改善するか否かについて検討する。
- 参考スコア(独自算出の注目度): 8.095249951569182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Future prediction is increasingly used to improve vision-language-action (VLA) policies, based on the premise that anticipating scene evolution encourages representations useful for control. However, forecast quality alone does not establish that a policy has learned a better representation for action. This distinction matters under distribution shift, where successful control depends on preserving spatial state and likely scene change beyond familiar configurations. We study what determines whether predictive supervision improves the visual representation used by a VLA policy. Through controlled comparisons with matched target constructions, prediction horizons, and training conditions, we find that different prediction interfaces produce markedly different forecasts and visual representations, including in the spatial, dynamics, and action information that transfers beyond familiar scenes. We trace these differences to how predictive errors shape the policy's visual stream. Consistent with this controlled finding, VLA policies trained with more direct, scene-matched future supervision show stronger robustness under simulated and physical distribution shifts. Together, our results frame future prediction as a representation-learning design problem whose value for control depends on whether its supervision reaches the representations through which the policy acts.
- Abstract(参考訳): 将来の予測は、シーンの進化が制御に有用な表現を促進するという前提に基づいて、視覚言語アクション(VLA)ポリシーを改善するためにますます使われる。
しかし、予測品質だけでは、政策が行動のより良い表現を学んだことを証明していない。
この区別は、制御が成功した場合、空間状態の保存と、慣れ親しんだ構成を超えたシーン変化に依存する。
本稿では,VLA政策で使用される視覚的表現を,予測的監督が改善するか否かについて検討する。
一致したターゲット構築、予測地平線、訓練条件との制御された比較により、異なる予測インターフェースが、よく知られたシーンを超えて移動する空間的、動的、行動情報を含む、著しく異なる予測と視覚的表現を生成することがわかった。
これらの違いは、ポリシーの視覚的ストリームを予測エラーがどのように形成するかに遡る。
この制御された発見と一致して、VLAポリシーはより直接的な、シーンマッチングされた将来の監視で訓練され、シミュレートされた物理的分散シフトの下で強い堅牢性を示す。
本研究の結果は、今後の予測を、制御する価値が政策の行動する表現に達するかどうかに依存する表現学習設計問題として捉えたものである。
関連論文リスト
- V-JEPA Policy: Building Effective World-Action Models on Predictive Visual Latents [28.145441594584714]
本稿では,凍結したV-JEPA 2.1エンコーダの潜伏空間上にWAMを構築するシンプルなフレームワークであるV-JEPA Policyを紹介する。
命令条件付き未来遅延予測器とフローマッチングアクションエキスパートは、単一の下流ステージでスクラッチから共同で学習する。
0.9Bの総パラメータで0.6Bのトレーニングが可能であり、V-JEPAポリシーは代表的WAMと視覚言語アクションベースラインとの競合性能を達成する。
論文 参考訳(メタデータ) (2026-09-29T11:03:02Z) - Disentangling Spurious Correlations in Vision-Language-Action Models via Predicting Domain-Invariant Latent Lookahead [15.755022483588014]
Domain-Invariant Latent Lookahead (DILL)は、Vision-Language-Action(VLA)ポリシーにおけるショートカット学習を緩和する表現学習フレームワークである。
私たちのキーとなる考え方は、ドメイン変換された軌跡データから学んだ、ドメイン不変の将来の潜伏者によるポリシーの監督です。
論文 参考訳(メタデータ) (2026-09-29T09:56:17Z) - The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models [19.617236657706957]
ジェネレーションフリーワールドアクションモデル(WAM)は、トレーニング中に将来のビデオ予測を保持するが、推論時に内部ビデオの特徴から作用する。
我々の表現診断は、より予測可能な将来変化を持つ表現は、線形動作復号を容易にする必要はないことを示している。
これらの知見は,アクション関連予測状態(ARPS, Action-Relevant Predictive States)を動機付けている。
論文 参考訳(メタデータ) (2026-09-20T05:37:10Z) - UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling [73.35395707747456]
ビジョン・ランゲージ・アクションモデルの最近の進歩はロボット操作を改善しているが、基本的な遷移実現可能性のギャップによって観察・行動学習は制限されている。
将来の観測は、物理的に実現可能な遷移と必ずしも一致しない。
歴史的に実行可能なアクションパターンは、現在のシーンにおける意図した遷移を必ずしも認識しない可能性があるため、コンテキスト対応の適応が必要である。
論文 参考訳(メタデータ) (2026-09-10T17:45:03Z) - VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction [8.801486222527984]
テストタイムトレーニング(TTT)は、ラベルのないデプロイメントストリームから視覚-言語-アクション(VLA)ポリシーを適用するための軽量な方法を提供する。
VLAポリシー(VANE)のための信頼性TTTフレームワークを導入する。
SimplerEnv WidowXでは、VANEは対応するTTベースラインよりも平均的な成功率を32ドルポイント向上させる。
論文 参考訳(メタデータ) (2026-08-10T11:22:54Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - Learning Interpretable Policies in Hindsight-Observable POMDPs through
Partially Supervised Reinforcement Learning [57.67629402360924]
本稿では,PSRL(Partially Supervised Reinforcement Learning)フレームワークを紹介する。
PSRLの中心は、教師なし学習と教師なし学習の融合である。
PSRLは、保存中のモデル解釈可能性を高め、従来の手法で設定された性能ベンチマークよりも大幅に向上することを示す。
論文 参考訳(メタデータ) (2024-02-14T16:23:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。