論文の概要: PAIR: Bridging Perception and Action in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2610.09016v1
- Date: Tue, 06 Oct 2026 19:11:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.567011
- Title: PAIR: Bridging Perception and Action in Vision-Language-Action Models
- Title(参考訳): PAIR:視覚・言語・行動モデルにおけるブリッジング知覚と行動
- Abstract要約: 視覚言語アクション(VLA)モデルは、視覚的な観察と言語指示を連続したロボットアクションにマッピングする。
このタスクはシーンを記述する表現からアクション生成をサポートする表現へ移行する必要がある。
PAIRは、これらの2つの空間間での認識-行動の共有表現を学習するフレームワークである。
- 参考スコア(独自算出の注目度): 7.619235741393162
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models map visual observations and language instructions to continuous robot actions. This task requires a transition from representations that describe the scene and instruction to representations that support action generation. Many continuous-action VLAs leave this transition implicit and supervise it mainly through the final action-prediction loss. We introduce PAIR, a framework that learns a shared perception-action representation between these two spaces. During training, a Masked Action Autoencoder encodes expert action chunks into horizon-aligned Action Latent Tokens. A Bridge Module extracts task-relevant features from the current visual-language representations. PAIR aligns these features with the Action Latent Tokens to form Bridge Tokens that preserve task information and capture the structure of expert actions. The Bridge Tokens are then projected into the action-token space and injected into the initial Action Tokens, providing an action-ready starting point for Action Expert refinement. At inference, the autoencoder is removed, and the Bridge Tokens are generated only from the current observation and instruction. Experiments on LIBERO, LIBERO-Plus, and CALVIN ABC-D show gains for the evaluated OpenVLA-OFT and VLA-Adapter models. On LIBERO-Plus, PAIR raises VLA-Adapter's success rate from 59.1% to 64.2%. On CALVIN, it increases VLA-Adapter's average completed sequence length from 4.42 to 4.53. Across seven real-world tasks, PAIR raises OpenVLA-OFT's success rate from 51.4% to 65.0%. Representation analyses show that Bridge Tokens retain task information while making continuous-action information accessible before Action Expert refinement. These results support a shared intermediate representation as a useful interface between perception and action in continuous-action VLAs.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、視覚的な観察と言語指示を連続したロボットアクションにマッピングする。
このタスクはシーンを記述する表現からアクション生成をサポートする表現へ移行する必要がある。
多くの連続作用VLAは、この遷移を暗黙に残し、主に最終作用予測損失を通じて監督する。
PAIRは、これらの2つの空間間での認識-行動の共有表現を学習するフレームワークである。
トレーニング中、Masked Action Autoencoderは専門家のアクションチャンクを水平方向のAction Latent Tokenにエンコードする。
Bridge Moduleは現在の視覚言語表現からタスク関連の特徴を抽出する。
PAIRはこれらの機能をAction Latent Tokensと整列して、タスク情報を保持し、専門家のアクションの構造をキャプチャするBridge Tokensを形成する。
ブリッジトークンはアクショントークン空間に投影され、最初のアクショントークンに注入される。
推論時にオートエンコーダを除去し、ブリッジトークンは現在の観察と指示からのみ生成される。
LIBERO, LIBERO-Plus, CALVIN ABC-D実験は, 評価されたOpenVLA-OFTおよびVLA-Adapterモデルに対する利得を示す。
LIBERO-Plusでは、VLA-Adapterの成功率が59.1%から64.2%に上昇している。
CALVINでは、VLA-Adapterの平均完了シーケンス長が4.42から4.53に増加する。
現実世界の7つのタスクの中で、PAIRはOpenVLA-OFTの成功率を51.4%から65.0%に引き上げている。
表現分析により,ブリッジトークンはタスク情報を保持し,アクションエキスパートの洗練前に連続行動情報をアクセスできるようにする。
これらの結果は、連続作用VLAにおける知覚と行動の間の有用なインターフェースとして、共有中間表現をサポートする。
関連論文リスト
- eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing [12.503171740549552]
本稿では,タスク固有のアクション関連情報をルーティングすることで,効率的な状態表現を構築するeRLTを紹介する。
eRLTは平均正規化学習曲線AUCを代表ベースラインよりも最大23.7%改善する。
USBコネクタの挿入とマザーボードのリボンケーブルの挿入に関する実際のロボット実験は、それぞれ108.9%と46.7%のAUCの改善を示している。
論文 参考訳(メタデータ) (2026-10-01T01:43:42Z) - Learning Skills from Historical Action Trajectories: Action Experience Dictionary for World Action Models [129.76412745258145]
World Action Models(WAM)は、視覚力学予測とアクション生成を結合するが、操作タスク間のアクションエクスペリエンスの再利用を明示的にサポートしていない。
本研究では,歴史的行動軌跡を共有行動埋め込みにエンコードするアクション体験辞書(AED)を開発した。
シミュレーション・ベンチマークと実世界のクロス・エボディメント・セッティングの実験により,AEDの有効性が検証された。
論文 参考訳(メタデータ) (2026-09-30T17:26:38Z) - LA4VLA: Learning to Act without Seeing via Language-Action Pretraining [51.209359878543005]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を共同で行動にマッピングすることで、ロボットのデモンストレーションで一般的に事前訓練される。
LA4VLAは、視覚的観察なしに、ポリシーが言語条件付きアクションの事前取得を可能にする、言語行動事前訓練フレームワークである。
論文 参考訳(メタデータ) (2026-06-25T17:13:02Z) - ActionMap: Robot Policy Learning via Voxel Action Heatmap [61.10410508218428]
ActionMapは、ネイティブアクションデコーダの代わりに既存のVLAにドロップする。
Heatmapヘッドは、マッチしたトレーニングステップで、2つのアーキテクチャ的に異なるバックボーンを越えます。
クロスバックボーン一貫性は、アクション表現がVLAパフォーマンスの真のレバーであることを示している。
論文 参考訳(メタデータ) (2026-06-05T04:42:56Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Action with Visual Primitives [36.230909065494345]
VLA(Vision-Language-Action)モデルは、汎用的なロボット操作のための有望なパラダイムとして登場した。
AVP(Action with Visual Primitives)は、このビジュアルプリミティブ中心のインターフェースを実装したエンドツーエンドアーキテクチャである。
AVP は pi_0.5 よりも 27.61% 向上し,近年の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-05-21T08:52:47Z) - MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction [11.87290433247564]
textbfMulti-textbfViewtextbfPoint textbfLatent textbfAction textbfModel (textbfMVP-LAM)を提案する。
MVP-LAMは、時間同期マルチビュービデオから、地道的なアクションについて非常に有意義な個別の潜伏アクションを学習する。
橋梁V2では、MVP-LAMはよりアクション中心の潜伏行動を生成し、より高信頼な相互情報を得るとともに、アクション予測を改善した。
論文 参考訳(メタデータ) (2026-02-03T15:51:25Z) - DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models [25.91822750707556]
VLA(Vision-Language Action)モデルは、ロボット操作において顕著な進歩を見せている。
VLAモデルはタスク関連領域のイメージトークンに過度に参加する可能性がある。
この振る舞いは、各ステップにおける望ましいアクショントークンの生成からモデルを邪魔し、タスクの成功率に影響を与える可能性がある。
論文 参考訳(メタデータ) (2026-01-22T16:02:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。