論文の概要: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.04816v1
- Date: Mon, 06 Jul 2026 08:50:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.091285
- Title: CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models
- Title(参考訳): CAC-VLA:視覚・言語・アクションモデルのためのコンテキストゲートアクションコンディショニング
- Abstract要約: VLA(Vision-Language-Action)モデルは、汎用ロボット操作において有望なパラダイムとなっている。
本稿では,CAC-VLAを提案する。CAC-VLAは,VLM内で直接,軽量な潜在動作インタフェースを学習するコンテキストゲーティング・アクション・コンディショニング・フレームワークである。
LIBEROとLIBERO-Plusの実験はCAC-VLAの有効性を示し、平均成功率は98.3%に達した。
- 参考スコア(独自算出の注目度): 22.159641172687884
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models have become a promising paradigm for generalist robot manipulation, where visual-language representations are used to condition continuous action generation. However, these representations are not explicitly optimized for action conditioning, leaving the action expert to bridge the gap between multimodal understanding and precise motor control. Recent action-reasoning methods introduce additional modules to generate explicit action plans or action-space reasoning signals, demonstrating the benefit of action-level guidance but often requiring separate action-generation frameworks. We propose CAC-VLA, a Context-Gated Action Conditioning framework that learns a lightweight latent-action interface directly within the VLM. Instead of generating executable trajectories, CAC-VLA trains the VLM to predict coarse-to-fine latent actions, which are structured representations encoded from future action segments, and adaptively leverages them to condition the action expert via a context gate. This enables VLM-native action conditioning while calibrating the influence of latent-action guidance on expert action generation. Experiments on LIBERO and LIBERO-Plus demonstrate the effectiveness of CAC-VLA, achieving 98.3% average success rate on LIBERO and 89.5% LIBERO-Plus, suggesting that context-gated latent-action conditioning is an effective interface for continuous expert control.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、視覚言語表現を連続的な行動生成の条件に使用する汎用ロボット操作において、有望なパラダイムとなっている。
しかし、これらの表現はアクションコンディショニングに明示的に最適化されておらず、アクションエキスパートはマルチモーダル理解と正確なモーター制御のギャップを埋めることになる。
最近のアクション推論手法では、明示的なアクション計画やアクション空間推論信号を生成するモジュールが追加されており、アクションレベルのガイダンスの利点を示しているが、多くの場合は別々のアクション生成フレームワークを必要とする。
本稿では,CAC-VLAを提案する。CAC-VLAは,VLM内で直接,軽量な潜在動作インタフェースを学習するコンテキストゲーティング・アクション・コンディショニング・フレームワークである。
CAC-VLAは実行可能なトラジェクトリを生成する代わりに、将来のアクションセグメントから符号化された構造化表現である粗大な潜在アクションを予測するためにVLMを訓練し、コンテキストゲートを介してアクションエキスパートを条件付けるためにそれらを適応的に活用する。
これにより、エキスパートアクション生成に対する潜在アクションガイダンスの影響を校正しながら、VLMネイティブなアクションコンディショニングが可能になる。
LIBEROとLIBERO-Plusの実験は、CAC-VLAの有効性を示し、LIBEROの平均成功率は98.3%、LIBERO-Plusは89.5%に達した。
関連論文リスト
- QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance [108.46436073194546]
効果的なプランニングは、ローカルで、視覚的に基礎があり、内部で生成され、アクションと直接整合するべきである、と私たちは主張する。
本稿では,タスク条件付きアベイランスをVLAモデル内で明示的な視覚的計画インターフェースとして内包する統合フレームワークであるAfford-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-22T20:43:47Z) - Latent Action Reparameterization for Efficient Agent Inference [56.42014061367112]
本稿では,複数のステップのセマンティックな振る舞いに対応する,コンパクトな潜在行動空間を学習するフレームワークを提案する。
手作りのマクロや階層型コントローラとは異なり、潜在動作はエージェントの軌跡から学習され、モデルに直接統合される。
論文 参考訳(メタデータ) (2026-05-18T16:07:44Z) - From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models [14.109112325287208]
本研究は,2つの視点から潜時行動監視に関する研究である。 (i) 画像に基づく潜時行動による軌道の規則化, (ii) 行動に基づく潜時行動による目標空間の統一である。
以上の結果より, 動作に基づく潜在動作は複雑な運動調整において優れるが, 定式化タスク対応は明らかである。
論文 参考訳(メタデータ) (2026-05-06T09:27:07Z) - Language-Grounded Decoupled Action Representation for Robotic Manipulation [78.42228162226839]
認識と制御を結びつけるために,Language-Grounded Decoupled Action Representation (LaDA) フレームワークを提案する。
LaDAは3つの解釈可能なアクションプリミティブ(翻訳、回転、グリップ制御)の微細な中間層を導入し、低レベルのアクションに対して明示的な意味構造を提供する。
さらに、セマンティックガイダンスによるソフトラベルのコントラスト学習の目的を用いて、類似のアクションプリミティブをタスク間で整列させ、一般化と動きの整合性を高める。
論文 参考訳(メタデータ) (2026-03-13T13:08:26Z) - AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models [36.00004339916959]
本稿では、連続因果配列として行動を生成するスタンドアロンの自己回帰(AR)アクションエキスパートを提案する。
我々の研究は、スケーラブルでコンテキスト対応のアクション生成スキーマを導入し、効果的なロボットポリシーをトレーニングするための堅牢な構造基盤を提供します。
論文 参考訳(メタデータ) (2026-03-10T18:03:29Z) - AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation [21.23747444669735]
VLAモデル(AC2-VLA)に対するアクションコンテキスト対応適応計算を提案する。
AC2-VLAは、タイムステップ間の認識再利用、トークンプルーニング、統一メカニズム内のモデルコンポーネントの選択的な実行を適応的に行う。
ロボット操作ベンチマークの実験では、AC2-VLAはFLOPを29.4%まで減らし、最大1.79倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-27T14:10:39Z) - ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models [15.5794433640853]
Action Chain-of-Thought (ACoT) は、推論プロセス自体が粗いアクション意図の構造化シーケンスとして定式化されるパラダイムである。
我々は2つの補完的要素: Explicit Action Reasoner (EAR) と Implicit Action Reasoner (IAR) を紹介する。
論文 参考訳(メタデータ) (2026-01-16T16:17:06Z) - On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning [61.38273866396522]
ビジョン・ランゲージ・アクションモデルが汎用ロボット学習の強力なパラダイムとして登場した。
現在の手法は、シミュレーションや物理世界の展開に挑戦するには相変わらず適していない。
本稿では,VLA フレームワークのテスト時間強化学習について紹介する。
論文 参考訳(メタデータ) (2026-01-11T01:51:30Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。