論文の概要: Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2607.14635v1
- Date: Thu, 16 Jul 2026 06:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.01724
- Title: Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
- Title(参考訳): 行動QFormer:視覚・言語・行動モデルにおける行動スーパービジョンに基づく構造的表現整形
- Abstract要約: 視覚言語行動(VLA)モデルにおける行動監視は、しばしば、学習行動予測のための下流目標として扱われる。
動作に適合する表現を形成するには, 動作監視を継承したマルチモーダル経路に直接適用しすぎると, 言語側処理やオブジェクトグラウンド化をサポートする表現を不安定化することができる。
我々は、クエリベースのアクション対応インターフェースであるAction QFormerを紹介し、下流アクション生成の前に、継承されたマルチモーダル情報をアクション対応表現に再編成する。
- 参考スコア(独自算出の注目度): 16.349740935807866
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Action supervision in vision-language-action (VLA) models is often treated as a downstream objective for learning action prediction. In this paper, we study it instead as a force that shapes inherited multimodal representations. We show that this shaping has a dual effect: it is necessary for forming action-compatible representations, but when action supervision is applied too directly to the inherited multimodal pathway, it can also destabilize representations that support language-side processing and object grounding. To address this tension, we introduce Action QFormer, a query-based action-facing interface that uses instruction-conditioned queries to reorganize inherited multimodal information into action-facing representations before downstream action generation. In zero-shot sim-to-real navigation, Action QFormer improves average closed-loop task success from 18.8% to 56.3%, raises fixed-instruction action-generation correctness from 22.5% to 75.5%, and nearly eliminates out-of-distribution instruction generations. Further analyses show that Action QFormer changes how action supervision shapes inherited multimodal representations, reducing broad upstream rewriting while preserving targeted and sometimes constructive action-supervised adaptation. These results suggest that improving VLA performance requires not only stronger pretrained backbones, but also better ways of selecting and organizing inherited multimodal information while controlling how it is shaped under action supervision.
- Abstract(参考訳): 視覚言語行動(VLA)モデルにおける行動監視は、しばしば、学習行動予測のための下流目標として扱われる。
本稿では、その代わりに、継承されたマルチモーダル表現を形作る力として研究する。
この形状には2つの効果があることが示される: 動作互換表現の形成には必要であるが、動作監視が継承されたマルチモーダル経路に直接適用されすぎると、言語側処理とオブジェクトグラウンド化をサポートする表現の不安定化も可能である。
この緊張に対処するために、我々はAction QFormerを紹介した。Action QFormerは、命令条件付きクエリを使って、下流のアクション生成の前に、継承したマルチモーダル情報をアクション対応の表現に再構成する。
ゼロショットのsim-to-realナビゲーションでは、Action QFormerは平均クローズドループタスクの成功を18.8%から56.3%に改善し、22.5%から75.5%に修正命令生成の正しさを高め、配布外命令の世代をほとんど排除している。
さらなる分析により、アクション監視の形状がマルチモーダル表現を継承する方法が変化し、ターゲットとコンストラクティブなアクション管理の適応を維持しながら、広範囲のアップストリーム書き換えが削減されたことが示されている。
これらの結果から, VLAの性能向上には, より強い事前訓練されたバックボーンだけでなく, 動作監視下でどのように形成されているか制御しながら, 継承されたマルチモーダル情報を選択・整理するより良い方法が必要であることが示唆された。
関連論文リスト
- Reconstructing Is Not Acting: Action-Centric Latent Dynamics Modeling [21.941208569455657]
潜在アクションモデルは、視覚的遷移から潜在アクションを推論し、将来の状態を再構築することにより、ラベルのないビデオからアクション表現を学習する。
本稿では,アクション抽出とアクション利用の両方を強化する軽量なアクション中心フレームワークである$textbfACT-LAMを提案する。
いくつかのロボットデータセットとVP$2$ベンチマークの実験は、強力な潜在アクション一貫性、フォワードダイナミクス、下流のビジュアルプランニングパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-09-14T08:10:46Z) - JEPA Policy: Diffusion-Free Imitation Learning via Paired Action and Future Representation Prediction [6.889062419237111]
JEPA Policyは、アクションチャンクとその観測された将来の表現をペア化されたトレーニングターゲットとして使用する、拡散のないフレームワークである。
将来の予測は、アクションを生成するために使われる表現を形作ることができる。
その結果、反復的な生成サンプリングを伴わない低遅延ビズモータ模倣に対する実践的なアプローチとして、ペア・フューチャー・リ表現の監視を支援する。
論文 参考訳(メタデータ) (2026-09-09T02:42:20Z) - CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models [22.159641172687884]
VLA(Vision-Language-Action)モデルは、汎用ロボット操作において有望なパラダイムとなっている。
本稿では,CAC-VLAを提案する。CAC-VLAは,VLM内で直接,軽量な潜在動作インタフェースを学習するコンテキストゲーティング・アクション・コンディショニング・フレームワークである。
LIBEROとLIBERO-Plusの実験はCAC-VLAの有効性を示し、平均成功率は98.3%に達した。
論文 参考訳(メタデータ) (2026-07-06T08:50:05Z) - AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - QuoVLA: Quotient Space for Vision-Language-Action Models [51.02329790939691]
VLA(Vision-Language-Action)モデルは、視覚的な観察と言語指示を連続的な行動にマッピングすることで、トレーニング済みのVLM潜伏者をロボット制御に適応させることが一般的である。
VLA の textitQuotient Theory は、事前訓練された VLM 潜伏剤は、アクションに十分ではないがアクションに十分であることを示している。
提案するQuoVLAは,事前学習されたVLMラテントを動作十分表現に圧縮する,VLAの商空間フレームワークである。
論文 参考訳(メタデータ) (2026-05-24T06:28:53Z) - Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model [31.013109374489442]
VLA(Vision-Language-Action)モデルは、最近、具体化されたタスク間で強力なパフォーマンスを示した。
本稿では,拡散行動専門家が複数の候補アクションチャンクをドラフトし,VLMが各候補を1つの前方パスに1つの難易度基準でスコア付けして1つを選択することを提案する。
マッチしたバックボーン、トレーニングデータ、アクション・チャンク長では、ADVは拡散ベースのベースラインよりも実世界の+4.3ポイント、+19.7ポイントで成功率を向上させる。
論文 参考訳(メタデータ) (2026-03-18T09:16:20Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - \textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models [15.5794433640853]
Action Chain-of-Thought (ACoT) は、推論プロセス自体が粗いアクション意図の構造化シーケンスとして定式化されるパラダイムである。
我々は2つの補完的要素: Explicit Action Reasoner (EAR) と Implicit Action Reasoner (IAR) を紹介する。
論文 参考訳(メタデータ) (2026-01-16T16:17:06Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z) - VITA: Vision-to-Action Flow Matching Policy [27.783132918359545]
VITAはノイズフリーで条件なしのポリシー学習フレームワークである。
フローマッチングを使って視覚表現を潜在アクションにマッピングする。
ALOHAとRoomimicの8つのシミュレーションと2つの実世界のタスクについて評価した。
論文 参考訳(メタデータ) (2025-07-17T15:41:57Z) - Capturing Rich Behavior Representations: A Dynamic Action Semantic-Aware Graph Transformer for Video Captioning [13.411096520754507]
既存のビデオキャプション手法は、単にオブジェクトの振舞いの浅いあるいは単純化した表現を提供するだけである。
本稿では,オブジェクトの振る舞いの本質を包括的に把握する動的アクション意味認識グラフ変換器を提案する。
論文 参考訳(メタデータ) (2025-02-19T14:16:47Z) - Goal-Conditioned End-to-End Visuomotor Control for Versatile Skill
Primitives [89.34229413345541]
本稿では,制御器とその条件をエンドツーエンドに学習することで,落とし穴を回避する条件付け手法を提案する。
本モデルでは,ロボットの動きのダイナミックな画像表現に基づいて,複雑な動作シーケンスを予測する。
代表的MPCおよびILベースラインに対するタスク成功の大幅な改善を報告した。
論文 参考訳(メタデータ) (2020-03-19T15:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。