論文の概要: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models
- arxiv url: http://arxiv.org/abs/2607.25516v1
- Date: Tue, 28 Jul 2026 09:56:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.790681
- Title: A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models
- Title(参考訳): VLAモデルにおけるテスト時間モダリティ適応のための因果関係を考慮したInfer-diagnose-refineフレームワーク
- Abstract要約: Infer-diagnose-refine (IDR) フレームワークを提案する。
IDRはまず、視覚観察の事実的シナリオと反事実的シナリオの下でのアクションを推論し、視覚観察の因果効果を推定された動的重要性として診断する。
シミュレーションベンチマークと実世界のタスクの両方の実験では、複数のVLAバックボーン全体のパフォーマンスが改善されている。
- 参考スコア(独自算出の注目度): 16.665710235622214
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) models predict sequential actions to execute tasks specified by language instructions, conditioned on visual observations and proprioceptive states. However, how to fuse modalities in VLA models remains an open problem, since robot manipulation involves dynamic phases, such as long-distance movements and close-range interactions, in which the importance of visual observations may vary over time. In this paper, we propose an infer-diagnose-refine (IDR) framework, a model-agnostic framework that can be integrated with diverse VLA architectures for refining action predictions at test time. IDR first infers actions under factual and counterfactual scenarios of visual observations, and then diagnoses the causal effects of visual observations as the estimated dynamic importance, which is finally used to refine the action predictions in a training-free manner. We further design a causality-aware action refiner to realize the IDR framework, including zero-padding interventions for inferring counterfactual actions, norm-based quantification for diagnosing causal effects, and gated residual fusion for refining actions. Extensive experiments on both simulation benchmarks and real-world tasks show improvements in overall performance across multiple VLA backbones, demonstrating the efficacy of dynamically adjusting visual importance at test time.
- Abstract(参考訳): 視覚言語アクション(VLA)モデルは、言語命令によって指定されたタスクを実行するためのシーケンシャルアクションを予測する。
しかしながら、ロボット操作は長距離移動や近距離相互作用のような動的位相を伴うため、視覚的観察の重要性が時間とともに変化する可能性があるため、VLAモデルにおけるモダリティを融合する方法は未解決の課題である。
本稿では,様々なVLAアーキテクチャと統合可能なモデルに依存しないフレームワークであるInfer-diagnose-refine(IDR)フレームワークを提案する。
IDRはまず、視覚的観察の現実的シナリオと反現実的シナリオの下でのアクションを推論し、次に視覚的観察の因果効果を推定されたダイナミックな重要性として診断し、最終的にトレーニングなしの方法でアクション予測を洗練するために使用される。
IDRフレームワークを実現するために、さらに因果性を考慮したアクション精錬器を設計し、反ファクト行動の推測のためのゼロパディング介入、因果効果の診断のためのノルムに基づく定量化、リファインアクションのためのゲート残差融合を含む。
シミュレーションベンチマークと実世界のタスクの両方に対する大規模な実験は、複数のVLAバックボーンにわたる全体的なパフォーマンスの改善を示し、テスト時に視覚的重要性を動的に調整する効果を示す。
関連論文リスト
- IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training [18.292611164084537]
IMPACTは,事前誘導と目標設定を併用したスケーラブルなインタラクション対応フレームワークである。
IMPACTは、対応するMSE訓練ベースラインを一貫して上回り、相互作用の忠実度、物理的妥当性、視覚的品質を改善している。
論文 参考訳(メタデータ) (2026-08-31T18:00:36Z) - Uncertainty Quantification for Flow-Based Vision-Language-Action Models [33.28454469934064]
視覚言語アクションモデル(VLA)は、視覚言語バックボーンと、大規模ロボットデータセットのフローマッチングによってトレーニングされた表現力豊かな生成アクションヘッドを組み合わせる。
ロボット操作における強い経験的性能にもかかわらず、VLAは予測の信頼性を定量化し、動作が信頼できない可能性があることを検知するメカニズムを欠いている。
本稿では,不確実性誘導型アクティブ微調整のためのフレームワークであるSAVEを提案する。
論文 参考訳(メタデータ) (2026-06-16T15:19:09Z) - Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA [8.586006378757878]
VLA(Vision- Language-action)ポリシーとWAM(World-Action Models)は、ロボット操作においてますます重要なパラダイムである。
本稿では,WAMが将来予測を単に追加するか,ロボットの動作や内部表現を制御可能な方法で変更するかを問う。
論文 参考訳(メタデータ) (2026-05-31T08:35:12Z) - Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior? [6.847591547447323]
VLA(Vision-Language-Action)モデルは、自動運転において有望な能力を示す。
現在のVLAベースの運転行動は、視覚情報に根ざしている。
本稿では,VLAに基づく運転モデルにおける視覚的ビヘイビア依存性を系統的に解析する,構造化されたマルチレベル視覚フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-29T09:18:32Z) - Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models [7.802379200026965]
認識状態の複雑さに基づいてVLA実行を動的にルーティングする適応型フレームワークを提案する。
我々のアプローチは、VLAの視覚言語バックボーンを、パラメトリックおよび非パラメトリック推定器のアンサンブルに潜伏埋め込みを投影することにより、アクティブな検出ツールに変換する。
論文 参考訳(メタデータ) (2026-03-05T13:14:41Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - \ extsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention [92.85371254435074]
PosA-VLAフレームワークは、ポーズ条件付き監視を通じて視覚的注意を保ち、タスク関連領域に対するモデルの認識を一貫して導く。
本手法は,多様なロボット操作ベンチマークにおいて,正確かつ時間効率のよい動作を実施できることを示す。
論文 参考訳(メタデータ) (2025-12-03T12:14:29Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z) - Explanatory Model Monitoring to Understand the Effects of Feature Shifts on Performance [61.06245197347139]
そこで本研究では,機能シフトによるブラックボックスモデルの振る舞いを説明する新しい手法を提案する。
本稿では,最適輸送と共有値の概念を組み合わせた提案手法について,説明的性能推定として紹介する。
論文 参考訳(メタデータ) (2024-08-24T18:28:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。