論文の概要: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.02497v1
- Date: Mon, 03 Aug 2026 17:02:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.721104
- Title: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
- Title(参考訳): 視覚言語行動モデルにおけるロバスト命令一般化のための接地的意味的再結合
- Abstract要約: VLA(Vision-Language-Action)モデルは、ロボット操作において優れているが、標準的な指示が言い換えられると破滅的な性能低下を被る。
現状のVLAでは,タスクの正当性を内部的に保持することに成功した。
不安定な関節経路をバイパスするエレガントな介入であるグラウンドド・セマンティック・リバインド(GSR)を提案する。
- 参考スコア(独自算出の注目度): 20.8047896631941
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models excel in robotic manipulation but suffer catastrophic performance drops when canonical instructions are simply paraphrased. Although this brittleness is typically addressed through costly data scaling, our probing reveals that the root cause is architectural rather than a lack of semantic understanding. Specifically, we demonstrate that current VLAs successfully retain the correct task identity internally. The failure actually stems from the joint encoding of dynamic visual observations and text, which introduces systematic feature shifts. Because the downstream action policy is highly vulnerable to these variations, it fails to translate the preserved semantics into correct control commands. To resolve this structural bottleneck, we propose Grounded Semantic Re-binding (GSR), an elegant intervention that bypasses unstable joint routing by explicitly fusing independently extracted task semantics with native visual features to train a completely re-initialized action expert from scratch. This targeted intervention dramatically restores paraphrastic invariance using only canonical demonstrations. On the LIBERO-Para benchmark, GSR improves success rates by up to 44.6 percent. It enables lightweight models to rival massively scaled baselines and pushes state-of-the-art models to a new record PRIDE score of 70.4, outperforming the recently introduced large-scale pretrained model Xiaomi-Robotics-0 in instruction generation capabilities. Building on these insights, we also introduce ParaVLA, a natively decoupled 0.33B-parameter model exhibiting near-perfect robustness to instruction rewording. Ultimately, our work proves that robust semantic grounding can be achieved through elegant structural design, bypassing the inefficient brute-force data scaling paradigm.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、ロボット操作において優れているが、標準的な指示が単に言い換えられる場合、破滅的なパフォーマンス低下に悩まされる。
この不安定性は通常、コストのかかるデータスケーリングによって対処されるが、私たちの調査によると、根本原因はセマンティックな理解の欠如ではなくアーキテクチャにある。
具体的には、現在のVLAが内部で正しいタスクの同一性を維持することを実証する。
この失敗は、動的視覚観察とテキストの共同符号化に起因しており、体系的な特徴シフトがもたらされる。
ダウンストリームアクションポリシーはこれらのバリエーションに対して非常に脆弱であるため、保存されたセマンティクスを正しいコントロールコマンドに変換することに失敗する。
この構造的ボトルネックを解決するため、我々は、独立に抽出されたタスクセマンティクスとネイティブな視覚的特徴を明示的に融合させることにより、不安定な関節ルーティングを回避し、完全に再起動されたアクションエキスパートをゼロから訓練するエレガントな介入であるグラウンドドセマンティックリバインド(GSR)を提案する。
この目的の介入は、標準的なデモンストレーションのみを使用してパラフラスティックな不変性を劇的に回復させる。
LIBERO-Paraベンチマークでは、GSRは最大44.6%の成功率を改善する。
軽量モデルは大規模なベースラインに匹敵し、最先端のモデルを新しいPRIDEスコア70.4まで押し上げ、命令生成能力において最近導入された大規模事前訓練モデルのXiaomi-Robotics-0よりも優れていた。
また,これらの知見に基づいてParaVLAを導入した。ParaVLAはネイティブに分離された0.33Bパラメータモデルで,命令のリワードに対してほぼ完全なロバスト性を示す。
最終的に、我々の研究は、非効率なブルートフォースデータスケーリングパラダイムを回避し、エレガントな構造設計によって堅牢なセマンティックグラウンドを実現することができることを証明した。
関連論文リスト
- DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving [39.60553851234952]
VLA(Vision-Language-Action)モデルは、エンドツーエンドの自動運転において有望なパラダイムとして登場した。
本稿では,障害対応の潜時メモリを備えた検索拡張VLAであるDriveVLA-M0を提案する。
DriveVLA-M0はメモリの追加で効率よくスケールし、メモリ拡張によるトレーニング不要のパフォーマンス向上を可能にする。
論文 参考訳(メタデータ) (2026-08-11T03:01:46Z) - Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning [21.67233368353003]
本稿では,アクション生成ループから空間的グラウンドを明示的に抽出する分離アーキテクチャであるSVP-ILを提案する。
実験では、SVP-ILは最先端のVLAや純粋なビジュモータベースラインよりも著しく優れている。
論文 参考訳(メタデータ) (2026-06-24T03:45:06Z) - The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF [19.923694743124475]
大規模言語モデル (LLM) は、エージェントおよび検索強化世代 (RAG) システムにますます多くデプロイされている。
実際には、そのような文脈は、しばしば非構造化され、良性だが命令のようなセマンティックノイズで汚染される。
本稿では、参照テキストにおけるそのような注意散らし命令に対する堅牢性を評価するためのベンチマークであるDistractionIFを紹介する。
論文 参考訳(メタデータ) (2026-05-28T07:18:15Z) - AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models [12.774216017720642]
事前学習された視覚言語モデル(VLM)は強力なゼロショット一般化を示すが、敵の摂動に弱いままである。
本稿では,アライメントガイド付ファインチューニング(AGFT)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-31T08:17:27Z) - LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models [15.955490895662384]
本稿では,言語一般化の詳細な解析のためのベンチマークであるLIBERO-Paraを紹介する。
パラフレージングにより22-52ppの連続的な性能劣化が観察された。
本稿では,意味的因子と構文的因子を用いてパラフレーズの難易度を定量化する指標PRIDEを提案する。
論文 参考訳(メタデータ) (2026-03-30T11:27:34Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models [64.99746027349767]
Adversarial Robustness Adaptation (R-Adapt)は、トレーニング済みのすべての重みを凍結し、初期層のみに限って最小限の洞察駆動適応を導入するフレームワークである。
R-Adaptは、大きな視覚言語モデル(LLaVAやQwen-VLなど)に効率よく一般化し、ロバスト性を高める。
論文 参考訳(メタデータ) (2026-03-13T09:02:11Z) - ActionCodec: What Makes for Good Action Tokenizers [106.78093973045526]
VLA(Vision-Language-Action)モデルでは、より優れた命令追従と訓練効率が示されている。
このパラダイムの中心はアクショントークン化であるが、その設計は主に再構築の忠実さに焦点を当てている。
我々は、トレーニング効率とVLA性能の両方を大幅に向上させる高性能なアクショントークンであるtextbfActionCodecを紹介する。
論文 参考訳(メタデータ) (2026-02-17T07:07:15Z) - Understanding Degradation with Vision Language Model [56.09241449206817]
視覚的劣化を理解することは、コンピュータビジョンにおいて重要な問題であるが、難しい問題である。
本稿では,教師付き微調整と強化学習を併用したマルチモーダル・チェーン・オブ・ソート・モデルであるDU-VLMを紹介する。
また,110,000個のクリーン劣化ペアと接地された物理アノテーションからなる大規模データセットである textbfDU-110k も導入した。
論文 参考訳(メタデータ) (2026-02-04T13:51:15Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models [15.709482146201283]
現代のビジョン・ファンデーション・モデル(Vision Foundation Models)の凍結した特徴に基づいて訓練された単純な線形分類器は、新しい最先端技術を確立している。
この基準線は標準ベンチマーク上の特別な検出器と一致し、また、ウィジェット内のデータセット上では決定的に優れていることを示す。
我々は、AIの法医学におけるパラダイムシフトを提唱し、静的ベンチマークの過度な適合から、ファンデーションモデルの進化する世界の知識を現実の信頼性に活用することへと移行した。
論文 参考訳(メタデータ) (2026-02-02T07:20:02Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。