論文の概要: Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.01573v1
- Date: Mon, 03 Aug 2026 01:11:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.290231
- Title: Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models
- Title(参考訳): 視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線・視線
- Abstract要約: 位置ブラインドスポット(PBS)を緩和する2段階のブラックボックスフレームワークを提案する。
これらのPBS領域から収集したデモに対して,LoRAを介してポリシーを微調整し,ワークスペース全体のパフォーマンスを維持しながら,その能力を向上させる。
検索戦略は平均0.678のF1スコアを達成し、ランダム検索と適応サンプリングベースラインをそれぞれ0.268と0.178で上回った。
- 参考スコア(独自算出の注目度): 10.146688961256869
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Vision-Language-Action (VLA) models achieve promising performance in robotic manipulation, typically measured by success rates aggregated over predefined object configurations, an evaluation that implicitly assumes spatially uniform competence across the workspace. However, this assumption does not hold: even with the instruction and every other scene factor held fixed, merely relocating a task-irrelevant distractor can sharply raise the failure probability within localized, spatially coherent regions, which we term Positional Blind Spots (PBS). In this paper, we propose a two-stage black-box framework to uncover and mitigate PBS. During the uncovering stage, we grid the workspace and apply a one-sided log-likelihood-ratio test to localize PBS cells with significantly elevated risk. During the mitigation stage, we fine-tune the policy via LoRA on demonstrations collected from these PBS regions, improving competence there while largely preserving performance across the rest of the workspace. We evaluate our framework on five state-of-the-art VLA policies across two benchmarks, and find that PBS are pervasive and spatially concentrated in all of them, with failure rates up to 0.58. Our search strategy achieves an average F1-score of 0.678, outperforming random search and adaptive sampling baselines by 0.268 and 0.178, respectively. Guided by the discovered regions, targeted fine-tuning reduces the overall failure rate by 40.00%--85.19%.
- Abstract(参考訳): 近年のVLA(Vision-Language-Action)モデルでは、ロボット操作における有望なパフォーマンスを実現している。
しかし、この仮定は成り立たない: 命令と他のシーン要素が固定されている場合でも、単にタスク非関連なイントラクタを移動するだけで、局所的で空間的に整合した領域内の障害確率を急上昇させることができる。
本稿では,PBSの発見と緩和を目的とした2段階のブラックボックスフレームワークを提案する。
発見段階では,作業空間を網羅し,一方の対数様比検定をPBS細胞の局在化に適用し,リスクを著しく高める。
緩和段階では、これらのPBS領域から収集したデモに対してLoRAを介してポリシーを微調整し、その能力を向上させるとともに、ワークスペース全体のパフォーマンスをほぼ維持する。
2つのベンチマークにまたがる5つの最先端VLAポリシーの枠組みを評価し、PBSが広範で空間的に集中しており、失敗率は最大0.58であることを確認した。
検索戦略は平均0.678のF1スコアを達成し、ランダム検索と適応サンプリングベースラインをそれぞれ0.268と0.178で上回った。
発見地域によってガイドされ、目標の微調整により、全体の故障率は40.00%--85.19%減少する。
関連論文リスト
- Robust Validation to Geometric Perturbations for Autonomous Pose Estimation [0.8062121966457854]
視覚に基づくナビゲーションと自律着陸では、機械学習コンポーネントは動的操作条件下で厳格な検証を必要とする。
標準勾配に基づくポーズ推定は、ポーズ推定に失敗し、しばしば単純なランダムサンプリングベースラインよりも悪いパフォーマンスを示す。
我々はGLO(Global Lipschitzian)におけるロバストネス推定を再構成する。
これは、幾何学的検証を連続キーポイント回帰とディープオブジェクト検出に拡張する最初の研究である。
論文 参考訳(メタデータ) (2026-08-21T13:08:37Z) - Beyond Mode Collapse: Distribution Matching for Diverse Reasoning [69.88237286885065]
GRPOのようなオンライン強化学習手法はモード崩壊に悩まされる。
このことは、逆KL最小化のモード探索行動に由来することを示す。
KL最小化の原理的近似によりモード崩壊を防止するDMPOを提案する。
論文 参考訳(メタデータ) (2026-05-19T07:13:00Z) - Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation [50.23374353859762]
多様な単発デモを収集することで「最大限のカバレッジ」を達成できる。
我々は、この現象を包括的-密度トレードオフとして定式化する。
Anchor-Centric Adaptation (ACA) は、2段階のフレームワークで、まずコアアンカーでの繰り返しデモを通じてポリシースケルトンを安定化し、次に教師力によるエラーマイニングと制約付き残差更新を通じて高リスク境界までカバー範囲を広げる。
論文 参考訳(メタデータ) (2026-05-08T07:35:24Z) - Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming [64.48633529149579]
本稿では,VLA(Vision-Language-Action)モデルの言語的変異に対する脆弱性を明らかにするための新しいフレームワークを提案する。
本手法は, ストレス試験用VLAエージェントへのスケーラブルなアプローチを示すため, 平均作業成功率を93.33%から5.85%に下げる。
論文 参考訳(メタデータ) (2026-04-07T08:43:36Z) - ROBOGATE: Adaptive Failure Discovery for Safe Robot Policy Deployment via Two-Stage Boundary-Focused Sampling [0.0]
ROBOGATEは、物理に基づくシミュレーションと2段階適応サンプリング戦略を組み合わせたデプロイメントリスク管理フレームワークである。
我々は、Franka Panda (7-DOF) とUR5e (6-DOF) の2つのロボット体のスクリプトによるピック・アンド・プレイス・コントローラーの評価を行った。
我々のロジスティック回帰リスクモデルは、組み合わせたデータセットで0.780のAUCを達成する。
論文 参考訳(メタデータ) (2026-03-23T15:52:54Z) - Manifold of Failure: Behavioral Attraction Basins in Language Models [0.49388902330345724]
本稿では,大規模言語モデル(LLM)における失敗のマニフォールドを体系的にマッピングするフレームワークを提案する。
これらの障害領域の連続的なトポロジを照らすためにMAP-Elitesを用いて、脆弱性の探索を品質多様性問題として再編成する。
3つのLSMにわたって、MAP-Elitesは最大63%の行動カバレッジを実現し、最大370の脆弱性ニッチを発見し、モデル固有のトポロジカルシグネチャが劇的に異なることを示す。
論文 参考訳(メタデータ) (2026-02-25T15:08:20Z) - Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models [59.242742594156546]
CoEvoは、テキストプロキシとビジュアルプロキシの両方を双方向でサンプル条件で適応するテストタイムフレームワークである。
CoEvoは最先端のパフォーマンスを実現し、AUROCを1.33%改善し、ImageNet-1KではFPR95を45.98%削減した。
論文 参考訳(メタデータ) (2026-01-13T12:08:26Z) - Navigating the Reality Gap: Privacy-Preserving Adaptation of ASR for Challenging Low-Resource Domains [4.585227671447896]
インドにおける多言語モデル(IndicWav2Vec)は、インドの農村部の臨床データに対して40.94%のWERに低下し、使用不能となることを示す。
これを解決するために、ローランド適応(LoRA)による局所的かつ連続的な適応を可能にするゼロデータ抽出フレームワークについて検討する。
以上の結果から,マルチドメインエクスペリエンス・リプレイ(ER)が主性能向上を達成し,目標WERの17.1%の相対的な改善を実現した。
論文 参考訳(メタデータ) (2025-12-18T10:56:27Z) - Enhancing CLIP Robustness via Cross-Modality Alignment [54.01929554563447]
視覚言語モデルのための最適なトランスポートベースフレームワークであるクロスモダリティアライメントを提案する。
COLAは、グローバルな画像テキストアライメントと特徴空間における局所的な構造的一貫性を復元する。
COLAはトレーニングフリーで、既存の微調整モデルと互換性がある。
論文 参考訳(メタデータ) (2025-10-28T03:47:44Z) - Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognition [26.27331683733832]
視覚的位置認識(VPR)は、ジオタグ付き画像のデータベースを参照することにより、クエリ画像の位置を予測することを目的としている。
既存の手法では、識別領域の正確なモデリングと完全な利用が欠如している。
本稿では、画像検索とVPRにおける再ランク付けを同時に行うために、FoL(FoL)アプローチを提案する。
論文 参考訳(メタデータ) (2025-04-14T05:04:51Z) - Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction [80.67150791183126]
事前訓練された視覚言語モデル(VLM)は、印象的なゼロショット認識能力を示したが、それでも高密度予測タスクでは性能が劣っている。
提案するDenseVLMは,非バイアスの領域言語アライメントを,強力な事前学習型VLM表現から学習するためのフレームワークである。
DenseVLMは、オープン語彙オブジェクト検出および画像分割法において、元のVLMを直接置き換えることができることを示す。
論文 参考訳(メタデータ) (2024-12-09T06:34:23Z) - Locally Estimated Global Perturbations are Better than Local Perturbations for Federated Sharpness-aware Minimization [81.32266996009575]
フェデレートラーニング(FL)では、クライアント間の複数ステップの更新とデータの均一性が、よりシャープなミニマによるロスランドスケープにつながることが多い。
クライアント側におけるグローバルな摂動方向を局所的に推定する新しいアルゴリズムであるFedLESAMを提案する。
論文 参考訳(メタデータ) (2024-05-29T08:46:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。