論文の概要: Validating, Not Sampling: Region-Level Robustness of Vision-Language and Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2609.22293v1
- Date: Mon, 14 Sep 2026 08:53:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.365556
- Title: Validating, Not Sampling: Region-Level Robustness of Vision-Language and Vision-Language-Action Models
- Title(参考訳): サンプリングしない検証:ビジョンランゲージの領域レベルロバスト性とビジョンランゲージ-アクションモデル
- Abstract要約: 視覚言語モデル(VLM)と視覚言語アクションモデル(VLA)は、現実のアプリケーションにますます多くデプロイされている。
これらのモデルの既存のベンチマークはサンプル摂動のみであり、未試験領域に障害がないことを保証するものではない。
画像摂動の連続領域全体の6つのVLMと5つのVLAの検証を行った。
- 参考スコア(独自算出の注目度): 22.88024814370669
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language models (VLMs) and vision-language-action models (VLAs) are increasingly deployed in real-world applications. There, a small perturbation to the recorded camera image may change a decision significantly. However, existing benchmarks for these models only sample perturbations, which does not guarantee the absence of a failure in the untested region. We present the first robustness validation of six VLMs (drawn from the Gemma, InternVL, LLaVA, and Qwen families) and five VLAs (drawn from the GR00T, OpenVLA, and $π$ families) over entire continuous regions of photometric and geometric image perturbation: brightness shifts, camera rotations, and their composition. To this end, we build on the validation framework H$^2$V and introduce H$^2$V-M, a margin-aware convergence rule that makes validation affordable at the 32B parameter scale. We demonstrate that H$^2$V-M outperforms H$^2$V by an order of magnitude in model queries and that it finds counterexamples faster than random sampling while providing soundness guarantees. Our VLM and VLA robustness validation shows that robustness is mostly dependent on the perturbation type, rather than the model, and that VLMs are more robust to large camera rotations than VLAs. For VLAs, even perturbations as small as $\pm1^\circ$ can change the commanded action in many cases. We also show that robustness depends more on model family than on model size.
- Abstract(参考訳): 視覚言語モデル(VLM)と視覚言語アクションモデル(VLA)は、現実のアプリケーションにますます多くデプロイされている。
ここでは、記録されたカメラ画像に対する小さな摂動が決定を大きく変える可能性がある。
しかし、これらのモデルの既存のベンチマークはサンプル摂動のみであり、未試験領域の障害がないことを保証するものではない。
本稿では,6つのVLM(Gemma,InternVL,LLaVA,Qwenファミリー)と5つのVLA(GR00T,OpenVLA,および$π$ファミリーから引き出された)を,光度シフト,カメラ回転,およびそれらの構成の連続領域全体にわたって,初めてロバスト性検証を行った。
この目的のために、検証フレームワーク H$^2$V 上に構築し、32Bパラメータスケールでの検証を手頃な価格にするためのマージン対応収束ルール H$^2$V-M を導入する。
我々は,H$^2$V-Mがモデルクエリの桁違いにH$^2$Vを上回ることを示した。
我々のVLMとVLAのロバスト性検証では、ロバスト性はモデルよりも摂動型に依存しており、VLMはVLAよりも大きなカメラ回転に対してロバストであることが示されている。
VLA の場合、$\pm1^\circ$ 程度の摂動でさえ、多くの場合、命令されたアクションを変更することができる。
また、ロバスト性はモデルサイズよりもモデルファミリに依存していることも示しています。
関連論文リスト
- VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Questioning the Stability of Visual Question Answering [11.848401203578456]
ビジュアル言語モデル(VLM)は目覚ましい進歩を遂げているが、その信頼性は小さく、意味を保った入力変更ではよく理解されていない。
視覚的・テキスト的摂動に配慮したVLMロバスト性の最初の大規模・系統的研究について述べる。
最新のシステム(例えば、GPT-4o、Gemini 2.0 Flash)は、少数のピクセルや無害なリフレージングでしばしば失敗することを示す。
論文 参考訳(メタデータ) (2025-11-14T12:05:05Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models [28.422082187079166]
我々は、Vision-Language-Action(VLA)モデルのテスト時間スケーリングフレームワークであるRoboMonkeyを紹介した。
RoboMonkeyは、VLAから小さなアクションの集合をサンプリングし、ガウス摂動と過半数投票を適用してアクション提案分布を構築し、次に視覚言語モデル(VLM)ベースの検証器を使用して最適なアクションを選択する。
既存のVLAとRoboMonkeyのペアリングは大きなパフォーマンス向上をもたらし、アウト・オブ・ディストリビューションタスクでは25%、イン・ディストリビューションタスクでは9%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-06-21T20:56:17Z) - VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models [84.84277196012907]
VLsI: Verbalized Layers-to-Interactions, a new VLM family in 2B and 7B model size。
GPT-4Vよりも優れた性能向上(2Bは11.0%、7Bは17.4%)を達成した。
論文 参考訳(メタデータ) (2024-12-02T18:58:25Z) - MiniVLM: A Smaller and Faster Vision-Language Model [76.35880443015493]
MiniVLMは視覚特徴抽出器と視覚言語融合モジュールの2つのモジュールで構成されている。
MiniVLMはモデルサイズを73%$、推論時間コストを94%$に削減する。
論文 参考訳(メタデータ) (2020-12-13T03:02:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。