論文の概要: The Visual Insensitivity Gap: Diagnosing When Vision-Language Models Fail to Use Visual Evidence
- arxiv url: http://arxiv.org/abs/2609.00868v1
- Date: Tue, 01 Sep 2026 08:01:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.445362
- Title: The Visual Insensitivity Gap: Diagnosing When Vision-Language Models Fail to Use Visual Evidence
- Title(参考訳): 視覚不感のギャップ:視覚言語モデルが視覚的エビデンスの使用に失敗した場合の診断
- Authors: Genpei Zhang,
- Abstract要約: 我々はこの現象を視覚不感ギャップと呼び、サンプルごとの視覚感度指数(VSI)で定量化する。
この仮定は、6つのVLMと3つの知覚的ベンチマークで40%~97%のサンプルで失敗することを示す。
- 参考スコア(独自算出の注目度): 1.7844382164707184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models are evaluated by aggregate accuracy on multimodal benchmarks, a practice that implicitly assumes the model uses its visual input. We show this assumption fails on 40%--97% of samples across six VLMs and three perceptual benchmarks: blurring the question-relevant visual region leaves the next-token distribution nearly unchanged. We name this phenomenon the Visual Insensitivity Gap and quantify it with a per-sample Visual Sensitivity Index (VSI). The gap is a property of samples, not of models: VSI ranks correlate across models (grand-mean Spearman rho=+0.40, permutation p<10^-3), so the same samples are flagged insensitive by VLMs sharing no architectural detail beyond a contrastively pretrained vision tower. The mechanism is concrete: on the insensitive samples, a linear probe on each model's own vision tower distinguishes perturbed from clean images at 0.72--0.79 accuracy, yet the model's argmax token changes on only 2%--11% of the same samples, an encoder--LLM gap above 0.65 on every model. Mapping VSI's diagnostic utility cell by cell surfaces a strong regime (multi-choice reasoning on capable VLMs: AUROC=0.85--0.87) and a weak regime (well-calibrated factuality, where softmax confidence already leads). VSI is not a universal best abstention signal; it is a sample-intrinsic indicator of vision-ignoring failure, best used as a conditional ensemble component.
- Abstract(参考訳): 視覚言語モデルは、そのモデルが視覚入力を使用すると暗黙的に仮定するプラクティスであるマルチモーダルベンチマークの集約精度によって評価される。
この仮定は、6つのVLMと3つの知覚的ベンチマークで40%~97%のサンプルで失敗することを示す。
我々はこの現象を視覚不感ギャップと呼び、サンプルごとの視覚感度指数(VSI)で定量化する。
VSIランクはモデル間で相関する(グランド平均スピアマンrho=+0.40、置換p<10^-3)ため、VLMは対照的に事前訓練された視覚塔以外のアーキテクチャの詳細を共有しない。
このメカニズムは具体的であり、各モデルの視覚塔上の線形プローブは、クリーン画像からの摂動を0.72--0.79精度で区別するが、モデルのargmaxトークンは同一サンプルの2%--11%で変化し、エンコーダ-LLMギャップは0.65以上である。
細胞表面によるVSIの診断ユーティリティーセルのマッピングは、強力なレジーム(有能なVLMの多重選択推論: AUROC=0.85--0.87)と弱いレジーム(ソフトマックスの信頼性が既に導かれる、よく校正された事実)である。
VSIは、視覚を無視する障害のサンプル-本質的な指標であり、条件付きアンサンブル成分として最もよく用いられる。
関連論文リスト
- NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models [40.71918318095227]
ビジョンファクターモデル(VLM)は、高レベルなマルチモーダルタスクにおいて高い性能を達成するが、数値認識はあまり理解されていない。
我々は,6つの制御条件にわたる10,800の合成画像からなる認知にインスパイアされた診断ベンチマークであるNumerosityVLMを紹介した。
論文 参考訳(メタデータ) (2026-08-15T22:01:21Z) - Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization [0.44787896002954924]
広範に使われている5つの視覚言語モデル(VLM)を評価する。
本実験では, エンゲージメント認識のためのゼロショットVLMの3つの主要な故障モードを明らかにした。
論文 参考訳(メタデータ) (2026-06-20T03:53:40Z) - Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models [29.66841995436342]
現代の視覚言語モデル(VLM)は、計量距離クエリでは信頼できないままである。
我々は,Hypersim,ScanNet,KITTI360から構築したマルチビュー評価プロトコルであるtextbfViewDiagを紹介する。
安定な予測は、証拠に敏感な推論よりも先駆的な崩壊を反映している可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-01T18:06:08Z) - Unveiling the Visual Counting Bottleneck in Vision-Language Models [49.591496870141846]
この研究は視覚的数え上げを3つの認知段階(視覚的識別、大きさ認識、象徴的マッピング)に分解する。
合成Go基板と線形プローブを用いて、視覚的バックボーンは、外挿系にしっかりと、線形に分離可能な量表現を保っていることを示す。
我々は、崩壊をシンボルマッピングステージに向ける。そこでは、モデルがシンボルトークンに有効な視覚的大きさを投影することに失敗する。
論文 参考訳(メタデータ) (2026-05-28T16:20:29Z) - Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision? [10.315515647818009]
ベンチマーク精度はしばしば、視覚言語モデルにおける基底的な視覚的理解を反映していると仮定される。
我々は、このミスマッチをオープンソースの視覚言語モデルで体系的に研究する。
VLMは視覚入力を取り入れているが、その予測はきめ細かい視覚的証拠の喪失にはあまり敏感ではない。
論文 参考訳(メタデータ) (2026-05-21T17:35:04Z) - To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs [1.9349092719498848]
Tri-Layer Diagnostic Frameworkは、潜在異常検出、ビジュアル必要スコア、コンペティションスコアという3つのメトリクスを通じて幻覚ソースをアンハングルする。
我々の分類では、69.6%のサンプルが視覚的シコファンシーを示しており、モデルは視覚異常を検知するが、ユーザーの期待を満足させるために幻覚を与える。
論文 参考訳(メタデータ) (2026-03-19T00:15:05Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection [55.54007781679915]
本稿では,多種多様な視覚的エンコーディングを効率よく融合させ,モデルの微粒化知覚を高めるSynergistic Semantic-Visual Prompting (SSVP)を提案する。
SSVPは、MVTec-AD上で93.0%のImage-AUROCと92.2%のPixel-AUROCで最先端のパフォーマンスを達成し、既存のゼロショットアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-14T04:42:19Z) - Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens [53.99177152562075]
視覚における自己回帰モデルのスケールアップは、大きな言語モデルほど有益でないことが証明されている。
モデルが離散トークンを使用するか、連続トークンを使用するか、BERTやGPTのようなトランスフォーマーアーキテクチャを用いてランダムまたは固定順序でトークンを生成するか、という2つの重要な要素に焦点を当てる。
その結果,すべてのモデルが検証損失の点で効果的にスケールしているのに対して,評価性能はFID,GenEvalスコア,視覚的品質などによって異なる傾向を呈することがわかった。
論文 参考訳(メタデータ) (2024-10-17T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。