論文の概要: Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- arxiv url: http://arxiv.org/abs/2605.22903v1
- Date: Thu, 21 May 2026 17:35:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.036225
- Title: Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Title(参考訳): 見ずに見る:ビジョンランゲージベンチマークは本当にビジョンをテストするのか?
- Abstract要約: ベンチマーク精度はしばしば、視覚言語モデルにおける基底的な視覚的理解を反映していると仮定される。
我々は、このミスマッチをオープンソースの視覚言語モデルで体系的に研究する。
VLMは視覚入力を取り入れているが、その予測はきめ細かい視覚的証拠の喪失にはあまり敏感ではない。
- 参考スコア(独自算出の注目度): 10.315515647818009
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Benchmark accuracy is often implicitly assumed to reflect grounded visual understanding in vision-language models (VLMs), yet it remains unclear to what extent such scores truly reflect reliance on visual evidence. Motivated by a surprising observation that removing a substantial fraction of image tokens only degrades model performance very slightly on a widely used hallucination benchmark, we systematically investigate this mismatch in a set of open-source VLMs. Our analysis spans multiple levels of granularity, spanning global visual degradation, localized occlusion, question reformulation, answer-space expansion, and decision-level analyses beyond standard accuracy. We further complement these behavioral results with a layer-wise analysis of vision-token geometry. Throughout the experiments, we find that although VLMs do incorporate visual input, their predictions are less sensitive to the loss of fine-grained visual evidence that standard accuracy should have suggested. Even when the final prediction remains unchanged, the model's internal support for the correct answer may already be weakened. We further complement a representation-level analysis, which shows increasing similarity among visual tokens in deeper layers, providing a possible explanation for our findings. Together, these results suggest that current benchmarks are not sufficient to reliably evaluate fine-grained visual grounding in VLMs.
- Abstract(参考訳): ベンチマーク精度は視覚言語モデル(VLM)の基盤的な視覚的理解を反映していると暗黙的に仮定されることが多いが、そのようなスコアが実際に視覚的証拠に依存しているかどうかは不明である。
画像トークンのかなりの部分を削除することは、広く使われている幻覚ベンチマークにおいて、モデル性能をわずかに低下させるだけで、このミスマッチをオープンソースのVLMで体系的に研究する。
我々の分析は、グローバルな視覚的劣化、局所的な隠蔽、質問の修正、回答空間の拡大、および標準精度を超える決定レベルの分析など、様々なレベルの粒度にまたがる。
さらに,これらの挙動を視覚-視覚幾何学の階層的解析により補完する。
実験を通して、VLMは視覚入力を取り入れているが、それらの予測は、標準精度が示唆すべき微細な視覚的証拠の喪失にはあまり敏感でないことがわかった。
最終的な予測が変更されていない場合でも、モデルの正解に対する内部サポートはすでに弱まる可能性がある。
さらに、より深い層における視覚トークン間の類似性の増加を示す表現レベル解析を補完し、この結果について説明できる。
これらの結果から、現在のベンチマークでは、VLMの微細な視覚的接地を確実に評価するには不十分であることが示唆された。
関連論文リスト
- Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds [12.841957617988148]
本研究では,タスクの視覚的提示がモデル性能と障害モードを,基礎となる推論問題が変化しない場合にどのように形成するかを検討する。
空間構造をより使いやすくしながら、視覚的モダリティを保ちつつ、軽量な入力側足場を導入する。
視覚提示は,VLMベンチマークが基底認識,下流推論,あるいは両者の混合を計測するかどうかを決定する中心的な要因であることがわかった。
論文 参考訳(メタデータ) (2026-08-21T14:40:26Z) - Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis [63.49939245944781]
我々は1100万の質問と0.28万の画像を含む総合的なきめ細かい評価ベンチマークであるFG-BMKを紹介する。
現在のLVLMは、視覚的表現、セマンティックグラウンドディング、モダリティアライメント、カテゴリーレベルの知識において、相互に絡み合ったボトルネックから生じる障害を伴って、微粒化認識器が不十分なままである。
論文 参考訳(メタデータ) (2026-06-17T13:23:26Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Unveiling the Visual Counting Bottleneck in Vision-Language Models [49.591496870141846]
この研究は視覚的数え上げを3つの認知段階(視覚的識別、大きさ認識、象徴的マッピング)に分解する。
合成Go基板と線形プローブを用いて、視覚的バックボーンは、外挿系にしっかりと、線形に分離可能な量表現を保っていることを示す。
我々は、崩壊をシンボルマッピングステージに向ける。そこでは、モデルがシンボルトークンに有効な視覚的大きさを投影することに失敗する。
論文 参考訳(メタデータ) (2026-05-28T16:20:29Z) - Counting to Four is still a Chore for VLMs [3.017198998175514]
視覚言語モデル(VLM)は、複雑なマルチモーダル推論タスクにおいて印象的な性能を達成した。
それらは依然として、オブジェクトカウントのような単純な接地スキルで失敗します。
本稿では, 挙動解析と力学解析の両方を通して, VLM計数行動の実証的研究を行った。
論文 参考訳(メタデータ) (2026-04-11T05:23:19Z) - VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning [5.887179947363831]
大規模視覚言語モデル(LVLM)は、強いマルチモーダル推論を実現するが、幻覚や誤った反応を高い確信でしばしば示す。
既存の言語化された信頼度校正法は、主にテキストのみのLLM向けに開発され、通常、バイナリ応答レベルの正しさを使用して単一の総合的な信頼度スコアを最適化する。
本稿では,信頼を視覚的・理性的な信頼に明確に分離する強化学習フレームワークであるVL-Calibrationを提案する。
論文 参考訳(メタデータ) (2026-04-10T17:47:19Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images [34.324634481264034]
我々は、忠実な視覚的推論を評価するために設計されたプロセス検証可能なベンチマークであるViEBenchを提案する。
専門家による視覚的エビデンスを含む200個の高解像度画像を合成し、ViEBenchは難易度でタスクを知覚と推論の次元に分類する。
実験の結果,(1)VLMは無関係な領域に接するにもかかわらず,正しい最終回答を導き出すことができ,(2)正しい証拠を見つけることはできるが,正確な結論に至らなかった。
論文 参考訳(メタデータ) (2026-01-14T07:25:15Z) - Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment [7.969076042774561]
低レベルの歪み知覚タスクを導入し、モデルが特定の歪みタイプを分類する必要がある。
解析の結果,MLLMは構造的にそのような歪みを表現できるが,トレーニングテンプレートに適合しがちであることがわかった。
視覚エンコーダのアライメントを改善することで、歪み認識精度が劇的に向上し、14.92%から84.43%に向上することを示す。
論文 参考訳(メタデータ) (2025-12-10T12:06:47Z) - Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation [14.521056434373213]
大規模視覚言語モデル (LVLM) はテキスト画像のアライメントを判断するツールとして好まれている。
対人的視覚操作は、LVLM審査員が不当に膨らんだスコアを割り当てることを体系的に騙すことができるか?
敵対的な視覚操作は、LVLM審査員を体系的に騙して不当に膨らませたスコアを割り当てることができるか?
論文 参考訳(メタデータ) (2025-05-21T08:24:28Z) - Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions [75.45274978665684]
VLU(Vision-Language Understanding)ベンチマークには、提供されたコンテキストによってサポートされない仮定に答えが依存するサンプルが含まれている。
サンプル毎にコンテキストデータを収集し,エビデンスに基づくモデル予測を促進するためにコンテキスト選択モジュールをトレーニングする。
我々は,十分なコンテキストを欠いたサンプルを同定し,モデル精度を向上させる汎用なコンテキスト・アワレ認識検出器を開発した。
論文 参考訳(メタデータ) (2024-05-18T02:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。