論文の概要: Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.26326v1
- Date: Tue, 28 Jul 2026 22:52:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.492943
- Title: Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models
- Title(参考訳): 多モーダル大規模言語モデルにおける視覚的文脈感性
- Authors: Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson,
- Abstract要約: MLLM(Multimodal Large Language Models)は、事前訓練された言語モデルの豊富な事前情報と視覚入力を統合することで、高い性能を達成する。
しかし、視覚的な証拠が事前訓練された知識と矛盾する場合、視覚中心のタスクでは失敗することが多い。
2つの診断パラダイムを用いてこれらの障害を探索する。(1)視覚情報が利用可能かどうかの探索、(2)画像再構成、(2)マルチモーダルコンテキスト感度の測定である。
- 参考スコア(独自算出の注目度): 14.5102059776721
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal Large Language Models (MLLMs) achieve strong performance by integrating visual inputs with the rich priors of pretrained language models. However, they often fail on vision-centric tasks, especially when visual evidence conflicts with pretrained knowledge. We explore these failures separately using two diagnostic paradigms: (1) probing whether visual information is available, via image reconstruction, and (2) measuring multimodal context sensitivity, the extent to which the model follows visual context versus the language prior. To support the second, we introduce the WhatIfVis, a benchmark spanning five coarse-grained dimensions (spatial-temporal, color, count, size, and weight) whose questions admit answers from either the image or the prior. Our analysis yields three findings: (i) Coarse-grained visual evidence is preserved, as these attributes can be reconstructed from the final-layer image tokens of frozen MLLMs. Failures on questions about these attributes therefore point to post-perceptual utilization, rather than to degraded visual encoding during perception. (ii) Even when explicitly instructed to use or ignore visual evidence, vanilla models (without supervised fine-tuning on the WhatIfVis) show unstable visual context sensitivity. Supervised fine-tuning (SFT) improves this controllability and generalizes across domains, and activation patching further localizes the vision-versus-prior trade-off at architecture-specific depths across all six models. (iii) The vision-versus-prior trade-off is controllable along a learned vector. Applying this steering vector, even without any intent instruction, improves controllability over the vanilla model. Together, these results relocate the bottleneck, indicating that for the coarse attributes we study, MLLMs encode the visual evidence but cannot reliably control their reliance on it.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、事前訓練された言語モデルの豊富な事前情報と視覚入力を統合することで、高い性能を達成する。
しかし、視覚的な証拠が事前訓練された知識と矛盾する場合、視覚中心のタスクでは失敗することが多い。
1)視覚情報が利用可能かどうかを画像再構成を用いて検証し,(2)視覚的文脈に追従する程度であるマルチモーダルな文脈感度を測定する。
このベンチマークは5つの粗い次元(空間時間、色、数、サイズ、重さ)にまたがるもので、画像または先行画像からの回答を認めている。
私たちの分析では3つの結果が得られます。
一 凍結MLLMの最終層画像トークンからこれらの属性を再構成することができるので、粗粒の視覚的証拠を保存することができる。
これらの属性に関する質問の失敗は、知覚中の視覚的エンコーディングを劣化させるのではなく、知覚後の利用を指す。
(II)視覚的エビデンスの使用や無視を明示的に指示した場合においても,バニラモデル(WhatIfVisの教師なし微調整)は不安定な視覚的文脈感受性を示す。
Supervised Fine-tuning (SFT)は、この制御性を改善し、ドメインをまたいで一般化する。
三 視覚反転優先トレードオフは、学習ベクトルに沿って制御可能であること。
このステアリングベクターを適用すると、意図的な命令がなくても、バニラモデルに対する制御性が向上する。
これらの結果から, MLLMは視覚的エビデンスを符号化するが, それらの依存度を確実に制御することはできないことが示唆された。
関連論文リスト
- See2Think: Do Multimodal Models Really Use Intermediate Visual States? [12.082470543980422]
See2ThinkBenchとVisual Action-of-Thought (VAoT)を組み合わせた統合評価フレームワークであるSeee2Thinkを紹介する。
VAoTは4つの制御された推論設定の下で、テキストの思考、視覚行動、レンダリングされた状態、およびその後の推論を記録する。
視覚的推論はモデルに依存し、環境に依存しており、タスク間で一貫した1つの設定が支配的でないことが分かっています。
論文 参考訳(メタデータ) (2026-07-29T11:10:34Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models [58.9387276447485]
視覚推論 前者(VIF)は、純粋な視覚表現とモデルの出力空間の間の橋渡しを確立する軽量アーキテクチャモジュールである。
一般的な推論、OCR、テーブル理解、視覚中心の評価、幻覚を含む14のベンチマークタスクについて実験を行った。
論文 参考訳(メタデータ) (2026-05-18T10:04:22Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - See or Recall: A Sanity Check for the Role of Vision in Solving Visualization Question Answer Tasks with Multimodal LLMs [13.330105502094721]
MLLMがどのように可視化について認識し、理由を判断するかは、人間が同じ問題にどのようにアプローチするかと根本的に異なる。
規則に基づく決定木と正当性チェックテーブルを統合した包括的正当性チェックフレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-14T02:19:28Z) - Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs [50.77984109941538]
近年のマルチモーダル LLM の視覚能力は, いまだに系統的な欠点を呈している。
CLIP-blind pairs'(CLIP-blind pairs)を識別する。
様々なCLIPに基づく視覚・言語モデルの評価を行い、CLIPモデルに挑戦する視覚パターンとマルチモーダルLLMの問題との間に顕著な相関関係を見出した。
論文 参考訳(メタデータ) (2024-01-11T18:58:36Z) - DiMBERT: Learning Vision-Language Grounded Representations with
Disentangled Multimodal-Attention [101.99313208598569]
視覚と言語(V-L)タスクは、視覚内容と自然言語の両方を理解する必要がある。
視覚と言語に対する注意空間を分離したDiMBERT(Disentangled Multimodal-Attention BERT)を提案する。
DiMBERTは3つのタスクに対して最新のパフォーマンスを新たに設定する。
論文 参考訳(メタデータ) (2022-10-28T23:00:40Z) - Visual Perturbation-aware Collaborative Learning for Overcoming the
Language Prior Problem [60.0878532426877]
本稿では,視覚的摂動校正の観点から,新しい協調学習手法を提案する。
具体的には、異なる摂動範囲で2種類のキュレートされた画像を構築するための視覚コントローラを考案する。
2つの診断VQA-CPベンチマークデータセットの実験結果は、その効果を明らかに示している。
論文 参考訳(メタデータ) (2022-07-24T23:50:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。