論文の概要: Detect Before You Leap: Mirage Detection in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.00435v1
- Date: Fri, 29 May 2026 23:51:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.40657
- Title: Detect Before You Leap: Mirage Detection in Vision-Language Models
- Title(参考訳): 目視領域モデルにおけるミラージュ検出
- Abstract要約: 視覚言語モデル(VLM)は、必要な視覚的証拠が欠落している、空白である、あるいは疑問に無関係である場合でも、自信ある視覚的答えを生み出すことができる。
プレリリースミラージュ検出について検討し、画像探索ペアが与えられた場合、VLMが応答するかどうかを判定する。
本稿では,CLIP ViT-H/14ビジョンエンコーダのレイヤ間でパッチトケン表現を探索するモデル非依存手法であるテクストコンディション・レイヤワイド・インテリアアライメント(TC-LIA)を提案する。
- 参考スコア(独自算出の注目度): 2.6212127510234797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) can produce confident visual answers even when the required visual evidence is missing, blank, or unrelated to the question. This failure mode, known as mirage (Asadi et al. 2026), is especially concerning in medical and document visual question answering, where plausible but visually ungrounded responses may be mistaken for image-based evidence. We study pre-release mirage detection: given an image-question pair, the goal is to determine whether a VLM should answer or abstain before producing a response. We propose Text-Conditioned Layer-wise Internal Alignment (TC-LIA), a model-agnostic method that probes patch-token representations across the layers of a CLIP ViT-H/14 vision encoder. TC-LIA projects layer-wise image patch tokens into the final CLIP embedding space and measures their similarity to the question embedding, allowing the method to track whether question-relevant visual evidence emerges across vision layers. The resulting alignment trajectory is summarized using final image-text cosine similarity, late-layer top-k patch-text alignment, early-to-late gain, and layer-wise slope. These features are combined with pixel-statistic blank/noise detection, zero-shot domain routing, and structured VLM self-assessment in an ensemble. Across five VQA domains, three input conditions, and twelve VLM backbones, the best systems achieve approximately 94.6-94.7% three-class detection accuracy with mirage rates below 3%, while baseline mirage rates range from 21.7% to 66.6%.
- Abstract(参考訳): 視覚言語モデル(VLM)は、必要な視覚的証拠が欠落している、空白である、あるいは疑問に無関係である場合でも、自信ある視覚的答えを生み出すことができる。
ミラージュ(Asadi et al 2026)として知られるこの障害モードは、医用および文書の視覚的質問応答において特に重要であり、画像に基づく証拠として、妥当だが視覚的に根拠のない応答を誤る可能性がある。
画像探索ペアが与えられた場合、VLMが応答を生成する前に応答するかどうかを判断することを目的として、プレリリースミラージュ検出について検討する。
本稿では,CLIP ViT-H/14ビジョンエンコーダのレイヤ間でパッチトケン表現を探索するモデル非依存手法であるテクストコンディション・レイヤワイド・インテリアアライメント(TC-LIA)を提案する。
TC-LIAは、最終CLIP埋め込み空間にレイヤワイドなイメージパッチトークンをプロジェクトし、それらが質問埋め込みと類似性を測定し、質問関連視覚的エビデンスが視覚層全体に出現するかどうかを追跡する。
得られたアライメント軌跡は、最終的な画像-テキストコサイン類似性、ラテン層トップkパッチテキストアライメント、アーリー・トゥ・レイト・ゲイン、レイヤーワイド・スロープを用いて要約される。
これらの特徴は、画素統計的空白/ノイズ検出、ゼロショット領域ルーティング、アンサンブル内の構造化されたVLM自己評価と組み合わせられる。
5つのVQAドメイン、3つの入力条件、12のVLMバックボーンで、最良のシステムは、約94.6-94.7%の3種類の検出精度で、マレージレートは3%以下であり、ベースラインのマレージレートは21.7%から66.6%である。
関連論文リスト
- CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering [6.875316321208349]
CapProbeは、詳細なキャプション評価を地域ごとの事実チェックに変換する、フルシーンの高密度QAベンチマークである。
346のイメージ、1,868のリージョン、25,650の質問からなる。
言語判断者はキャプションだけで答える; 不確実なオプションと有効精度は、未回答のプローブと不正に解決されたプローブを区別するための判断依存のプロキシを提供する。
論文 参考訳(メタデータ) (2026-08-11T15:36:10Z) - SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering [16.639536340934715]
コスト適応型チャート質問応答のための対話型システムSAFE-Cascadeを実演する。
チャートイメージと自然言語の質問が与えられたとき、SAFE-CascadeはまずチャートテキストをOCRで抽出する。
テキストのみの言語モデルから仮回答を取得し、学習したルータを使用して、テキスト応答を受け入れるか、VLMにエスカレートするかを決定する。
論文 参考訳(メタデータ) (2026-06-17T23:00:17Z) - Beyond Pixels: Introspective and Interactive Grounding for Visualization Agents [3.1626173943755975]
VLM(Vision-Language Models)は、しばしば誤読値、幻覚的詳細、チャート内の重なり合う要素を混乱させる。
現在のアプローチはピクセル解釈のみに依存し、Pixel-Only Bottleneckを作成する。
Introspective and Interactive Visual Grounding (IVG)は、スペック・グラウンド・イントロスペクションとビュー・グラウンド・インタラクションを組み合わせたフレームワークである。
論文 参考訳(メタデータ) (2026-04-22T22:47:23Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification [14.448350657613368]
RAVIDは、視覚検索強化生成(RAG)を活用するAI生成画像検出のための最初のフレームワークである
提案手法では,表現学習を改善するためにカテゴリ関連プロンプトを付加した細調整のCLIP画像エンコーダであるRAVID CLIPを利用する。
RAVIDの平均精度は80.27%で、最先端のC2P-CLIPでは63.44%である。
論文 参考訳(メタデータ) (2025-08-05T23:10:56Z) - Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology [87.65242416688146]
TreeBenchは、ビジュアルグラウンド推論の診断ベンチマークである。
TreeVGRは、強化学習と共同でローカライゼーションと推論を監督する訓練パラダイムである。
論文 参考訳(メタデータ) (2025-07-10T17:59:58Z) - Probing Visual Language Priors in VLMs [51.016683265437536]
我々は,意図的に分布外画像を特徴付けるベンチマークであるViLPを紹介した。
ViLPの各質問には、3つの潜在的な答えと3つの対応するイメージが結合される。
本稿では,モデルが新たなVQAデータを生成し,ピクセルレベルおよびセマンティックな汚職を適用して,自己学習のための「良いバッド」画像ペアを生成する自己改善フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-31T17:54:29Z) - Breaking the Frame: Visual Place Recognition by Overlap Prediction [53.17564423756082]
本稿では,重なり合う予測に基づく新しい視覚的位置認識手法 VOP を提案する。
VOPは、Vision Transformerのバックボーンを使用してパッチレベルの埋め込みを取得することで、コビジュアブルなイメージセクションを進める。
提案手法では,データベース画像の重複点の評価に投票機構を用いる。
論文 参考訳(メタデータ) (2024-06-23T20:00:20Z) - Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs [71.07108539262721]
低レベルの視覚に関連する人間の言語応答をエミュレートするためのベンチマーク設定を設計する。
我々は,MLLMの低レベルの認識関連質問応答と記述評価を,単一画像から画像ペアへ拡張する。
複数のMLLMが単一の画像に対して十分な低レベルの視覚能力を持つことを示したが、GPT-4Vのみが人間よりも高い精度で比較できる。
論文 参考訳(メタデータ) (2024-02-11T06:44:11Z) - Advancing Visual Grounding with Scene Knowledge: Benchmark and Method [74.72663425217522]
ビジュアルグラウンドディング(VG)は、視覚と言語の間にきめ細かいアライメントを確立することを目的としている。
既存のVGデータセットの多くは、単純な記述テキストを使って構築されている。
我々は、アンダーラインScene underline-guided underlineVisual underlineGroundingの新たなベンチマークを提案する。
論文 参考訳(メタデータ) (2023-07-21T13:06:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。