論文の概要: Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination
- arxiv url: http://arxiv.org/abs/2608.07302v1
- Date: Fri, 07 Aug 2026 14:56:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.536797
- Title: Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination
- Title(参考訳): 異なる真実と同一の注意:LVLM物体の幻覚を検知・緩和するための視覚的注意に対するロジットレンズ
- Abstract要約: 実物と幻影物の両方が、モデルの中間から後期の層で等しく強い視覚的注意を受けることがわかった。
本稿では,幻覚検出のためのLogit-Lens Consistency Checkを組み込んだ無トレーニング検出フレームワークを提案する。
- 参考スコア(独自算出の注目度): 23.128973540926552
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) often suffer from object hallucination, generating objects that are absent from the image. Prior work largely attributes this to insufficient visual attention. However, we find that both real and hallucinated objects receive equally strong visual attention in the model's mid-to-late layers, suggesting that the key issue may not be how much the model attends, but what it attends to and why. To this end, we decode the visual features of high-attention regions using Logit Lens, and observe that regions corresponding to real objects can be correctly decoded to the target object tokens, whereas those for hallucinated objects cannot. Building on this, we identify two hallucination mechanisms: (i) visual uncertainty, triggered by semantically similar or confusable regions; masking these regions eliminates the hallucination. (ii) contextual prior, triggered by strong co-occurrence priors; even when the initially attended region is masked, the hallucination persists and attention drifts to other regions. Based on these findings, we propose a simple yet effective training-free Detect-Mitigate framework comprising a Logit-Lens Consistency Check to detect hallucination and targeted remedies: High-Attention Regions Masking (HARM) for visual uncertainty hallucination, and Visual Evidence Enhanced Decoding (VEED) for contextual prior hallucination. Our approach achieves state-of-the-art results on multiple hallucination benchmarks. Code will be available.
- Abstract(参考訳): LVLM(Large Vision-Language Model)は、しばしば物体の幻覚に悩まされ、画像から欠落する物体を生成する。
以前の研究は、主に視覚的な注意が不足しているためである。
しかし、実際のオブジェクトと幻覚オブジェクトの両方が、モデルの中間から後期のレイヤで同じように視覚的に注意を払っていることがわかり、主要な問題は、モデルがどの程度参加しているかではなく、そのモデルが何に出席しているか、なぜかであるかもしれないことを示唆している。
この目的のために,ロジットレンズを用いて高アテンション領域の視覚的特徴を復号し,実際のオブジェクトに対応する領域が対象オブジェクトトークンに正しく復号化可能であるのに対して,幻覚されたオブジェクトには復号できないことを観察する。
これに基づいて、2つの幻覚機構を同定する。
(i)視覚的不確実性は、意味的に類似した領域または不整合な領域によって引き起こされ、これらの領域を隠蔽することで幻覚は排除される。
(i) 強い共起先行によって引き起こされる文脈的先行、初期参加地域がマスクされている場合でも幻覚が持続し、他の地域への注意が漂う。
そこで本研究では,視覚的不確実性幻覚のためのHigh-Attention Regions Masking (HARM) と,文脈的前幻覚のためのVisual Evidence Enhanced Decoding (VEED) を組み合わせた,簡便で効果的なトレーニング不要な検出・マイゲートフレームワークを提案する。
提案手法は,複数の幻覚ベンチマークの最先端結果を実現する。
コードは利用可能です。
関連論文リスト
- VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering [5.541436522468184]
大規模視覚言語モデル (LVLM) は言語学的に流動的であるが、視覚的証拠とは矛盾する出力を生成する。
その結果、LVLMは、最終的な視覚アテンションマップがキーイメージオブジェクトに集中できない場合、幻覚を起こす傾向にあることがわかった。
VEGASは,視覚エンコーダの注意マップを言語モデルの中間層に統合し,キーイメージオブジェクトに集中できないトークンを適応的にステアリングする手法である。
論文 参考訳(メタデータ) (2025-12-12T23:33:50Z) - Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs [31.601057368065877]
既存の手法は、省略と製造幻覚が共通の原因を共有するという欠点のある仮定に基づいており、しばしば省略を減らし、より多くの製造を誘発する。
本研究は,視覚的特徴を言語表現にマッピングする場合に,排他的幻覚が不十分な自信から生じることを示すことによって,この見解を覆すものである。
本研究では,物体の存在や不在を視覚的証拠がどのように推測するかを明らかにする概念的枠組みである視覚意味的注意力場を提案する。
論文 参考訳(メタデータ) (2025-08-30T05:47:41Z) - Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models [57.58426038241812]
LVLM(Large Vision-Language Models)は、複雑なマルチモーダルタスクにおいて顕著な性能を示す。
これらのモデルは、画像から様々な視覚的実体を暗黙的に認識または推測する必要がある場合、まだ幻覚に悩まされている。
本稿では,視覚的質問応答(VQA)ベンチマークを提案する。
論文 参考訳(メタデータ) (2024-12-29T23:56:01Z) - Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens [7.806633929976787]
LVLM(Large Vision-Language Models)の幻覚は、その信頼性を著しく損なう。
本稿では,LVLMが視覚情報をどのように処理し,その処理が幻覚を引き起こすかについて述べる。
本稿では,様々な頭部に情報を統合することで視覚的注意を調節する簡易な推論時間手法を提案する。
論文 参考訳(メタデータ) (2024-11-23T03:40:05Z) - Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models? [53.89380284760555]
大型視覚言語モデル(LVLM)は、画像に見つからない概念に言及するキャプションを生成する。
これらの幻覚は、LVLMの信頼性を損なうものであり、ユビキタス採用の主な障害であることは間違いない。
最近の研究は、画像領域やオブジェクトをテキストスパンに明示的にアライメントする、接地目的の追加は、LVLM幻覚の量を減らすことを示唆している。
論文 参考訳(メタデータ) (2024-06-20T16:56:11Z) - Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs [52.497823009176074]
LVLM(Large Vision-Language Models)はしばしば、幻覚として知られる事実情報を誤認する応答を生成する。
視覚的知覚の向上とLVLMの推論能力の向上を目的とした学習自由度手法であるVisual Description Grounded Decoding (VDGD)を紹介した。
論文 参考訳(メタデータ) (2024-05-24T16:21:59Z) - Analyzing and Mitigating Object Hallucination in Large Vision-Language Models [110.12460299261531]
大規模視覚言語モデル(LVLM)は、人間の言語で視覚情報を理解する際、顕著な能力を示した。
LVLMは依然として物体幻覚に悩まされており、画像に実際に存在しない物体を含む記述を生成するという問題である。
そこで我々は,LVLMの幻覚を再現するアルゴリズム LVLM Hallucination Revisor (LURE) を提案する。
論文 参考訳(メタデータ) (2023-10-01T18:10:53Z) - Plausible May Not Be Faithful: Probing Object Hallucination in
Vision-Language Pre-training [66.0036211069513]
大規模視覚言語事前学習モデルは、テキストを生成する際に、存在しない視覚オブジェクトを幻覚させる傾向がある。
標準メトリクスでより良いスコアを得るモデルは、オブジェクトをより頻繁に幻覚させる可能性があることを示す。
驚いたことに、パッチベースの機能が最も良く、より小さなパッチ解決は、オブジェクト幻覚の非自明な減少をもたらす。
論文 参考訳(メタデータ) (2022-10-14T10:27:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。