論文の概要: Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs
- arxiv url: http://arxiv.org/abs/2607.29412v1
- Date: Fri, 31 Jul 2026 13:33:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.232363
- Title: Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs
- Title(参考訳): 注意頭の役割--VLMにおける幻覚の理解と検出-
- Abstract要約: Vision-Language Models (VLMs) は幻覚の傾向が強く、入力された画像によってサポートされないコンテンツを生成する。
統合された頭部レベルの視点では,幻覚による変化が各頭部の忠実な文脈行動からの局所的な逸脱として現れる。
詳細な分析により、これらの偏差は注目ヘッド、コンテキストソース、偏差方向にわたって体系的に整理され、その結果の信号はヘッドアイデンティティが保存されると線形に可読であることが分かる。
- 参考スコア(独自算出の注目度): 49.743008490747094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite remarkable progress in vision-language generation, Vision-Language Models (VLMs) remain prone to hallucinations, producing content that is inconsistent with or unsupported by the input image. Existing works largely design detection or mitigation methods around one specific hallucination pattern, such as visual-textual imbalance, but real VLM hallucinations arise from a mixture of multiple patterns, so signals bound to a single pattern struggle to remain stable across models and tasks. Under a unified head-level view, we find that hallucination-induced changes manifest as localized deviations from each head's faithful contextual behavior, a phenomenon we term Role-Break. Detailed analysis reveals that these deviations are systematically organized across attention heads, contextual sources, and deviation directions, and that the resulting signal is linearly readable once head identity is preserved. Based on these findings, we build a lightweight linear detector on top of Role-Break that requires no fine-tuning of the VLM, whose feature dimension stays below 5,000 and reaches an average AUROC of 93.23 across six VLMs and four benchmarks. A small-scale intervention experiment further shows that the detected tokens can be directly acted upon in the discriminative setting.
- Abstract(参考訳): 視覚言語生成の顕著な進歩にもかかわらず、視覚言語モデル(VLM)は幻覚の傾向を保ち、入力された画像によって支持されない内容を生成する。
既存の研究は、視覚とテクスチャの不均衡など、ある特定の幻覚パターンに関する検出や緩和方法を主に設計しているが、実際のVLM幻覚は複数のパターンの混合から生じるため、単一のパターンに縛られた信号はモデルやタスク間で安定に保たれている。
統合された頭部レベルでは、幻覚による変化が各頭部の忠実な文脈行動からの局所的な逸脱として現れ、この現象はロール・ブルーク(Role-Break)と呼ばれる。
詳細な分析により、これらの偏差は注目ヘッド、コンテキストソース、偏差方向にわたって体系的に整理され、その結果の信号はヘッドアイデンティティが保存されると線形に可読であることが分かる。
これらの知見に基づき、我々はロールブリークの上に軽量線形検出器を構築し、6つのVLMと4つのベンチマークで平均93.23のAUROCに達するため、VLMの微調整は不要である。
小規模な介入実験により、検出されたトークンが識別設定で直接作用できることが示される。
関連論文リスト
- Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction [49.96701537295129]
LVLM(Large Vision-Language Models)は、モーダルなタスク間で大きな成功を収めてきたが、幻覚によって妨げられている。
既存の方法は幻覚を緩和するが、しばしば生成行動を変化させ、結果として出力が短くなり、トークンの分布がシフトする。
幻覚緩和のための制御および選択的な潜伏介入を行う効果的なプラグアンドプレイフレームワークであるMESAを提案する。
論文 参考訳(メタデータ) (2026-04-09T07:31:27Z) - Hallucination Begins Where Saliency Drops [18.189047289404325]
幻覚は、前の出力トークンが次のトークンの予測に対して低い正当性を示すときにしばしば起こる。
LVLMs-Saliencyは,各出力トークンの視覚的グラウンドリング強度を定量化する,勾配認識型診断フレームワークである。
本手法は, 流速とタスク性能を保ちながら幻覚率を大幅に低減し, 堅牢かつ解釈可能なソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-28T05:50:52Z) - VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck [43.74340618057423]
本稿では,新しい幻覚検出・緩和フレームワークVIB-Probeを提案する。
本手法は,意味論をフィルタリングしながら,階層や頭部の識別パターンを抽出する。
私たちのコードは公開されます。
論文 参考訳(メタデータ) (2026-01-09T05:58:22Z) - Mechanisms of Prompt-Induced Hallucination in Vision-Language Models [58.991412160253276]
制御されたオブジェクトカウント設定において、プロンプトが画像中のオブジェクト数をオーバーステートする障害モードについて検討する。
刺激誘発幻覚 (PIH) を, 追加訓練を伴わずに40%以上減少させる小さなアテンションヘッドのセットを同定した。
本研究は, 刺激による幻覚を誘発する内的メカニズムについての知見を提示し, モデル特異的な行動の実施方法の違いを明らかにした。
論文 参考訳(メタデータ) (2026-01-08T18:23:03Z) - Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction [59.801614364841775]
LVLM(Large Vision-Language Models)は目覚ましい能力を示しているが、幻覚は依然として持続的な課題である。
本研究は,LVLMにおける視覚知覚とトークン生成の内部進化の系統的解析である。
我々は,VDC(d Dominance Correction)戦略を考案し,不要なトークンを検出し,検証済みトークンに置き換えて出力信頼性を向上させる。
論文 参考訳(メタデータ) (2025-12-21T17:05:42Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence [69.86946427928511]
大型視覚言語モデル(LVLM)における幻覚を駆動する内部メカニズムについて検討する。
本稿では,視覚的コンテキストに対する注目ヘッド出力の感度を定量化する指標として,視覚認識型頭部偏差(VHD)を紹介する。
視覚認識型頭部強化(VHR)は,視覚認識型頭部機能を高めることで幻覚を緩和するための訓練不要なアプローチである。
論文 参考訳(メタデータ) (2024-12-18T15:29:30Z) - Reducing Hallucinations in Vision-Language Models via Latent Space Steering [34.1755878632361]
幻覚は、アプリケーションに大規模な視覚言語モデル(LVLM)を配置する上での課題である。
本稿では,視覚的特徴の安定性を高めるために,視覚とテクスチュアル・インターベンション(VTI, Visual and Textual Intervention)を提案する。
論文 参考訳(メタデータ) (2024-10-21T08:42:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。