論文の概要: Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding
- arxiv url: http://arxiv.org/abs/2606.27596v1
- Date: Thu, 25 Jun 2026 22:55:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.324427
- Title: Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding
- Title(参考訳): 病理的ショートカットの分解: 忠実なLVLMデコーディングのための因果的フレームワーク
- Abstract要約: LVLM(Large Vision-Language Models)は、洗練された推論を示すが、対象の幻覚に影響を受けやすい。
トレーニング不要な推論時間フレームワークであるFox(Faithfulness and Observational-flow via eXpression-rectification)を提案する。
FoxはSOTAのパフォーマンスを達成し、言語豊かさを維持しながらSIDを29.1%上回っている。
- 参考スコア(独自算出の注目度): 19.38472051288709
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) exhibit sophisticated reasoning but remain susceptible to object hallucination. Deviating from the prevailing attention intensity assumption, we reveal a deeper dynamic structural misalignment: hallucination is triggered at decision-critical steps where specific attention heads, acting as risky mediators, decouple from visual evidence to lock onto language priors. This establishes a pathological shortcut that bypasses visual grounding. To dismantle this, we propose Fox (Faithfulness and Observational-flow via eXpression-rectification), a training-free inference-time framework. Fox diagnoses structural misalignment using a visual attention entropy probe to localize risky mediators unsupervisedly. We then execute a targeted causal intervention via numerical logit saturation to physically sever the shortcut path. Finally, a conflict-gated cooperative decoding strategy reconciles interventional faithfulness with observational fluency. Extensive experiments demonstrate that Fox achieves SOTA performance, outperforming SID by 29.1% while preserving linguistic richness. Code is available at https://github.com/Cc2021start/Fox.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、洗練された推論を示すが、対象の幻覚に影響を受けやすい。
幻覚は、特定の注意を向け、リスクのある仲介者として行動し、視覚的証拠から切り離して、言語先行にロックする決定クリティカルなステップで引き起こされる。
これにより、視覚的接地をバイパスする病理的ショートカットが確立される。
そこで本研究では,eXpression-rectification によるFox (Faithfulness and Observational-flow via eXpression-rectification) を提案する。
Foxは、視覚的注意エントロピープローブを用いて構造的不整合を診断し、教師なしのリスクのあるメディエーターをローカライズする。
次に,数値ロジット飽和法を用いて目的の因果介入を行い,ショートカット経路を物理的に切断する。
最後に、干渉的信条と観察的流布とを一致させる、紛争対応型協調的復号化戦略について述べる。
大規模な実験により、FoxはSOTAのパフォーマンスを達成し、言語的豊かさを維持しながらSIDを29.1%上回った。
コードはhttps://github.com/Cc2021start/Fox.comで入手できる。
関連論文リスト
- Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment [45.92240827409312]
Saliency-Driven Perceptual Realignment (SDPR) は、推論全体を通して視覚的認知の低下を緩和するトレーニング不要のフレームワークである。
提案するSDPRは,全発生経路における視覚的認知の全体的アライメントのため,幻覚に対して頑健である。
論文 参考訳(メタデータ) (2026-07-18T14:39:16Z) - HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models [70.67112531913669]
視覚言語モデルにおける幻覚は、一般的に意味的誤りとして扱われる。
それまでの研究は主に、世代ごとの幻覚の検出や抑制に重点を置いていた。
幻覚的意味論がモデルの推論コンテキストに入る段階である PHR (Post Hallucination Reasoning) について検討する。
論文 参考訳(メタデータ) (2026-07-08T15:02:11Z) - See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs [34.999900039604846]
MLLM(Multimodal large language model)は、大きな言語モデル(LLM)を視覚的に拡張し、画像やテキストに対する共同推論を可能にする。
機械学的な研究は、この弱点が視覚的な怠慢に由来することを示唆している。
本稿では,視覚情報ゲイン・イン・アライメント(VIGIL)を提案する。
論文 参考訳(メタデータ) (2026-06-24T21:12:24Z) - Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination [25.643533134113607]
我々はロジットレンズを用いて注意機構を解析し、Vocabulary Hijacking(語彙ハイジャック)という別個の異常を明らかにする。
本研究では,ハイジャック・アウェア・ビジュアル・アテンション・エンハンスメント(HAVAE, Hijacking-Aware Visual Attention Enhancement)を提案する。
論文 参考訳(メタデータ) (2026-05-11T14:16:25Z) - Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models [65.57985131861399]
幻覚は、しばしば高いエントロピー状態を示す認知的分岐点と強く相関している。
本稿では,視覚的に認識可能な推論機能の内部化を目的とした,軽量で総合的なトレーニングパラダイムであるV-STARを提案する。
論文 参考訳(メタデータ) (2026-04-11T13:59:05Z) - STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models [14.848157882117613]
大型ビデオ言語モデル (Video-LLMs) は幻覚を起こす傾向があり、しばしば視覚的にサポートされない時間的関係や誤った時間的関係を生じる。
リスクの高いデコードステップを識別し,中間層からトークン条件の視覚的エビデンスを選択するSTEARを提案する。
実験により、STEARは時間的一貫性、忠実性、堅牢性を改善しながら、幻覚を一貫して減少させることが示された。
論文 参考訳(メタデータ) (2026-04-03T13:52:57Z) - Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs [47.94507630961399]
トレーニング不要なデコードフレームワークであるVISAGEを導入し、推論時に目的を校正する。
我々は、VISAGEが推定誤差の下で有界目的損失を維持することを保証する解析的安定性を保証する。
幻覚感受性および汎用ベンチマークによる評価は、フレームワークの堅牢性を示している。
論文 参考訳(メタデータ) (2026-03-26T17:53:49Z) - Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs [26.144870818163387]
構造因果グラフを用いて幻覚過程をモデル化する枠組みを提案する。
本稿では、復号時のモダリティ寄与不均衡を定量化する新しい計量であるVTACRを紹介する。
トークン・レイヤ・アテンションを動的に調整する微細言語によるアテンション介入機構を設計する。
論文 参考訳(メタデータ) (2025-11-12T06:13:26Z) - Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation [9.540386616651295]
CoT(Chain-of-Thought)は、ステップバイステップ推論を奨励することによって幻覚を緩和する。
我々の研究は、推論の利用における見落とされがちなトレードオフを浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-20T15:49:37Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence [69.86946427928511]
大型視覚言語モデル(LVLM)における幻覚を駆動する内部メカニズムについて検討する。
本稿では,視覚的コンテキストに対する注目ヘッド出力の感度を定量化する指標として,視覚認識型頭部偏差(VHD)を紹介する。
視覚認識型頭部強化(VHR)は,視覚認識型頭部機能を高めることで幻覚を緩和するための訓練不要なアプローチである。
論文 参考訳(メタデータ) (2024-12-18T15:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。