論文の概要: FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2606.29431v3
- Date: Mon, 06 Jul 2026 07:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.518824
- Title: FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models
- Title(参考訳): FADE:大規模視覚言語モデルにおける言語パラメータ支配の低減による幻覚の緩和
- Authors: Yichen Guo, Kai Tang, Fenglai Lin, Yiding Sun, Dongxu Zhang, Wenya Wang, Lin William Cong, Shanghang Zhang,
- Abstract要約: 各トランス層を流れる情報の流れを調べた結果,注目モジュールが常に視覚的証拠を蓄積していることが判明した。
FADE(FFN Attenuation for Decoding)は、FFN出力を減衰させ、言語優先の優位性を低下させる訓練不要な手法である。
- 参考スコア(独自算出の注目度): 48.51649944704363
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite the impressive capabilities of Large Vision-Language Models (LVLMs), they remain susceptible to hallucination, generating content inconsistent with the input image. Recent studies attribute this to the dominance of language priors over visual inputs and employ contrastive decoding methods to mitigate this dominance, but the mechanistic origin remains unexplored. We investigate the information flow through each transformer layer and find that attention modules consistently aggregate visual evidence, while FFN modules at critical layers act as the source of language priors. These priors can override visual evidence, causing correct predictions in intermediate layers to drift toward incorrect outputs. Based on this insight, we propose FADE (FFN Attenuation for DEcoding), a training-free method that attenuates FFN outputs to reduce language-prior dominance. Evaluations on POPE, CHAIR, and MME benchmarks across LLaVA-1.5, mPLUG-Owl2, and InstructBLIP show that FADE effectively mitigates hallucinations while preserving inference efficiency.
- Abstract(参考訳): LVLM(Large Vision-Language Models)の印象的な機能にもかかわらず、幻覚の影響を受けにくいままであり、入力画像と矛盾するコンテンツを生成する。
近年の研究では、視覚的な入力よりも言語優先が支配的であり、この支配を緩和するために対照的な復号法が採用されているが、機械的起源は未解明のままである。
本稿では,各トランス層を流れる情報の流れを調査し,注目モジュールが常に視覚的証拠を集約しているのに対して,FFNモジュールは言語先行の源泉として機能していることを示す。
これらの先行は視覚的証拠をオーバーライドし、中間層の正しい予測を誤った出力に向ける。
この知見に基づいて、FFN出力を減衰させ、言語優位性を低下させる訓練不要なFADE(FFN Attenuation for Decoding)を提案する。
LLaVA-1.5, mPLUG-Owl2, InstructBLIPにおけるPOPE, CHAIR, MMEベンチマークの評価は, FADEが推論効率を保ちながら幻覚を効果的に緩和することを示した。
関連論文リスト
- Global Context or Local Detail? Adaptive Visual Grounding for Hallucination Mitigation [31.028607494171336]
VLM(Vision-Language Models)は、物体の幻覚によってしばしば弱められる。
トレーニング不要な推論フレームワークであるPND(Positive-and-Negative Decoding)を紹介する。
PNDは、視覚的忠実性を強制するために、デコードプロセスに直接介入する。
論文 参考訳(メタデータ) (2026-04-27T12:23:00Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models [22.091545786344994]
本稿では,視覚的事実情報を最も有意に表現した中間層を動的に選択するトレーニングフリーな手法である,視覚的ファクト抽出(EVA)によるデコーディングを紹介する。
EVAは幻覚率を基準法と比較して著しく低下させ、幻覚を緩和する効果を裏付ける。
論文 参考訳(メタデータ) (2025-07-21T14:15:34Z) - ClearSight: Visual Signal Enhancement for Object Hallucination Mitigation in Multimodal Large language Models [28.24397677839652]
マルチモーダル大言語モデル(MLLM)におけるオブジェクト幻覚を軽減するために、コントラストデコーディング戦略が広く用いられている。
モデル中層における視覚信号に注意を向けるプラグイン・アンド・プレイ技術であるVisual Amplification Fusion (VAF)を提案する。
VAFは、生成された出力のコヒーレンスと精度を維持しながら、推論速度に影響を与えることなく、様々なMLLMの幻覚を著しく低減する。
論文 参考訳(メタデータ) (2025-03-17T12:30:40Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance [67.26434607115392]
大規模視覚言語モデル(LVLM)は様々な視覚言語タスクにおいて印象的な成果を上げている。
LVLMは言語バイアスによる幻覚に悩まされ、画像や非効果的な視覚的理解に焦点が当てられなくなった。
MDA (Multimodal duAl-attention meChanIsm) aNd soft-image Guidance (IFG) を用いたLVLMの言語バイアスに対処するためのLACingを提案する。
論文 参考訳(メタデータ) (2024-11-21T16:33:30Z) - Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding [14.701135083174918]
LVLM(Large Vision-Language Models)は、視覚入力から詳細でコヒーレントな応答を生成する。
言語に対する依存度が高すぎるため、幻覚を起こす傾向にある。
そこで我々は,SumGD (Slide-Guided Decoding) という新しい手法を提案する。
論文 参考訳(メタデータ) (2024-10-17T08:24:27Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。