論文の概要: Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
- arxiv url: http://arxiv.org/abs/2609.00231v1
- Date: Mon, 31 Aug 2026 18:38:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.980524
- Title: Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
- Title(参考訳): 言語に先立って:マルチモーダルLLMにおける視覚-オリジン幻覚の診断と修正
- Abstract要約: 視覚的特徴抽出と画像とテキストの埋め込みの誤調整から幻覚が生じる視覚的オリジン幻覚の証拠を提示する。
本稿では、この問題を修正するために、ACFT(Adversarial Contrastive Fine-Tuning)を提案する。
ACFTは、LLaVA、MiniGPT-4、Qwen2.5-VLにまたがるPOPE、MME、および4つの記述レベル幻覚ベンチマークの最先端性能を達成する。
- 参考スコア(独自算出の注目度): 37.0916688511164
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing research on object hallucination in multimodal large language models (MLLMs) predominantly attributes the problem to language priors such as over-reliance on textual co-occurrence statistics. We challenge this view by presenting quantitative evidence for a complementary, under-explored cause: visual-origin hallucination, where hallucinations arise from incorrect visual feature extraction and misalignment between image and text embeddings. Through cosine similarity analysis and Smooth Grad-CAM entropy measurements, we show that hallucinated samples exhibit systematically lower image-text similarity (average 0.158 vs. -0.122) and inverted attention patterns, where attention is dispersed when the target object is present but wrongly concentrated when it is absent. Guided by this diagnosis, we propose Adversarial Contrastive Fine-Tuning (ACFT). ACFT uses an Adversarial Hallucination Attribute Flipping (AHAF) procedure, involving minimal, targeted adversarial perturbations that flip an image's hallucination attribute, to construct perfectly aligned positive-negative pairs, which are then used for contrastive fine-tuning. AHAF simultaneously serves as a diagnostic probe, revealing that MLLM visual representations lie dangerously close to hallucination decision boundaries. Requiring only 0.9% of the COCO dataset and adding zero inference overhead, ACFT achieves state-of-the-art performance on POPE, MME, and four description-level hallucination benchmarks across LLaVA, MiniGPT-4, and Qwen2.5-VL. Code is available at https://github.com/zxp555/ACFT_MM
- Abstract(参考訳): MLLM(Multimodal large language model)におけるオブジェクト幻覚に関する既存の研究は、主にテキスト共起統計に対する過度な信頼などの言語先行性に起因する。
本稿では,視覚的視覚的特徴抽出と画像とテキストの埋め込みの誤認識から幻覚を生じさせる視覚-オリジン幻覚という,相補的で未発見な原因の定量的証拠を提示することによって,この見解に挑戦する。
本研究では,コサイン類似度分析とSmooth Grad-CAMエントロピー測定により,幻覚標本が画像テキスト類似度(平均0.158 vs. -0.122)と逆注意パターンを系統的に低く示し,対象物の存在時に注意を分散させるが,不在時に誤集中することを示した。
本稿では,この診断を参考に,Adversarial Contrastive Fine-Tuning (ACFT)を提案する。
ACFTは、画像の幻覚属性を反転させる最小限の対向的摂動を伴い、完全に整列した正負のペアを構築し、コントラスト的な微調整に使用する、AHAF(Adversarial Hallucination Attribute Flipping)手順を使用する。
AHAFは同時に診断プローブとして機能し、MLLM視覚表現が幻覚決定境界に危険なほど近くにあることを明らかにした。
COCOデータセットの0.9%しか必要とせず、推測オーバーヘッドがゼロであるACFTは、POPE、MME、LLaVA、MiniGPT-4、Qwen2.5-VLの4つの説明レベルの幻覚ベンチマークで最先端のパフォーマンスを達成する。
コードはhttps://github.com/zxp555/ACFT_MMで入手できる。
関連論文リスト
- Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation [5.041079621345155]
画像は文脈として、モデルのパラメトリック知識とテキストコンテキストと同時に競合する、と我々は主張する。
本研究では,2つの意味論的に異なるコンテキスト参照ベクトルを抽出する,学習不要なフレームワークであるコンテキスト参照ステアリング(CAS)を提案する。
実験により、CASは遅延遅延を増大させることなくオブジェクト幻覚を実質的に緩和し、ネイティブテキスト生成の品質を保っていることが示された。
論文 参考訳(メタデータ) (2026-05-27T05:33:06Z) - VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing [70.82867621856968]
大きな視覚言語モデル(LVLM)は、しばしば物体幻覚(OH)に悩まされる
近年の研究では、幻覚の問題は言語の先行に起因している可能性が示唆されている。
本稿では視覚コントラスト編集(VCE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T12:40:07Z) - Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs [6.645440928271175]
Visionivate-Language Models (VLM)は、有望な実用的な応用のために、AIコミュニティで注目を集めている。
近年の研究では、これらの幻覚はVLMの言語的先行性への過度な依存と視覚的特徴統合の欠如に起因している。
本稿では,textbfActtextbfLocate-textbfEdit textbfAdversarially Parametric editing framework for Hallucination mitigation inVLMsを提案する。
論文 参考訳(メタデータ) (2025-12-26T11:56:45Z) - What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models? [95.46087552542998]
本稿では,Halucination検索を用いたObject Probing Evaluationベンチマークを紹介する。
これは、大きな視覚ランゲージモデルで幻覚を誘発する最も誤解を招きやすいイントラクタを生成することを目的としている。
実験結果から, HOPEの精度は少なくとも9%低下し, 最先端のLVLMでは最大23%低下した。
論文 参考訳(メタデータ) (2025-08-03T03:11:48Z) - Mitigating Object Hallucinations via Sentence-Level Early Intervention [10.642552315531404]
マルチモーダルな大言語モデル(MLLM)は、多モーダルな理解に革命をもたらしたが、幻覚と闘い続けている。
人間のアノテーションに依存しないフレームワークであるSENTINELを提案する。
文レベルの早期iNtervention through IN- domain preference Learningは、オリジナルのモデルと比較して幻覚を90%以上減らすことができる。
論文 参考訳(メタデータ) (2025-07-16T17:55:43Z) - Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images [6.48620624181578]
SHE(Sequence Hallucination Eradication)は,幻覚を検知し緩和する軽量なフレームワークである。
また,行動幻覚の重症度を定量化する新しい指標(BEACH)を提案する。
論文 参考訳(メタデータ) (2025-06-08T15:08:52Z) - MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM [58.2298313720146]
マルチモーダル幻覚は多源性であり、様々な原因から生じる。
既存のベンチマークでは、知覚誘発幻覚と推論誘発幻覚を適切に区別することができない。
論文 参考訳(メタデータ) (2025-05-30T05:54:36Z) - ANAH-v2: Scaling Analytical Hallucination Annotation of Large Language Models [65.12177400764506]
大規模言語モデル (LLM) は、様々な領域や広範囲のアプリケーションにまたがる、長い形式の質問応答タスクにおいて幻覚を示す。
現在の幻覚検出と緩和データセットはドメインやサイズによって制限されている。
本稿では,幻覚アノテーションデータセットを同時に,段階的にスケールアップする反復的自己学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-05T17:56:38Z) - Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback [40.930238150365795]
我々は,LVLM(Large Vision Language Models)における幻覚の検出と緩和について,きめ細かいAIフィードバックを用いて提案する。
プロプライエタリモデルによる小型幻覚アノテーションデータセットを生成する。
そこで本研究では,幻覚緩和モデルの訓練のための選好データセットを自動構築する検出テーマ書き換えパイプラインを提案する。
論文 参考訳(メタデータ) (2024-04-22T14:46:10Z) - Fine-grained Hallucination Detection and Editing for Language Models [109.56911670376932]
大規模言語モデル(LM)は、しばしば幻覚と呼ばれる事実的誤りを引き起こす傾向にある。
我々は,幻覚の包括的分類を導入し,幻覚が多様な形態で現れることを議論する。
本稿では, 幻覚自動検出のための新しいタスクを提案し, 新たな評価ベンチマークであるFavaBenchを構築した。
論文 参考訳(メタデータ) (2024-01-12T19:02:48Z) - Hallucination Augmented Contrastive Learning for Multimodal Large
Language Model [53.65682783591723]
マルチモーダル大規模言語モデル(MLLM)は、自然言語と視覚情報を効率的に統合し、マルチモーダルタスクを処理できることが示されている。
しかし、MLLMは幻覚の基本的な限界に直面しており、誤った情報や偽情報を生成する傾向がある。
本稿では,MLLMにおける幻覚を表現学習の新たな視点から論じる。
論文 参考訳(メタデータ) (2023-12-12T04:05:15Z) - HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data [102.56792377624927]
機械生成データに固有の幻覚は未発見のままである。
本稿では,クロスチェックパラダイムに基づく新しい幻覚検出・除去フレームワークであるHaluciDoctorを提案する。
LLaVAに比べて44.6%の幻覚を緩和し,競争性能を維持した。
論文 参考訳(メタデータ) (2023-11-22T04:52:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。