論文の概要: Hallucination-aware intermediate representation edit in large vision-language models
- arxiv url: http://arxiv.org/abs/2603.29405v1
- Date: Tue, 31 Mar 2026 08:10:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-01 15:25:03.33979
- Title: Hallucination-aware intermediate representation edit in large vision-language models
- Title(参考訳): 大きな視覚言語モデルにおける幻覚認識中間表現の編集
- Authors: Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang,
- Abstract要約: 大規模視覚言語モデルは多モーダル推論と複雑なシーン理解において例外的な性能を示した。
幻覚の緩和に関する最近の研究は、リトレーニング法とコントラストデコーディング(CD)法に焦点を当てている。
本稿では,幻覚表現を動的に検出し,幻覚除去編集を行うフレームワークを提案する。
- 参考スコア(独自算出の注目度): 46.189518549824356
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models have demonstrated exceptional performance in multimodal reasoning and complex scene understanding. However, these models still face significant hallucination issues, where outputs contradict visual facts. Recent research on hallucination mitigation has focused on retraining methods and Contrastive Decoding (CD) methods. While both methods perform well, retraining methods require substantial training resources, and CD methods introduce dual inference overhead. These factors hinder their practical applicability. To address the above issue, we propose a framework for dynamically detecting hallucination representations and performing hallucination-eliminating edits on these representations. With minimal additional computational cost, we achieve state-of-the-art performance on existing benchmarks. Extensive experiments demonstrate the effectiveness of our approach, highlighting its efficient and robust hallucination elimination capability and its powerful controllability over hallucinations. Code is available at https://github.com/ASGO-MM/HIRE
- Abstract(参考訳): 大規模視覚言語モデルは多モーダル推論と複雑なシーン理解において例外的な性能を示した。
しかしながら、これらのモデルは、出力が視覚的事実と矛盾する、重大な幻覚の問題に直面している。
幻覚の緩和に関する最近の研究は、リトレーニング法とコントラストデコーディング(CD)法に焦点を当てている。
どちらの手法もうまく機能するが、リトレーニング手法には相当なトレーニングリソースが必要であり、CD法は二重推論オーバーヘッドを導入する。
これらの要因が実用性に支障をきたす。
上記の課題に対処するため,幻覚表現を動的に検出し,これらの表現に対して幻覚除去編集を行うためのフレームワークを提案する。
計算コストを最小化して、既存のベンチマークで最先端のパフォーマンスを実現する。
本手法の有効性を実証し,その効率的で堅牢な幻覚除去能力と幻覚に対する強力な制御性を強調した。
コードはhttps://github.com/ASGO-MM/HIREで公開されている。
関連論文リスト
- Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors [8.089908150148554]
マルチモーダル大規模言語モデル (MLLM) は様々な視覚言語タスクにおいて顕著な成功を収めている。
MLLMは幻覚に非常に敏感であり、視覚的証拠とは相容れない内容を生み出す。
本研究では,幻覚の緩和のための訓練不要で自己指導的な方法を提案する。
論文 参考訳(メタデータ) (2025-09-26T07:24:28Z) - VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding [38.23310445372371]
LVLM(Large Vision-Language Models)はマルチモーダルタスク推論において顕著な機能を示す。
彼らはしばしば、幻覚として知られる視覚的内容が正確に反映されていないように思われる応答を生成する。
近年のアプローチでは、推論段階における復号化戦略を調整することで幻覚を緩和するための訓練不要な手法が導入されている。
textbfVisutextbfal textbfLayer Fustextbfion textbfD
論文 参考訳(メタデータ) (2024-11-24T13:42:02Z) - Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization [123.54980913741828]
大規模ビジュアル言語モデル(LVLM)は、マルチモーダルデータの理解において、例外的な能力を示した。
彼らは必然的に幻覚に悩まされ、生成されたテキストと対応するイメージを切断する。
現在の視覚的コントラスト復号法のほとんどは、視覚的不確実性情報を導入して幻覚を緩和しようとするものである。
しかし、彼らは幻覚トークンを正確に誘導するのに苦労し、幻覚を緩和する効果を著しく制限した。
論文 参考訳(メタデータ) (2024-05-24T08:46:31Z) - Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding [25.489832294197797]
本稿では,LVLM推論における幻覚の低減を目的とした,命令コントラストデコーディング(ICD)手法を提案する。
本手法は,マルチモーダル核融合モジュールにおいて,外乱指示が幻覚を著しく悪化させるという観察に着想を得たものである。
論文 参考訳(メタデータ) (2024-03-27T16:04:47Z) - HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data [102.56792377624927]
機械生成データに固有の幻覚は未発見のままである。
本稿では,クロスチェックパラダイムに基づく新しい幻覚検出・除去フレームワークであるHaluciDoctorを提案する。
LLaVAに比べて44.6%の幻覚を緩和し,競争性能を維持した。
論文 参考訳(メタデータ) (2023-11-22T04:52:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。