論文の概要: Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery
- arxiv url: http://arxiv.org/abs/2609.37263v1
- Date: Tue, 29 Sep 2026 11:11:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.436127
- Title: Beyond Attention Imbalance: Mitigating Hallucinations via Spectral Surgery
- Title(参考訳): 注意不均衡を超えて:分光器手術による幻覚の緩和
- Abstract要約: 幻覚は、LVLM(Large Vision-Language Models)にとって重要な障壁である。
本稿では,FLASH(Frequency-Localized Attention SHaping)を提案する。
- 参考スコア(独自算出の注目度): 4.717663831930326
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Large Vision-Language Models (LVLMs) achieve remarkable success, hallucinations remain a significant barrier to their reliable deployment. Recent studies primarily attribute these issues to cross-modal attention imbalances; most solutions therefore focus on reweighting visual tokens or suppressing language priors. However, such approaches often overlook the spectral characteristics of the visual information flow and frequently rely on Contrastive Decoding (CD), which doubles inference time. Instead of following conventional approaches, we identify two distinct hallucination patterns-Perceptual-Semantic Dissociation and Localized Fixation-and propose FLASH (Frequency-Localized Attention SHaping), a training-free and CD-free framework. FLASH utilizes a Spectral Vortex Score to detect vision heads within multi-head attention layers and applies adaptive spectral modulation to rectify the visual information flow during decoding. Empirical results demonstrate that FLASH achieves a superior balance between performance and efficiency compared to SOTA methods.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は大きな成功をおさめているが、幻覚は信頼性の高い展開において重要な障壁である。
近年の研究では、これらの問題の主な原因として、視覚的トークンの再重み付けや言語先行の抑制に焦点が当てられている。
しかし、このような手法はしばしば視覚情報フローのスペクトル特性を見落とし、コントラストデコーディング(CD)に依存しており、これは推論時間を2倍にしている。
従来の手法に従わず、知覚・意味的解離と局所的固定という2つの異なる幻覚パターンを同定し、FLASH(Frequency-Localized Attention SHaping)を提案する。
FLASHはスペクトル渦スコア(Spectral Vortex Score)を用いて、マルチヘッドアテンション層内の視覚ヘッドを検出し、適応スペクトル変調を適用して復号時の視覚情報の流れを補正する。
実験結果から,FLASHはSOTA法に比べて性能と効率のバランスが良好であることが示された。
関連論文リスト
- HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models [9.926121668688772]
視覚言語モデル(VLM)は、予測がきめ細かい視覚的証拠を必要とする場合、信頼性が低いままである。
これまでに見過ごされた原因は、スペクトル応答剛性である。
本稿では,事前学習した意味表現を保存しながらタスク条件付き周波数経路を導入するHAFI-VLMを提案する。
論文 参考訳(メタデータ) (2026-08-03T12:15:33Z) - Disentangling Semantic Attention from Structural Bias in the Attention Manifold [61.68044165974505]
MLLM(Multimodal Large Language Models)は、意味的に非形式的な視覚トークンに対して不均等な注意を払っている。
本研究では,SPAR(Saliency-guided Purification and Adaptive Redistribution)を導入した。
論文 参考訳(メタデータ) (2026-07-27T05:30:19Z) - DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models [13.261187830239797]
本研究ではDICA(Dual-Indicator Guided Contrastive Alignment)を提案する。
DICAは、視覚的注意エントロピー(VAE)と出力画像相関(OIC)の2つの情報理論的指標を追跡する。
論文 参考訳(メタデータ) (2026-07-27T02:40:49Z) - See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models [8.304027910542446]
大規模視覚言語モデル(LVLM)における視覚エンコーダの内部的注意ダイナミクスについて検討する。
分析の結果,幻覚の挙動は集中期において注目度が低いトークンに特に敏感であることが判明した。
本稿では、フォーカスフェーズにおいて、このようなトークンを選択的に抑制する軽量な推論時間介入を提案する。
論文 参考訳(メタデータ) (2026-04-04T02:46:58Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - PruneHal: Reducing Hallucinations in Multi-modal Large Language Models through Adaptive KV Cache Pruning [87.35309934860938]
大型言語モデル(MLLM)における幻覚は、視覚トークンに割り当てられた注意不足と強く関連している。
我々は、適応的なKVキャッシュプルーニングを活用し、重要な視覚情報に焦点をあてるトレーニングフリーでシンプルで効果的な方法である textbfPruneHal を提案する。
論文 参考訳(メタデータ) (2025-10-22T02:41:07Z) - Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration [2.19036693868242]
大規模視覚言語モデル(LVLM)はマルチモーダルタスクにおいて印象的な性能を発揮するが、幻覚に悩まされることが多い。
2つの重要なバイアスをターゲットとして、この問題に対処するために、信頼性意識(CAAC)フレームワークを導入します。
CAACでは、視覚トークン間の注意のバランスをとるためにVTC(Visual-Token)と、視覚的接地を強化するためにAdaptive Attention Re-Scaling(Adaptive Re-Scaling)という2段階のアプローチを採用している。
論文 参考訳(メタデータ) (2025-05-27T17:45:21Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。