論文の概要: EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation
- arxiv url: http://arxiv.org/abs/2608.29092v1
- Date: Sat, 29 Aug 2026 06:45:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.834973
- Title: EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation
- Title(参考訳): EviAnchor:地域的視覚的エビデンス補償による視覚・言語モデルにおける幻覚の緩和
- Authors: Sihang Jia, Shuliang Liu, Songbo Yang, Xuming Hu,
- Abstract要約: EviAnchorは世代を通して視覚的証拠を保存・再活性化するフレームワークである。
POPE、CHAIR、MMHal-Benchにわたる実験は、視覚的接地における一貫した改善を示している。
- 参考スコア(独自算出の注目度): 30.996670295558612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models (LVLMs) frequently generate content unsupported by visual inputs. Preliminary experiments show that visual evidence is primarily incorporated into answer-side representations in early-to-middle decoder layers, while its direct influence progressively weakens in later layers. This attenuation suggests that visual evidence acquired earlier may be insufficiently utilized during subsequent generation. Based on this observation, we propose EviAnchor, a training-free and single-branch inference framework that preserves and reactivates visual evidence throughout generation. EviAnchor introduces Regional Evidence Anchor (REA) slots to progressively aggregate dense visual tokens into spatially structured representations. It then strengthens the current decision state's access to these visual anchors through decision-conditioned evidence routing, mitigating excessive dependence on textual context. Finally, the model resumes its native Transformer computation to integrate the retrieved visual evidence with question semantics and generation history. Experiments across POPE, CHAIR, and MMHal-Bench demonstrate consistent improvements in visual grounding.
- Abstract(参考訳): 大規模視覚言語モデル (LVLM) は、視覚入力によるコンテンツサポートを頻繁に生成する。
予備実験により、視覚的エビデンスは主に初期から中級デコーダ層における応答側表現に組み込まれ、その直接的な影響は後期層では徐々に弱まることが示された。
この減衰は、それ以前に取得された視覚的証拠が、その後の世代で不十分に活用されることを示唆している。
本研究は,創生を通して視覚的エビデンスを保存・再活性化するトレーニングフリーかつ単一ブランチ推論フレームワークであるEviAnchorを提案する。
EviAnchorはRegional Evidence Anchor(REA)スロットを導入し、密集した視覚トークンを空間的に構造化された表現に徐々に集約する。
その後、決定条件付きエビデンスルーティングを通じて、現在の決定状態の視覚的アンカーへのアクセスを強化し、テキストコンテキストへの過度な依存を軽減する。
最後に、モデルはネイティブなTransformer計算を再開し、検索した視覚的エビデンスと質問セマンティクスと生成履歴を統合する。
POPE、CHAIR、MMHal-Benchにわたる実験は、視覚的接地における一貫した改善を示している。
関連論文リスト
- GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning [27.232897918541067]
連鎖推論は多モーダルな大言語モデルの問題解決能力を大幅に改善した。
しかし、微細な視覚的証拠は、テキストベースの推論ステップをまたいだ保存と再利用が難しいままである。
GLaQは、逐次ラテントロールアウトをコンテキスト条件付きクエリの固定セットに置き換える、接地型ラテントクエリフレームワークである。
論文 参考訳(メタデータ) (2026-08-16T04:01:08Z) - Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment [45.92240827409312]
Saliency-Driven Perceptual Realignment (SDPR) は、推論全体を通して視覚的認知の低下を緩和するトレーニング不要のフレームワークである。
提案するSDPRは,全発生経路における視覚的認知の全体的アライメントのため,幻覚に対して頑健である。
論文 参考訳(メタデータ) (2026-07-18T14:39:16Z) - See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL [19.682815357013453]
マルチモーダル大言語モデル(MLLM)は、強力なテキスト推論を視覚入力と統合するが、その応答は基礎となる画像と矛盾する可能性がある。
質問条件付き視覚的エビデンス記述を最適化するために,前訓練と後訓練の中間段階である視覚的エビデンス事前調整(VEPA)を導入する。
論文 参考訳(メタデータ) (2026-06-16T08:45:24Z) - Diagnosing Visual Ignorance in Vision-Language Models [29.2851901986069]
VLM(Vision-Language Models)は、しばしば言語先行に頼り、視覚的証拠に弱く根ざした自信ある答えを生み出す。
本研究では,機械的視点と行動的視点の両方から言語優先性について検討する。
言語優先の信頼性は、モデル内部とベンチマークの妥当性の両方に影響を及ぼす体系的なルーティング障害であることがわかった。
論文 参考訳(メタデータ) (2026-06-05T04:16:01Z) - Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models [58.9387276447485]
視覚推論 前者(VIF)は、純粋な視覚表現とモデルの出力空間の間の橋渡しを確立する軽量アーキテクチャモジュールである。
一般的な推論、OCR、テーブル理解、視覚中心の評価、幻覚を含む14のベンチマークタスクについて実験を行った。
論文 参考訳(メタデータ) (2026-05-18T10:04:22Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models [65.57985131861399]
幻覚は、しばしば高いエントロピー状態を示す認知的分岐点と強く相関している。
本稿では,視覚的に認識可能な推論機能の内部化を目的とした,軽量で総合的なトレーニングパラダイムであるV-STARを提案する。
論文 参考訳(メタデータ) (2026-04-11T13:59:05Z) - Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction [59.801614364841775]
LVLM(Large Vision-Language Models)は目覚ましい能力を示しているが、幻覚は依然として持続的な課題である。
本研究は,LVLMにおける視覚知覚とトークン生成の内部進化の系統的解析である。
我々は,VDC(d Dominance Correction)戦略を考案し,不要なトークンを検出し,検証済みトークンに置き換えて出力信頼性を向上させる。
論文 参考訳(メタデータ) (2025-12-21T17:05:42Z) - VideoAnchor: Reinforcing Subspace-Structured Visual Cues for Coherent Visual-Spatial Reasoning [69.64660280965971]
VideoAnchorは、サブスペース親和性を活用してフレーム間の視覚的手がかりを強化するプラグイン・アンド・プレイモジュールである。
InternVL2-8BとQ2.5VL-72Bのベンチマークで一貫した性能向上を示した。
私たちのコードはhttps://github.com/feufhd/VideoAnchor.comで公開されます。
論文 参考訳(メタデータ) (2025-09-29T17:54:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。