論文の概要: Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.28058v1
- Date: Fri, 28 Aug 2026 08:21:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.252503
- Title: Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models
- Title(参考訳): 大型視覚言語モデルにおける幻覚緩和のための動的アライメント補償
- Abstract要約: LVLM(Large Vision-Language Models)は幻覚を起こす傾向があり、マルチモーダル入力とは無関係または矛盾な応答を生成する。
本稿では,表現の偏差を検出し,残差補償を選択的に適用する訓練不要な推論時間法であるemphDynamic Alignment Compensation (DAC)を提案する。
複数のLVLMバックボーンにまたがる9つの幻覚に焦点を当てた汎用マルチモーダルベンチマークの実験により、DACは高い全体的な性能を維持しながら、常に幻覚を減少させることが示された。
- 参考スコア(独自算出の注目度): 11.237547873256924
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Vision-Language Models (LVLMs) remain prone to hallucinations, producing responses that are irrelevant or inconsistent with the multimodal input. Existing mitigation methods mainly rely on external supervision, output calibration, or attention regulation, leaving the internal representation dynamics of autoregressive generation underexplored. We identify an inference-time failure mode in which cross-modal representations degrade across decoder layers and drift across generation steps, destabilizing token prediction and increasing hallucination risk. We propose \emph{Dynamic Alignment Compensation} (DAC), a training-free inference-time method that detects representation divergence and selectively applies lightweight residual compensation. DAC combines Layer-wise Semantic Compensation to mitigate inter-layer degradation with Sequential Semantic Correction to constrain temporal drift. Experiments on nine hallucination-focused and general-purpose multimodal benchmarks across multiple LVLM backbones show that DAC consistently reduces hallucinations while maintaining strong overall performance.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は幻覚を起こす傾向があり、マルチモーダル入力とは無関係または矛盾な応答を生成する。
既存の緩和方法は、主に外部の監督、出力校正、注意制御に依存しており、自己回帰生成の内部表現のダイナミクスを過小評価している。
我々は,デコーダ層にまたがってクロスモーダル表現が劣化し,生成ステップを越えてドリフトし,トークン予測の安定化と幻覚リスクが増大する推論時間障害モードを同定する。
本稿では,表現のばらつきを検知し,軽量な残差補償を選択的に適用する訓練不要な推論時間法である 'emph{Dynamic Alignment Compensation} (DAC) を提案する。
DACはレイヤワイズ・セマンティック補償を組み合わせ、時間的ドリフトを制限するためにシークエンシャル・セマンティック補正と層間劣化を緩和する。
複数のLVLMバックボーンにまたがる9つの幻覚に焦点を当てた汎用マルチモーダルベンチマークの実験により、DACは高い全体的な性能を維持しながら、常に幻覚を減少させることが示された。
関連論文リスト
- Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Mitigating Multimodal Hallucination via Phase-wise Self-reward [37.441718699530526]
我々は、外部の監督なしに推論時に動的幻覚を緩和できる新しい自己回帰フレームワークを導入する。
textbfPSRD (textbfPhase-wise textbfSelf-textbfReward textbfDecoding) は、位相方向の自己回帰信号で導かれるオンライン幻覚補正用である。
論文 参考訳(メタデータ) (2026-04-20T09:04:49Z) - HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models [0.7252027234425333]
Hesitation-Triggered Differential Inference (HTDC)は、標準のフルブランチ推論を保存するトレーニング不要のデコードフレームワークである。
Hesitation-Triggered Differential Inference は、強いタスク精度を維持しながら、常に幻覚を減少させる。
論文 参考訳(メタデータ) (2026-04-13T22:47:27Z) - Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction [49.96701537295129]
LVLM(Large Vision-Language Models)は、モーダルなタスク間で大きな成功を収めてきたが、幻覚によって妨げられている。
既存の方法は幻覚を緩和するが、しばしば生成行動を変化させ、結果として出力が短くなり、トークンの分布がシフトする。
幻覚緩和のための制御および選択的な潜伏介入を行う効果的なプラグアンドプレイフレームワークであるMESAを提案する。
論文 参考訳(メタデータ) (2026-04-09T07:31:27Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization [78.94590726578014]
マルチモーダル推論モデル (Multimodal reasoning model, MLRM) は幻覚の傾向が強く, 効果的な解はいまだ未発見のままである。
textbfCompression と textbfPreference textbfOptimization を組み合わせたトレーニングベースの緩和フレームワーク C3PO を提案する。
論文 参考訳(メタデータ) (2026-02-03T11:00:55Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models [3.9464481148889354]
層集約(DCLA)による層間整合性を用いた復号化機構を提案する。
提案手法は,従来のレイヤから表現を集約することで動的セマンティック参照を構築し,階層間の一貫性を強制するために意味的に逸脱したレイヤを補正する。
MMEやPOPEのような幻覚ベンチマークの実験では、DCLAはLVLMの信頼性と性能を高めつつ、幻覚を効果的に低減することを示した。
論文 参考訳(メタデータ) (2025-05-18T10:15:42Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding [25.489832294197797]
本稿では,LVLM推論における幻覚の低減を目的とした,命令コントラストデコーディング(ICD)手法を提案する。
本手法は,マルチモーダル核融合モジュールにおいて,外乱指示が幻覚を著しく悪化させるという観察に着想を得たものである。
論文 参考訳(メタデータ) (2024-03-27T16:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。