論文の概要: Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.28123v1
- Date: Wed, 27 May 2026 08:14:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.876509
- Title: Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models
- Title(参考訳): 大規模視覚言語モデルにおけるハロシン化緩和のためのリスク対応選択型プロンプト
- Authors: Yuang Huang, Yafeng Zhang, Yu Zilan,
- Abstract要約: 大規模視覚言語モデル(LVLM)における検証プロンプトの検討
その修正は入力困難によって増加するが、新しく導入されたエラーは難易度を越えて持続する。
本研究では、事前不確実性信号を用いて検証を選択的にトリガーする訓練不要な手法として、リスク対応選択プロンプト(RSP)を提案する。
- 参考スコア(独自算出の注目度): 0.6925738064847174
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prompt-based verification is widely used to mitigate hallucinations in large vision-language models (LVLMs), yet when it helps remains poorly understood. We systematically study verification prompting across two representative LVLM architectures and hallucination benchmarks, and find that it is a risk-bearing intervention: its corrections increase with input difficulty, while newly introduced errors persist across difficulty levels. As a result, always-on prompting helps on hard inputs but offers little benefit -- and can harm -- easier ones. Our analysis further shows that this behavior is associated with a conservative output shift. Verification prompts redistribute attention from visual tokens toward instruction tokens and induce a distinct middle-layer entropy pattern absent in a neutral-prompt control, suggesting instruction-conditioned attention redistribution rather than uniformly improved visual grounding. Motivated by this input-dependent risk, we propose Risk-aware Selective Prompting (RSP), a training-free approach that uses pre-generation uncertainty signals to trigger verification selectively. RSP mitigates the degradation of always-on prompting while preserving baseline performance, and reveals that effective selection signals vary across architectures.
- Abstract(参考訳): プロンプトに基づく検証は、大きな視覚言語モデル(LVLM)における幻覚を緩和するために広く用いられているが、それでも理解されていない。
2つの代表的なLVLMアーキテクチャと幻覚ベンチマークにまたがる検証を体系的に研究し、その修正は入力困難によって増加するが、新しく導入されたエラーは難易度を越えて持続する。
結果として、常にオンのプロンプトはハードインプットに役立ちますが、利益はほとんど得られません。
我々の分析は、この挙動が保守的な出力シフトと関連していることを示している。
検証は、視覚トークンから命令トークンへの再帰的注意を喚起し、中層エントロピーパターンを中立プロンプト制御に欠如させる。
この入力依存型リスクを動機として,前世代不確実性信号を用いて検証を選択的にトリガする訓練不要な手法であるRSPを提案する。
RSPは、ベースライン性能を維持しながら、常時オンプロンプトの劣化を緩和し、効率的な選択信号がアーキテクチャによって異なることを明らかにした。
関連論文リスト
- CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs [16.77211535169488]
本稿では,大規模視覚言語モデルのためのコントラスト型幻覚認識ステップワイドデコーディング(CHASD)を提案する。
CHASDは、次のトークンの最大確率が閾値以下である場合にのみ、不確実性駆動の信頼ゲートを使用してコントラスト分岐を活性化する。
実験の結果,CHASDは強いトレーニングのないベースラインよりも幻覚関連指標を向上し,競争的推論効率が向上することが示された。
論文 参考訳(メタデータ) (2026-05-22T08:03:12Z) - Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models [57.870323273127234]
本研究の目的は,画像の持続的支配パターンに対して内的注意を喚起する新たな敵攻撃であるtextbfAttention Hijacking を提案することである。
提案手法は,クエリの特定の単語に対する操作された出力の依存性を低減する。
論文 参考訳(メタデータ) (2026-05-17T08:02:27Z) - Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models [65.57985131861399]
幻覚は、しばしば高いエントロピー状態を示す認知的分岐点と強く相関している。
本稿では,視覚的に認識可能な推論機能の内部化を目的とした,軽量で総合的なトレーニングパラダイムであるV-STARを提案する。
論文 参考訳(メタデータ) (2026-04-11T13:59:05Z) - ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration [71.21097024566285]
LVLM(Large-Language Models)はしばしば深刻な幻覚に悩まされる。
既存の緩和戦略は、視覚的焦点を強化するか、強い先行を抑えるために、言語的、単一段階の状態に依存している。
本研究では,適応的な文脈情報の統合を通じて幻覚を緩和する学習自由推論介入手法であるAdaptive Context in VisionTegration (ACT)を提案する。
論文 参考訳(メタデータ) (2026-04-01T14:49:50Z) - Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation [51.743225614196774]
マルチモーダル大言語モデル (MLLM) は視覚言語推論において顕著な進歩を遂げている。
彼らは幻覚に弱いままであり、そこで生成されたコンテンツは視覚的証拠から逸脱する。
近年の視覚強調法では、復号時に視覚トークンを補強することでこの問題に対処しようとしている。
本稿では,MLLMのトレーニングフリーフレームワークであるAdaptive Visual Reinforcement (AIR)を提案する。
論文 参考訳(メタデータ) (2026-02-27T14:18:51Z) - Hallucination Begins Where Saliency Drops [18.189047289404325]
幻覚は、前の出力トークンが次のトークンの予測に対して低い正当性を示すときにしばしば起こる。
LVLMs-Saliencyは,各出力トークンの視覚的グラウンドリング強度を定量化する,勾配認識型診断フレームワークである。
本手法は, 流速とタスク性能を保ちながら幻覚率を大幅に低減し, 堅牢かつ解釈可能なソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-28T05:50:52Z) - Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models [13.32858759983739]
LVLM(Large Vision-Language Models)は、しばしばオブジェクト幻覚に悩まされ、視覚入力と矛盾するテキストを生成する。
この問題を緩和するための既存の推論時間の介入は、難しいトレードオフをもたらします。
本稿では,LVLMを視覚的に生成するフレームワークであるResidual-Update Directed Decoding Regulation(RUDDER)を提案する。
論文 参考訳(メタデータ) (2025-11-13T13:29:38Z) - Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs [51.93737995405164]
LVLM(Large Vision-Language Models)は幻覚の影響を受けやすいモデルである。
本稿では,条件付きポイントワイド・ミューチュアル・インフォメーション(C-PMI)キャリブレーション・デコーディング・ストラテジーを導入する。
提案手法は,復号効率を保ちながら,LVLMの幻覚を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-05-26T08:36:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。