論文の概要: MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
- arxiv url: http://arxiv.org/abs/2606.00622v1
- Date: Sat, 30 May 2026 08:53:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-03 00:57:58.910159
- Title: MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
- Title(参考訳): MM-Snowball:マルチモーダルマルチトゥル対話における幻覚スノーボールの評価と緩和
- Abstract要約: MM-Snowballは,対話内における幻覚雪球の診断のための最初のベンチマークである。
本稿では,この劣化に対処するために,コンフリクト・アウェア・ビジュアル・リクティフィケーション(CAVR)を提案する。
- 参考スコア(独自算出の注目度): 98.58433916474472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) demonstrate remarkable visual understanding, yet their reliability in interactive settings is severely undermined by hallucination snowballing: a phenomenon where initial errors amplify across conversational turns, leading to a collapse in coherence. This failure reveals a fundamental vulnerability where models progressively neglect visual grounding in favor of over-relying on polluted textual history. Existing benchmarks are predominantly confined to single-turn VQA, which fail to capture the complex dynamics of error propagation in long-horizon interactions. To address this, we introduce MM-Snowball, the first benchmark for fine-grained diagnosis of hallucination snowballing within dialogues. Extensive evaluation shows that our benchmark poses a significant challenge even to advanced MLLMs and reveals the inefficacy of existing mitigation methods designed for single-turn VQA. To counteract this degradation, we propose Conflict-Aware Visual Rectification (CAVR). This training-free method mitigates snowballing through a synergistic dual-mechanism that refreshes visual grounding at the representation level and rectifies output distributions at the logit level, effectively re-anchoring the model to visual facts. Experiments demonstrate that CAVR achieves state-of-the-art performance, offering a promising path toward more reliable interactive AI. Data and code are available at: https://frenkie-chiang.github.io/MM-Snowball
- Abstract(参考訳): マルチモーダル・大規模言語モデル(MLLM)は目覚ましい視覚的理解を示すが、対話的な設定における信頼性は幻覚的スノーボール(英語版)によって著しく損なわれている。
この失敗は、汚染されたテキスト履歴を過度に参照することを支持するために、モデルが視覚的根拠を徐々に無視する根本的な脆弱性を明らかにする。
既存のベンチマークは、主に1ターンのVQAに限られており、長い水平相互作用におけるエラー伝播の複雑なダイナミクスを捉えられなかった。
そこで本研究では,覚醒スノーボールの詳細な診断のための最初のベンチマークであるMM-Snowballを紹介する。
大規模な評価の結果,我々のベンチマークは高度MLLMにも大きな課題を呈し,一ターンVQA用に設計された既存の緩和手法の非効率性を明らかにした。
そこで我々は,この劣化に対処するために,衝突認識ビジュアル・リクティフィケーション(CAVR)を提案する。
表現レベルでの視覚的接地をリフレッシュし、ロジットレベルでの出力分布を補正し、効果的にモデルを視覚的事実に再編成する、相乗的双曲機構を通じて雪玉を緩和する。
実験では、CAVRが最先端のパフォーマンスを達成し、より信頼性の高いインタラクティブAIへの有望な道を提供することを示した。
データとコードは、https://frenkie-chiang.github.io/MM-Snowball.comで入手できる。
関連論文リスト
- Unified Hallucination Fuzzing for Multimodal Large Language Models [44.4785399881315]
マルチモーダル大言語モデル(MLLM)に対する幻覚は依然として永続的な課題である
既存の評価は、主に静的なベンチマークに基づいており、狭い分類範囲と急速な性能飽和に悩まされている。
本稿では,総合的なベンチマークと自己進化型ストレステストを統合するシステム評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T17:57:37Z) - Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration [7.647944993041615]
本研究では,急激な乱れに頼らずに,動的に意味的ドリフトを補正する学習自由推論手法を提案する。
様々な注意点にまたがる不規則な統計的中間点を計算することにより、信頼性の高い視覚表現のための安定なアンカーを確立する。
この再校正プロセスは、生成頻度と言語前兆を完全に保ちながら、視覚的意味的ミスアライメントを効果的に補正する。
論文 参考訳(メタデータ) (2026-05-24T09:14:49Z) - VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing [70.82867621856968]
大きな視覚言語モデル(LVLM)は、しばしば物体幻覚(OH)に悩まされる
近年の研究では、幻覚の問題は言語の先行に起因している可能性が示唆されている。
本稿では視覚コントラスト編集(VCE)を提案する。
論文 参考訳(メタデータ) (2026-04-21T12:40:07Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - ReLoop: "Seeing Twice and Thinking Backwards" via Closed-loop Training to Mitigate Hallucinations in Multimodal understanding [1.3244588997833218]
MLLM(Multimodal Large Language Models)は、オープンな視覚的質問応答において顕著な進歩を遂げている。
MLLMは幻覚に弱いままであり、信頼性と事実の整合性にとって重要な課題である。
クロスモーダル理解のためのマルチモーダル整合性を促進する統合クローズドループトレーニングフレームワークであるReLoopを提案する。
論文 参考訳(メタデータ) (2025-07-07T12:40:48Z) - Visual hallucination detection in large vision-language models via evidential conflict [24.465497252040294]
Dempster-Shafer理論(DST)に基づく不確実性推定によるLVLMの視覚幻覚検出法
そこで本研究では,LVLMの視覚幻覚検出手法として,DST(Dempster-Shafer theory)を用いた第1次視覚幻覚検出法を提案する。
論文 参考訳(メタデータ) (2025-06-24T11:03:10Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling [78.78822033285938]
VLM(Vision-Language Models)は視覚的理解に優れ、視覚幻覚に悩まされることが多い。
本研究では,幻覚を意識したトレーニングとオンザフライの自己検証を統合した統合フレームワークREVERSEを紹介する。
論文 参考訳(メタデータ) (2025-04-17T17:59:22Z) - Mitigating Hallucination for Large Vision Language Model by Inter-Modality Correlation Calibration Decoding [66.06337890279839]
大規模視覚言語モデル(LVLM)は、下流のマルチモーダルタスクに対する視覚言語理解において顕著な能力を示している。
LVLMは、複雑な生成タスクにおいて幻覚を生じさせ、視覚入力と生成されたコンテンツの間に矛盾が生じている。
本研究では,LVLMにおける幻覚を無訓練で緩和するIMCCD法を提案する。
論文 参考訳(メタデータ) (2025-01-03T17:56:28Z) - Beyond Logit Lens: Contextual Embeddings for Robust Hallucination Detection & Grounding in VLMs [3.8318712731382054]
LMMの中間層からコンテキストトークンを埋め込む洗練された方法であるContextualLensを導入する。
このアプローチは、行動やOCRを含む様々なカテゴリーにおける幻覚の検出と接地を著しく改善する。
我々の貢献は、より信頼性が高く解釈可能なマルチモーダルモデルへの道を開いた。
論文 参考訳(メタデータ) (2024-11-28T14:47:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。