論文の概要: Reliability Challenges in Diffusion Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.01318v1
- Date: Tue, 01 Sep 2026 14:38:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.769977
- Title: Reliability Challenges in Diffusion Vision-Language Models
- Title(参考訳): 拡散ビジョンランゲージモデルにおける信頼性の課題
- Authors: Md. Atabuzzaman, Chris Thomas,
- Abstract要約: 拡散に基づくLarge Vision-Language Models (dLVLMs) は自己回帰(AR) LVLMの強力な代替品として登場した。
本報告では,dLVLMにおける幻覚と偏見の信頼性評価について述べる。
- 参考スコア(独自算出の注目度): 2.6281187565150526
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based Large Vision-Language Models (dLVLMs) have recently emerged as a compelling alternative to autoregressive (AR) LVLMs, offering advantages in parallel decoding, bidirectional context, and controllable generation. Despite rapid progress, their reliability properties remain largely uncharacterized. We present the first systematic reliability evaluation of hallucination and bias in dLVLMs, benchmarking six diffusion models against competitive AR baselines across four dimensions. Our key findings are: (1) dLVLMs reverse the yes-bias of AR models in binary visual queries; (2) they achieve competitive hallucination rates yet exhibit degraded linguistic quality; (3) they collapse to near-zero accuracy on underrepresented racial groups with opposite-polarity gender bias; and (4) they exhibit accuracy collapse in multiple-choice settings when the correct option is shorter than its distractors, associated with a length prior that emerges at the first denoising step. Tokens committed at late denoising steps with low confidence further correlate with hallucinated content, pointing to a mechanistic signal unique to diffusion generation. These patterns vary across model families, suggesting reliability is shaped by the generative paradigm together with training data.
- Abstract(参考訳): 拡散に基づくLarge Vision-Language Models (dLVLMs)は、最近、自動回帰(AR)LVLMの代替として登場し、並列デコーディング、双方向コンテキスト、制御可能な生成の利点を提供している。
急速な進歩にもかかわらず、その信頼性は依然としてほとんど達成されていない。
4次元のARベースラインに対して6つの拡散モデルをベンチマークし, 幻覚とバイアスの系統的信頼性評価を行った。
主な知見は,(1)ARモデルのイエスバイアスを2次視覚クエリで逆転させる,(2) 競合する幻覚率を達成する,(2) 言語品質が低下しない,(3) 反対極性性に偏った人種群でほぼゼロに近い精度で崩壊する,(4) 正しい選択が気晴らしステップで現れる長さに関連付けられている,複数の選択において精度が低下する,といったものだった。
低信頼の遅発段で行うトークンは、拡散生成に特有の機械的信号を指して、さらに幻覚的内容と相関する。
これらのパターンはモデルファミリによって異なり、信頼性はトレーニングデータとともに生成パラダイムによって形成されていることを示唆している。
関連論文リスト
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs [69.52853771994451]
我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
論文 参考訳(メタデータ) (2026-08-01T11:48:25Z) - MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue [98.58433916474472]
MM-Snowballは,対話内における幻覚雪球の診断のための最初のベンチマークである。
本稿では,この劣化に対処するために,コンフリクト・アウェア・ビジュアル・リクティフィケーション(CAVR)を提案する。
論文 参考訳(メタデータ) (2026-05-30T08:53:34Z) - Self-Prophetic Decoding to Unlock Visual Search in LVLMs [108.77389957341586]
LVLM(Large Vision-Language Models)は、真のマルチモーダル推論に向けて急速に進化している。
LVLMビジュアルサーチは、訓練後の本質的能力の非互換性と、長い多段階推論コンテキストにおける干渉の2つの主要な課題に直面している。
固有単一ステップ機能を活用してコヒーレントな多ステップ推論を可能にする自己プロヒーレントデコーディングフレームワークであるSeProDを紹介する。
論文 参考訳(メタデータ) (2026-05-27T17:01:39Z) - Uncertainty Quantification for Large Language Diffusion Models [35.87984313223733]
自己回帰モデルに代わるものとして,大規模言語拡散モデル (LLDM) が登場している。
既存の不確実量化(UQ)手法は自己回帰因子化を前提とするか、高価な繰り返しサンプリングを使用する。
LLDMのUQに関する最初の体系的研究を行い、軽量ゼロショット不確実性信号を提案する。
論文 参考訳(メタデータ) (2026-05-14T08:39:56Z) - Lost in Diffusion: Uncovering Hallucination Patterns and Failure Modes in Diffusion Large Language Models [10.020835642521897]
本研究は,dLLMの幻覚パターンを評価するための最初の制御された比較研究である。
以上の結果から,現在のdLLMは,建築・規模・事前学習重量に制御されるARよりも幻覚の確率が高いことが示唆された。
以上の結果から,dLLMは一般タスクにおける性能ギャップを狭めたが,その異なる幻覚機構は信頼性をモデル化する上で重要な課題であることが示された。
論文 参考訳(メタデータ) (2026-04-12T09:59:41Z) - Hallucination Begins Where Saliency Drops [18.189047289404325]
幻覚は、前の出力トークンが次のトークンの予測に対して低い正当性を示すときにしばしば起こる。
LVLMs-Saliencyは,各出力トークンの視覚的グラウンドリング強度を定量化する,勾配認識型診断フレームワークである。
本手法は, 流速とタスク性能を保ちながら幻覚率を大幅に低減し, 堅牢かつ解釈可能なソリューションを提供する。
論文 参考訳(メタデータ) (2026-01-28T05:50:52Z) - Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization [38.469173375694076]
マルチモーダル大言語モデル(MLLM)における幻覚の根本原因を系統的に解析する。
1)不正確な初期記述が後続の推論を誤った前提に固定する連鎖的視覚推論の過度な信頼、(2)政策最適化中の探索の多様性が不十分で、過度に自信があるが誤ったアウトプットを発生させる要因、(3)トレーニングサンプル間の破壊的な衝突、NTKの類似性が誤関連や不安定なパラメータ更新を引き起こす要因である。
実験の結果,提案手法は幻覚率を著しく低減し,MLLMの推論精度を効果的に向上することが示された。
論文 参考訳(メタデータ) (2026-01-09T07:59:18Z) - Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction [59.801614364841775]
LVLM(Large Vision-Language Models)は目覚ましい能力を示しているが、幻覚は依然として持続的な課題である。
本研究は,LVLMにおける視覚知覚とトークン生成の内部進化の系統的解析である。
我々は,VDC(d Dominance Correction)戦略を考案し,不要なトークンを検出し,検証済みトークンに置き換えて出力信頼性を向上させる。
論文 参考訳(メタデータ) (2025-12-21T17:05:42Z) - Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion [52.315729095824906]
MLLM Semantic-Corrected Ping-Pong-Ahead Diffusion (PPAD) は,マルチモーダル大言語モデル(MLLM)を推論中の意味的オブザーバとして導入する新しいフレームワークである。
中間世代をリアルタイムに分析し、潜在意味的不整合を識別し、フィードバックを制御可能な信号に変換し、残りの認知ステップを積極的に導く。
大規模な実験ではPPADの大幅な改善が示されている。
論文 参考訳(メタデータ) (2025-05-26T14:42:35Z) - Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models [77.96693360763925]
Video SimpleQAは、ビデオコンテキストにおける事実性評価に適した最初の包括的なベンチマークである。
我々の研究は、既存のビデオベンチマークとは以下の重要な特徴によって異なる: 知識: ビデオの明示的な物語を超えた外部知識の統合を要求する。
短い形式の決定的な答え: 回答は、最小のスコアリング分散を持つ短いフォーマットで、曖昧で決定的に正しいものとして作成されます。
論文 参考訳(メタデータ) (2025-03-24T17:46:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。