論文の概要: Revealing Epistemic Uncertainty in MLLMs via Causal-Invariant Masking
- arxiv url: http://arxiv.org/abs/2610.02887v1
- Date: Fri, 02 Oct 2026 06:29:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.244739
- Title: Revealing Epistemic Uncertainty in MLLMs via Causal-Invariant Masking
- Title(参考訳): Causal-invariant Masking によるMLLMの上皮不確かさの解明
- Abstract要約: MLLM(Multimodal Large Language Models)は幻覚に悩まされ、信頼性の高いデプロイメントを保証するために不確実性定量化(Uncertainty Quantification, UQ)が重要なニーズとなる。
因果関係に焦点を絞った視点で,元の予測と条件のセマンティックシフトを測定するコーサル不変マスキング(CIM)を提案する。
また,超球面埋め込み空間内でのセマンティックシフトを推定する高速な幾何的プロキシ指標であるEEDを提案する。
- 参考スコア(独自算出の注目度): 66.12909617366432
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) suffer from hallucinations, creating a critical need for Uncertainty Quantification (UQ) to ensure reliable deployment. However, existing approaches struggle to detect uncertainty caused by superficial associations, especially when the query-relevant signal is weak. We mainly attribute this issue to their bias toward aleatoric uncertainty arising from data ambiguity, overlooking epistemic uncertainty stemming from model limitations. To further decompose uncertainty types for a comprehensive UQ, we propose Causal-Invariant Masking (CIM), which measures the semantic shift between the original predictions and those conditioned on a causally-focused view. Based on this framework, we introduce Semantic Divergence as our core metric for UQ and provide theoretical evidence that it converges to the variance of model's sensitivity to non-causal correlations, establishing its ability to capture MLLM's limitation. To accelerate UQ in MLLMs, we further propose Expected Embedding Drift (EED), a fast geometric proxy metric that estimates semantic shift directly within the hyperspherical embedding space. Experiments show that our method achieves state-of-the-art performance on various benchmarks, while the proposed EED accelerates by nearly 50% with comparable performance.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は幻覚に悩まされ、信頼性の高いデプロイメントを保証するために不確実性定量化(Uncertainty Quantification, UQ)が重要なニーズとなる。
しかし、既存のアプローチは、特にクエリ関連信号が弱い場合、表面的関連による不確実性を検出するのに苦労している。
我々は主に、データあいまいさから生じるアレタリック不確実性に対する偏見を、モデル制限から生じるてんかんの不確実性を見落としている。
包括的UQのための不確実性型をさらに分解するため,因果的視点に基づく予測と条件のセマンティックシフトを測定するCIM(Causal-Invariant Masking)を提案する。
この枠組みに基づき、我々はセマンティック・ディバージェンス(Semantic Divergence)をUQのコアメトリックとして導入し、モデル感度と非因果関係のばらつきに収束する理論的な証拠を提供し、MLLMの限界を捉える能力を確立した。
MLLMにおけるUQを高速化するために,超球面埋め込み空間内でのセマンティックシフトを直接推定する高速な幾何的プロキシ指標であるEED(Embed Drift)を提案する。
実験の結果,提案したEEDは同等の性能で50%近く高速化した。
関連論文リスト
- Causally-Constrained Probabilistic Forecasting for Time-Series Anomaly Detection [1.8995711908407733]
本研究では,異常検出のための因果制約付き確率予測フレームワークを提案する。
ディープ・シークエンス・モデリングに先立って、明示的な時間付き因果グラフを統合する。
実験により,提案手法が最先端検出性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-20T09:24:28Z) - Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching [3.0708725114491293]
視覚言語モデル(VLM)は本質的に決定論的であり、不確実性を定量化する固有のメカニズムが欠如している。
我々は,低密度領域がモデル無知を意味するてんかん不確実性の指標として,埋め込みの負の対数密度を理論的に動機付けている。
我々は,REPVLMが不確実性と予測誤差のほぼ完全な相関を達成し,既存のベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-01-29T12:58:42Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - The Illusion of Certainty: Uncertainty quantification for LLMs fails under ambiguity [48.899855816199484]
そこで本研究では,第1の曖昧な質問応答(QA)データセットであるMAQA*とAmbigQA*を紹介する。
予測分布とアンサンブルに基づく推定器は、あいまいさの下では基本的に限定的であることを示す。
論文 参考訳(メタデータ) (2025-11-06T14:46:35Z) - Improving Uncertainty Quantification in Large Language Models via Semantic Embeddings [11.33157177182775]
大規模言語モデル(LLM)における正確な不確実性の定量化は、信頼性の高いデプロイメントに不可欠である。
LLMにおける意味的不確実性を測定するための現在の最先端手法は、厳密な双方向の包含基準に依存している。
本研究では,意味的不確実性のよりスムーズでロバストな推定を実現するためにセマンティックな埋め込みを利用する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-10-30T04:41:46Z) - Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities [79.9629927171974]
大規模言語モデル(LLM)の不確実性は、安全性と信頼性が重要であるアプリケーションには不可欠である。
ホワイトボックスとブラックボックス LLM における不確実性評価手法である Kernel Language Entropy (KLE) を提案する。
論文 参考訳(メタデータ) (2024-05-30T12:42:05Z) - SPUQ: Perturbation-Based Uncertainty Quantification for Large Language
Models [9.817185255633758]
大規模言語モデル(LLM)がますます普及し、顕著なテキスト生成機能を提供している。
プレッシャーの課題は、自信を持って間違った予測をする傾向にある。
本稿では,浮腫とてんかんの両不確実性に対処するために,新しいUQ法を提案する。
その結果,モデルキャリブレーションは大幅に改善し,予測誤差(ECE)は平均50%減少した。
論文 参考訳(メタデータ) (2024-03-04T21:55:22Z) - Uncertainty Quantification for Forward and Inverse Problems of PDEs via
Latent Global Evolution [110.99891169486366]
本稿では,効率的かつ高精度な不確実性定量化を深層学習に基づく代理モデルに統合する手法を提案する。
本手法は,フォワード問題と逆問題の両方に対して,堅牢かつ効率的な不確実性定量化機能を備えたディープラーニングに基づく代理モデルを提案する。
提案手法は, 長期予測を含むシナリオに適合し, 拡張された自己回帰ロールアウトに対する不確かさの伝播に優れる。
論文 参考訳(メタデータ) (2024-02-13T11:22:59Z) - Monotonicity and Double Descent in Uncertainty Estimation with Gaussian
Processes [52.92110730286403]
限界確率はクロスバリデーションの指標を思い起こさせるべきであり、どちらもより大きな入力次元で劣化すべきである、と一般的に信じられている。
我々は,ハイパーパラメータをチューニングすることにより,入力次元と単調に改善できることを証明した。
また、クロスバリデーションの指標は、二重降下の特徴である質的に異なる挙動を示すことも証明した。
論文 参考訳(メタデータ) (2022-10-14T08:09:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。