論文の概要: BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs
- arxiv url: http://arxiv.org/abs/2608.30646v2
- Date: Tue, 01 Sep 2026 09:20:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:26.02594
- Title: BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs
- Title(参考訳): BiG-SURE-Bipartite Graph for Semantic Uncertainity and Reliability Estimation of LLMs (特集 バイオサイバネティックスとバイオサイバネティックス)
- Authors: Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy,
- Abstract要約: BiG-SUREは温度間セマンティック合意に基づく不確実性推定器である。
テキストQA,多言語QA,マルチモーダルQAタスクでBiG-SUREを評価する。
- 参考スコア(独自算出の注目度): 19.837692149547127
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reliable uncertainty estimation is a crucial requirement for deploying large language models (LLMs) and vision-language models (VLMs) in safety-critical settings, especially when the model parameters are not accessible (black-box). We propose BiG-SURE, an uncertainty estimator based on cross-temperature semantic agreement. The method samples low-temperature responses as stable semantic anchors and high-temperature responses as probes under meaning-preserving input transformations. It then constructs an anchor-probe Bipartite Graph (BiG) using NLI-based entailment scores and defines confidence through the normalized squared spectral energy of this matrix, with uncertainty given by its complement. This bipartite graph-based Semantic Uncertainty and Reliability Estimation (SURE) score measures whether high-temperature probes remain semantically aligned with the model's stable low-temperature belief or not. We evaluate BiG-SURE on text QA, multilingual QA, and multimodal QA tasks across multiple model families. In these experiments, BiG-SURE improves average abstention AUROC over prior black-box uncertainty estimators, while remaining simple, unsupervised, and applicable to black-box model settings.
- Abstract(参考訳): 信頼性の高い不確実性推定は、特にモデルパラメータがアクセスできない場合(ブラックボックス)に、大きな言語モデル(LLM)と視覚言語モデル(VLM)を安全クリティカルな設定にデプロイする上で重要な要件である。
温度間セマンティック合意に基づく不確実性推定器であるBiG-SUREを提案する。
本手法は, 意味保存入力変換の下で, 低温応答を安定なセマンティックアンカーとして, 高温応答をプローブとしてサンプリングする。
その後、NLIに基づく包含スコアを用いてアンカープローブBipartite Graph(BiG)を構築し、この行列の正規化された2乗スペクトルエネルギーを通じて信頼を定義する。
この二部グラフに基づくSemantic Uncertainty and Reliability Estimation (SURE)スコアは、高温プローブがモデルの安定な低温信念と意味的に一致しているかどうかを測定する。
テキストQA,多言語QA,マルチモーダルQAタスクにおいて,複数のモデルファミリ間でBiG-SUREを評価する。
これらの実験では、BiG-SUREは従来のブラックボックス不確実性推定器よりも平均禁忌AUROCを改善し、単純で教師なしでブラックボックスモデル設定に適用できる。
関連論文リスト
- Improving Semantic Uncertainty Quantification in Language Model Question-Answering via Token-Level Temperature Scaling [55.29156356409814]
現状のアプローチ,特に温度の固定化は,系統的に誤校正され,識別性に欠けるセマンティックな信頼性分布を生じさせることを示す。
一つの温度を最適化することは、適切な帰納バイアスをもたらすと我々は主張するが、驚くほど単純だが効果的な解であることを示した。
論文 参考訳(メタデータ) (2026-04-08T15:00:32Z) - LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs [61.06744611795341]
医用視覚言語モデル(VLM)は医用画像の強力なゼロショット認識器である。
本研究では,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ(texttttextbfLATA,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ)を提案する。
texttttextbfLATAは交換性を損なうことなくゼロショット予測をシャープにする。
論文 参考訳(メタデータ) (2026-02-19T16:45:38Z) - Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes [60.75226150503949]
本稿では,解答埋め込みの幾何学的構造を解析し,意味的不確実性を定量化するベイズ的枠組みを提案する。
S GPUは、生成した回答を密接なセマンティック空間にマッピングし、セマンティック埋め込みのグラム行列を計算し、セマンティック構成を要約する。
我々は,SGPUがモデルとモダリティをまたいで転送されることを示し,そのスペクトル表現が意味的不確実性の一般的なパターンを捉えていることを示す。
論文 参考訳(メタデータ) (2025-12-16T08:15:24Z) - Efficient semantic uncertainty quantification in language models via diversity-steered sampling [46.23327887393273]
本稿では,デコード中に意味的に冗長な出力を回避できるダイバーシティステアリング・サンプリング手法を提案する。
主要なアイデアは、モデルの提案分布に連続的な意味-類似性ペナルティを注入することである。
モジュラーであり、ベースLSMへの勾配アクセスを必要としないため、このフレームワークは不確実性評価のためのドロップインエンハンスメントとして機能することを約束している。
論文 参考訳(メタデータ) (2025-10-24T10:06:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - TECP: Token-Entropy Conformal Prediction for LLMs [0.10742675209112619]
Token-Entropy Conformal Prediction (TECP) は、トークンレベルのエントロピーをロジットフリーで参照不要な不確実性尺度として活用する新しいフレームワークである。
本手法は,ブラックボックスLLM設定における信頼に値する生成のための原理的かつ効率的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-08-30T11:31:04Z) - Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction [0.0]
動的しきい値キャリブレーションとクロスモーダル整合性検証を統合したモデル非依存不確実性定量化法を提案する。
このフレームワークは、様々なキャリブレーションとテストの分割比で安定したパフォーマンスを実現し、医療、自律システム、その他の安全に敏感な領域における現実的な展開の堅牢性を強調している。
この研究は、マルチモーダルAIシステムにおける理論的信頼性と実用性の間のギャップを埋め、幻覚検出と不確実性を考慮した意思決定のためのスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-04-24T15:39:46Z) - Calibrated Large Language Models for Binary Question Answering [49.1574468325115]
よく校正されたモデルは、その予測が正しい可能性を正確に反映する確率を生成するべきである。
本稿では、帰納的Venn-Abers予測器(IVAP)を用いて、バイナリラベルに対応する出力トークンに関連する確率をキャリブレーションする手法を提案する。
論文 参考訳(メタデータ) (2024-07-01T09:31:03Z) - Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities [79.9629927171974]
大規模言語モデル(LLM)の不確実性は、安全性と信頼性が重要であるアプリケーションには不可欠である。
ホワイトボックスとブラックボックス LLM における不確実性評価手法である Kernel Language Entropy (KLE) を提案する。
論文 参考訳(メタデータ) (2024-05-30T12:42:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。