論文の概要: Uncertainty-Aware Abstention in Large Language Models with Provable Alignment Guarantees
- arxiv url: http://arxiv.org/abs/2607.04430v1
- Date: Sun, 05 Jul 2026 17:50:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.928378
- Title: Uncertainty-Aware Abstention in Large Language Models with Provable Alignment Guarantees
- Title(参考訳): 確率的アライメント保証を有する大規模言語モデルにおける不確実性認識の欠如
- Abstract要約: 大規模言語モデル (LLM) は質問応答システム (QA) に徐々にデプロイされている。
信頼度を見積もることなく、幻覚または不一致の応答を生成することができる。
我々は、任意の不確実性スコアをリスク制御された選択応答規則に変換する信頼区間に基づくキャリブレーションフレームワークであるCICを提案する。
- 参考スコア(独自算出の注目度): 0.5371337604556311
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly deployed in question answering (QA) systems, yet they may generate hallucinated or misaligned responses without reliable confidence estimates. Uncertainty quantification (UQ) offers a natural basis for selective answering, where a system answers only when its prediction is deemed reliable and abstains otherwise. However, existing uncertainty scores for LLMs are often heuristic: a threshold chosen on such scores does not, by itself, provide statistical guarantees on the error rate among accepted answers. We propose CIC, a confidence-interval-based calibration framework that converts arbitrary uncertainty scores into risk-controlled selective answering rules. Given a held-out calibration set, CIC evaluates each generated response using an application-specific alignment criterion and associates it with an uncertainty score and a binary error label. For each candidate uncertainty threshold, CIC estimates the acceptance-conditioned error rate and constructs a high-probability upper confidence bound using either Hoeffding-style or Clopper-Pearson confidence intervals. It then selects the largest threshold whose upper bound is below a user-specified risk level $α$, thereby maximizing the answering rate subject to a finite-sample reliability constraint. Under exchangeability, CIC guarantees with probability at least $1-δ$ that the selected threshold, if non-null, controls the error rate among accepted answers at level $α$. We evaluate CIC on both closed-ended and open-ended QA benchmarks across seven LLMs and multiple uncertainty estimators. Experimental results show that CIC consistently achieves valid risk control while retaining strong answering efficiency, providing a practical and statistically grounded mechanism for deploying LLMs in reliability-sensitive QA workflows.
- Abstract(参考訳): 大規模言語モデル (LLM) は質問応答システム (QA) にますますデプロイされているが、信頼度を見積もることなく、幻覚的あるいは不一致の応答を生成する。
不確実性定量化(英: Uncertainty Quantification、UQ)は選択的な答えの自然な基礎を提供する。
しかし、LLMの既存の不確実性スコアは、しばしばヒューリスティックである:そのようなスコアで選択された閾値は、それ自体は、受け入れられた回答のエラー率に関する統計的保証を提供しない。
我々は、任意の不確実性スコアをリスク制御された選択応答規則に変換する信頼区間に基づくキャリブレーションフレームワークであるCICを提案する。
ホールドアウト校正セットが与えられた場合、CICはアプリケーション固有のアライメント基準を用いて各生成された応答を評価し、不確実性スコアとバイナリエラーラベルとを関連付ける。
各候補不確実性しきい値について、CICは受け入れ条件付き誤差率を推定し、ホーフディングスタイルまたはクロッパー・ピアソンの信頼区間を用いて高確率な高信頼度を構築する。
次に、上限がユーザ指定リスクレベル$α$以下である最大のしきい値を選択し、有限サンプル信頼性制約の回答率を最大化する。
交換性の下では、CICは少なくとも1-δ$の確率で、選択されたしきい値が非nullであれば、レベル$α$で受け入れられた回答のエラー率を制御することを保証している。
我々は、7つのLLMおよび複数の不確実性推定器のクローズドエンドおよびオープンエンドQAベンチマークでCICを評価する。
実験結果から,信頼性に敏感なQAワークフローにLLMをデプロイするための実用的かつ統計的基盤機構を提供するとともに,高い応答効率を維持しつつ,有効なリスク制御をCICは一貫して達成していることがわかった。
関連論文リスト
- Asymptotic Risk Calibration for Selective Question Answering [0.0]
大規模言語モデル(LLM)は、流動性があるが誤った答えを生成する。
A-CRC-QAは不確実性を考慮した質問応答のためのポストホックキャリブレーションフレームワークである。
A-CRC-QAはモデルに依存しず、追加のトレーニングを必要とせず、異なる不確実性推定器と組み合わせることができる。
論文 参考訳(メタデータ) (2026-08-12T12:45:45Z) - LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy [1.3254304182988286]
本稿では,アダプティブ・コンフォーマル・セマンティック・エントロピー(ACSE, Adaptive Conformal Semantic Entropy)を提案する。
我々の不確実性スコアリング機能は、同じプロンプトに対する複数の多様な応答のクラスタリングセマンティックエントロピーに基づいている。
我々のアプローチは、最先端の不確実性定量化ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T20:56:11Z) - Entropy Alone is Insufficient for Safe Selective Prediction in LLMs [20.664633053172327]
選択予測システムは、高リスクケースでの回答を控えることで、言語モデル幻覚による害を軽減することができる。
不確実性定量化技術はしばしばそのようなケースを特定するために用いられるが、より広い選択的予測ポリシーの文脈で評価されることはほとんどない。
エントロピーに基づく不確実性手法のモデル依存的故障モードを同定し、エントロピースコアと正当性プローブ信号を組み合わせることで、信頼できない禁忌行動に対処する。
論文 参考訳(メタデータ) (2026-03-22T11:27:13Z) - Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation [47.91529693614168]
既存の方法は、主に回答ファーストであり、回答を生成した後のみ信頼を生み出す。
モデルが答える前に信頼を出力する信頼第一パラダイムについて検討し、このスコアを正解する確率として解釈する。
我々は,信頼度校正と正解精度をセグメント化された信用代入を通じて協調的に最適化する強化学習フレームワークであるCoCAを提案する。
論文 参考訳(メタデータ) (2026-03-06T04:03:13Z) - Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations [49.84786015324238]
信頼度推定(CE)は、大きな言語モデル(LLM)の回答がどれほど信頼性が高いかを示し、ユーザの信頼と意思決定に影響を与える可能性がある。
本稿では,CEの信頼性を3つの新しい側面で評価する総合評価フレームワークを提案する。
これには、急激な摂動に対する自信の堅牢性、意味論的に等価な答えに対する安定性、意味論的に異なる答えに対する感受性が含まれる。
論文 参考訳(メタデータ) (2026-01-12T23:16:50Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - SConU: Selective Conformal Uncertainty in Large Language Models [59.25881667640868]
SconU(Selective Conformal Uncertainity)と呼ばれる新しいアプローチを提案する。
我々は,特定の管理可能なリスクレベルで設定されたキャリブレーションの不確実性分布から,与えられたサンプルが逸脱するかどうかを決定するのに役立つ2つの共形p値を開発する。
我々のアプローチは、単一ドメインと学際的コンテキストの両方にわたる誤発見率の厳密な管理を促進するだけでなく、予測の効率を高める。
論文 参考訳(メタデータ) (2025-04-19T03:01:45Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。