論文の概要: Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning
- arxiv url: http://arxiv.org/abs/2607.14817v1
- Date: Thu, 16 Jul 2026 10:35:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.077631
- Title: Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning
- Title(参考訳): 疫学不確実性の評価:OOD検出とアクティブラーニングを超えて
- Abstract要約: タスクに対するベイズ最適決定戦略は、不確実性の定量化に一般的に使用されるスコアと一致しない。
再現可能な誤りである後悔を識別する能力を用いて不確実性を評価する。
学習したコンポーネント間の標準相関指標が必ずしも実際の運用性を予測するとは限らないことを示す。
本研究は, 関節脱離および実用性診断の手段として, 達成可能なリスク, 後悔, 分解のカバー面を評価することを提案する。
- 参考スコア(独自算出の注目度): 29.285132690069375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current evaluation of epistemic uncertainty relies on tasks such as out-ofdistribution detection and active learning. However, the Bayes-optimal decision strategies for these tasks do not coincide with the scores commonly used to quantify epistemic uncertainty. Building on the epistemic reject-option framework, we evaluate epistemic uncertainty using its ability to identify regret, the reducible error. Formulating selective prediction as a constrained optimization over coverage, expected risk, and regret, we prove the optimal selector is a thresholded convex combination of the ground-truth aleatoric and epistemic uncertainties. This theoretical unification exposes a weakness in recent uncertainty disentanglement literature: we demonstrate that standard correlation metrics between learned components do not necessarily predict their actual operational utility. We instead propose to evaluate the achievable risk, regret, coverage surface of the decomposition as a diagnostic for joint disentanglement and utility. Benchmarking standard methods on datasets with dense human annotations reveals that decision-theoretic rankings can disagree substantially with proxy-task rankings, including pairwise rank inversions between methods that are top-ranked on one criterion and bottom-ranked on other.
- Abstract(参考訳): 疫学不確実性の現在の評価は、アウト・オブ・ディストリビューションの検出やアクティブ・ラーニングといったタスクに依存している。
しかし、これらのタスクに対するベイズ最適決定戦略は、てんかんの不確実性の定量化に一般的に使用されるスコアと一致しない。
本研究は, てんかん性拒絶反応の枠組みを基礎として, 後悔, 再現可能な誤りを識別する能力を用いて, てんかん不確実性を評価する。
対象範囲, 予測リスク, 後悔に対する制約付き最適化として選択予測を定式化することにより, 最適セレクタは, 接地トルース・アレタリック・エピステマティック不確実性の閾値付き凸であることを示す。
この理論的な統一は、最近の不確実性障害の文献の弱点を露呈する。我々は、学習したコンポーネント間の標準相関指標が必ずしも実際の運用性を予測するとは限らないことを実証する。
そこで本研究では, 関節外乱, 有用性の診断として, 達成可能なリスク, 後悔, カバー面の評価を提案する。
厳密な人間のアノテーションでデータセットの標準手法をベンチマークすると、決定理論のランキングはプロキシタスクのランクと大きく異なっており、例えば、ある基準で上位にランク付けされ、他の基準で下位にランク付けされているメソッド間のペアのランクインバージョンが含まれる。
関連論文リスト
- A Unified Risk View of Uncertainty: Posterior Risk for Disentanglement and Evaluation Beyond Proxies [2.854451361373021]
提案する不確実性の定義は,不確実性(不確実性)をポイントワイド後リスク(pointwise rear risk)として定義する。
この見解は、関数に対するベイズの不確実性と、後部平均からの推定値依存偏差を組み合わせ、誤特定や最適化誤差のような効果を捉えている。
プロキシ評価を避けることにより、不確実性推定のきめ細かい分析が可能になる。
論文 参考訳(メタデータ) (2026-08-06T13:05:16Z) - Entropy Alone is Insufficient for Safe Selective Prediction in LLMs [20.664633053172327]
選択予測システムは、高リスクケースでの回答を控えることで、言語モデル幻覚による害を軽減することができる。
不確実性定量化技術はしばしばそのようなケースを特定するために用いられるが、より広い選択的予測ポリシーの文脈で評価されることはほとんどない。
エントロピーに基づく不確実性手法のモデル依存的故障モードを同定し、エントロピースコアと正当性プローブ信号を組み合わせることで、信頼できない禁忌行動に対処する。
論文 参考訳(メタデータ) (2026-03-22T11:27:13Z) - Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation [68.106428321492]
大規模言語モデル (LLM) は高度な推論能力を示し、ロボットが自然言語の命令を理解し、適切な接地で高レベルな計画を生成することができる。
LLMの幻覚は重大な課題であり、しばしば過度に信頼され、不一致または安全でない計画に繋がる。
本研究は, 信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性評価を別々に評価するものである。
論文 参考訳(メタデータ) (2025-10-09T10:26:58Z) - Addressing Pitfalls in the Evaluation of Uncertainty Estimation Methods for Natural Language Generation [20.726685669562496]
幻覚は、大きな言語モデル(LLM)の信頼性を損なう一般的な問題である。
近年の研究では、LLMの予測的不確実性によって生じる幻覚のサブセット、すなわち confabulations が特定されている。
衝突を検出するため,自然言語生成における予測不確かさを推定する様々な手法が開発されている。
論文 参考訳(メタデータ) (2025-10-02T17:54:09Z) - Hesitation is defeat? Connecting Linguistic and Predictive Uncertainty [2.8186733524862158]
本稿では,ルールベースのラベルラによってラベル付けされた自由テキストレポートから推定される予測不確実性と人・言語不確実性との関係について検討する。
その結果,予測的不確実性と言語的不確実性との間には緩やかな相関関係がみられ,機械の不確実性と人間の解釈を整合させる上での課題が浮き彫りにされた。
論文 参考訳(メタデータ) (2025-05-06T18:34:37Z) - SConU: Selective Conformal Uncertainty in Large Language Models [59.25881667640868]
SconU(Selective Conformal Uncertainity)と呼ばれる新しいアプローチを提案する。
我々は,特定の管理可能なリスクレベルで設定されたキャリブレーションの不確実性分布から,与えられたサンプルが逸脱するかどうかを決定するのに役立つ2つの共形p値を開発する。
我々のアプローチは、単一ドメインと学際的コンテキストの両方にわたる誤発見率の厳密な管理を促進するだけでなく、予測の効率を高める。
論文 参考訳(メタデータ) (2025-04-19T03:01:45Z) - Benchmarking common uncertainty estimation methods with
histopathological images under domain shift and label noise [62.997667081978825]
リスクの高い環境では、深層学習モデルは不確実性を判断し、誤分類の可能性がかなり高い場合に入力を拒否しなければなりません。
我々は,全スライド画像の分類において,最もよく使われている不確実性と頑健さの厳密な評価を行う。
我々は一般的に,手法のアンサンブルが,ドメインシフトやラベルノイズに対するロバスト性の向上とともに,より良い不確実性評価につながることを観察する。
論文 参考訳(メタデータ) (2023-01-03T11:34:36Z) - DEUP: Direct Epistemic Uncertainty Prediction [56.087230230128185]
認識の不確実性は、学習者の知識の欠如によるサンプル外の予測エラーの一部である。
一般化誤差の予測を学習し, aleatoric uncertaintyの推定を減算することで, 認識的不確かさを直接推定する原理的アプローチを提案する。
論文 参考訳(メタデータ) (2021-02-16T23:50:35Z) - Temporal Difference Uncertainties as a Signal for Exploration [76.6341354269013]
強化学習における探索の効果的なアプローチは、最適な政策に対するエージェントの不確実性に依存することである。
本稿では,評価値のバイアスや時間的に矛盾する点を強調した。
本稿では,時間差誤差の分布の導出に依存する値関数の不確かさを推定する手法を提案する。
論文 参考訳(メタデータ) (2020-10-05T18:11:22Z) - Learning to Predict Error for MRI Reconstruction [67.76632988696943]
提案手法による予測の不確実性は予測誤差と強く相関しないことを示す。
本稿では,2段階の予測誤差の目標ラベルと大小を推定する新しい手法を提案する。
論文 参考訳(メタデータ) (2020-02-13T15:55:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。