論文の概要: Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
- arxiv url: http://arxiv.org/abs/2607.25600v2
- Date: Wed, 29 Jul 2026 07:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 14:21:10.732179
- Title: Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
- Title(参考訳): 自己知識を超えて:LLMにおける推論と検索の不確実性を促進する
- Abstract要約: ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
- 参考スコア(独自算出の注目度): 4.476374205849672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation improves knowledge-intensive question answering, but indiscriminate retrieval can introduce irrelevant evidence and unnecessary computation. We investigate whether verbalized confidence from black-box language models can serve as an actionable signal for retrieval routing. Our method, BeyondUncertainty, first elicits a structured provisional answer and confidence estimate, then applies a model-specific threshold selected on held-out validation data and frozen before test evaluation. Low-confidence questions receive top-5 TF-IDF retrieval followed by a second answer call, whereas high-confidence questions return the provisional answer directly. We evaluate 27,000 policy instances across six QA benchmarks, three model families, and three retrieval policies. BeyondUncertainty achieves 0.483 mean token-level F1, compared with 0.467 for always retrieval and 0.401 for no retrieval, while reducing retrieved passages by 20.4\% relative to always retrieval. When matched on the number of questions routed to retrieval within each dataset-model cell, it outperforms a post-hoc random allocation in 17 of 18 settings, with an average gain of 0.024 F1. Although poorly calibrated as an absolute probability, probe uncertainty modestly predicts question-level retrieval benefit (AUROC = 0.628). However, the additional probe increases total token usage by 28.2\%, revealing a trade-off between more selective evidence acquisition and end-to-end token efficiency.
- Abstract(参考訳): Retrieval-augmented generationは知識集約的な質問応答を改善するが、無差別検索は無関係な証拠や不要な計算を導入することができる。
ブラックボックス言語モデルからの言語的信頼度が,検索経路の動作可能な信号として機能するかを検討する。
提案手法であるBeyondUncertaintyは、まず構造化された仮回答と信頼度推定を行い、保持された検証データ上で選択されたモデル固有しきい値を適用し、テスト評価の前に凍結する。
低信頼の質問はトップ5のTF-IDF検索を受け取り、次いで第2の回答コールを受け取り、高信頼の質問は仮の回答を直接返す。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
BeyondUncertaintyは平均トークンレベルF1を0.483とし、常に検索すると0.467、検索なしなら0.401とした。
各データセットモデルセル内の検索にルーティングされた質問数にマッチすると、18設定中17でポストホックランダムアロケーションを上回り、平均ゲインは0.024 F1である。
絶対確率は低いが、プローブの不確実性は質問レベルの検索利益(AUROC = 0.628)を適度に予測する。
しかし、追加のプローブはトークン全体の使用量を28.2 %増加させ、より選択的な証拠取得とエンドツーエンドのトークン効率のトレードオフを明らかにする。
関連論文リスト
- Evaluating Confidence-Gated Retrieval with Matched Trajectory Replay [3.888537003098864]
信頼と行動のマッピングを比較するための制御プロトコルであるMatched trajectory replayを提案する。
マルチホップ質問応答システムにおいて, 生の言語的信頼度とポストホック等調音校正度を比較した。
全体的な精度は、HotpotQAでは最大15ポイント向上するが、MuSiQueでは最大17ポイント低下する。
論文 参考訳(メタデータ) (2026-08-27T09:15:33Z) - Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States [0.0]
厳密で不確実な回答は精査を招待する一方、自信のあるエラーは警告なしで下流の判断を静かに低下させる。
モデルの内部アクティベーションから、どれほど確実にそのような自信ある答え、あるいは自信ある幻覚が検出できるかを問う。
残差ストリーム上で線形プローブを訓練し、2つの確立された質問応答ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-07-13T11:22:25Z) - Conditional Inference Trees and Forests for Feature Selection [0.0]
条件推論木 (CIT) と条件推論林 (CIF) は, 分割しきい値を選択する前に, テスト特徴による分割選択バイアスを低減する。
我々は,CITとCIFを,実データベンチマーク,ランタイムアブリゲーション,合成機能回復実験を用いて,下流予測のための上位k$の機能評価手法として検討する。
論文 参考訳(メタデータ) (2026-07-01T19:23:07Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - AB-RAG: Adaptive Budgeted Retrieval-Augmented Generation for Reliable Question Answering [0.0]
AB-RAGはトレーニングフリーでバックボーンに依存しないフレームワークで、答えを生成する。
信頼度を3つの信号の組み合わせから推定する。
そして、停止するか、より多くの証拠を回収するかを決定する。
論文 参考訳(メタデータ) (2026-06-27T21:08:14Z) - Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction [0.28932261919131014]
検索プロセスの事実性に関する有意義な信頼度と生成した回答を関連付けることが重要である。
本稿では,新たな2段階の手法を提案する。
我々の研究は、幅広い自然言語産業応用のための新しいタイプの認証されたRAGシステムを確立するのに役立ちます。
論文 参考訳(メタデータ) (2026-05-04T11:28:19Z) - Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation [47.91529693614168]
既存の方法は、主に回答ファーストであり、回答を生成した後のみ信頼を生み出す。
モデルが答える前に信頼を出力する信頼第一パラダイムについて検討し、このスコアを正解する確率として解釈する。
我々は,信頼度校正と正解精度をセグメント化された信用代入を通じて協調的に最適化する強化学習フレームワークであるCoCAを提案する。
論文 参考訳(メタデータ) (2026-03-06T04:03:13Z) - Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection [0.0]
大規模言語モデル(LLM)は、ますます重要な意思決定システムにデプロイされている。
出力アンカートークン確率に基づく正規化信頼スコアを導入する。
これにより、最小限のオーバーヘッドでエラーや幻覚を直接検出できる。
論文 参考訳(メタデータ) (2026-02-18T07:05:12Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - Llamas Know What GPTs Don't Show: Surrogate Models for Confidence
Estimation [70.27452774899189]
大規模言語モデル(LLM)は、ユーザを誤解させるのではなく、不正な例に対して低い信頼を示さなければならない。
2023年11月現在、最先端のLLMはこれらの確率へのアクセスを提供していない。
言語的信頼度と代理モデル確率を構成する最良の方法は、12データセットすべてに対して最先端の信頼度推定を与える。
論文 参考訳(メタデータ) (2023-11-15T11:27:44Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Improving Passage Retrieval with Zero-Shot Question Generation [109.11542468380331]
オープンな質問応答における経路検索を改善するための,シンプルで効果的な再ランク付け手法を提案する。
再ランカは、学習済み言語モデルを用いて、検索されたパスに条件付けられた入力質問の確率を算出するゼロショット質問生成モデルを用いて、検索されたパスを再スコアする。
論文 参考訳(メタデータ) (2022-04-15T14:51:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。