論文の概要: Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
- arxiv url: http://arxiv.org/abs/2607.25600v1
- Date: Tue, 28 Jul 2026 11:30:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.816239
- Title: Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
- Title(参考訳): 自己知識を超えて:LLMにおける推論と検索の不確実性を促進する
- Authors: Chandan Kumar Sah, Xiaoli Lian, Li Zhang,
- Abstract要約: ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
- 参考スコア(独自算出の注目度): 4.476374205849672
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation improves knowledge-intensive question answering, but indiscriminate retrieval can introduce irrelevant evidence and unnecessary computation. We investigate whether verbalized confidence from black-box language models can serve as an actionable signal for retrieval routing. Our method, BeyondUncertainty, first elicits a structured provisional answer and confidence estimate, then applies a model-specific threshold selected on held-out validation data and frozen before test evaluation. Low-confidence questions receive top-$5$ TF--IDF retrieval followed by a second answer call, whereas high-confidence questions return the provisional answer directly. We evaluate 27,000 policy instances across six QA benchmarks, three model families, and three retrieval policies. BeyondUncertainty achieves $0.483$ mean token-level F1, compared with $0.467$ for always retrieval and $0.401$ for no retrieval, while reducing retrieved passages by $20.4\%$ relative to always retrieval. When matched on the number of questions routed to retrieval within each dataset--model cell, it outperforms a post-hoc random allocation in 17 of 18 settings, with an average gain of 0.024 F1. Although poorly calibrated as an absolute probability, probe uncertainty modestly predicts question-level retrieval benefit (AUROC $=0.628$). However, the additional probe increases total token usage by $28.2\%$, revealing a trade-off between more selective evidence acquisition and end-to-end token efficiency.
- Abstract(参考訳): Retrieval-augmented generationは知識集約的な質問応答を改善するが、無差別検索は無関係な証拠や不要な計算を導入することができる。
ブラックボックス言語モデルからの言語的信頼度が,検索経路の動作可能な信号として機能するかを検討する。
提案手法であるBeyondUncertaintyは、まず構造化された仮回答と信頼度推定を行い、保持された検証データ上で選択されたモデル固有しきい値を適用し、テスト評価の前に凍結する。
低信頼の質問は5ドル TF-IDF の検索を受け取り、次いで2回目の応答が続くが、高信頼の質問は暫定的な回答を直接返す。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
BeyondUncertainty は平均トークンレベル F1 を 0.483$ で、常に検索すると 0.467$ で、検索なしなら 0.401$ で、検索の場合、検索されたパスを 20.4\% で減らす。
各データセット-モデルセル内の検索にルーティングされた質問数にマッチすると、18設定中17でポストホックランダムアロケーションを上回り、平均ゲインは0.024 F1である。
絶対確率は低いが、プローブの不確実性は質問レベルの検索利益(AUROC $=0.628$)を適度に予測する。
しかし、追加のプローブはトークン全体の使用量を28.2 %$に増やし、より選択的な証拠取得とエンドツーエンドのトークン効率のトレードオフを明らかにする。
関連論文リスト
- Confidently Wrong: Detecting Hallucinations in Financial Question Answering from LLM Internal States [0.0]
厳密で不確実な回答は精査を招待する一方、自信のあるエラーは警告なしで下流の判断を静かに低下させる。
モデルの内部アクティベーションから、どれほど確実にそのような自信ある答え、あるいは自信ある幻覚が検出できるかを問う。
残差ストリーム上で線形プローブを訓練し、2つの確立された質問応答ベンチマークで評価する。
論文 参考訳(メタデータ) (2026-07-13T11:22:25Z) - Conditional Inference Trees and Forests for Feature Selection [0.0]
条件推論木 (CIT) と条件推論林 (CIF) は, 分割しきい値を選択する前に, テスト特徴による分割選択バイアスを低減する。
我々は,CITとCIFを,実データベンチマーク,ランタイムアブリゲーション,合成機能回復実験を用いて,下流予測のための上位k$の機能評価手法として検討する。
論文 参考訳(メタデータ) (2026-07-01T19:23:07Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - AB-RAG: Adaptive Budgeted Retrieval-Augmented Generation for Reliable Question Answering [0.0]
AB-RAGはトレーニングフリーでバックボーンに依存しないフレームワークで、答えを生成する。
信頼度を3つの信号の組み合わせから推定する。
そして、停止するか、より多くの証拠を回収するかを決定する。
論文 参考訳(メタデータ) (2026-06-27T21:08:14Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z) - Improving Passage Retrieval with Zero-Shot Question Generation [109.11542468380331]
オープンな質問応答における経路検索を改善するための,シンプルで効果的な再ランク付け手法を提案する。
再ランカは、学習済み言語モデルを用いて、検索されたパスに条件付けられた入力質問の確率を算出するゼロショット質問生成モデルを用いて、検索されたパスを再スコアする。
論文 参考訳(メタデータ) (2022-04-15T14:51:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。