論文の概要: Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.29959v1
- Date: Mon, 29 Jun 2026 08:36:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.130532
- Title: Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation
- Title(参考訳): キャリブレーションによる検索予算の配分は、検索の強化に役立てる
- Authors: Zhe Dong, Fang Qin, Manish Shah, Yicheng Wang,
- Abstract要約: 適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
- 参考スコア(独自算出の注目度): 10.60293484295824
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation (RAG) typically retrieves a fixed number of passages for every query. This is wasteful when the reader already knows the answer, and it can be harmful when irrelevant or partially relevant passages distract the reader. We formulate adaptive RAG as calibrated retrieval-budget allocation: given a query, decide whether to answer closed-book, retrieve a compact context (k=1), retrieve a full context (k=5), or abstain. The contribution is a probability interface rather than a new raw uncertainty signal. We calibrate sequence log-probability and prefix-logit uncertainty signals into probabilities of correctness, then use these probabilities for graded context selection, selective abstention, and explicit latency/token trade-offs. Across core QA experiments on TriviaQA, Natural Questions, and MS MARCO, with auxiliary PopQA motivation and Qwen/Llama family checks, diagnostic out-of-fold calibration improves probability quality dramatically: for sequence log-probability, ECE drops from 0.275 to 0.062 on TriviaQA, 0.643 to 0.009 on NQ, and 0.711 to 0.031 on MS MARCO. Graded retrieval improves full-context and passage-budget frontiers for both our signal and TARG-style prefix entropy/margin, while retrieval-call AUC remains essentially tied with binary gating because k=1 is still a retrieval call. Held-out train/validation/test threshold experiments report deployable operating points. At matched-accuracy frontier operating points, a measured cost model reveals that gating is not universally faster: it increases latency by about 27% on Qwen3-8B but saves about 8% on Qwen3-32B. These results support a nuanced view of adaptive RAG: calibrated confidence is best understood as a reusable interface for allocating retrieval budget under task and system constraints.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) は通常、クエリ毎に一定数のパスを取得する。
これは、読者が既に答えを知っていれば無駄であり、無関係または部分的に関連したパスが読者を混乱させる場合、有害である可能性がある。
クエリを付与し、クローズドブックに回答するか、コンテクスト(k=1)を検索するか、フルコンテキスト(k=5)を検索するか、あるいは停止するかを決定する。
コントリビューションは、新しい生の不確実性信号ではなく、確率インターフェースである。
我々は、シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整し、これらの確率を、グレード付きコンテキスト選択、選択的棄権、明示的なレイテンシ/トーケントレードオフに使用します。
TriviaQA、Nature Questions、MS MARCOのコアQA実験、補助的なPopQAモチベーションとQwen/Llamaファミリーチェック、診断のアウトオブフォールドキャリブレーションにより、確率品質が劇的に向上する。
グレード検索は、我々の信号とTARGスタイルのプレフィックスエントロピー/マージンの両方のフルコンテキストとパス予算フロンティアを改善し、一方、検索コールAUCは、k=1がまだ検索コールであるため、基本的にバイナリゲーティングと結びついている。
列車/検証/テストしきい値実験では、展開可能な運転点が報告されている。
Qwen3-8Bではレイテンシが約27%向上するが、Qwen3-32Bでは約8%削減される。
調整された信頼度は、タスクおよびシステム制約下での検索予算を割り当てるための再利用可能なインターフェースとして最もよく理解されている。
関連論文リスト
- SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering [15.39457034915546]
我々は,textitReliable Audio-Visual Question Answering (mathcalR$-AVQA) に公式な問題を定式化する。
本稿では,$mathcalR$-AVQAの性能を高める軽量な手法であるAdaptive Confidence Refinement (ACR)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:35:33Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - TARG: Training-Free Adaptive Retrieval Gating for Efficient RAG [46.122203287541005]
トレーニングフリーのAdaptive Retrieval Gating (TARG) は、ベースモデルからの短い非遅延ドラフトのみを使用していつ取得するかを決定する、単発のポリシーである。
NQ-Open、TriviaQA、PopQAでは、TARGは一貫して精度と効率のフロンティアをシフトさせる。
論文 参考訳(メタデータ) (2025-11-12T23:09:52Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Will My Robot Achieve My Goals? Predicting the Probability that an MDP Policy Reaches a User-Specified Behavior Target [56.99669411766284]
自律的なシステムがタスクを実行する場合、ユーザの目標を達成する確率のキャリブレーションされた見積もりを維持する必要がある。
本稿では,ユーザの目標が目標間隔として指定される設定について検討する。
我々は、共形予測を反転させて確率推定を計算する。
論文 参考訳(メタデータ) (2022-11-29T18:41:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。