論文の概要: Token-Budgeted Escalation for Financial Document QA: Cost Is Predictable, Benefit Is the Bottleneck
- arxiv url: http://arxiv.org/abs/2610.07760v1
- Date: Tue, 06 Oct 2026 04:55:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.817003
- Title: Token-Budgeted Escalation for Financial Document QA: Cost Is Predictable, Benefit Is the Bottleneck
- Title(参考訳): 財務文書QAのトークン予算によるエスカレーション:コストは予測可能、ベネフィットはボトルネック
- Abstract要約: 検索拡張生成システムは、難しいクエリをより深いコンテキストにルーティングすることができる。
バッチデプロイメントは、クエリによってコストが変わるコール間で共有トークンの予算を割り当てなければならない。
我々は、財務文書質問応答のための有限バッチ割当として選択的エスカレーションを定式化する。
- 参考スコア(独自算出の注目度): 2.650267352862835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation systems can route difficult queries to deeper context, but batch deployments must allocate a shared token budget across calls whose costs vary by query. We formulate selective escalation as finite-batch allocation for financial document question answering. Each of 150 FinanceBench questions first receives a top-1 retrieval answer. Predictors estimate the adjudication-quality gain and token cost of an optional top-5 call, and the allocator prioritizes calls by predicted gain per token. At the nominal 10% budget, gain-per-token allocation improves adjudication quality over gain-only ranking by 0.034 (95% document-bootstrap CI [0.001, 0.072]) while using 46.6% fewer total tokens than one-pass top-5 retrieval. Additional-call cost is accurately predictable (R-squared 0.93), whereas beneficial escalation remains difficult to rank (AUROC 0.60). These results show that heterogeneous cost is actionable under tight constraints, while progress across the full budget frontier depends on stronger query-specific benefit estimates.
- Abstract(参考訳): 検索可能な拡張生成システムは、難しいクエリをより深いコンテキストにルーティングすることができるが、バッチデプロイメントでは、クエリによってコストが変わるコール間で共有トークン予算を割り当てなければならない。
我々は、財務文書質問応答のための有限バッチ割当として選択的エスカレーションを定式化する。
ファイナンスベンチの質問は、まずトップ1の回答を受け取る。
予測者は、任意のトップ5呼び出しの判断品質のゲインとトークンコストを推定し、アロケータはトークン当たりの予測ゲインによって呼び出しを優先順位付けする。
名目上の10%の予算では、ゲイン・パー・トークンの割り当ては1パスのトップ5検索よりも46.6%少ないトークンを使用しながら、ゲインのみのランキングよりも0.034(95%のドキュメントブートストラップCI[0.001, 0.072])の調整品質を向上させる。
追加呼び出しコストは正確に予測可能である(R-squared 0.93)が、有利なエスカレーションはランク付けが難しい(AUROC 0.60)。
これらの結果は、不均一なコストは厳密な制約の下で動作可能である一方で、フル予算フロンティアの進捗は、より強いクエリ固有の利益推定に依存していることを示している。
関連論文リスト
- Agentic RAG Evaluation: Budget Allocation Across Questions, Trajectories, and Reads [0.49644055902166656]
エージェント検索強化世代における評価予算は、質問、探索軌跡、繰り返し回答にまたがる。
我々はHotpotQAとMuSiQueの検索フィードバック比較を用いて、割当精度、読み出し効率、コスト境界を測定する。
論文 参考訳(メタデータ) (2026-10-04T07:55:34Z) - Top-K Is Not a Budget for Hybrid Retrieval [0.0]
現代のRAGのハイブリッド検索は、高密度でスパースな検索者によるTop-L$の結果を融合させるのが一般的である。
本稿では、直接アクセス予算を入力として取り、インクリメンタルに認証し、全リスト上のRFFランキングの正確なプレフィックスを返すDiBudを提案する。
論文 参考訳(メタデータ) (2026-09-14T07:18:40Z) - Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation [64.51088225051959]
不均一なAIシステムは、最低コストで最も効果的に答えられる専門家にクエリをルーティングすることで、品質と効率を向上させることができる。
我々はこのトレードオフをPandoraのBoxの例として定式化した。
ガウス信号モデルの下では、得られたポリシーは、各専門家とインプットに対して、その価値見積の精算がそのコストに値するかどうかを決定する、クローズドフォームな情報表現を持つ。
論文 参考訳(メタデータ) (2026-08-20T17:54:37Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning [13.41454380481593]
不確実性を考慮した予算割当(Uncertainty-Aware Budget Allocation、UAB)は、追加の推論コストなしで見積もられた要求当たりの不確実性に基づいて、固定サンプリング予算を再配置する凹型整数最適化フレームワークである。
1.5Bから27Bパラメータにまたがる6つのオープンウェイトモデルとブラックボックスモデルと、数学、論理学、選好タスクをカバーする5つの推論ベンチマークを評価した。
論文 参考訳(メタデータ) (2026-05-26T11:06:58Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - One-Stage Top-$k$ Learning-to-Defer: Score-Based Surrogates with Theoretical Guarantees [6.792743621449621]
最初の1段階のTop-k$ Learning-to-Deferフレームワークを紹介します。
我々は、最もコスト効率の良いエンティティラベルや専門家1人当たりのインプットを$k$で選択するスコアベースの共有モデルを学ぶ。
CIFAR-10とSVHNの実験により、我々の1段階のTop-$k$法がTop-1deferralを厳密に上回っていることを確認した。
論文 参考訳(メタデータ) (2025-05-15T10:41:16Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Confidence-Budget Matching for Sequential Budgeted Learning [69.77435313099366]
問合せ予算で意思決定問題を定式化する。
我々は,多腕バンディット,線形バンディット,強化学習問題を考察する。
我々は,CBMに基づくアルゴリズムが逆性の存在下で良好に動作することを示す。
論文 参考訳(メタデータ) (2021-02-05T19:56:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。