論文の概要: Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.08665v1
- Date: Thu, 09 Jul 2026 16:34:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.596781
- Title: Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models
- Title(参考訳): 再サンプリングか再帰か? 大規模言語モデルのための予算を考慮したテスト時間モデル選択
- Abstract要約: この研究は、大規模言語モデルに対する予算対応テストタイムモデル選択を定式化する。
単位コスト当たりの限界精度の推定によるオンライン再サンプリング・オー・リルート(RoR)割り当てポリシーを提案する。
11モデルのオープンウェイトプールから4つの異なる難易度ベンチマークで新たに生成した正しさテンソルの実験により、提案されたRoRポリシーは、単一ルート、一コミットルータ、予算対応のベスト・オブ・K、カスケード、ランダム・アロケーションベースラインに対して、良好なコスト品質のロバスト性を達成することが示された。
- 参考スコア(独自算出の注目度): 0.10152838128195468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Routing among large language models (LLMs) trades response quality against serving cost, motivated by the reported gap between deployed routers and a per-instance oracle. Recent analysis shows that test-time resampling can recover per-instance selection headroom that no single-commit router captures; however, that guarantee holds only under an idealized oracle equipped with correctness labels and an unconstrained budget, neither of which a deployed system has. To the best of our knowledge, no previous work treats resampling the committed model and rerouting to an alternative model as competing uses of a single per-query cost budget. Therefore, this work formulates budget-aware test-time model selection: given a per-query budget and an imperfect verifier, allocate each unit of budget between resampling and rerouting so that expected correctness is maximized. An online resample-or-reroute (RoR) allocation policy driven by estimated marginal correctness per unit cost is proposed, and its behavior is grounded in the recoverability asymmetry between selection and sampling. Replay experiments on newly regenerated multi-draw correctness tensors from an eleven-model open-weight pool over four benchmarks of differing difficulty show that the proposed RoR policy attains a favorable cost-quality Pareto front relative to single-route, one-commit-router, budget-aware best-of-K, cascade, and random-allocation baselines for the tested pools, with the largest gains on the most heterogeneous benchmark; an ablation further shows the gains are verifier-gated, shrinking as verifier quality degrades, and robustness replays under a provider price vector and a label-free agreement verifier delineate where the conclusions carry over.
- Abstract(参考訳): 大規模言語モデル(LLM)間のルーティングは、デプロイされたルータとインスタンス単位のオラクル間のギャップが報告されていることによる、サービスコストに対する応答品質のトレードオフである。
近年の研究では、シングルコミットルータが捕捉しないインスタンス毎の選択ヘッドルームをテスト時間再サンプリングで回収できることが示されているが、その保証は正しいラベルと制約のない予算を備えた理想化されたオラクルの下でのみ維持される。
私たちの知る限りでは、従来の作業では、コミットモデルを再サンプリングし、ひとつのクエリ単位のコスト予算を競合するものとして、代替モデルに再ルーティングする処理は行われていません。
したがって、この作業は、クエリ毎の予算と不完全検証器とを付与し、再サンプリングとリルーチンの間に予算単位を割り当て、期待された正しさを最大化する、予算対応テストタイムモデル選択を定式化する。
単位コスト当たりの限界正しさを推定したオンライン再サンプリング・オー・リルート(RoR)割り当てポリシーを提案し,その動作は選択とサンプリングの非対称性の回復性に基礎を置いている。
4つの異なる難易度で11モデルのオープンウェイトプールから新たに再生された多重描画補正テンソルの再生実験により、提案されたRoRポリシーは、単ルート、一コミットルータ、予算対応ベストオブK、カスケード、ランダムアロケーションベースラインに対して好適なコスト品質のパレートを達成し、最もヘテロジニアスなベンチマークで最大のゲインを得た。
関連論文リスト
- Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation [64.51088225051959]
不均一なAIシステムは、最低コストで最も効果的に答えられる専門家にクエリをルーティングすることで、品質と効率を向上させることができる。
我々はこのトレードオフをPandoraのBoxの例として定式化した。
ガウス信号モデルの下では、得られたポリシーは、各専門家とインプットに対して、その価値見積の精算がそのコストに値するかどうかを決定する、クローズドフォームな情報表現を持つ。
論文 参考訳(メタデータ) (2026-08-20T17:54:37Z) - RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning [6.614808404204836]
本稿では,カスケードルーティングをマルコフ決定プロセスとして定式化する品質推定自由フレームワークを提案する。
トラジェクティブリターンとアドバンテージを使用して、パフォーマンスコストの目標を直接最適化する。
論文 参考訳(メタデータ) (2026-08-16T15:47:04Z) - Best-Arm Identification with Generative Proxy [10.674965991983974]
固定信頼度ベストアーム識別法について検討し,各報酬の引き分けを,安価だが相関の取れたプロキシスコアと組み合わせて検討した。
本稿では,最小二乗法に適合する残差の上限値を維持する位相除去アルゴリズム PROBE を提案する。
我々は PROBE が$-PAC であり、一定の乗算係数と一定の加法キャリブレーションコストまで、既知の相関オラクルサンプルの複雑さが得られることを証明した。
論文 参考訳(メタデータ) (2026-07-08T00:41:43Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment [57.588738943463646]
大規模言語モデル(LLM)は機械翻訳(MT)において顕著な性能を発揮した
大規模に展開するのは 違法に高価です
モデル内ルータである textbfRouteLMT を提案する。
論文 参考訳(メタデータ) (2026-04-24T13:02:45Z) - Reinforcement Learning from Multi-Source Imperfect Preferences: Best-of-Both-Regimes Regret [71.69884486156359]
我々は, 累積的不完全化予算を用いて, エンフルティソースの不完全性選好からエピソードRLを考察した。
我々は,最良な登録行動を示す,後悔$tildeO(sqrtK/M+)$の統一アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-03-20T19:34:53Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - AdaGReS:Adaptive Greedy Context Selection via Redundancy-Aware Scoring for Token-Budgeted RAG [4.69377227249912]
本稿ではトークン予算RAGのための冗長性を考慮したコンテキスト選択フレームワークであるAdaGReSを紹介する。
AdaGReSは、目的から派生した限界ゲインを用いてトークン予算制約の下で欲求選択を行う。
オープンドメイン質問応答(Natural Questions)と高冗長バイオメディカル(ドラッグ)コーパスの実験は、冗長性制御とコンテキスト品質の一貫性を実証している。
論文 参考訳(メタデータ) (2025-12-31T18:48:07Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Market-Driven Subset Selection for Budgeted Training [1.7969777786551429]
それぞれのトレーニング例を取引可能な契約として扱う,市場ベースのフレームワークを提案する。
厳格な60kの予算の下でのGSM8Kの数学的推論では、セレクタは強い単一信号基底線でパリティを達成する。
本フレームワークは,逐次的推論および分類タスクのための固定的な計算予算の下で,多信号データキュレーションを統一する。
論文 参考訳(メタデータ) (2025-10-02T18:12:03Z) - Meta-Router: Bridging Gold-standard and Preference-based Evaluations in Large Language Model Routing [15.724480880994259]
大規模言語モデル(LLM)ルータは、クエリ毎に候補のプールから最も適切なモデルを選択する。
クラウドソーシングやLSM-as-a-judgeシステムを通じて収集された嗜好ベースのデータは、より安価でスケーラブルだが、応答の真の品質を反映することにはバイアスが伴うことが多い。
我々は、好みデータバイアスを補正し、2つのデータソース間の不均衡に対処し、ルーティングの堅牢性と効率を改善する統合因果ルータトレーニングフレームワークを開発する。
論文 参考訳(メタデータ) (2025-09-29T21:44:00Z) - Additive Distributionally Robust Ranking and Selection [0.8283940114367679]
そこで本研究では,$k + m - 1$の事前仮説クリティカルシナリオのみをサンプリングすることを目的とした,単純な加算割当(AA)手順を提案する。
AAが一貫したものであり、驚くべきことに、最も強い意味で付加性を達成することを証明します。
結果は、DRR&Sの加法構造に対する新しい、そして反直観的な洞察を与える。
論文 参考訳(メタデータ) (2025-09-07T17:36:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。