論文の概要: Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing
- arxiv url: http://arxiv.org/abs/2608.08265v1
- Date: Sat, 08 Aug 2026 17:53:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.751446
- Title: Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing
- Title(参考訳): オポチュニティは実現不可能:マルチLLMルーティングのための選択Valid診断
- Authors: Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb,
- Abstract要約: Oracleのルーティングは、クエリごとの選択によって、言語モデルのプールがどれだけ得られるかを測定する。
我々は、最適な固定モデルを選択するか、ルータファミリーの最良のメンバーを選択するのに生き残る選択正当信頼区間を証明した。
実現可能なオラクルの機会の共有は小さく、証明可能である。
- 参考スコア(独自算出の注目度): 0.9558392439655014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Oracle routing measures how much a pool of language models could gain from per-query selection, but the diagnostic has two flaws: testing against a best fixed model selected on the same examples invalidates paired inference, and a full-information oracle sees outcomes no deployable router observes. We separate three estimands (outcome-oracle opportunity, the Bayes-optimal gain from a declared pre-answer signal, and the held-out gain of a learned router) and prove selection-valid confidence intervals that survive choosing the best fixed model or the best member of a router family, a signal-information sandwich, and a $(1-1/e)$ greedy guarantee for building compact pools from submodular complementary coverage. On eight checkpoints from six families over four benchmarks, selection-valid intervals certify a population oracle gap of $9.7$--$30.7$ points on every task, yet the strongest deployable prompt router recovers only $7.5$--$14.4\%$ of it, and the simultaneous interval for the best of eleven tested policies has lower limit zero throughout. The realizable share of oracle opportunity is small and certifiable: strong routers beat the best fixed model, and most of the gap remains.
- Abstract(参考訳): 同一例で選択された最高の固定モデルに対するテストは、ペア推論を無効にし、フルインフォメーションのオラクルは、デプロイ可能なルータが監視できない結果を見る。
我々は,3つの推定値(アウトカム・オーラル・機会,ベイズ・最適ゲイン,事前回答信号からのベイズ・オプティマルゲイン,学習ルータのホールドアウトゲイン)を分離し,最良固定モデル又はルータファミリーのベストメンバーの選択を継続する選択正当信頼区間,信号情報サンドイッチ,およびサブモジュール補間カバレッジからコンパクトプールを構築するための1-1/eドルを保証した。
4つのベンチマーク上の6つのファミリーのチェックポイントでは、選択値間隔は全タスクで9.7$--30.7$の人口オラクルギャップを証明しているが、最も高いデプロイ可能なプロンプトルータは7.5$---14.4\%の時間間隔でしか回復できず、11の試験されたポリシーのうちの最高値のインターバルは、限界ゼロを減らしている。
強力なルーターが最高の固定モデルに勝っていて、そのギャップの大部分は残っている。
関連論文リスト
- Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration [8.515185888009833]
テストタイムのコラボレーションはLLM推論の改善と評価されることが多いが、その利益は不均一であり、時にはネガティブである。
固定候補プールに対しては、セレクタまたは検証器のネットゲインを測定可能な要素に分解する。
このことは、マルチエージェントトポロジーの本質的な性質としてではなく、候補選択問題として協調を再構築する。
論文 参考訳(メタデータ) (2026-07-20T04:09:19Z) - Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models [0.10152838128195468]
この研究は、大規模言語モデルに対する予算対応テストタイムモデル選択を定式化する。
単位コスト当たりの限界精度の推定によるオンライン再サンプリング・オー・リルート(RoR)割り当てポリシーを提案する。
11モデルのオープンウェイトプールから4つの異なる難易度ベンチマークで新たに生成した正しさテンソルの実験により、提案されたRoRポリシーは、単一ルート、一コミットルータ、予算対応のベスト・オブ・K、カスケード、ランダム・アロケーションベースラインに対して、良好なコスト品質のロバスト性を達成することが示された。
論文 参考訳(メタデータ) (2026-07-09T16:34:15Z) - How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise [0.10152838128195468]
シングルドローノイズはギャップのかなりの少数派であり、不飽和ベンチマークでは大きく、最も厳しいクエリでは半分に近づいている。
ルーティングベンチマークが採用可能なマルチサンプルオラクルプロトコルをリリースする。
論文 参考訳(メタデータ) (2026-07-03T15:49:40Z) - Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts [0.07812854697536452]
6つのベンチマークで206,000のクエリモデルペアを持つマルチ層LSMルーティングについて大規模に検討する。
報告された未解決性のかなりの部分は, 評価成果物に起因していることが示されている。
論文 参考訳(メタデータ) (2026-05-08T07:49:24Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。