論文の概要: How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise
- arxiv url: http://arxiv.org/abs/2607.03436v2
- Date: Tue, 07 Jul 2026 05:35:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.117065
- Title: How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise
- Title(参考訳): ルータとオラクルのギャップを再現可能なスペシャリストのアドバンテージとシングルドローラベルのノイズに分解する
- Authors: Teng-Ruei Chen,
- Abstract要約: シングルドローノイズはギャップのかなりの少数派であり、不飽和ベンチマークでは大きく、最も厳しいクエリでは半分に近づいている。
ルーティングベンチマークが採用可能なマルチサンプルオラクルプロトコルをリリースする。
- 参考スコア(独自算出の注目度): 0.10152838128195468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On real open-model pools, 12--36% of the reported router-to-oracle gap is single-draw label noise that no single-commit router can capture, while the majority is genuine, recoverable specialist advantage; this work proves why (a recoverability asymmetry) and releases a protocol to measure it. Routing among large language models (LLMs) trades cost for quality, motivated by the gap between learned routers and a per-instance oracle. But under stochastic decoding that oracle is a single Bernoulli draw, not a reproducible property. We recast the question structurally: the expected oracle decomposes as $O^{\exp}=O^{\mathrm{repro}}+Δ$, into reproducible single-commit headroom $O^{\mathrm{repro}}$ and a non-negative single-commit selection floor $Δ$. Our main result is a recoverability asymmetry: this floor is closed by no single-commit router (deterministic or randomized), yet is provably recovered by test-time sampling: best-of-$K$ on the committed model, at the oracle's own budget, dominates the independent-pool single-draw oracle. This cap needs no cross-model independence, pinning "not recoverable" to single-commit selection, not to information. The floor's magnitude is a prospective, conservative localization, not an audit: LLMRouterBench (33 models, 391,645 instances) builds its oracle as a per-query union of single $T=0.2$ draws, so its 20-point gap is by construction a union of stochastic draws; since $O^{\mathrm{repro}}$ is non-identifiable at $k=1$, we re-estimate by fresh $k\ge20$ resampling under one-sided, dependence-corrected bounds. Across three controlled open-model re-generations (arithmetic, competition math, and non-math science), single-draw noise is a substantial minority of the gap, larger on unsaturated benchmarks and approaching half on the hardest queries. We release a multi-sample oracle protocol that routing benchmarks can adopt.
- Abstract(参考訳): 実際のオープンモデルプールでは、報告されたルータ間ギャップの12~36%は、シングルコミットルータがキャプチャできないシングル描画ラベルノイズであり、大多数は本物で、回復可能なスペシャリストの利点である。
大規模言語モデル(LLM)間のルーティングは、学習ルータとインスタンス単位のオラクル間のギャップによって動機づけられた、品質上のコストを取引する。
しかし、確率的復号法の下では、オラクルは1つのベルヌーイ図面であり、再現可能な性質ではない。
期待のオラクルは$O^{\exp}=O^{\mathrm{repro}}+Δ$として分解され、再現可能な単一コミットのヘッドルーム$O^{\mathrm{repro}}$と非負の単一コミットの選択フロア$$$に分解される。
我々の主な結果は、回復可能性の非対称性である: このフロアは、単一コミットルータ(決定的またはランダム化)によって閉じられているが、テスト時間サンプリングによって確実に回収される: コミットモデル上では、オラクル自身の予算で、独立プールのシングルプールオーラクルを支配している。
このキャップはクロスモデルの独立性は必要とせず、情報ではなくシングルコミットの選択に"復元不可能"をピン留めする。
LLMRouterBench (33モデル、391,645インスタンス)は、単一$T=0.2$のドローのクエリ単位としてオラクルを構築するので、20ポイントのギャップは、確率的ドローのユニオンの構築によるものである;$O^{\mathrm{repro}}$は$k=1$で識別できないので、新しい$k\ge20$は、一方の依存補正境界の下で再サンプリングされる。
3つの制御されたオープン・モデル・リジェネレーション(パラメータ、競合数学、非マス・サイエンス)において、シングル・ドリューノイズはギャップのかなりの少数派であり、不飽和ベンチマークでは大きく、最も厳しいクエリでは半分に近づいている。
ルーティングベンチマークが採用可能なマルチサンプルオラクルプロトコルをリリースする。
関連論文リスト
- Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums [51.49970814177172]
データセットに対する経験的リスクは、自然に$N=nm$全サンプルに類似性を示す。
我々は悲観的な収束分析を避ける分析を提供する。
我々の成果は、既存の最先端の体制を改善した。
論文 参考訳(メタデータ) (2026-06-14T14:11:07Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Regret-Oracle Complexity Tradeoffs in Agnostic Online Learning [37.15283418677639]
従来のオンライン学習は、LittlestoneのStandard Optimal Algorithm(SOA)をベースラーナーとして利用して、実現可能な設定に還元することで、古典的に解決される。
私たちはSOAを、オフラインの実証的なリスク最小化のオラクルを通じてのみ概念クラスにアクセスする、実現可能なベースラーナーに置き換えます。
提案アルゴリズムは,クエリの総複雑性を$O(Td_mathrmVC+1)$に減らし,ほぼ最適の後悔を完全保存することを示した。
論文 参考訳(メタデータ) (2026-05-08T02:41:23Z) - On the Gradient Complexity of Private Optimization with Private Oracles [51.044364532408345]
我々は,リプシッツ損失の個人的経験的/人口的リスクの1次オラクルクエリーの観点から,ランニング時間について検討した。
予測ランニングタイム$(minfracsqrtd2, fracdlog(1/))$は、$dgeq 1/2$のときの次元の問題に対して$$$過剰なリスクを達成するために必要であることを示す。
論文 参考訳(メタデータ) (2025-11-17T23:58:11Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Tradeoffs between Mistakes and ERM Oracle Calls in Online and Transductive Online Learning [17.389446817000945]
学習者が経験的リスク最小化(Empirical Risk Minimization, ERM)や弱一貫性オラクルによってのみ概念クラスと対話する場合, オンライン学習とトランスダクティブオンライン学習を学習する。
論文 参考訳(メタデータ) (2025-05-30T18:11:58Z) - The Projected Covariance Measure for assumption-lean variable significance testing [3.8936058127056357]
単純だが一般的なアプローチは、線形モデルを指定し、次に$X$の回帰係数が 0 でないかどうかをテストすることである。
条件付き平均独立性のモデルフリーなnullをテストする問題、すなわち条件付き平均の$Y$$$X$と$Z$は$X$に依存しない。
本稿では,加法モデルやランダムフォレストなど,柔軟な非パラメトリックあるいは機械学習手法を活用可能な,シンプルで汎用的なフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-03T17:55:50Z) - Model-Based Multi-Agent RL in Zero-Sum Markov Games with Near-Optimal
Sample Complexity [67.02490430380415]
モデルに基づくMARLは、Nash平衡値(NE)を求めるために$tilde O(|S||B|(gamma)-3epsilon-2)$のサンプル複雑性を実現する。
また、アルゴリズムが報酬に依存しない場合、そのようなサンプル境界は最小値(対数因子まで)であり、アルゴリズムは報酬知識のない遷移サンプルを問合せする。
論文 参考訳(メタデータ) (2020-07-15T03:25:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。