論文の概要: How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise
- arxiv url: http://arxiv.org/abs/2607.03436v1
- Date: Fri, 03 Jul 2026 15:49:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.610423
- Title: How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise
- Title(参考訳): ルータとオラクルのギャップを再現可能なスペシャリストのアドバンテージとシングルドローラベルのノイズに分解する
- Authors: Teng-Ruei Chen,
- Abstract要約: 大きな言語モデル(LLM)間のルーティングは、低コストでより良い品質を実現する。
期待されるインスタンスごとのオラクルは$Oexp=Omathrmrepro+$として分解されることを示す。
このフロアはシングルコミットルータによって閉鎖されるが、テストタイムサンプリングによって回収される。
- 参考スコア(独自算出の注目度): 0.10152838128195468
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Routing among large language models (LLMs) promises better quality at lower cost, motivated by the reported gap between learned routers and a per-instance oracle. But that oracle is computed from a single correctness label per (query, model), so under stochastic decoding it is one Bernoulli draw, not a reproducible property. We recast the question structurally: the expected per-instance oracle decomposes as $O^{\exp}=O^{\mathrm{repro}}+Δ$, into reproducible single-commit headroom $O^{\mathrm{repro}}$ and a non-negative single-commit selection floor $Δ$. Our main result is a recoverability asymmetry: this floor is closed by no single-commit router, yet is recovered by test-time sampling -- best-of-$K$ on the committed model, at the oracle's own budget, dominates the independent-pool single-draw oracle. The cap needs no cross-model independence; we prove it with the exact decomposition and noise-share bounds that shrink as the budget grows. The procedure adds no new router, only resampling. The floor's magnitude is a prospective, conservative localization, not an audit: our primary target LLMRouterBench (33 models, 391,645 instances) defines its oracle as a per-query union over single $T=0.2$ generations -- by construction a union of stochastic single draws. Since $O^{\mathrm{repro}}$ is non-identifiable from the released $k=1$ matrix, we estimate the noise share by fresh $k\ge20$ resampling under one-sided, dependence- and guessing-floor-corrected bounds, recasting 'model-recall failure' as thin-support union inflation. On a controlled open-model re-generation, single-draw noise is a substantial minority of the gap -- larger on an unsaturated benchmark, approaching half on the hardest queries where no model is reliable -- while the majority remains recoverable specialist advantage. We release a multi-sample oracle evaluation protocol for routing benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)間のルーティングは、学習ルータとインスタンス単位のオラクル間のギャップが報告されていることから、低コストでより良い品質を実現する。
しかし、そのオラクルは1つの正当性ラベル(クエリ、モデル)から計算されるので、確率的復号化の下ではベルヌーイの描画は再現可能な性質ではない。
期待されるインスタンスごとのオラクルは$O^{\exp}=O^{\mathrm{repro}}+Δ$として分解され、再現可能な単一コミットのヘッドルーム$O^{\mathrm{repro}}$と非負の単一コミットの選択フロア$$$に分解される。
このフロアはシングルコミットルータによって閉じられているが、テスト時間サンプリングによって回収される -- コミットモデル上では、オラクル自身の予算で、独立プールのシングルドローオラクルを支配している。
我々は、予算が増加するにつれて縮小する正確な分解とノイズ共有境界でそれを証明している。
このプロシージャは新しいルータを追加せず、再サンプリングのみを行う。
私たちの主要なターゲットであるLLMRouterBench(33モデル、391,645インスタンス)は、そのオラクルを単一のT=0.2$世代に対するクエリー単位として定義しています。
O^{\mathrm{repro}}$ は、リリースされた $k=1$ 行列から識別できないので、一方的な、従属的、推測的なフロア補正境界の下で、新しい$k\ge20$ 再サンプリングによってノイズのシェアを推定し、"モデル-リコール障害"を薄い共役組合のインフレーションとして再キャストする。
コントロールされたオープンモデルのリジェネレーションでは、シングルドローノイズはギャップのかなりの少数であり、不飽和なベンチマークで大きくなり、モデルの信頼性が低い最も厳しいクエリで半分に近づき、大多数は回復可能なスペシャリストのアドバンテージのままである。
ベンチマークをルーティングするためのマルチサンプルオラクル評価プロトコルをリリースする。
関連論文リスト
- Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums [51.49970814177172]
データセットに対する経験的リスクは、自然に$N=nm$全サンプルに類似性を示す。
我々は悲観的な収束分析を避ける分析を提供する。
我々の成果は、既存の最先端の体制を改善した。
論文 参考訳(メタデータ) (2026-06-14T14:11:07Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - Regret-Oracle Complexity Tradeoffs in Agnostic Online Learning [37.15283418677639]
従来のオンライン学習は、LittlestoneのStandard Optimal Algorithm(SOA)をベースラーナーとして利用して、実現可能な設定に還元することで、古典的に解決される。
私たちはSOAを、オフラインの実証的なリスク最小化のオラクルを通じてのみ概念クラスにアクセスする、実現可能なベースラーナーに置き換えます。
提案アルゴリズムは,クエリの総複雑性を$O(Td_mathrmVC+1)$に減らし,ほぼ最適の後悔を完全保存することを示した。
論文 参考訳(メタデータ) (2026-05-08T02:41:23Z) - On the Gradient Complexity of Private Optimization with Private Oracles [51.044364532408345]
我々は,リプシッツ損失の個人的経験的/人口的リスクの1次オラクルクエリーの観点から,ランニング時間について検討した。
予測ランニングタイム$(minfracsqrtd2, fracdlog(1/))$は、$dgeq 1/2$のときの次元の問題に対して$$$過剰なリスクを達成するために必要であることを示す。
論文 参考訳(メタデータ) (2025-11-17T23:58:11Z) - DISCO: Diversifying Sample Condensation for Efficient Model Evaluation [59.01400190971061]
コスト評価は傾向を低下させ、イノベーションのサイクルを遅くし、環境への影響を悪化させる。
モデル応答の多様性を最大化するサンプルを選択することが重要となる。
我々のメソッドである$textbfDiversifying Sample Condensation (DISCO)$は、最も大きなモデル不一致を持つトップkサンプルを選択します。
論文 参考訳(メタデータ) (2025-10-09T08:53:59Z) - Tradeoffs between Mistakes and ERM Oracle Calls in Online and Transductive Online Learning [17.389446817000945]
学習者が経験的リスク最小化(Empirical Risk Minimization, ERM)や弱一貫性オラクルによってのみ概念クラスと対話する場合, オンライン学習とトランスダクティブオンライン学習を学習する。
論文 参考訳(メタデータ) (2025-05-30T18:11:58Z) - The Projected Covariance Measure for assumption-lean variable significance testing [3.8936058127056357]
単純だが一般的なアプローチは、線形モデルを指定し、次に$X$の回帰係数が 0 でないかどうかをテストすることである。
条件付き平均独立性のモデルフリーなnullをテストする問題、すなわち条件付き平均の$Y$$$X$と$Z$は$X$に依存しない。
本稿では,加法モデルやランダムフォレストなど,柔軟な非パラメトリックあるいは機械学習手法を活用可能な,シンプルで汎用的なフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-03T17:55:50Z) - Model-Based Multi-Agent RL in Zero-Sum Markov Games with Near-Optimal
Sample Complexity [67.02490430380415]
モデルに基づくMARLは、Nash平衡値(NE)を求めるために$tilde O(|S||B|(gamma)-3epsilon-2)$のサンプル複雑性を実現する。
また、アルゴリズムが報酬に依存しない場合、そのようなサンプル境界は最小値(対数因子まで)であり、アルゴリズムは報酬知識のない遷移サンプルを問合せする。
論文 参考訳(メタデータ) (2020-07-15T03:25:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。