論文の概要: CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing
- arxiv url: http://arxiv.org/abs/2608.07424v2
- Date: Mon, 10 Aug 2026 06:21:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.840961
- Title: CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing
- Title(参考訳): CoBa:Compute-Balanced Routingによるコスト効果テストタイムスケーリング
- Abstract要約: 本稿では,次の計算単位が生成,検証,停止に費やされるべきかどうかをシステムが決定しなければならない計算割当問題として,テスト時間推論を定式化する。
計算バランスの取れたルーティングポリシであるCoBaを導入し、まず少数の候補を最初に獲得し、より安価な検証を広く適用し、不確実性や高価値な候補をルートしてより強力な検証を行う。
- 参考スコア(独自算出の注目度): 15.829191594065888
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling is often implemented by spending more compute along one axis: sampling more solutions, extending a chain of thought, or applying a stronger evaluator. Under a fixed inference budget, these choices compete. This paper formulates test-time reasoning as a compute-allocation problem in which a system must decide whether the next unit of compute should be spent on generation, verification, or stopping. We introduce CoBa, a compute-balanced routing policy that first obtains a small set of candidates, applies cheap verification broadly, and routes uncertain or high-value candidates to stronger verification. On 3,129 example-generator evaluations spanning MATH-500, AIME 2024/2025, AMC 2023, and procedural symbolic reasoning, CoBa-Routed-Strong reaches 85.13% macro accuracy, statistically matching a self-evaluation weighted-voting proxy at 85.20% while using 49.1% fewer parameter-weighted tokens. It also matches best-of-16 majority voting within 0.01 macro-accuracy points while using 58.9% fewer parameter-weighted tokens; paired tests retain a small best-of-16 edge at substantially higher cost. Paired bootstrap tests show significant gains over single-sample decoding, while the remaining gap to the pool oracle exposes headroom for sharper routing. For local reasoning systems, test-time scaling becomes a question of where the next computation is most valuable.
- Abstract(参考訳): テストタイムのスケーリングは、より多くのソリューションをサンプリングしたり、思考の連鎖を拡張したり、より強力な評価器を適用したりすることで実装されることが多い。
一定の推論予算の下では、これらの選択は競合する。
本稿では,次の計算単位が生成,検証,停止に費やされるべきかどうかをシステムが決定しなければならない計算割当問題として,テスト時間推論を定式化する。
計算バランスの取れたルーティングポリシであるCoBaを導入し、まず少数の候補を最初に獲得し、より安価な検証を広く適用し、不確実性や高価値な候補をルートしてより強力な検証を行う。
MATH-500、AIME 2024/2025、AMC 2023、および手続き的記号推論にまたがる3,129のサンプルジェネレータ評価において、CoBa-Routed-Strongは85.13%のマクロ精度に達し、パラメータ重み付きトークンを49.1%削減しながら、自己評価重み付き投票プロキシを85.20%と統計的に一致させた。
また、パラメータ重み付きトークンを58.9%削減しつつ、0.01マクロ精度ポイント以内の16の多数投票と一致している。
ペアリングブートストラップテストではシングルサンプルの復号化よりも顕著に向上する一方、プールオラクルへの残りのギャップは、よりシャープなルーティングのためにヘッドルームを露出する。
ローカルな推論システムでは、テスト時間のスケーリングは次の計算がどこに最も価値があるかという問題になる。
関連論文リスト
- Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning [3.8191765711200065]
本稿では,テスト時間計算を用いて候補解の探索と改良を行う検証自由幅改良フレームワークを提案する。
提案手法は, 難解な復号化, 多数決投票, 検証器ベースのベスト・オブ・N$, ビームサーチ, および複数のオープンウェイトモデル間でのルック・復号化を一貫して改善する。
論文 参考訳(メタデータ) (2026-08-06T06:38:37Z) - Test-Time Scaling via Error Localization [15.13459650752427]
大規模言語モデルの性能向上のための信頼性の高い手法として,推論時間計算のスケーリングが登場している。
固定あるいは環境フィードバックを利用してトークンレベルのエラーローカライゼーションを行う推論時アルゴリズムであるTTEL(Test-Time Scaling via Error Localization)を導入する。
論文 参考訳(メタデータ) (2026-07-23T15:55:29Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning [24.596125996494717]
CAPSは2つの軸に沿って不均一に検証器を割り当てる推論のみのフレームワークである。
CAPSは、コードに対する検証対象の予算の25.4%を使用しながら、20組中14組で先頭のペアワイズ検証器を上回っている。
論文 参考訳(メタデータ) (2026-05-15T01:16:12Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Reducing Variance in Temporal-Difference Value Estimation via Ensemble
of Deep Networks [109.59988683444986]
MeanQは単純なアンサンブル法であり、ターゲット値をアンサンブル平均として推定する。
本稿では,Atari Learning Environmentベンチマークを用いた実験において,MeanQが顕著なサンプル効率を示すことを示す。
論文 参考訳(メタデータ) (2022-09-16T01:47:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。