論文の概要: Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
- arxiv url: http://arxiv.org/abs/2609.19499v2
- Date: Sat, 19 Sep 2026 17:04:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.081184
- Title: Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
- Title(参考訳): LLM試験時間スケーリングのエネルギーと性能を形作る候補生成戦略
- Abstract要約: テストタイムスケーリングは、複数の候補応答を生成し、組み合わせることで、大きな言語モデルの推論を改善することができる。
推論予算は、しばしば生成された候補数、Nによって記述される。
候補数だけでは、マルチ候補テストタイムスケーリングのシステムコストを記述するには不十分であることを示す。
- 参考スコア(独自算出の注目度): 8.794670104526867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling can improve large language model reasoning by generating and combining multiple candidate responses. In sampling-based methods, the inference budget is often described by the number of generated candidates, N. However, N tells us how many candidates are generated, not how they are executed. The same candidate budget can be produced in one batched generation call or split across several sequential calls with smaller batch sizes. We first study the effect of increasing N on reasoning accuracy using Phi-3-mini and Qwen2.5-1.5B on 500 GSM8K prompts. As expected, increasing N from 1 to 8 improves accuracy by 8.4 percentage points for Phi-3-mini and 18.4 points for Qwen2.5-1.5B. However, accuracy alone does not show the systems cost of using a larger candidate budget. We therefore fix N = 8 and compare four generation schedules: 1x8, 2x4, 4x2, and 8x1, where axb denotes a generation calls with b candidates per call. We measure latency, throughput, GPU-hours, and gross GPU-device energy while keeping the total candidate count fixed. On A100 GPUs, eight serial calls use 4.64-4.86x as much gross GPU-device energy and have 5.77-6.12x the P95 latency of one batched call with eight candidates. The same pattern appears across three independently scheduled A100 nodes per model and in short-output SciQ/V100 experiments. These results show that candidate count alone is not enough to describe the systems cost of multi-candidate test-time scaling. When candidates are independent and memory allows it, fewer generation calls with larger batch sizes are more efficient. Evaluations should therefore report not only candidate count and accuracy, but also generation schedule and GPU-level systems metrics.
- Abstract(参考訳): テストタイムスケーリングは、複数の候補応答を生成し、組み合わせることで、大きな言語モデルの推論を改善することができる。
サンプリングベースの手法では、推論予算は生成された候補数によって説明されることが多いが、Nはどのように実行されるかではなく、どれだけの候補が生成されるかを教えてくれる。
同じ候補の予算は、1つのバッチ生成コールで作成するか、より小さなバッチサイズで複数のシーケンシャルコールで分割することができる。
まず,500 GSM8Kプロンプトに対するPhi-3-miniおよびQwen2.5-1.5Bの推理精度に及ぼすNの増加の影響について検討した。
予想通り、Nが1から8に増加すると、Phi-3-miniの8.4ポイント、Qwen2.5-1.5Bの18.4ポイントの精度が向上する。
しかし、精度だけでは、より大きな候補予算を使用するシステムのコストは示さない。
したがって、N = 8 を固定し、1x8, 2x4, 4x2, 8x1 の4つの生成スケジュールを比較する。
合計候補数を固定しながら、レイテンシ、スループット、GPU時間、総GPUデバイスエネルギーを測定します。
A100 GPUでは、8つのシリアルコールが4.64-4.86倍のGPUデバイスエネルギーを使用し、5.77-6.12倍のP95レイテンシを持つ。
同じパターンは、モデルごとに独立にスケジュールされた3つのA100ノードと、短出力のSciQ/V100実験に現れる。
これらの結果から,候補数だけでは多候補テスト時間スケーリングのシステムコストを記述するには不十分であることが示唆された。
候補が独立してメモリが許可されると、より大きなバッチサイズを持つ世代呼び出しがより効率的になる。
したがって、評価は候補数と精度だけでなく、生成スケジュールとGPUレベルのシステムメトリクスも報告する必要がある。
関連論文リスト
- Is INT8 Portable? A Cross-Platform Measurement Study of Quantized Inference on Embedded and Automotive Accelerators [0.0]
「一度量子化し、どこにでもデプロイする」というのは、組込みおよび自動車の配置にとって安全ではない。
エッジNPUレイテンシは計算よりも出力/デバイス間転送サイズによって設定されることを示す。
論文 参考訳(メタデータ) (2026-09-14T05:29:21Z) - Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck [1.4991111518581999]
テストタイムスケーリング(TTS)は、追加の推論計算を使用することで、言語モデルの出力を改善する。
5世代ベンチマークで5つのTSファミリーの計算正規化比較を行った。
論文 参考訳(メタデータ) (2026-08-19T13:59:53Z) - SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition [0.0]
SPLは1つの仕様で決定論的計算と確率論的計算モードを構成する宣言型言語である。
A.splの仕様は、ローカルノード、クラウドAPI、分散グリッドで動作しない。
広範囲な78レシピの料理ブックと1200ランの制御実験により,SPLの有効性を検証した。
論文 参考訳(メタデータ) (2026-07-06T03:53:10Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference [31.2331188304598]
評価バッチサイズ、GPUカウント、GPUバージョンなどのシステム構成の変更は、生成されたレスポンスに大きな違いをもたらす可能性がある。
この変数の根本原因は、限定的な数値精度で浮動小数点算術の非連想性に遡る。
そこで我々は16ビットの精度で重みを格納するが、FP32では全ての計算を実行する軽量な推論パイプラインLayerCastを開発した。
論文 参考訳(メタデータ) (2025-06-11T08:23:53Z) - Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding [48.55176091771745]
テストタイムスケーリングは、推論中に追加の計算リソースを割り当てることで、大きな言語モデルのパフォーマンスを向上させる。
Best-of-N (BoN) サンプリングはサンプリングベースの一般的なスケーリング手法である。
我々は,全Nサンプルの完全生成を回避する復号法であるセルフトランケーションBest-of-N(ST-BoN)を提案する。
コスト面では、ST-BoNはFull-BoNと同じ性能を達成し、計算コストを70%-80%削減し、同じコストで3~4ポイント精度を向上させることができる。
論文 参考訳(メタデータ) (2025-03-03T11:21:01Z) - Provable Scaling Laws for the Test-Time Compute of Large Language Models [84.00141420901038]
本研究では,大規模言語モデルのテスト時間計算において,証明可能なスケーリング法則を享受する2つのアルゴリズムを提案する。
1つは2段階ノックアウト方式のアルゴリズムで、各候補は複数の相手に対して平均勝利率で評価される。
もう1つは2段階のリーグ方式のアルゴリズムで、各候補は複数の相手に対して平均勝利率で評価される。
論文 参考訳(メタデータ) (2024-11-29T05:29:47Z) - Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning [24.386388107656334]
本稿では,自然言語から派生した翻訳プログラムを検証メカニズムとして活用するフレームワークであるProveを紹介する。
バニラ多数決とは異なり、我々の手法は、対応するプログラム出力が生成した解と矛盾する解をフィルタリングし、検証に合格する解のみを集約する。
以上の結果から,すべてのモデルサイズとデータセットにまたがる数学的推論タスクの解決において,Proveはバニラ多数投票を一貫して上回る結果となった。
論文 参考訳(メタデータ) (2024-10-16T14:24:55Z) - Validation tests of GBS quantum computers give evidence for quantum
advantage with a decoherent target [62.997667081978825]
複数モードデータの検証に指紋としてグループカウント確率の正P位相空間シミュレーションを用いる。
偽データを解き放つ方法を示し、これを古典的なカウントアルゴリズムに適用する。
論文 参考訳(メタデータ) (2022-11-07T12:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。