論文の概要: Thought-Level Beam Search for Reasoning
- arxiv url: http://arxiv.org/abs/2608.08020v2
- Date: Tue, 11 Aug 2026 04:35:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.543256
- Title: Thought-Level Beam Search for Reasoning
- Title(参考訳): 推論のための思考レベルビーム探索
- Authors: Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali,
- Abstract要約: テストタイムの計算スケーリングは、大きな推論モデルにおけるパフォーマンスの主要な要因である。
部分軌道上の制約付き計算割当問題としてテスト時間推論を定式化する。
Emph Thoughtレベルビームサーチを実行する推論アルゴリズムであるGambitを導入する。
- 参考スコア(独自算出の注目度): 39.76902449987798
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Test-time compute scaling is a primary driver of performance in large reasoning models (LRMs), but extreme inefficiency bounds current approaches, shifting the critical question from \emph{how much} compute to spend, to \emph{where} to allocate it. We formalize test-time reasoning as a constrained compute allocation problem over partial trajectories. Under a fixed hardware budget, existing paradigms fail to actively allocate the compute to the most promising partial progress: traditional parallel sampling treats traces independently and induces severe memory bottlenecks, while subtractive pruning starves hardware and fails to actively and sufficiently shift the output distribution. To overcome this dichotomy, we introduce Gambit, an inference algorithm that executes \emph{thought-level beam search}. By periodically pruning unpromising trajectories and immediately branching from high-quality prefixes, Gambit dynamically concentrates compute onto the most promising reasoning traces via a light-weight scorer probing hidden states while maintaining continuous high hardware utilization. Extensive evaluations across multiple models and benchmarks demonstrate that Gambit strictly dominates existing baselines. Under identical hardware constraints, our method yields up to a +6.7\% absolute accuracy gain on HMMT-24 and +3.3\% on AIME-25 over pruning baselines, delivers $>2\times$ higher throughput on trace completion, and reduces total token consumption by up to 68.5\% relative to standard parallel sampling.
- Abstract(参考訳): テストタイムの計算スケーリングは、大きな推論モデル(LRM)におけるパフォーマンスの第一の要因であるが、極端な非効率性は現在のアプローチを束縛し、重要な質問を計算に費やし、それを割り当てるために "emph{how}" から "emph{where}" にシフトする。
部分軌道上の制約付き計算割当問題としてテスト時間推論を定式化する。
従来の並列サンプリングは、トレースを独立して扱い、深刻なメモリボトルネックを誘発する一方、減算プルーニングはハードウェアを飢えさせ、出力分布を積極的に、十分にシフトさせることができない。
この二分法を克服するために、Gambitを導入する。Gambitは、emph{ Thought-level beam search}を実行する推論アルゴリズムである。
周期的に未証明の軌跡を刻み込み、高品質な接頭辞から即座に分岐することにより、Gambitは、連続した高いハードウェア利用を維持しながら隠れた状態を探索する軽量スコアラーを介して、計算を最も有望な推論トレースに動的に集中させる。
複数のモデルとベンチマークにわたる大規模な評価は、Gambitが既存のベースラインを厳密に支配していることを示している。
同一のハードウェア制約下では,HMMT-24で最大6.7\%,AIME-25で最大3.3\%,トレース完了時に2\times$高スループットで最大68.5\%,標準並列サンプリングと比較して総トークン消費量を最大68.5\%削減する。
関連論文リスト
- Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy [13.790557800221057]
プルーニングは、大規模言語モデル(LLM)推論を加速するための支配的なパラダイムとして現れている。
我々はGEMM中心の分類法を導入し、一般的な行列乗法における論理的textbfM, textbfN, textbfK次元に従って既存のプルーニング手法を再編成する。
論文 参考訳(メタデータ) (2026-06-08T06:26:18Z) - Thinking in Scales: Accelerating Gigapixel Pathology Image Analysis via Adaptive Continuous Reasoning [52.41928980786654]
スライド画像全体に対してトークン効率のよいスケール空間連続推論を可能にするPathCTMを提案する。
PathCTMは診断推論を動的逐次情報追跡として定式化する。
必要な画像パッチの数を95.95%削減し、推論時間を約95.62%短縮し、AUCを劣化せずに維持する。
論文 参考訳(メタデータ) (2026-05-19T07:46:44Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Hidden States as Early Signals: Step-level Trace Evaluation and Pruning for Efficient Test-Time Scaling [19.080366193748127]
大規模言語モデル(LLM)は、複数のトレースを生成することによって、テスト時間スケーリングを通じて推論能力を向上することができる。
長い推論トレースと多重サンプリングの組み合わせは、相当な計算とエンドツーエンドのレイテンシをもたらす。
隠れ状態を用いて推論ステップを評価する新しいプルーニングフレームワークであるStep-level Trace Evaluation and Pruningを提案する。
論文 参考訳(メタデータ) (2026-01-14T02:54:55Z) - DeepPrune: Parallel Scaling without Inter-trace Redundancy [53.62015294143274]
並列推論トレースの80%以上は、実質的な無駄な計算を代表して、同じ最終回答をもたらす。
動的プルーニングによる効率的な並列スケーリングを実現する新しいフレームワークであるDeepPruneを提案する。
我々の研究は並列推論のための新しい標準を確立し、高性能推論をより効率的にする。
論文 参考訳(メタデータ) (2025-10-09T17:24:54Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning [39.56908863102256]
低ビット後の量子化は、より厳しい設定で69.81%の数学的推論を損なう。
デプロイクリティカルな2つの問題に,プロセスレベルの精度で対処する。
われわれの設定では、332のキュレートされたサンプルと1つのGPUで3~5分計算すると、完全な精度のベースラインに向かって4ビットの重み計算が引き起こされる。
論文 参考訳(メタデータ) (2025-05-16T12:11:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。