論文の概要: Towards Better Exploration in Sequential Test-Time Scaling
- arxiv url: http://arxiv.org/abs/2609.39632v1
- Date: Wed, 30 Sep 2026 12:39:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.781413
- Title: Towards Better Exploration in Sequential Test-Time Scaling
- Title(参考訳): シークエンシャルテストタイムスケーリングにおける探索の改善に向けて
- Abstract要約: テストタイムのスケーリングは、推論に計算を追加することで、言語モデルの推論を改善する。
パラレルメソッドは、モデルから独立した回答を繰り返しサンプリングし、モデルが1回の試行で解決しそうにない問題に対して、スケールが不十分である。
我々は、新しいアイデアにアクセスするために、以前の回答に基づいてシーケンシャルな手法が構築されていることを示すが、これまでのところ、並列スケーリングによって見いだされた以上の回答には到達していない。
- 参考スコア(独自算出の注目度): 44.159903234602496
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling improves language model reasoning by spending additional compute at inference. However, both classes of existing methods often fail to continue improving over long timescales. Parallel methods repeatedly sample independent answers from the model, scaling poorly on problems the model is unlikely to solve in a single attempt. In contrast, sequential methods build on previous answers to access new ideas, yet so far have not been shown to reach answers beyond those found by parallel scaling. First, we show that sequential scaling often stops improving because it becomes prematurely trapped in an attractor: a set of answers that prevents exploration of different answers once entered. Across 27 combinations of scaling methods, models, and benchmarks, we find that 53.8% of sequential scaling trajectories enter an attractor within four iterations. Second, we show that a simple model-mixing intervention helps escape attractors. This reduces the attractor hit rate by 21.2 percentage points on average, expands solution coverage beyond a compute-matched parallel baseline, and improves accuracy of recursive self-aggregation by at least 2.2 percentage points. Our results motivate refocusing long-horizon test-time scaling from parallel methods to sequential methods that improve previous answers.
- Abstract(参考訳): テストタイムのスケーリングは、推論に計算を追加することで、言語モデルの推論を改善する。
しかし、既存のメソッドのどちらのクラスも長い時間スケールで改善が続けられないことが多い。
パラレルメソッドは、モデルから独立した回答を繰り返しサンプリングし、モデルが1回の試行で解決しそうにない問題に対して、スケールが不十分である。
対照的に、シーケンシャルメソッドは、新しいアイデアにアクセスするために、以前の回答に基づいて構築されている。
まず, 逐次的スケーリングは, 一度入力された解の探索を阻止する解答の集合である, 引き付け子に早期に閉じ込められてしまうため, しばしば改善が止まることを示す。
27のスケーリング方法、モデル、ベンチマークの組み合わせで、53.8%のシーケンシャルなスケーリングトラジェクトリが4回のイテレーションでアトラクタに入ることがわかった。
第二に、単純なモデル混合の介入は、引き付け者から逃れるのに役立つことを示す。
これにより、アトラクタのヒット率を平均で21.2ポイント削減し、計算マッチングされた並列ベースラインを超えてソリューションカバレッジを拡大し、少なくとも2.2ポイントの再帰的自己集合の精度を向上させる。
本研究は, 並列手法から逐次手法への長期テスト時間スケーリングの再焦点化を動機としたものである。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning [15.355823330309724]
スケーラブル遅延推論はフィードフォワードモデルの精度を2.6%から、Sudoku-Extremeの99%以上に向上することを示す。
4万以上の層に展開することで、スケーラブルな遅延推論により、フィードフォワードモデルの2.6%から、Sudoku-Extremeの99%以上まで精度が向上する。
論文 参考訳(メタデータ) (2026-05-20T17:59:48Z) - Scaling Test-Time Compute for Agentic Coding [126.72747643609274]
本稿では,ロールアウト軌跡のコンパクトな表現に基づくエージェントコーディングのためのテスト時間スケーリングフレームワークを提案する。
当社のフレームワークは,各ロールアウトを,その健全な仮説,進捗,障害モードを保存する構造的な要約に変換する。
提案手法は,SWE-Bench Verified および Terminal-Bench v2.0 におけるフロンティア符号化エージェントの性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-04-16T17:39:33Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Exploring Test-time Scaling via Prediction Merging on Large-Scale Recommendation [13.057539100440634]
テスト期間中に計算資源を効率的に活用し、スケールアップする方法は、まだ未定である。
DLRSにテスト時間スケーリングを適用する上で重要なポイントは、多様だが有意義なアウトプットを効果的に生成することにある。
オンラインデプロイ時の並列サーバの増加により、テスト時間のスケーリングはシームレスに加速できる。
論文 参考訳(メタデータ) (2025-12-08T15:41:10Z) - It's Not That Simple. An Analysis of Simple Test-Time Scaling [1.9906814758497542]
以前の研究では、o1のようなモデルから抽出したモデルでこのスケーリング動作を複製するシンプルなテストタイムスケーリングが提案されていた。
本稿では, 簡単なテスト時間スケーリングの解析を行い, スケーリングの挙動は最大長を強制することによるスケールダウンに起因することが確認された。
論文 参考訳(メタデータ) (2025-07-19T00:28:10Z) - Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities? [61.85289698610747]
我々は,o1-like large language model (LLMs) が本当にテスト時間スケーリング機能を持っているか検討した。
これらのo1型モデルの長いCoTは、常に精度を向上しないことがわかった。
並列スケーリング戦略とCoT長特性を組み合わせた手法であるShortest Majority Voteを提案する。
論文 参考訳(メタデータ) (2025-02-17T07:21:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。