論文の概要: Planned Test-Time Scaling with Coordinated Reasoning Paths
- arxiv url: http://arxiv.org/abs/2609.27374v1
- Date: Wed, 23 Sep 2026 05:25:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.897175
- Title: Planned Test-Time Scaling with Coordinated Reasoning Paths
- Title(参考訳): Coordinated Reasoning Paths を用いた計画されたテスト時間スケーリング
- Abstract要約: 独立サンプリングを協調的な協調ポリシーで置き換えるためのテスト時間スケーリングを提案する。
プランナーは各ブランチのソリューションアウトラインを生成し、異なる推論パスに向かってブランチを操縦する。
PTTSは繰り返しサンプリングを厳密に一般化し、スタイリングされた環境では補完的推論モードのカバレッジを確実に促進することを示す。
- 参考スコア(独自算出の注目度): 83.82104376196268
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling with parallel branches is widely adopted to improve performance on challenging reasoning tasks. The predominant approach, repeated sampling, draws branches independently from a single policy, which can produce redundant attempts and thereby limit the gains from additional inference compute. To address this limitation, we propose Planned Test-Time Scaling (PTTS), which replaces independent sampling with a coordinated joint policy: a planner generates a solution outline for each branch, steering the branches toward distinct reasoning paths, and an executor produces a full solution conditioned on each outline. Formally, we show that PTTS strictly generalizes repeated sampling and, in a stylized setting, provably promotes coverage of complementary reasoning modes and yields better pass@k scaling. We instantiate PTTS on top of strong reasoning models, keeping them fixed as executors while replacing repeated sampling with PTTS inference to further enhance test-time scaling. Concretely, we develop two variants: PTTS-ZS prompts a model to jointly generate outlines for all branches in a single autoregressive pass, while PTTS-RL directly optimizes the planner against the pass@k reward using truncated execution rollouts for efficient training and a sharper reward signal. Across five mathematical reasoning benchmarks with Qwen3-1.7B and 4B, PTTS-ZS improves pass@64 over repeated sampling by up to 6.7 points, while PTTS-RL further increases the gain to up to 13.4 points. Further analysis indicates that broader coverage of distinct reasoning paths contributes to these gains. Overall, PTTS provides a general framework for improving test-time scaling by coordinating reasoning branches, with zero-shot and trainable instantiations that yield substantial performance gains.
- Abstract(参考訳): 並列ブランチによるテスト時間のスケーリングは、困難な推論タスクのパフォーマンス向上のために広く採用されている。
主要なアプローチである繰り返しサンプリングは、1つのポリシーから独立して分岐を引き出すため、冗長な試行を発生させ、追加の推論計算から得られる利得を制限することができる。
この制限に対処するために、独立サンプリングを協調した共同政策に置き換える計画テスト時間スケーリング(PTTS)を提案する。
形式的には、PTTSは繰り返しサンプリングを厳密に一般化し、スタイリングされた環境では、補完的推論モードのカバレッジを確実に促進し、pass@kスケーリングを改善する。
強い推論モデルの上にPTTSをインスタンス化し、それらを実行子として固定し、繰り返しサンプリングをPTTS推論に置き換え、テスト時間スケーリングをさらに強化する。
具体的には、PTTS-ZSは1つの自己回帰パスで全てのブランチのアウトラインを共同生成するようにモデルに促し、PTTS-RLは、効率的なトレーニングとよりシャープな報酬信号のために、トランカットされた実行ロールアウトを使用して、pass@k報酬に対して直接プランナーを最適化する。
Qwen3-1.7Bと4Bの5つの数学的推論ベンチマークにおいて、PTTS-ZSは繰り返しサンプリングよりもパス@64を6.7ポイント改善し、PTTS-RLはさらに13.4ポイントまで上昇する。
さらなる分析は、異なる推論経路の広範なカバレッジがこれらの利益に寄与していることを示している。
PTTSは全体として、推論ブランチをコーディネートすることでテスト時間のスケーリングを改善するための一般的なフレームワークを提供する。
関連論文リスト
- ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning [75.26064451955199]
ExTraは、モデル自身のロールアウトから探索信号を抽出するフレームワークである。
GRPO上でQwen3-1.7Bをpass@1で約5ポイント、pass@16で+7ポイント改善する。
論文 参考訳(メタデータ) (2026-06-23T15:51:39Z) - BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses [48.550535291129584]
GRPO型推論RLにおいて,全ての完了が等しく有用な更新信号を提供するか否かを検討する。
我々の勾配類似性分析は、同じプロンプト群において、同じクラス補完がしばしば非常に類似した更新方向を誘導することを示している。
本稿では,最短の修正完了と最短の修正完了をコンパクトな更新単位として利用するBPPO(Binary Prefix Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-05-27T06:34:17Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - What If We Allocate Test-Time Compute Adaptively? [2.1713977971908944]
テストタイムスケーリングは、推論計算を均一に割り当て、固定されたサンプリング戦略を使用し、再ランク付けにのみ検証を適用する。
本稿では,推論を反復的軌跡生成と選択として扱う検証器誘導適応フレームワークを提案する。
データセット全体にわたって、当社の動的PRMガイダンスアプローチは、テスト時間の直接スケーリングよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-01T07:30:22Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。