論文の概要: Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems
- arxiv url: http://arxiv.org/abs/2607.07674v1
- Date: Wed, 08 Jul 2026 17:32:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.476905
- Title: Max Out GRPO Signal: Adaptive Trace Prefix Control for Hard Reasoning Problems
- Title(参考訳): Max Out GRPO Signal:Adaptive Trace Prefix Control for Hard Reasoning Problems
- Abstract要約: グループ相対政策最適化は、グループ内のロールアウトが成功しない場合、モデルの最も難しい問題で行き詰まります。
参照解の正しいプレフィックスを前もって成功率を高め、プレフィックス長を困難に対する連続ノブとする。
コンカレントメソッドはknobを一度セットし、AdaPrefix-GRPOはそれをフィードバックコントローラに変換する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Group Relative Policy Optimization (GRPO) stalls on a model's hardest problems: when no rollout in a group succeeds, the group-relative advantages vanish and the problem contributes no gradient, wasting the frontier examples we most want to learn from. Prepending a correct prefix of a reference solution raises the success rate, making prefix length a continuous knob on difficulty. Concurrent methods set the knob once; AdaPrefix-GRPO turns it into a feedback controller: throughout training it adjusts how much of the solution each problem gets, holding its success rate near 50%, where GRPO's gradient signal is largest, then withdraws the assistance entirely, so the deployed model solves problems unaided. On hard math, at matched training FLOPs, it more than doubles GRPO's accuracy on held-out problems from the training distribution for a 0.6B model (2.1x), with 1.6x on Qwen3-1.7B and 1.7x on AIME, while roughly halving trace length. The method is implemented in data preparation plus a loss mask on prefix tokens; the trainer is otherwise stock. The smaller the model, the larger the gain.
- Abstract(参考訳): グループ相対政策最適化(GRPO)は、グループのロールアウトが成功しない場合、グループ相対的優位性は消滅し、問題は勾配に寄与せず、私たちが最も学びたい最前線の例を無駄にします。
参照解の正しいプレフィックスを前もって成功率を高め、プレフィックス長を困難に対する連続ノブとする。
AdaPrefix-GRPO は、トレーニングを通じて各問題の解の量を調整することで、GRPO の勾配信号が最大となる50%近くの成功率を保持し、完全な補助を取り除き、デプロイされたモデルが問題を無視する。
ハード数学では、FLOPと一致したトレーニングでは、GRPOが0.6Bモデル(2.1x)のトレーニング分布から、Qwen3-1.7Bの1.6倍、AIMEの1.7倍の約半分のトレース長で保持する問題の精度を2倍以上に向上させる。
この方法はデータ準備とプレフィックストークンのロスマスクで実装され、それ以外はトレーナーが備わっている。
モデルが小さくなればなるほど、利益は大きくなる。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Understanding Diversity Collapse in RLVR via the Lens of Overtraining [78.37408098404312]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力を高めるための重要なアプローチとなっている。
我々は、この多様性の崩壊をエンフェーバートレーニングのレンズを通してフォーマルに定式化する
本稿では,各問題の限界寄与を推論境界に推定することにより,オーバートレーニングから最適化をリダイレクトするemphBayesian boundary Gating (BBG)を提案する。
論文 参考訳(メタデータ) (2026-06-13T20:13:37Z) - Self-Supervised On-Policy Distillation for Reasoning Language Models [9.324642081509756]
emphSelf-Supervised On-Policy Distillation (SSOPD)
コードはhttps://github.com/tzq 1999/SSOPD.comでリリースされる。
論文 参考訳(メタデータ) (2026-05-17T15:14:24Z) - Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs [0.871725390496537]
確率質量をより良い解へシフトさせることにより、選好最適化が推論を改善することを示す。
GRPOのトレーニングは、難易度をまたいだ全データセットの精度に適合するが、45%のトレーニングステップしか使用していない。
GSM8KトレーニングされたGRPOは、MATHトレーニングされたGRPOよりもMATHの数値サブセットの方が精度が高く、1.5Bで5%、3Bで3%を超える。
論文 参考訳(メタデータ) (2026-04-07T17:22:18Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Transform-Augmented GRPO Improves Pass@k [50.3707071191733]
グループ相対政策最適化(GRPO)は推論を改善するために設計されたが、2つの障害モードによって状況が悪化する。
本稿では,各質問に対して意味論的に等価な変換変種を生成するTA-GRPO(Transform-Augmented GRPO)を提案する。
このプール化された計算は、元の質問が簡単すぎるか難しすぎる場合でも、混合報酬を保証する一方、多様なフレーズのトレーニングは、複数のソリューション戦略を促進する。
論文 参考訳(メタデータ) (2026-01-30T02:43:29Z) - Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking [49.8843966537226]
テスト時間スケーリング(TTS)は,大規模言語モデル(LLM)の推論能力向上に有効であることが証明された。
提案手法は「一問題・複数解」(1PNS)の学習パラダイムであり,モデルから妥当な推論軌跡を抽出する手法である。
Reasoning Path Divergence (RPD) を用いて、問題ごとの最大多様な解集合と微調整Qwen3-4B-Baseをキュレートする。
論文 参考訳(メタデータ) (2025-10-30T04:08:53Z) - GCPO: When Contrast Fails, Go Gold [6.596504114809683]
本稿では、外部標準基準回答を組み込んだグループコントラストポリシー最適化(GCPO)を紹介する。
モデルが問題を解くことができない場合、参照応答は正しい応答を提供し、不当に正確な更新方向に向けてモデルを操る。
GCPOは、複数のベンチマークデータセットで卓越した結果を達成し、ベースラインモデルよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-10-09T05:09:06Z) - Nudging the Boundaries of LLM Reasoning [77.26972440427285]
現在のオンライン強化学習アルゴリズムは、モデルに「解決不可能」な問題から学べない。
自己生成ヒントを用いてLLM推論の上界を推し進める「看護」手法であるNuRLを提案する。
NuRLは、テスト時間スケーリングを補完しながら、6つのベンチマークと3つのモデルで一貫した改善を実現している。
論文 参考訳(メタデータ) (2025-09-30T02:01:40Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。