論文の概要: ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR
- arxiv url: http://arxiv.org/abs/2609.09075v2
- Date: Fri, 11 Sep 2026 19:18:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.707515
- Title: ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR
- Title(参考訳): ThinkPrior:RLVRにおけるコールドスタート・プロンプト選択の難しさ
- Abstract要約: グループ相対的な利点は、グループ内のすべてのロールアウトが正しいか、すべて間違っている場合、全くゼロである。
歴史に基づくプロンプトの選択は、まず難易度を見積もるために、ターゲティング・ポリティ・ロールアウトに費やさなければならない。
ThinkPriorは、期待される学習可能性によって選択し、トレーニング結果から更新し、損失も勾配も変更しない。
測定されたThinkPrior+DAPO組成は、両方の腕が同じ3840ロールアウト更新予算を維持している間に、生成されたロールアウトを10.6%削減する。
- 参考スコア(独自算出の注目度): 0.38452047300097886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In reinforcement learning with verifiable rewards (RLVR) trained with group relative policy optimization (GRPO), the KL-free reward-advantage term studied here depends on within-group reward variation. If all rollouts in a group are correct or all are wrong, their group-relative advantages are identically zero; these zero-advantage silent groups provide no reward-advantage gradient, yet uniform sampling spends 39% of a run's rollouts on them. History-based prompt selection must first spend target-policy rollouts to estimate difficulty, creating a cold start with rollout waste; ThinkPrior instead uses an external anchor in one offline pass to construct a zero-rollout difficulty prior before the first target-policy rollout. The verifier-scored anchor pass rate supplies an external-anchor initialization for a Beta posterior; ThinkPrior selects by expected learnability and then updates from training outcomes, changing neither the loss nor the optimizer. On Qwen2.5-Math-7B across sixteen seeds, ThinkPrior more than halves early silent groups and cuts wasted rollouts through step 30 by nearly a fifth, while we detect no difference in final accuracy. On this 250-prompt pool the fixed-budget result is a reallocation rather than a net saving. The measured ThinkPrior+DAPO composition reduces generated rollouts by 10.6% while both arms retain the same 3840-rollout update budget. The prior requires no target-policy rollout before the first selection, but the posterior thereafter uses target-policy outcomes.
- Abstract(参考訳): 集団相対政策最適化(GRPO)で訓練された検証可能な報酬(RLVR)を用いた強化学習において、ここで研究されるKLフリー報酬アドバンテージ項は、グループ内報酬の変動に依存する。
グループ内のすべてのロールアウトが正しいか、あるいはすべて間違っている場合、グループの相対的な利点はゼロである; これらのゼロアドバンテージなサイレントグループは報酬-アドバンテージ勾配を提供しないが、均一なサンプリングはランのロールアウトの39%に費やしている。
履歴ベースのプロンプト選択は、まず難易度を見積り、ロールアウトの無駄でコールドスタートを発生させる。代わりにThinkPriorは、1つのオフラインパスで外部アンカーを使用して、最初のターゲットポリシのロールアウトの前にゼロロールアウトの難易度を構築する。
検証済みのアンカーパスレートは、ベータ後部の外部アンカー初期化を提供する。ThinkPriorは、期待される学習可能性によって選択し、トレーニング結果から更新し、損失もオプティマイザも変更しない。
16種にわたるQwen2.5-Math-7Bでは、ThinkPriorは初期のサイレントグループの半減期を5分の1近く短縮し、最終精度の差は検出されなかった。
この250プロンプトプールでは、固定予算結果がネットセーブというよりはむしろリアルロケーションである。
測定されたThinkPrior+DAPO組成は、両方の腕が同じ3840ロールアウト更新予算を維持している間に、生成されたロールアウトを10.6%削減する。
前者は第1セレクションの前に目標政策のロールアウトを必要としないが、その後は目標政策の結果を使用する。
関連論文リスト
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR [0.0]
検証可能な報酬を伴う強化学習は、長い推論軌道の計算生成グループの大部分に費やしている。
最近のアロケータは、難易度やユーティリティのポイントワイズな概念に従って、プロンプト、ロールアウト、トークンに予算を割り当てることで、このコストを削減している。
グループ相対スコア勾配は、独立点寄与の総和ではなく、ロールアウト対に対する2次統計値である。
論文 参考訳(メタデータ) (2026-08-11T19:24:59Z) - Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR [0.0]
グループの有効性は、ロールアウトの最初の数回で決定されることが多いので、すでに決定済みのプロンプトに全グループで費やすのは無駄です。
有効なグループをコミットし、短時間の調査で飽和したグループを放棄し、新しいプロンプトに解放された予算を再配置する、二段階のSPRT方式のルールを適用した。
我々は, 放棄信頼性, ロールアウト削減, 固定予算利回り支配, 有効群収率とGRPO基準との関係を証明した。
論文 参考訳(メタデータ) (2026-07-28T20:43:23Z) - CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents [1.4298580363875282]
結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
本研究では,各ターン当たりの報酬を中間的エビデンス読解ターンに割り当てることで,グループ報酬分布が1つの値に崩壊するのを防ぐ,分散テキスト戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T11:50:29Z) - GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization [54.596224644751565]
訓練後強化学習(RL)は多次元報酬に頼り、包括的能力を育成する。
これを解決するために、グループ報酬分離政策最適化(GDPO)のような既存の手法は、総合的なスコアを独立した報酬グループに分解し、各グループ内でRL損失を個別に計算する。
本稿では,GD$2$PO(Group-Dynamic reward-Decoupled Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-15T14:19:28Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR [25.35547462790362]
グループベースのポリシー最適化手法は通常、各プロンプトに一定数のロールアウトを割り当てる。
我々は、ヒットユーティリティを導入し、提案されたプロンプトの追加アロケーションにおける少なくとも1つのロールアウトが正しいという後続の確率について紹介する。
本研究では,Hit-Utility Optimal Rollout Allocation (HORA)を提案する。
論文 参考訳(メタデータ) (2026-05-08T01:42:25Z) - Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL [6.435733307123974]
GRPO(Group-relative RL Training)は、トレーニングプロンプト毎に少数の並列ロールアウトをサンプリングする。
グループ内の報酬を拡大して、軌道ごとの利点を計算する。
プロンプトのロールアウトが同じ報酬で終わるとき、群は報酬の分散をゼロとし、勾配を持たない。
論文 参考訳(メタデータ) (2026-05-07T07:41:09Z) - Learning to Hint for Reinforcement Learning [51.46328710610512]
グループ相対政策最適化(GRPO)は、検証可能な報酬を伴う強化学習に広く用いられている。
GRPOは、グループ内のすべてのロールアウトが同じ報酬を受けると、しばしば有利な崩壊に苦しむ。
Hint Learning for Reinforcement Learning (HiLL)を提案する。
論文 参考訳(メタデータ) (2026-04-01T09:58:08Z) - Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning [55.15106182268834]
検証可能な報奨付き強化学習(RLVR)が,大規模言語モデルにおける推論能力向上のための主要なアプローチとして登場した。
ロールアウト生成は恥ずかしく並列であり、メモリライトであるのに対して、ポリシー更新は通信量が多く、メモリ集約的である。
PODS(Policy Optimization with Down-Sampling)を導入し、戦略的に選択されたロールアウトサブセットでのみトレーニングすることで、ポリシー更新からロールアウト生成を分離する。
論文 参考訳(メタデータ) (2025-04-18T17:49:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。