論文の概要: CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning
- arxiv url: http://arxiv.org/abs/2608.03068v1
- Date: Tue, 04 Aug 2026 03:30:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.008724
- Title: CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning
- Title(参考訳): CVPO:価値変数適応と動的カリキュラム学習によるLLM強化学習推論の強化
- Abstract要約: 大規模言語モデル(LLM)の推論能力を高める効果的な方法として強化学習(RL)が登場した。
既存の手法では、生成した回答軌跡に対するフィードバックの精度が不十分であり、問題の難解なドリフト現象を示す。
CVPO - Curriculum-guided Value-Variance Policy Optimizationを提案する。
- 参考スコア(独自算出の注目度): 5.170275696099583
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has emerged as an effective method for enhancing the reasoning capabilities of large language models (LLMs). However, existing methods suffer from insufficient precision in feedback on generated answer trajectories and exhibit the phenomenon of problem difficulty drift. To address these challenges, we propose CVPO - Curriculum-guided Value-Variance Policy Optimization. At the response trajectory level, we find that token-level value-variance correlates with exploration intensity. Our theoretical analysis shows this variance bounds policy update magnitude. We then use the estimated trajectory value-variance to quantify the intrinsic randomness in generation. Based on this, we design a variance-aware advantage adjustment mechanism for different reward types. At the question level, we introduce a dynamic curriculum weighting method that adapts to question difficulty. This helps the model focus on tasks matched to its current ability during each training stage. Experimental results show our method outperforms strong value-based baselines like VAPO. It achieves better performance and stronger exploration, enabling more accurate and robust reasoning in language models across various math tasks.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は,大規模言語モデル(LLM)の推論能力を高める効果的な手法として登場した。
しかし、既存の手法では、生成した回答軌跡に対するフィードバックの精度が不十分であり、問題の難解なドリフト現象を示す。
これらの課題に対処するため,CVPO - Curriculum-guided Value-Variance Policy Optimizationを提案する。
応答軌道レベルでは,トークンレベルの値分散は探索強度と相関することがわかった。
我々の理論的分析は、この分散がポリシー更新の規模を制限していることを示している。
次に、推定された軌道値分散を用いて、生成時の固有ランダム性を定量化する。
これに基づいて、異なる報酬型に対する分散対応の利点調整機構を設計する。
質問レベルでは,質問の難易度に適応する動的カリキュラム重み付け手法を導入する。
これにより、トレーニングの各段階で現在の能力にマッチしたタスクにモデルがフォーカスするのに役立つ。
実験の結果,VAPOなどの強値ベースラインよりも高い性能を示した。
より優れたパフォーマンスとより強力な探索を実現し、様々な数学タスクにわたる言語モデルにおけるより正確で堅牢な推論を可能にします。
関連論文リスト
- VSPO: Vector-Steered Policy Optimization for Behavioral Control [30.80095775190934]
本稿では,言語モデルに対するVector-Steered Policy Optimization (VSPO)を提案する。
VSPOは、ターゲットの振る舞いに関連するステアリングベクトルを使用して、生成されたロールアウトの挙動強度を制御する。
VSPOはタスクの正確性を維持したり改善したりしながら、目標行動に沿った制御を一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-05-15T04:31:06Z) - HINT: Helping Ineffective Rollouts Navigate Towards Effectiveness [49.72591739116668]
強化学習(RL)は、大規模言語モデル(LLM)の長いチェーン・オブ・シント(CoT)推論能力を高めるための重要な要因となっている。
しかし、GRPOのような一般的な手法は、タスクの難しさがモデルの能力を超えると失敗し、スパーシリティと非効率なトレーニングに報いる。
我々は、適応的なヒントフレームワークであるHINT: Helping In Effective Rollouts Navigate Towards Effectiveを提案する。
論文 参考訳(メタデータ) (2025-10-10T13:42:03Z) - CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs [53.749193998004166]
カリキュラム学習は,大規模言語モデルの学習効率を高める上で重要な役割を担っている。
収束を加速し,計算オーバーヘッドを最小限に抑えるためにベイズ後続推定を用いた効率的な学習法であるCurESを提案する。
論文 参考訳(メタデータ) (2025-10-01T15:41:27Z) - Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning [37.20632079882874]
DACE(Difficulty Aware Certainty guided Exploration)を紹介する。
政策の成功率に基づいて、探索的エクスプロイトのトレードオフをバランスさせる。
挑戦的な数学的推論ベンチマーク(AIME, MATH)の実験は、DACEが強いベースラインを著しく上回っていることを示している。
論文 参考訳(メタデータ) (2025-08-29T08:57:54Z) - In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention [52.159541540613915]
本研究では,マルチヘッド型ソフトマックスアテンションモデルを用いて,線形データを用いたコンテキスト内学習を行う方法について検討する。
この結果から,学習内容の学習能力は,そのアーキテクチャと基礎となるデータ分布の集約的効果として,訓練されたトランスフォーマーから出現することが明らかとなった。
論文 参考訳(メタデータ) (2025-03-17T02:00:49Z) - Value-Distributional Model-Based Reinforcement Learning [59.758009422067]
政策の長期的業績に関する不確実性の定量化は、シーケンシャルな意思決定タスクを解決するために重要である。
モデルに基づくベイズ強化学習の観点から問題を考察する。
本稿では,値分布関数を学習するモデルに基づくアルゴリズムであるEpicemic Quantile-Regression(EQR)を提案する。
論文 参考訳(メタデータ) (2023-08-12T14:59:19Z) - Training Discrete Deep Generative Models via Gapped Straight-Through
Estimator [72.71398034617607]
再サンプリングのオーバーヘッドを伴わずに分散を低減するため, GST (Gapped Straight-Through) 推定器を提案する。
この推定子は、Straight-Through Gumbel-Softmaxの本質的な性質に着想を得たものである。
実験により,提案したGST推定器は,2つの離散的な深部生成モデリングタスクの強いベースラインと比較して,優れた性能を享受できることが示された。
論文 参考訳(メタデータ) (2022-06-15T01:46:05Z) - Dynamic Multi-Scale Loss Optimization for Object Detection [14.256807110937622]
マルチスケール検出器訓練の客観的不均衡について検討する。
本稿では, 適応可変重み付け (AVW) を提案する。
トレーニング中に重み付け方式を確率的に決定する新しい強化学習最適化(RLO)を開発した。
論文 参考訳(メタデータ) (2021-08-09T13:12:41Z) - DisCor: Corrective Feedback in Reinforcement Learning via Distribution
Correction [96.90215318875859]
ブートストラップに基づくQ-ラーニングアルゴリズムは必ずしも修正フィードバックの恩恵を受けないことを示す。
本稿では,この最適分布に対する近似を計算し,トレーニングに使用する遷移の重み付けに使用する新しいアルゴリズムであるDisCorを提案する。
論文 参考訳(メタデータ) (2020-03-16T16:18:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。