論文の概要: LamPO: A Lambda Style Policy Optimization for Reasoning Language Models
- arxiv url: http://arxiv.org/abs/2605.21235v1
- Date: Wed, 20 May 2026 14:24:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.721455
- Title: LamPO: A Lambda Style Policy Optimization for Reasoning Language Models
- Title(参考訳): LamPO: 言語モデルの推論のためのLambdaスタイルポリシー最適化
- Authors: Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao,
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は、数学、コーディング、科学的質問応答といったタスクにおける言語モデル推論の改善に有効なパラダイムとなっている。
我々は、スカラーグループの利点を emphPairwise De Advantage に置き換える textbfLambda-Style Policy Optimization 法である textbfLamPO を提案する。
AIME24, AIME25, MATH-500, GPQA-DiamondのQwen3-1.7B, Qwen3-4B, Phi-4-miniによる実験により, LamPOはGRPOよりも一貫して改善していることが示された。
- 参考スコア(独自算出の注目度): 34.349722314481824
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has become an effective paradigm for improving reasoning language models on tasks such as mathematics, coding, and scientific question answering. However, widely used group-relative objectives, such as GRPO, summarize each sampled group with scalar statistics and therefore discard fine-grained relational information among candidate responses. This weakens credit assignment under sparse outcome rewards, especially when multiple generated solutions differ only subtly in reasoning quality. We propose \textbf{LamPO}, a \textbf{Lambda-Style Policy Optimization} method that replaces scalar group advantages with a \emph{Pairwise Decomposed Advantage}. LamPO aggregates pairwise reward gaps within each response group and modulates each comparison by a confidence-aware weight computed from sequence log-probability differences, while retaining the critic-free and clipped-update structure of PPO-style optimization. When reference solutions are available, we further add a lightweight ROUGE-L-based dense auxiliary reward to reduce reward sparsity. Experiments on AIME24, AIME25, MATH-500, and GPQA-Diamond with Qwen3-1.7B, Qwen3-4B, and Phi-4-mini show that LamPO consistently improves over GRPO and recent RLVR variants, with more stable training dynamics and better sample efficiency.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、数学、コーディング、科学的質問応答といったタスクにおける言語モデル推論の改善に有効なパラダイムとなっている。
しかし、GRPOのような広く使われているグループ相対的目的は、各サンプル群をスカラー統計で要約し、従って候補応答間の詳細な関係情報を破棄する。
これは、特に、複数の生成されたソリューションが推論品質において微妙に異なる場合において、スパース結果報酬の下でのクレジット割り当てを弱める。
本稿では,スカラー群の利点を \emph{Pairwise Decomposed Advantage} に置き換えた \textbf{Lambda-Style Policy Optimization} 手法である \textbf{LamPO} を提案する。
LamPOは、各応答グループ内のペアワイズ報酬ギャップを集約し、各比較を、PPOスタイルの最適化における批判のない、クリップされた更新された構造を維持しながら、シーケンスログの確率差から計算された信頼度を考慮した重みによって変調する。
参照解が利用可能であれば、報酬の間隔を減らすために、ROUGE-Lベースの高密度補助報酬を追加する。
AIME24, AIME25, MATH-500, GPQA-DiamondをQwen3-1.7B, Qwen3-4B, Phi-4-miniで実験したところ、LamPOはGRPOや最近のRLVRよりも一貫して改善され、より安定したトレーニングダイナミクスとサンプル効率が向上した。
関連論文リスト
- LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models [34.349722314481824]
グループ相対政策最適化は、明示的な価値批判を先導する効果で評価されている。
群平均のようなモノリシックな統計ベースラインへの依存は、軌道空間の相対トポロジーを1つのスカラーに分解する。
我々は、この情報理論のボトルネックに対処する新しいフレームワークLambda Policy Optimization(LambdaPO)を紹介します。
論文 参考訳(メタデータ) (2026-05-19T06:10:24Z) - Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO [70.38763678943648]
検証可能な報酬(RLVR)による強化学習は、大規模言語モデルにおける推論とコード生成を改善するための中心的なパラダイムとなっている。
標準的なGRPOはシーケンスアグリゲーションを使用し、最近の研究はトークンアグリゲーションをより良い代替手段として提唱している。
トークンアグリゲーションは符号長結合を導入し、シーケンスアグリゲーションは暗黙的にダウンウェイトを延長する。
論文 参考訳(メタデータ) (2026-04-14T09:48:46Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning [11.157278744897427]
グループ相対政策最適化(GRPO)は、グループ内の全ての出力に対して平均報酬をベースラインとして減算することで、各出力の利点を計算するために提案された。
より適応的な利点推定モデルを用いて、KRPOはGRPOの安定性と性能を向上させることができることを示す。
論文 参考訳(メタデータ) (2025-05-12T13:09:49Z) - Token-Efficient RL for LLM Reasoning [0.02488650627593658]
本稿では,大規模言語モデル (LLM) において,厳密なメモリと計算限界下での推論に適した強化学習戦略を提案する。
ベースラインサブトラクションを用いた早期ポリシー勾配法に基づいて,出力トークンの小さな情報サブセット上で動作する批判のない手法を設計する。
提案手法は,SVAMPベンチマークの精度を46%から70%以上に向上し,マルチ桁乗算において高い性能を示した。
論文 参考訳(メタデータ) (2025-04-29T14:58:43Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。