論文の概要: Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
- arxiv url: http://arxiv.org/abs/2608.23311v2
- Date: Tue, 25 Aug 2026 15:31:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.267534
- Title: Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
- Title(参考訳): 安定探索ジレンマを超えて: LLM政策最適化のための環境規則化
- Abstract要約: Policy-KLはレスポンスの振る舞いを制限し、アクションサイドの探索予算を消費する。
我々は、正規化を入力側に移すことでジレンマを壊す代替案を議論する。
ERPO は標準の Policy-KL 正規化器を置き換え、クエリ分散のドリフトを効果的に制御する。
- 参考スコア(独自算出の注目度): 27.121081058414376
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Policy optimization (PO) for Large Language Models faces a stability--exploration trade-off, currently mediated by an action-side Policy-KL regularizer. This puts practitioners in a double bind: keeping Policy-KL constrains response behavior and consumes the action-side exploration budget, while dropping it leaves the optimization without an explicit drift control. We argue for an alternative that breaks the dilemma by moving regularization to the input side. As training progresses, the distribution over training queries induced by the current policy drifts unchecked from its pre-RL reference distribution. Concretely, Environment-Regularized Policy Optimization (ERPO) introduces a Query-KL (QKL) term that bounds this query distribution shift, together with a dataset-static reference-derived per-query weight that biases each per-query update toward queries typical under the reference. The QKL gradient flows strictly through the query likelihood; the response score function used by policy-gradient estimators does not appear in the QKL term, so QKL exerts no direct gradient pressure on the response distribution---exploration is preserved. ERPO plugs into GRPO/PPO/REINFORCE-style pipelines without additional forward passes. On six mathematical reasoning benchmarks, ERPO replaces the standard Policy-KL regularizer while achieving effective control over query distribution drift, delivering stronger accuracy and substantially more stable behavior under high-temperature decoding and long-horizon training. Our source code are available at https://github.com/AlibabaResearch/ERPO
- Abstract(参考訳): 大規模言語モデルのポリシー最適化(PO)は、現在アクションサイドのポリシー-KLレギュレータによって仲介されている、安定性と探索のトレードオフに直面している。
Policy-KLはレスポンスの動作を制約し、アクションサイドの探索予算を消費します。
我々は、正規化を入力側に移すことでジレンマを壊す代替案を議論する。
トレーニングが進むにつれて、現在のポリシーによって誘導されるトレーニングクエリの分布は、その事前RL参照分布から未確認でドリフトする。
具体的には、ERPO(Environment-Regularized Policy Optimization)では、クエリ分散シフトをバウンドするクエリ-KL(QKL)という用語を導入し、データセットスタティックな参照由来のクエリ単位の重みを基準の下で典型的なクエリに対してバイアスする。
QKL勾配はQKL項には表示されないため、QKLは応答分布に直進的な勾配圧力を課さないため、探索は保存される。
ERPOはGRPO/PPO/REINFORCEスタイルのパイプラインに追加のフォワードパスなしでプラグインする。
6つの数学的推論ベンチマークでは、ERPOは標準のポリシー-KL正規化器を代替し、クエリ分布のドリフトを効果的に制御し、高温復号および長距離トレーニングにおいてより精度が高く、より安定した振る舞いを提供する。
ソースコードはhttps://github.com/AlibabaResearch/ERPOで公開されています。
関連論文リスト
- Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning [43.981833556858135]
完全出力分布から正当性条件付き応答分布への保存制約を狭める条件正規化フレームワークを提案する。
CoKLは,既存の正規化手法よりも目標タスク改善と事前能力維持のバランスが良好である。
論文 参考訳(メタデータ) (2026-08-03T06:10:33Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Stochastic MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent [53.828537014796574]
オンラインの非政治強化学習(RL)は、ポリシークラスと更新ルールの2つの選択肢によって構成されている。
我々は、MeanFlow変換を通じてノイズをアクションにマッピングする一段階生成ポリシークラスであるMeanFlow Policiesを提案する。
7つのMuJoCoベンチマークで、Sは1ステップの推論効率を維持しながら、ガウスおよび生成ベースラインを改善する。
論文 参考訳(メタデータ) (2026-05-20T15:14:14Z) - Flow Matching Policy with Entropy Regularization [16.47598359293598]
Flow Matching Policy with Entropy Regularization (FMER)は、通常の微分方程式(ODE)ベースのオンラインRLフレームワークである。
FMERは、フローマッチングを通じてポリシーをパラメータ化し、最適な輸送によって動機付けられたストレートな確率経路に沿ってアクションをサンプリングする。
スパースマルチゴールのFrankaKitchenベンチマークの実験は、FMERが最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-03-18T13:00:20Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds [1.2183405753834562]
オフライン強化学習(RL)は、ログ化された遷移の固定バッチから決定ポリシーを学ぶことを目的としている。
本稿では,不確実性を即興的に保守的な政策改善に変換する統一的な枠組みであるEmphBayesian conservative Policy Optimization (BCPO)を提案する。
BCPOは環境/価値モデルよりも階層的なベイズ的後縁を維持し、アクション値に基づいてエンフレッシブルな下界(LCB)を構築し、明示的なKL正規化の下でポリシー更新を行う。
論文 参考訳(メタデータ) (2026-03-06T01:46:02Z) - Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning [49.92803982100042]
我々は,現在の政策と過去の政策のエントロピー比を新たなグローバル指標として用いることを提案する。
エントロピー比に双方向の制約を課すtextbfEntropy Ratio (ERC) 機構を導入する。
これは、グローバルな分布レベルでの政策更新を安定化させ、未サンプリングアクションの確率シフトを規制するPPOクリップの不能を補償する。
論文 参考訳(メタデータ) (2025-12-05T10:26:32Z) - On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning [59.11784194183928]
政策勾配アルゴリズムは大規模言語モデル(LLM)の推論能力の向上に成功している。
規則化されたポリシーグラディエント(RPG)ビューは、広く使われている$k_3$ペナルティが、正確には非正規化されたKLであることを示している。
RPG-REINFORCE with RPG-Style Clipは、DAPOよりも最大6ドル以上の絶対パーセンテージポイントの精度を向上させる。
論文 参考訳(メタデータ) (2025-05-23T06:01:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。