論文の概要: Predictive Divergence Masks for LLM RL
- arxiv url: http://arxiv.org/abs/2607.10848v1
- Date: Sun, 12 Jul 2026 17:20:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.5539
- Title: Predictive Divergence Masks for LLM RL
- Title(参考訳): LLM RLの予測拡散マスク
- Authors: Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang,
- Abstract要約: 大規模言語モデル(LLM)の強化学習は、一般的に、信頼領域マスクに頼り、非政治的な更新を安定させる。
近年のDPPOは, PPOの比例試験を行動とトレーニング方針の確率差に置き換えることで, 近接基準を改善している。
本稿では,次の政策段階の段階が,信頼領域で使用されるのと同じ偏差を増大または減少させるかどうかを問う,予測的偏差マスクを提案する。
- 参考スコア(独自算出の注目度): 44.851813004352046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning for large language models (LLMs) typically relies on trust-region masks to stabilize off-policy updates. The dominant PPO-style approach uses the sampled-token importance ratio for two criteria: a proximity criterion, which asks whether the policy has moved too far from the behavior policy, and a direction criterion, which asks whether the update pushes it farther away. Recent work DPPO improves the proximity criterion by replacing PPO's ratio-based test with a probability divergence between the behavior and training policies. However, its direction criterion is still inherited from PPO. A token can be masked only when the sampled-token importance ratio moves away from one. We observe that this ratio-based direction criterion is a single-sample proxy that can disagree in sign with the change of the divergence that defines the proximity criterion. We therefore propose the predictive divergence mask, which asks whether the next policy-gradient step will increase or decrease the same divergence used by the trust region. For the discrete softmax policies used in LLM RL, we derive this prediction in closed form. Because production rollout engines expose only a truncated (top-K) view of the vocabulary, we develop two lightweight top-$K$ estimators for this prediction. Detailed analysis shows the divergence-based direction is better aligned with the realized change of the divergence than the sampled ratio, and the resulting masks improve RL training across model scales and precision settings.
- Abstract(参考訳): 大規模言語モデル(LLM)の強化学習は、一般的に、信頼領域マスクに頼り、非政治的な更新を安定させる。
PPOスタイルの主流のアプローチでは、近接基準と、そのポリシーが行動方針からあまりにも遠くに移動したかどうかを問う方向基準と、更新がそれより遠くにプッシュしたかどうかを問う方向基準の2つの基準でサンプル・ツーケンの重要度比を使用する。
近年のDPPOは, PPOの比例試験を行動とトレーニング方針の確率差に置き換えることで, 近接基準を改善している。
しかし、その方向基準は依然としてPPOから受け継がれている。
トークンは、サンプリングされたトークンの重要度比が1から離れた場合にのみマスクすることができる。
この比に基づく方向基準は1サンプルのプロキシであり、近接基準を定義する発散の変化と一致しない。
そこで我々は,次の政策段階の段階が信頼領域で使用されるのと同じ偏差を増大または減少させるかどうかを問う,予測偏差マスクを提案する。
LLM RLで使用される離散ソフトマックスポリシーに対しては、この予測を閉じた形で導出する。
実運用用ロールアウトエンジンは語彙のトランキャット(トップ-K)ビューしか公開しないため、この予測のために2つの軽量トップ-K$推定器を開発する。
詳細な解析により, 発散方向はサンプル比よりも発散方向の現実的な変化と一致し, 得られたマスクは, モデルスケールおよび精度設定におけるRLトレーニングを改善した。
関連論文リスト
- Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models [61.74572554094633]
比クリッピングは流れモデルに不適であると主張する。
本稿では,比クリッピングを分岐近位制約に置き換えるFlow-DPPOを提案する。
実験により,フローDPPOはKL近位効率が向上し,高い報酬が得られることが示された。
論文 参考訳(メタデータ) (2026-06-09T15:59:57Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective [22.848847562976633]
トークンレベルのIS比は、PPOとGRPOが採用しているように、プレフィックス状態の分布ミスマッチを無視してバイアスを導入する。
我々は、累積トークンIS比と、累積対数比の自然な$sqrtt$成長に応じて、対数空間のクリップ境界を拡大する位置適応クリッピングを組み合わせたCTPOを提案する。
論文 参考訳(メタデータ) (2026-05-08T06:35:02Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization [58.116300485427764]
強化学習のポストトレーニングは、大きな言語モデルにおける推論の振る舞いを引き出すことができる。
トークンレベルの補正は、オフポリシーネスの度合いが大きい場合、不安定なトレーニングダイナミクスにつながることが多い。
我々は,最小固定率 (MinPRO) を簡易かつ効果的に提案する。
論文 参考訳(メタデータ) (2026-01-30T08:47:19Z) - Off-Policy Evaluation in Markov Decision Processes under Weak Distributional Overlap [3.351714665243138]
我々は,マルコフ決定過程(MDP)における非政治的評価の課題を再考し,分布重なりというより弱い概念の下で検討する。
本稿では,この環境での良好な性能を期待できる2重頑健性(TDR)推定器のクラスを紹介する。
我々の実験では、強い分布重なりが保たない場合、適切な乱れが、政治外の正確な評価を可能にする上で重要な役割を担っていることがわかった。
論文 参考訳(メタデータ) (2024-02-13T03:55:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。