論文の概要: Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization
- arxiv url: http://arxiv.org/abs/2609.39402v2
- Date: Sat, 03 Oct 2026 06:33:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.462451
- Title: Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization
- Title(参考訳): 近位エントロピーポリシ最適化によるRLVRにおけるエントロピーレベルクレジット割り当ての促進
- Abstract要約: 値モデルなしのRLVRメソッドは、ロールアウト中のすべてのトークンに対して均一なアドバンテージを割り当て、トークンが不平等に寄与することを無視します。
近年の手法ではトークンエントロピーを重要プロキシとして用いているが、バッチ全体にわたってグローバルに計算し、急激な難易度や位置の傾向と重畳している。
代わりに、各トークンのローカルコンテキストに対して重要度を測るべきである、と我々は主張する。
- 参考スコア(独自算出の注目度): 29.567949375022994
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Value-model-free RLVR methods such as GRPO assign uniform advantages to all tokens in a rollout, ignoring that tokens contribute unequally. Recent methods use token entropy as an importance proxy but compute it globally across the batch, conflating importance with prompt difficulty and positional trends. We argue that importance should instead be measured relative to the local context of each token. We introduce proximal entropy, a local measure of token importance relative to neighboring tokens, and prove it is invariant to both confounders. Proximal Entropy Policy Optimization (PEPO) uses it to weight per-token advantages and outperforms GRPO and entropy-based baselines on mathematical reasoning across Qwen3-1.7B, Qwen3-4B, and Llama-3.2-3B-Instruct. We also show the formulation generalizes to other algorithms where substituting proximal entropy into existing methods improves, and applying it to single-stream RL succeeds where global entropy fails.
- Abstract(参考訳): GRPOのような値モデルなしのRLVRメソッドは、ロールアウト中のすべてのトークンに均一なアドバンテージを割り当て、トークンが不平等に寄与することを無視する。
近年の手法ではトークンエントロピーを重要プロキシとして用いているが、バッチ全体にわたってグローバルに計算し、急激な難易度や位置の傾向と重畳している。
代わりに、各トークンのローカルコンテキストに対して重要度を測るべきである、と我々は主張する。
近位エントロピー(proximal entropy, 近位エントロピー)は, 近隣のトークンに対するトークンの重要性を局所的に測る尺度であり, 両共同設立者には不変であることを示す。
Proximal Entropy Policy Optimization (PEPO)は、Qwen3-1.7B、Qwen3-4B、Llama-3.2-3B-インストラクトの数学的推論におけるGRPOとエントロピーベースのベースラインよりも優れている。
また、この定式化は、近位エントロピーを既存手法に置き換えることにより改善するアルゴリズムに一般化され、グローバルエントロピーが失敗する単一ストリームRLに適用されることを示す。
関連論文リスト
- STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability [78.63876433996107]
GRPOの下でトークンレベルのエントロピーダイナミクスの1次勾配解析を行う。
本稿では,バッチ内部量子化によるエントロピークリティカルトークンのサブセットを識別するSTAREを提案する。
AIME24とAIME25では、STAREはDAPOや他の競争ベースラインを平均精度で4%-8%上回っている。
論文 参考訳(メタデータ) (2026-06-17T16:13:42Z) - Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control [77.8471519867791]
実験的に、エントロピー極性はエントロピーの変化を確実に予測することを示した。
本稿では、両極性分岐を保護し、有利な再重み付けによるエントロピー制御を実装するPAPO(Polarity-Aware Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-05-12T08:47:05Z) - Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization [53.75029276020459]
本研究では,エントロピー変化への寄与に応じて,エントロピー増加とエントロピー減少の更新を再スケールする適応的エントロピーフローバランス機構を提案する。
6つの数学的推論ベンチマークの実験は、OPEFOがトレーニングと最終的なパフォーマンスを改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T04:08:17Z) - From Uniform to Heterogeneous: Tailoring Policy Optimization to Every Token's Nature [38.46122853450324]
既存のアルゴリズムは全てのトークンに一様最適化を適用し、推論プロセスにおける異なる役割を無視している。
本稿では,トークンエントロピーに基づく最適化を動的に適用するトークン認識アルゴリズムであるヘテロジニアス適応ポリシー最適化(HAPO)を紹介する。
論文 参考訳(メタデータ) (2025-09-20T09:30:25Z) - GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy [5.691990020513277]
本稿では,2つの新しいアルゴリズムによる報酬の微粒化を促進するメカニズムである動的エントロピー重み付けを提案する。
報酬形成のための政策のエントロピーを再取得することで、我々は真にトークン単位の信用割り当てを達成できる。
論文 参考訳(メタデータ) (2025-08-06T11:42:47Z) - The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models [99.98293908799731]
本稿では,LLMによる推論,すなわち政策エントロピーの崩壊において,RLのスケーリングの大きな障害を克服することを目的としている。
実際には、エントロピーHと下流性能Rの間の変換方程式R=-a*eH+bを確立する。
Clip-Cov と KL-Cov という2つの単純かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:38:45Z) - Stochastic Q-learning for Large Discrete Action Spaces [79.1700188160944]
離散的な行動空間を持つ複雑な環境では、強化学習(RL)において効果的な意思決定が重要である
我々は、$n$アクションの集合全体を最適化するのとは対照的に、おそらく$mathcalO(log(n)$)$のような変数の集合のみを考える。
提示された値ベースのRL手法には、Q-learning、StochDQN、StochDDQNなどが含まれる。
論文 参考訳(メタデータ) (2024-05-16T17:58:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。