論文の概要: Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
- arxiv url: http://arxiv.org/abs/2607.14614v1
- Date: Thu, 16 Jul 2026 06:25:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.011875
- Title: Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization
- Title(参考訳): エントロピーを超えて: コントラストポリシー最適化による正当性を考慮したアドバンテージシェイピング
- Authors: Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang,
- Abstract要約: エントロピーは 有害な不確実性と 有害な混乱を区別できない
トークンレベルのコントラスト不一致を正当性を考慮した有利な整形に用いたコントラストポリシー最適化(CPO)を提案する。
CPOはエントロピーベースのRLVR法よりも優れ、強力な一般化を維持している。
- 参考スコア(独自算出の注目度): 35.632335113369116
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) commonly uses entropy for advantage shaping. However, entropy cannot distinguish useful uncertainty from detrimental confusion, limiting its effectiveness as a correctness signal. We propose Contrastive Policy Optimization (CPO), which uses token-level contrastive disagreement between reference-guided and vanilla generation distributions for correctness-aware advantage shaping. Both theoretical and empirical results show that this disagreement reliably indicates token-level correctness. We further show that On-policy Distillation is a special case of CPO, where the posterior distribution is instantiated by an external teacher model. CPO also resolves the zero-advantage problem. Experiments on in-domain and out-of-domain benchmarks demonstrate that CPO substantially outperforms entropy-based RLVR methods while maintaining strong generalization. Further analysis shows that correct and incorrect responses naturally support exploration and exploitation respectively, and balancing both leads to the best performance.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は、一般的にエントロピーを有利な形成に用いている。
しかし、エントロピーは有害な不確実性と有害な混乱を区別することができず、その正当性信号としての有効性を制限している。
本稿では、基準誘導型とバニラ生成型の間のトークンレベルのコントラスト不一致を利用して、正当性を考慮した有利な整形を行うコントラストポリシー最適化(CPO)を提案する。
理論的および実証的な結果は、この不一致が確実にトークンレベルの正しさを示すことを示している。
さらに、外部教師モデルにより後部分布がインスタンス化されるCPOでは、オンライン蒸留が特別なケースであることを示す。
CPOはゼロアドバンテージ問題も解決する。
ドメイン内およびドメイン外ベンチマークの実験により、CPOはエントロピーベースのRLVR手法よりも大幅に優れ、強力な一般化を維持していることが示された。
さらなる分析では、正しい応答と誤った応答がそれぞれ探索と搾取を自然にサポートし、両者のバランスが最高のパフォーマンスをもたらすことが示されている。
関連論文リスト
- Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization [9.860371691501076]
オンライン蒸留(OPD)がポストトレーニングの重要なパラダイムとして最近登場した。
我々は,生のKLスコアをバッチレベルの相対的優位性に変換することで最適化を安定化する実用的な方法として,グローバル正規化蒸留政策最適化(GNDPO)を提案する。
論文 参考訳(メタデータ) (2026-06-08T06:41:31Z) - Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment [51.18269946911088]
RLHF(Reinforcement Learning from Human Feedback)の代替としてDPO(Direct Preference Optimization)が登場している。
このような場合、DPOとRLHFは基本的に異なる目的を最適化する。
本稿では,制約付き制約付きRLHF(Constrained Preference Optimization, CPO)を導入する。
我々の理論的分析は、DPOの保証が保たれ、証明可能なアライメントで単純さを保つソリューションを提供するときに成立する。
論文 参考訳(メタデータ) (2026-05-20T07:26:22Z) - Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting [35.85110049085719]
グループ相対政策最適化(GRPO)は、大規模言語モデルの推論能力を改善するための有望なアプローチとして登場した。
極端トークンレベルの更新を動的にダウンウェイトするハイパーパラメータフリーで共分散重み付き最適化法を提案する。
提案手法は,GRPOと比較して推論ベンチマークのダウンストリーム性能を向上し,トレーニングの進行とともにエントロピーを効果的に安定化する。
論文 参考訳(メタデータ) (2026-05-12T05:05:47Z) - Know What You Know: Metacognitive Entropy Calibration for Verifiable RL Reasoning [31.629261193485053]
大規模推論モデル(LRM)は、複雑な現実世界のタスクを解くための強力なパラダイムとして登場した。
既存の結果のみのRLVRパイプラインのほとんどは、バイナリの正当性信号にのみ依存しており、モデルの本質的な不確かさをほとんど無視している。
本稿では,メタ認知型エントロピーキャリブレーションフレームワークEGPOを提案する。
論文 参考訳(メタデータ) (2026-02-26T08:40:06Z) - Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes [55.2480439325792]
強化学習(Reinforcement Learning, RL)は、数学のような検証可能な決定論的領域において、言語モデルの精度を向上させるために著しく有効であることが証明されている。
本稿では,現在のRL法が,科学的実験のような検証可能な領域における言語モデルの最適化にも有効かどうかを検討する。
論文 参考訳(メタデータ) (2025-08-15T20:50:53Z) - Mirror Descent Actor Critic via Bounded Advantage Learning [0.0]
Mirror Descent Value Iteration (MDVI)は、Kulback-Leiblerの発散とエントロピーを、その値とポリシー更新の正則化として使用している。
本稿では,MDVIのアクター・アクター・アクター・アクター・クリティカル(MDAC)を連続的なアクション・ドメインに対するアクター・アクター・アクター・アクター・アクター・アクター・クリティ(MDAC)として提案する。
論文 参考訳(メタデータ) (2025-02-06T08:14:03Z) - Fine-Tuning Language Models with Advantage-Induced Policy Alignment [80.96507425217472]
大規模言語モデルと人間の嗜好を整合させる新しいアルゴリズムを提案する。
言語タスクにおいてPPOを常に上回り、大きなマージンを持つことを示す。
また,損失関数の設計を支援する理論的正当性も提供する。
論文 参考訳(メタデータ) (2023-06-04T01:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。