論文の概要: ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning
- arxiv url: http://arxiv.org/abs/2607.27631v1
- Date: Thu, 30 Jul 2026 03:42:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.384549
- Title: ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning
- Title(参考訳): ReDiPPO:Mathematical Reasoningのための参照型値校正と離散型トークン再重み付け
- Authors: Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei,
- Abstract要約: ReDiPPOは、数学的推論のための参照誘導および離散化対応PPOフレームワークである。
ReDiPPOは価値推定精度を向上し、強力なポリシー最適化ベースラインを一貫して上回ることを示す。
- 参考スコア(独自算出の注目度): 25.155324087465885
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning has emerged as an effective paradigm for enhancing the mathematical reasoning capabilities of large language models. Among existing policy optimization methods, Proximal Policy Optimization (PPO) remains particularly appealing because its learned critic can, in principle, provide token-level credit assignment. However, in mathematical reasoning tasks characterized by long reasoning horizons and sparse outcome rewards, reliable token-level credit assignment remains challenging. The standard critic often fails to accurately evaluate intermediate reasoning states, resulting in noisy advantage estimates and suboptimal policy updates. In this paper, we propose ReDiPPO, a Reference-guided and Discrepancy-aware PPO framework for mathematical reasoning. ReDiPPO introduces a reference-guided critic that uses reference answers as training-time privileged signals to provide more accurate value estimation. Meanwhile, it retains a standard critic and quantifies the token-level reference-standard discrepancy between the standard value estimate and the reference-guided value estimate. This discrepancy serves as an indicator of difficult reasoning states and is used to reweight the corresponding token-level advantages during PPO optimization. Extensive experiments on diverse mathematical reasoning benchmarks demonstrate that ReDiPPO improves value-estimation accuracy and consistently outperforms strong policy optimization baselines, including PPO, DAPO, and GSPO, in final reasoning performance. Our code is available on https://github.com/cii030/ReDiPPO.
- Abstract(参考訳): 強化学習は、大規模言語モデルの数学的推論能力を高めるための効果的なパラダイムとして登場した。
既存の政策最適化手法の中で、PPO(Proximal Policy Optimization)は、学習した批評家が原則としてトークンレベルの信用代入を提供するため、特に魅力的である。
しかし、長い推論の地平線とまばらな結果の報酬によって特徴づけられる数学的推論タスクでは、信頼できるトークンレベルの信用代入は難しいままである。
標準的な批評家は、しばしば中間的推論状態の正確な評価に失敗し、ノイズの多い有利な見積もりと準最適政策更新をもたらす。
本稿では,ReDiPPO(Reference-guided and Discrepancy-aware PPO framework)を提案する。
ReDiPPOは、基準回答を訓練時間特権信号として使用し、より正確な値推定を提供する参照誘導型批評家を導入している。
一方、標準的な批評家を保持し、標準値推定と基準誘導値推定とのトークンレベルの基準標準誤差を定量化する。
この相違は、難解な推論状態の指標として機能し、PPO最適化時に対応するトークンレベルの利点を再重み付けするために使用される。
多様な数学的推論ベンチマークに関する広範な実験により、ReDiPPOは価値推定精度を向上し、PPO、DAPO、GSPOなどの強力なポリシー最適化ベースラインを最終的な推論性能で一貫して上回っていることが示されている。
私たちのコードはhttps://github.com/cii030/ReDiPPOで利用可能です。
関連論文リスト
- One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks [41.49967840381499]
Sequence-Level PPO (SPPO) は、PPOのサンプルテキスト効率と結果ベースの更新の安定性を調和させるスケーラブルなアルゴリズムである。
SPPOは標準のPPOをはるかに上回り、計算量の多いグループベースの手法の性能に匹敵する。
論文 参考訳(メタデータ) (2026-04-10T01:58:21Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - DPO Meets PPO: Reinforced Token Optimization for RLHF [35.638723885233475]
本稿では,トークンワイド報酬関数を選好データから学習し,この学習したトークンワイド報酬信号に基づいてポリシー最適化を行うアルゴリズムを提案する。
実験により、texttRTOはPPOや他の直接選好学習アルゴリズムよりも優れていることが示された。
論文 参考訳(メタデータ) (2024-04-29T17:58:30Z) - Fine-Tuning Language Models with Advantage-Induced Policy Alignment [80.96507425217472]
大規模言語モデルと人間の嗜好を整合させる新しいアルゴリズムを提案する。
言語タスクにおいてPPOを常に上回り、大きなマージンを持つことを示す。
また,損失関数の設計を支援する理論的正当性も提供する。
論文 参考訳(メタデータ) (2023-06-04T01:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。