論文の概要: Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
- arxiv url: http://arxiv.org/abs/2609.37119v1
- Date: Tue, 29 Sep 2026 09:28:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.382295
- Title: Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
- Title(参考訳): 批判を解き放つ: LLM ポストトレーニングにおけるリワードフリー政策最適化
- Abstract要約: 我々は、事前訓練された批評家が将来の成果を予測する能力は、効率的なロングホライゾン推論のための貴重な資産となることを示している。
本稿では,リワードフリーポリシー最適化(RFPO)を紹介する。
- 参考スコア(独自算出の注目度): 12.188582747728931
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent approaches to reinforcement learning (RL) post-training for large language models increasingly remove the critic to reduce training instability and memory overhead. Even where a critic is trained, it is discarded once training ends, although it has learned to predict outcomes. We revisit this trend and show that a pretrained critic's ability to predict future outcomes can make it a valuable asset for efficient long-horizon reasoning. First, we find that instability in critic-based RL for long chain-of-thought reasoning is largely an optimization artifact: keeping policy updates small and low in variance restores stable convergence. Second, a well-pretrained critic estimates the posterior probability of eventual success from later trajectory states and unfinished prefixes. Its predictions provide outcome-derived, dense, per-prefix learning signals that, during policy optimization, require neither completed rollouts, step-level annotations, nor external reward labels. Building on this insight, we introduce Reward-Free Policy Optimization (RFPO), which repurposes a single calibrated, frozen critic as a rollout-level reward, a value baseline for generalized advantage estimation, and a success forecaster for unfinished prefixes. We further show that binarizing the debiased score stops the policy from exploiting the critic's length bias. Binarized, RFPO matches supervised PPO without a single label in the training loop, while cutting compute and memory overhead. This makes RFPO well suited to long-horizon reasoning tasks, where outcomes arrive late and generation dominates cost: because rollouts can be rewarded before they finish, training no longer has to pay for waiting on every trajectory to complete. Our findings challenge the prevailing critic-free paradigm and establish critic-based, reward-free optimization as a scalable and computationally efficient path for LLM post-training.
- Abstract(参考訳): 大規模言語モデルに対する強化学習(RL)のポストトレーニングに対する最近のアプローチは、トレーニング不安定性とメモリオーバーヘッドを低減するために、批判を取り除きつつある。
批評家が訓練を受けた場合でも、トレーニングが終了すると破棄されるが、結果を予測することはできる。
我々は、この傾向を再考し、事前訓練された批評家の将来の成果を予測する能力が、効率的な長期的推論のための貴重な資産になることを示す。
まず、長い連鎖の推論に対する批判に基づくRLの不安定性は、主に最適化の成果である。
第二に、よく訓練された批評家は、後続の軌道状態と未完成の接頭辞から最終的な成功の確率を推定する。
その予測は、ポリシー最適化の間、完了したロールアウト、ステップレベルのアノテーション、あるいは外部の報酬ラベルを必要としない、結果由来の、密度の高い、プレフィックス毎の学習信号を提供する。
この知見に基づいて、ロールアウトレベルの報酬として、単一校正された凍結批評家を再利用したリワードフリーポリシー最適化(RFPO)、一般化された優位性推定のための値ベースライン、未完のプレフィックスに対する成功予測器を紹介する。
さらに、偏りのあるスコアをバイナライズすることで、批判者の長みバイアスを悪用する政策が止まることを示す。
RFPOは、計算とメモリオーバーヘッドをカットしながら、トレーニングループに1つのラベルなしで教師付きPPOにマッチする。
これにより、RFPOは長期の推論タスクに適しており、結果が遅くなり、世代がコストを上回ります。
本研究は,批判のないパラダイムを克服し,LLMポストトレーニングのスケーラブルで計算効率の良いパスとして,批判に基づく報酬のない最適化を確立することを目的とする。
関連論文リスト
- EasyPPO: Stabilizing the Critic Is Key [57.76826550536797]
PPO(Proximal Policy Optimization)の主な強みは、その学習的批判である。
批判は、大規模言語モデルの強化学習における不安定性の主要な原因でもある。
EasyPPOはフルトレーニングの地平線を通して安定しており、バニラPPO、VAPO、HL-GaussPPOより一貫して優れている。
論文 参考訳(メタデータ) (2026-09-29T06:15:00Z) - $T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training [38.44142588468548]
既存のグループ相対法では、コストがかかる。
単一生成軌道からトークンレベルの利点を校正するツインクリティカルな方法であるtfourを提案する。
実験の結果、最先端の批判のない手法と比較して、tfourは平均ベンチマーク性能を7.8%改善し、平均トレーニングステップ時間を63.4%削減した。
論文 参考訳(メタデータ) (2026-09-26T17:07:57Z) - Best Practice Critic Optimization [23.2221736020451]
批判に基づくトレーニングのレシピは、しばしば不安定である。
DPPO,報酬範囲に束縛された値予測,モンテカルロ値の目標,非正規化ポリシの優位性,長さ適応型汎用的優位性推定を組み合わせたレシピを開発した。
論文 参考訳(メタデータ) (2026-08-24T17:59:39Z) - RL Forgets! Towards Continual Policy Optimization [57.4336338996653]
継続的なポストトレーニングは、進化するタスクに視覚言語モデルを適用するための中心的なパラダイムになりつつある。
最近の研究は、強化学習が本質的に忘れやすいという信念から、教師付き微調整よりも強化学習を好んでいる。
我々は,事前タスク動作KL目標に基づくリプレイフリーフレームワークである継続ポリシー最適化(CPO)を提案する。
論文 参考訳(メタデータ) (2026-07-05T15:46:11Z) - PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF [20.068789951726078]
ヒューマンフィードバックからの強化学習は、アクターの実践的な代替手段である。
既存の批判のないアプローチは、軌跡内の全てのトークンに対して一様に軌道レベルの学習信号を伝達する。
本稿では,RLHF に対する計算効率のよい批判的手法であるprefix-Sampling Proximal Policy Optimization (PS-PPO) を提案する。
論文 参考訳(メタデータ) (2026-06-29T04:04:32Z) - VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models [102.76983747945836]
長い形式の連鎖推論は複雑なタスクのパフォーマンスを向上させることができる。
しかし、正しい答えが現れた後、モデルはしばしば不要な推論を生成し続ける。
我々はこの現象をGRPO型強化学習の観点から研究する。
論文 参考訳(メタデータ) (2026-06-16T13:10:30Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - RLP: Reinforcement as a Pretraining Objective [103.45068938532923]
我々は,情報駆動型強化事前訓練の目的として,強化学習のコアスピリットである探索を,事前訓練の最終段階に導くことを提案する。
このトレーニングの目的は、モデルが次に何が起こるかを予測する前に、自分自身で考えることを奨励し、事前学習の早い段階で独立した思考行動を教えることである。
特に、RLPは、通常のテキストにおける事前学習対象としての推論のための強化学習を再構築し、次のトーケン予測と有用な連鎖推論の出現の間のギャップを埋める。
論文 参考訳(メタデータ) (2025-09-26T17:53:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。