論文の概要: PACT: From Credit Assignment to Critic Alignment
- arxiv url: http://arxiv.org/abs/2609.26355v1
- Date: Tue, 22 Sep 2026 12:58:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.379888
- Title: PACT: From Credit Assignment to Critic Alignment
- Title(参考訳): PACT: クレジットアサインメントから批判アライメントへ
- Abstract要約: 強化学習は、大規模言語モデル(LLM)の訓練後の中心的な構成要素となっているが、トークンレベルの信用は一般的に受け入れられた数学的定義を欠いている。
完全性、固定整合性、中立性の3つの規則性条件を定式化し、トークンレベルの信用を独自に決定することを証明する。
この特徴付けは、既存のアルゴリズムにまたがる現象を説明する統一的な基盤を提供し、改良されたアクター・クリティカル・トレーニング手順の開発を導く。
- 参考スコア(独自算出の注目度): 35.4873739114819
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement learning has become a central component of large language model (LLM) post-training, yet token-level credit lacks a generally accepted mathematical definition, leaving its relationship to commonly used training signals unclear. We formulate three regularity conditions, namely Completeness, Prefix Consistency, and Neutrality, and prove that they uniquely determine token-level credit. This characterization provides a unified basis for explaining phenomena across existing algorithms and guides the development of an improved actor-critic training procedure. Through this lens, an ideal teacher in On-Policy Distillation (OPD) acts as an implicit critic, yielding an expected policy gradient proportional to that induced by token-level credit. Response-level REINFORCE Leave-One-Out (RLOO) signals match the expected policy-gradient contribution of token-level credit despite their coarser granularity. We further establish approximate credit sparsity under bounded outcome rewards and show how intermediate critic errors in Generalized Advantage Estimation (GAE) can become comparable to the underlying credit. These motivate Policy Aligned Critic Training (PACT), which adopts an Actor-then-Critic update order to apply importance sampling correction to critic training and better align the critic with the updated policy. In agentic mathematical reasoning, PACT achieves 72.87% average accuracy across four benchmarks, outperforming GRPO and PPO by 8.80 and 13.16 percentage points, respectively. On SWE-bench Verified, PACT achieves a pass rate of 67.4%, outperforming PPO, GRPO, and SAO by 2.4, 2.0, and 3.8 percentage points, respectively.
- Abstract(参考訳): 強化学習は、大規模言語モデル(LLM)の訓練後の中心的な構成要素となっているが、トークンレベルの信用は一般的に受け入れられた数学的定義を欠いている。
完全性、固定整合性、中立性の3つの規則性条件を定式化し、トークンレベルの信用を独自に決定することを証明する。
この特徴付けは、既存のアルゴリズムにまたがる現象を説明する統一的な基盤を提供し、改良されたアクター・クリティカル・トレーニング手順の開発を導く。
このレンズを通して、オン・ポリシィ蒸留(OPD)の理想的な教師は暗黙の批判として行動し、トークンレベルの信用によって引き起こされるものと比例する期待された政策勾配をもたらす。
応答レベルReINFORCELeave-One-Out(RLOO)シグナルは、粗い粒度にもかかわらず、期待されるトークンレベルの信用の段階的な貢献と一致する。
さらに、有界結果報酬に基づく近似的信用空間を確立し、一般化アドバンテージ推定(GAE)における中間的批判誤差が、基礎となる信用とどのように同等になるかを示す。
これらのモチベーションアライメント・アライメント・クライマックス・トレーニング(PACT)は、アクター・then-Criticアップデートを採用して、批判的トレーニングに重要なサンプリング修正を適用し、批判を更新されたポリシーと整合させる。
PACTは4つのベンチマークで72.87%の平均精度を達成し、それぞれGRPOとPPOを8.80ポイント、13.16ポイント上回っている。
SWEベンチ検証では、PACTは67.4%のパス率を獲得し、それぞれPPO、GRPO、SAOを2.4、2.0、そして3.8ポイント上回っている。
関連論文リスト
- ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning [25.155324087465885]
ReDiPPOは、数学的推論のための参照誘導および離散化対応PPOフレームワークである。
ReDiPPOは価値推定精度を向上し、強力なポリシー最適化ベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-30T03:42:52Z) - ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy [45.28312869386833]
モードローカル・サロゲート・エントロピーに基づくトークンレベルの信用割当フレームワークを提案する。
ACPOは、成功したロールアウトにおける不確実な決定と失敗したロールアウトにおける過信トークンを強調して、ポリシー更新を非対称に調整する。
AIME 2025やHumanEvalProなどの数学的推論とコーディングベンチマークの実験は、ACPOが強いRLベースラインよりも一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-03T09:14:27Z) - VIMPO: Value-Implicit Policy Optimization for LLMs [106.88933849641272]
GRPOのようなグループ相対的手法は、批評家の訓練を避けるが、典型的には全てのトークンに軌道レベルの利点を割り当てる。
アクター批判的手法は、より密集した学習信号を提供するが、学習価値関数を自身のトレーニング不安定性で要求する。
本稿では,KL-正規化強化学習の最適条件からポリシ実装値関数を導出する,批判のないポリシ最適化手法であるVIMPOを紹介する。
論文 参考訳(メタデータ) (2026-06-18T09:44:12Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback [59.078756231841574]
Critique-GRPOは、自然言語と数値フィードバックを統合して効果的なポリシー最適化を行うオンラインRLフレームワークである。
批判-GRPOは、教師付き学習とRLに基づく微調整法を8つの難解な数学、STEM、一般的な推論タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:39:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。