論文の概要: Semifactual Credit-Augmented Policy Optimization
- arxiv url: http://arxiv.org/abs/2609.40360v1
- Date: Wed, 30 Sep 2026 17:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.353267
- Title: Semifactual Credit-Augmented Policy Optimization
- Title(参考訳): 半現実的信用増資政策最適化
- Abstract要約: 検証可能な報酬付き強化学習(RLVR)は、大規模言語モデルの推論能力を改善した。
本研究は,基礎となる問題とその答えを保存するための半実的な介入を通して,この感度について検討する。
トークンレベルの信用代入に半実的安定性を組み込んだ半実的信用増資政策最適化(SCAPO)を導入する。
- 参考スコア(独自算出の注目度): 26.851464193164947
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) has improved the reasoning capabilities of large language models (LLMs), yet their predictions remain sensitive to task-irrelevant prompt features. We investigate this sensitivity through semifactual prompt interventions that preserve the underlying problem and its answer. Our analysis reveals substantial variation in token-level sensitivity and shows that suppressing high-drift token candidates during decoding improves reasoning accuracy without updating model weights. These findings highlight a limitation of Group Relative Policy Optimization (GRPO), which assigns the same outcome-derived advantage to every response token and may reinforce potential spurious dependence alongside useful reasoning. Motivated by this observation, we introduce Semifactual Credit-Augmented Policy Optimization (SCAPO), a causally inspired variant of GRPO that incorporates semifactual stability into token-level credit assignment. SCAPO measures token probability drift for fixed responses under semifactual interventions and uses normalized stability scores to reduce advantages for relatively unstable tokens during early training, while granting no additional credit for stability alone. On Qwen3-4B-Base and Qwen3-1.7B-Base, SCAPO improves AIME 2024-2026 accuracy over GRPO by 5.63 and 4.17 percentage points, respectively. At both model scales, SCAPO achieves the best results on most evaluated mathematics benchmarks and all evaluated out-of-distribution benchmarks among the compared methods. These results suggest that semifactual stability provides an effective training signal for improving reasoning and generalization through finer-grained credit assignment in RLVR. The code is available at https://github.com/DtYXs/SCAPO.
- Abstract(参考訳): 検証可能な報酬付き強化学習(RLVR)は、大きな言語モデル(LLM)の推論能力を改善したが、それらの予測はタスク非関連なプロンプト機能に敏感である。
本研究は,基礎となる問題とその答えを保存するための半実的な介入を通して,この感度について検討する。
分析の結果, トークンレベルの感度は著しく変化しており, 復号時の高ドリフトトークン候補の抑制により, モデル重みを更新することなく推論精度が向上することが示された。
これらの結果は、すべての応答トークンに同じ結果由来の利点を割り当て、有用な推論と共に潜在的急激な依存を補強するグループ相対政策最適化(GRPO)の限界を浮き彫りにしている。
本研究の目的は,トークンレベルの信用代入に半現実的安定性を組み込んだGRPOの因果的インスピレーションを受けた変種であるSCAPOを導入することである。
SCAPOは、半実的な介入の下での固定応答に対するトークンの確率ドリフトを測定し、正規化された安定性スコアを使用して、早期訓練中に比較的不安定なトークンの利点を減らし、安定性のみに追加のクレジットを与えない。
Qwen3-4BベースとQwen3-1.7Bベースでは、SCAPOはGRPOよりもAIME 2024-2026精度を5.63ポイント、Qwen3-1.7Bベースは4.17ポイント向上している。
両モデルスケールにおいて、SCAPOは、最も評価された数学のベンチマークと、比較した手法の中で評価されたアウト・オブ・ディストリビューションのベンチマークで最高の結果を得る。
これらの結果から, 半現実的安定性はRLVRにおけるよりきめ細かなクレジット割り当てによる推論と一般化を改善する効果的な訓練信号となることが示唆された。
コードはhttps://github.com/DtYXs/SCAPOで入手できる。
関連論文リスト
- Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning [3.9783774144289623]
GRPOのような批判のない方法は、応答レベルの報酬を利点に変換し、トークン間で均一にブロードキャストする。
本稿では,高感度トークンのクレジットを低減するGRPOの簡易拡張であるCSCRを提案する。
long-CoTの数学的推論ベンチマークでは、CSCRはGRPOベースラインを同じ数のポリシー更新で一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-30T09:03:33Z) - A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization [15.055990413189278]
検証可能な報酬(RLVR)による強化学習は言語モデル推論を改善するが、GRPOスタイルの最適化は崩壊しがちである。
我々はトークンレベルの勾配力学を通してこの不安定性を解析し、更新が次の確率とエントロピーにどのように影響するかを予測する分類法を導出した。
この発見を動機として、我々は、ポジティブ・アドバンテージ・ポリシー・オプティマイゼーション(WAPO: Winner Advantage Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-15T03:15:27Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards [73.44333771806282]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデルの推論能力向上に有効なパラダイムとして登場した。
本稿では,RLVRの簡易かつ効果的な拡張であるCIPO(Correction-Oriented Policy Optimization)を提案する。
CIPOは学習効率を向上し、モデルが自身のエラーを修正する能力を明示的に強化する。
論文 参考訳(メタデータ) (2026-05-14T08:22:21Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - StaRPO: Stability-Augmented Reinforcement Policy Optimization [41.96511339973761]
強化学習は複雑な推論タスクにおける大規模言語モデルの精度を高めるのに有効である。
既存のポリシー最適化フレームワークはフィードバック信号として最終回答の正確性に依存している。
本稿では,安定度を最適化対象に明示的に組み込んだ,安定性向上型強化学習フレームワーク StaRPO を提案する。
論文 参考訳(メタデータ) (2026-04-10T03:13:19Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning [60.00161035836637]
グループ相対政策最適化は、推論タスクのための有望な批判のない強化学習パラダイムとして登場した。
我々は,各トークンがモデルの最終回答にどの程度影響するかに基づいて,利益を再分配する,きめ細かい信用割当機構であるOutcome-grounded Advantage Reshaping (OAR)を紹介した。
OAR-Gは計算オーバーヘッドを無視して同等のゲインを達成し、どちらも強力なGRPOベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-12T10:48:02Z) - Causally-Enhanced Reinforcement Policy Optimization [36.523007244998695]
Causally-Enhanced Policy Optimization (CE-PO)は、因果一貫性のための異なるプロキシでポリシー最適化を強化する、ドロップイン報酬形成フレームワークである。
CE-POは、ヤコビアンに基づく感性によるモデル内部の影響を推定し、これらのシグナルを反実的に硬化させてニュアンスを抑えるとともに、結果のコヒーレンススコアをタスク精度フィードバックと融合させる。
4つのデータセットにわたる実験結果から、CE-POは平均で5.49%の精度(最大9.58%)を向上し、相関因果フリップや光対実編集による堅牢性を改善した。
論文 参考訳(メタデータ) (2025-09-27T04:10:16Z) - Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach [0.15749416770494704]
CGR(Certainty-Guided Reasoning)はトークン使用量を削減するとともに,ベースライン精度を向上させる。
CGRは、確実なしきい値と効率の間の調整可能なトレードオフによって、数百万のトークンを集約的に排除することができる。
信頼性を推論プロセスに統合することにより、CGRは大きな推論言語モデルをより適応的で信頼性があり、リソース効率が良いものにする。
論文 参考訳(メタデータ) (2025-09-09T14:57:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。