論文の概要: The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
- arxiv url: http://arxiv.org/abs/2605.08666v1
- Date: Sat, 09 May 2026 04:07:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.801324
- Title: The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
- Title(参考訳): 批判のないRLにおけるキャンセル仮説:アウトカム・リワードからトークン・クレジットへ
- Authors: Tianhao Cheng, Zeyu Huang, Zihan Qiu, Yu Cheng, Edoardo Ponti, Yinghui Xu, Ivan Titov, Zenglin Xu,
- Abstract要約: トークンレベルでの批判フリーなRLについて検討し,トークンフライング現象を明らかにした。
トークンの確率変化は、それ自身の利点によって完全に決定されないことを示し、他のトークンとの結合勾配相互作用も無視できない役割を担っている。
- 参考スコア(独自算出の注目度): 56.379030343338776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A commonly accepted explanation of critic-free RL for LLMs, based on sequence-level rewards, is that it reinforces successful rollouts with a positive advantage while penalizing failed ones. In contrast, we study critic-free RL from a token-level perspective, revealing the token-flipping phenomenon: positive and negative rollouts exhibit remarkably similar proportions of tokens whose probabilities are boosted or suppressed during RL training. To explain this phenomenon, we further show that a token's change in probability is not fully determined by its own advantage; coupled gradient interactions with other tokens also play a non-negligible role. Specifically, these token coupling effects occur primarily between identical tokens that are both predicted with low confidence. Building upon this analysis, we propose the cancellation hypothesis: as a result of coupling, opposing signals cancel out for tokens shared by positive and negative rollouts, while tokens more specific to successful rollouts receive stronger reinforcement, thereby inducing hidden token-level credit assignment from rollout-level rewards. We support this hypothesis with complementary empirical evidence. (1) Compared with training on only positive rollouts, critic-free RL shifts updates from template and formatting tokens toward reasoning tokens; (2) Tokens boosted by critic-free RL consistently demonstrate higher value than suppressed tokens, regardless of whether they originate from positive or negative rollouts. Guided by this view, we implement two batching interventions to encourage or preserve cancellation in critic-free RL training: query-preserved mini-batching and reward-balanced batching. Despite their simplicity, these interventions improve RLVR training across multiple model scales, supporting cancellation as both an explanatory principle and a practical design criterion for critic-free RL training.
- Abstract(参考訳): シークエンスレベルの報酬に基づいて、LLMに対する批判のないRLについて一般的に受け入れられている説明は、失敗するものをペナルティ化しながら、肯定的な優位性でロールアウトを成功させることである。
対照的に, トークンレベルの観点から, 批判のないRLについて検討し, トークンフライング現象を明らかにした: 正および負のロールアウトは, RLトレーニング中に確率が上昇または抑制されるトークンの顕著に類似した割合を示す。
この現象を説明するために、トークンの確率変化が自身の利点によって完全に決定されないことを示し、他のトークンとの結合勾配相互作用も無視できない役割を担っている。
具体的には、これらのトークン結合効果は主に、信頼度が低いように予測される同一のトークン間で起こる。
この分析に基づいて, 正のロールアウトと負のロールアウトで共有されるトークンに対して, 反対のシグナルがキャンセルされるのに対して, 成功したロールアウトに特有なトークンはより強い強化を受け, ロールアウトレベルの報酬から隠れトークンレベルのクレジット代入を誘導する, キャンセル仮説を提案する。
我々はこの仮説を補完的な実証的な証拠で支持する。
1) 肯定的なロールアウトのみのトレーニングと比較すると, 批判のないRLは, テンプレートやフォーマッティングトークンから推論トークンへの更新, (2) 批判のないRLによって促進されたトークンは, 正か負かに関わらず, 抑圧されたトークンよりも常に高い価値を示す。
この観点から、批判のないRLトレーニングのキャンセルを奨励または維持するために、クエリ保存されたミニバッチと報酬バランスのバッチ処理という、2つのバッチ処理の介入を実装した。
その単純さにもかかわらず、これらの介入は複数のモデルスケールにわたるRLVRトレーニングを改善し、説明原理と批判のないRLトレーニングのための実用的な設計基準の両方としてキャンセルをサポートする。
関連論文リスト
- Cornerstones or Stumbling Blocks? Deciphering the Rock Tokens in On-Policy Distillation [4.624042537090342]
On-Policy DistillationのKL目標に基づく学生と教師のミスマッチの最も直接的なシグナルとして,トークンタイプの高損失トークンについて検討する。
これらのトークンは、モデルの実際の推論性能に無視可能な機能的貢献を提供する。
論文 参考訳(メタデータ) (2026-05-10T01:41:43Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning [60.00161035836637]
グループ相対政策最適化は、推論タスクのための有望な批判のない強化学習パラダイムとして登場した。
我々は,各トークンがモデルの最終回答にどの程度影響するかに基づいて,利益を再分配する,きめ細かい信用割当機構であるOutcome-grounded Advantage Reshaping (OAR)を紹介した。
OAR-Gは計算オーバーヘッドを無視して同等のゲインを達成し、どちらも強力なGRPOベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-12T10:48:02Z) - AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens [9.127363793428119]
低パープレキシティ制御トークンの短いシーケンスは、正しいNoの判断から多くのバイナリ評価を反転させ、Yesの判断を誤ることを示す。
制御 token 強化例の小さなセットに対する LoRA ベースの対角訓練は,これらの偽陽性を著しく低減できることを示す。
論文 参考訳(メタデータ) (2025-12-19T09:22:11Z) - ASPO: Asymmetric Importance Sampling Policy Optimization [31.38346888572171]
ポジティブアドバンテージトークンのImportance Smpling(IS)比は不一致であり、正および負のトークンに対するアンバランストークン重み付けにつながる。
このミスマッチは、既に高確率のトークンを過剰に増幅しながら、低確率トークンの更新を抑制する。
我々は,IS比の正アドバンテージトークンを反転させるシンプルかつ効果的な戦略を用いた非対称的重要度サンプリングポリシー最適化(ASPO)を提案する。
論文 参考訳(メタデータ) (2025-10-07T15:54:24Z) - BroRL: Scaling Reinforcement Learning via Broadened Exploration [88.69554867685243]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルにおいて複雑な推論能力を解き放つ鍵となる要素として登場した。
最近のProRLは、トレーニングステップの数を増やすことで、RLのスケーリングを約束している。
RL, BroR-Lineasing the followingary paradigm for scaling RL, BroR-Lincreasing the rollouts per example to hundreds。
論文 参考訳(メタデータ) (2025-10-01T17:59:02Z) - Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model [7.8354921036790275]
大きな推論モデル(LRM)は複雑な問題を解決するのに優れているが、過度なジレンマに直面している。
単純なタスクを扱う場合、思考トークンがオーバーロードされた冗長なレスポンスを生成することが多い。
これらのトークンは、リフレクションやバックトラックのような不要な高レベルの推論動作を引き起こし、効率を低下させる。
論文 参考訳(メタデータ) (2025-06-30T13:30:33Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。