論文の概要: When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.07976v1
- Date: Wed, 08 Jul 2026 23:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.359977
- Title: When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning
- Title(参考訳): 達成不可能なトークンが強化されるとき--LLM強化学習のためのTail-Aware Credit Calibration
- Abstract要約: Tail-Aware Credit calibratiOn (TACO) は、望ましくないポジティブな更新を抑えるために、均一なクレジット割り当てを校正する手法である。
3つのLSMと8つのベンチマークの結果、TACOはGRPOスタイルのベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 32.70365827239751
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) has achieved remarkable success in enhancing the reasoning capabilities of large language models (LLMs). However, widely used critic-free RL methods rely on uniform credit assignment, broadcasting the same advantage to all tokens regardless of their differences. We identify a critical failure mode of this design, which we refer to as Positive-Credit Contamination: low-probability tail tokens that are contextually erroneous receive identical positive credit to plausible ones within the same trajectory, resulting in the indiscriminate reinforcement of flawed reasoning behavior. To mitigate this issue, we propose Tail-Aware Credit calibratiOn (TACO), a method that calibrates uniform credit assignment to suppress undesirable positive updates. TACO first computes a tail-risk score that incorporates the local generation context to assess each token's risk of falling into the unreliable tail, distinguishing unexpected rarity from uncertainty-driven exploration. TACO then uses this score to tune positive credit for risky tokens without removing their gradients entirely, so that recurring useful rare patterns can accumulate reinforcement while incidental noise is progressively dampened. Experimental results across three LLMs and eight benchmarks show that TACO consistently outperforms GRPO-style baselines. Notably, TACO improves training stability, supporting sustained performance gains in long-horizon RL. The source code is available at: https://github.com/xiuyilou/TACO.
- Abstract(参考訳): 強化学習(RL)は,大規模言語モデル(LLM)の推論能力の向上に成功している。
しかし、広く使われている批判なしのRL法は均一なクレジット代入に依存し、その差にかかわらず全てのトークンに対して同じ利点をブロードキャストする。
この設計の致命的な障害モードを同定し、これを正クレディット汚染(Positive-Credit Contamination)と呼ぶ。
この問題を軽減するため,Tail-Aware Credit calibratiOn (TACO) を提案する。
TACOはまず、各トークンが信頼できないテールに落下するリスクを評価するために、ローカル生成コンテキストを組み込んだテールリスクスコアを計算する。
TACOはこのスコアを使用して、リスクトークンの正のクレジットを、その勾配を完全に取り除かずに調整する。
3つのLLMと8つのベンチマークでの実験結果から、TACOはGRPOスタイルのベースラインを一貫して上回っていることがわかった。
特に、TACOはトレーニング安定性を改善し、長距離RLにおける持続的なパフォーマンス向上をサポートする。
ソースコードは、https://github.com/xiuyilou/TACO.comで入手できる。
関連論文リスト
- Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning [3.9783774144289623]
GRPOのような批判のない方法は、応答レベルの報酬を利点に変換し、トークン間で均一にブロードキャストする。
本稿では,高感度トークンのクレジットを低減するGRPOの簡易拡張であるCSCRを提案する。
long-CoTの数学的推論ベンチマークでは、CSCRはGRPOベースラインを同じ数のポリシー更新で一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-30T09:03:33Z) - Two is better than one: A Collapse-free Multi-Reward RLIF Training Framework [6.490241400619907]
内部フィードバックからの強化学習は、スケーラブルで教師なしの代替手段として最近登場した。
本稿では,学習信号を2つの補完成分に分解するマルチリワードRLIFフレームワークを提案する。
提案手法は,外部の地平監督に頼らずに,安定した長距離推論を支援することができることを示す。
論文 参考訳(メタデータ) (2026-05-21T15:30:47Z) - The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits [56.379030343338776]
トークンレベルでの批判フリーなRLについて検討し,トークンフライング現象を明らかにした。
トークンの確率変化は、それ自身の利点によって完全に決定されないことを示し、他のトークンとの結合勾配相互作用も無視できない役割を担っている。
論文 参考訳(メタデータ) (2026-05-09T04:07:20Z) - What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time [57.533031432715084]
TTRL(Test-Time Reinforcement Learning)は、Large Language Models(LLM)が、ラベルのないテストストリームの推論能力を向上することを可能にする。
既存のTTRL法は、正の擬似ラベル戦略にのみ依存している。
本研究では,ラベル雑音増幅を効果的に緩和する堅牢なテスト時間強化学習フレームワークであるSCRLを提案する。
論文 参考訳(メタデータ) (2026-03-20T11:47:12Z) - STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens [38.425692691443764]
既存の強化学習(RL)ファインチューニング手法は、安定性を維持するためにエントロピー正則化と再重み付けに大きく依存している。
実際には、彼らはしばしば後期的なパフォーマンスの崩壊に悩まされ、推論品質の低下と不安定なトレーニングにつながります。
トレーニングの不安定性は、約0.01%の少量のトークンによって引き起こされる可能性がある。
安定かつ効果的な大規模モデル改良を促進するSTAPO(Spurious-Token-Aware Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-02-17T14:46:48Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning [25.562101968892833]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデル(LLM)における長い連鎖推論を導く
既存のアプローチでは、トークンレベルのエントロピーやシーケンスレベルの長さ制御を通じてRLVRを改善するが、推論の進捗を意味的に基礎づけたステップレベルの尺度は欠如している。
本研究では,潜在的利得を増幅し,潜在的利得をペナルティ化し,飽和後のペナルティを適用してタイムリーな終了を促す,詳細な信用割当手法であるステップ電位アドバンテージ推定(SPAE)を提案する。
論文 参考訳(メタデータ) (2026-01-07T11:36:01Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning [64.04741347596938]
Token Hidden Reward (THR) はトークンレベルのメトリクスで、それぞれのトークンが正しい応答の確率に与える影響を定量化する。
トレーニングダイナミクスは、高い絶対THR値を持つトークンの小さなサブセットに支配されている。
この知見は、GRPOの学習信号を修正し、エクスプロイトや探索に向けて明示的にバイアストレーニングを行うTHR誘導再重み付けアルゴリズムを示唆している。
論文 参考訳(メタデータ) (2025-10-04T04:49:44Z) - Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty [59.97939500426759]
本稿ではRLCRについて述べる。RLCRは精度と信頼性を共同で向上する推論モデルを訓練する手法である。
多様なデータセット間で、RLCRは精度を損なうことなくキャリブレーションを大幅に改善することを示す。
また,言語的信頼度をテスト時に活用し,精度とキャリブレーションを向上させることも実証した。
論文 参考訳(メタデータ) (2025-07-22T17:56:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。