論文の概要: GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2608.30632v1
- Date: Mon, 31 Aug 2026 11:41:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.365889
- Title: GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning
- Title(参考訳): GMTS:LLM推論のためのRLVRトレーニングを改良したグラディエントマグニチュードベースのトークン選択
- Abstract要約: 本稿では,トークンの重要度を定量化するために,グラディエント・マグニチュードに基づくToken Selection(GMTS)手法を提案する。
GMTSがランク付けした上位20%トークンのトレーニングは、3つの推論領域と様々なモデルサイズでエントロピーベースのトークン選択よりも一貫して優れています。
- 参考スコア(独自算出の注目度): 1.238039401707697
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL), particularly RL with Verifiable Rewards (RLVR), has recently emerged as a central paradigm for enhancing large language models' (LLMs) reasoning abilities, demonstrating remarkable effectiveness across reasoning tasks. Recent studies suggest that high-entropy tokens play an exceptionally important role in model training, since training with only the highest 20% entropy tokens yields significant performance gains. However, why such high-entropy tokens are beneficial remains insufficiently understood. In this work, we find that although high-entropy tokens within one answer tend to correlate with large gradient magnitude, entropy alone fails to consistently reflect token importance across different answers, considering the variations in the answer-level reward signals. Based on this observation, we introduce the Gradient Magnitude-based Token Selection (GMTS) method to quantify token importance, which leverages the entropy-gradient connection to approximate gradient-magnitude rankings for token selection. We find that training on the top 20% tokens ranked by GMTS consistently outperforms entropy-based token selection across three reasoning domains and various model sizes, suggesting that GMTS provides a more fine-grained estimate of token contribution for RLVR training.
- Abstract(参考訳): Reinforcement Learning(RL)、特にVerifiable Rewards(RLVR)は、近年、大規模言語モデル(LLM)推論能力を向上する中心的なパラダイムとして登場し、推論タスク全体で顕著な効果を示している。
近年の研究では、高いエントロピートークンがモデルトレーニングにおいて極めて重要な役割を担っていることが示唆されている。
しかし、なぜそのような高エントロピートークンが有用かは、まだ十分に理解されていない。
本研究では,1つの解答における高エントロピートークンは大きな勾配等級と相関する傾向にあるが,解答レベルの報酬信号の変動を考慮すると,エントロピー単独では異なる解答におけるトークンの重要度を常に反映しないことがわかった。
本報告では,トークンの重要度を定量化するために,高次マグニチュード(GMTS)法を導入し,エントロピー・グラディエント接続をトークン選択のための近似勾配マグニチュードランキングに活用する。
GMTSがランク付けした上位20%トークンのトレーニングは、3つの推論領域と様々なモデルサイズでエントロピーベースのトークン選択を一貫して上回っており、GMTSはRLVRトレーニングによりきめ細かいトークンコントリビューションを見積もっていることを示唆している。
関連論文リスト
- Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index [6.642733744927882]
我々は,政策最適化のダイナミクスを捉えるには,サンプルトークンの確率やエントロピーを単独で評価することは不十分であると主張している。
本稿では,トークンのエントロピーと選択したトークンの確率を自然に結合する原理的情報理論の指標であるRelative Surprisal Index(RSI)を紹介する。
RSIは,ロジト次数ノルムの1次変動と,選択したロジト摂動の下での予測エントロピーの局所比に関係していることを示す。
論文 参考訳(メタデータ) (2026-06-30T12:33:19Z) - PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping [5.89473045822308]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LVLM(Large Vision-Language Models)の推論能力向上に有効なパラダイムとなっている。
既存のRLVR法は、全ての生成されたトークンに対して同一の学習信号を割り当てる軌道レベルの結果報酬に依存している。
本稿では,重要な知覚トークンを明確に識別し,強化するトークンレベルの強化学習フレームワークである知覚強化政策最適化(PRPO)を提案する。
論文 参考訳(メタデータ) (2026-06-07T16:06:29Z) - Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning [11.322734738973603]
強化学習に基づくポストトレーニングは、大規模言語モデルの推論能力を向上させるための重要なアプローチとなっている。
この研究は、各応答トークンに対する文脈支援の集中度や拡散度を測定する注意エントロピーを通して、それらの不均一性を研究する。
論文 参考訳(メタデータ) (2026-05-08T12:31:28Z) - Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning [5.454773103061359]
TokenUnlearnはトークンレベルの属性フレームワークで、クリティカルトークンを特定し、選択的にターゲットする。
提案手法は,マスキングによる知識認識信号とエントロピー認識信号を組み合わせて,正確なトークン選択のための重要スコアを得る。
論文 参考訳(メタデータ) (2026-05-01T02:59:03Z) - Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs [51.60575965819268]
本稿では,この相互依存を明示的にモデル化するToken-Reweighting(ToR)戦略を提案する。
ToRは複数のマルチモーダル推論ベンチマークで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-26T06:25:27Z) - Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning [106.68304931854038]
検証可能な報酬付き強化学習(RLVR)は、大規模言語モデル(LLM)の推論能力を高めるために広く用いられている。
我々は,RLVRのエントロピー・パフォーマンス交換機構を,異なるレベルの粒度で系統的に解析する。
分析の結果, 上昇段階において, 負のサンプルのエントロピー減少は効果的な推論パターンの学習を促進することが明らかとなった。
プラトー段階では、学習効率は、低エントロピーのサンプルに存在する高エントロピートークンと、シーケンスの終端に位置するトークンと強く相関する。
論文 参考訳(メタデータ) (2025-08-04T10:08:10Z) - IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation [79.22388408461458]
我々は,トークン決定性をチューニングと復号の両方に統合する情報ゲインに基づく決定性対応トークンハンドリング(IGD)戦略を導入する。
IGDはリコメンデーションの精度を一貫して改善し、強力なベースラインに比べて広く使われているランキングの指標で顕著に向上した。
論文 参考訳(メタデータ) (2025-06-16T08:28:19Z) - Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning [80.87085014818052]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLM)の推論能力向上のための強力なアプローチとして登場した。
本研究では,トークンエントロピーパターンの新たな視点からRLVRの先駆的な探索を行う。
トークンのごく一部だけが高いエントロピーを示しており、これらのトークンは様々な推論経路に向けてモデルを操る重要なフォークとして機能する。
論文 参考訳(メタデータ) (2025-06-02T17:54:39Z) - RSQ: Learning from Important Tokens Leads to Better Quantized LLMs [65.5558181902098]
レイヤーワイド量子化は、高価なリトレーニングなしで大きなモデルを効率的に圧縮するための重要な技術である。
モデルに回転を適用して外乱を緩和するRSQ(Rotate, Scale, then Quantize)を提案する。
RSQは、複数の下流タスクと3つのモデルファミリーで、ベースラインメソッドを一貫して上回っていることを実証する。
論文 参考訳(メタデータ) (2025-03-03T18:46:33Z) - Dense Reward for Free in Reinforcement Learning from Human Feedback [64.92448888346125]
我々は報酬モデルが単にスカラー出力よりも多くの情報を含んでいるという事実を活用している。
私たちは、これらの注意重みを使って、完了全体に沿って報酬を再分配します。
経験的に、トレーニングを安定化し、学習速度を加速し、実際は、より良い局所最適性をもたらす可能性があることを示す。
論文 参考訳(メタデータ) (2024-02-01T17:10:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。