論文の概要: Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
- arxiv url: http://arxiv.org/abs/2609.03342v1
- Date: Thu, 03 Sep 2026 04:00:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.921063
- Title: Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards
- Title(参考訳): グラディエントは、成果が得られないことを知っている: グラディエント・アライン・リワードによるLLM推論のための強化学習をアンロックする
- Abstract要約: グラディエント・リワード(GAR)は政策の勾配空間で機能する。
Cコサインと専門家-アンカー勾配の類似性は、密度の高い推論-認識の報酬をもたらす。
- 参考スコア(独自算出の注目度): 24.636191382674184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning from verifiable rewards (RLVR) drives chain-of-thought reasoning in large language models, yet its binary outcome reward cannot distinguish among correct trajectories. Existing dense reward alternatives, from surface heuristics to process reward models, either ignore the expert solutions already present in training corpora or require expensive offline annotation. We propose Gradient-Aligned Reward (GAR), which operates in the policy's own gradient space: truncated backpropagation through the output projection layer extracts a compact gradient vector for each rollout, and cosine similarity with an expert-anchor gradient yields a dense, reasoning-aware reward with less than 9% wall-clock overhead. We prove that this cosine admits a multiplicative decomposition into prediction-error and activation-pattern factors, providing a concrete characterization of what the alignment signal measures. On Qwen3-4B and Qwen3-8B, GAR consistently improves over GRPO and other baselines on competition-level math benchmarks and transfers to GPQA Diamond and MMLU-Pro without domain-specific data. Code and data are available at https://github.com/LQgdwind/GAR.
- Abstract(参考訳): 検証可能な報酬(RLVR)からの強化学習は、大きな言語モデルにおける連鎖的推論を促進するが、その二項帰納報酬は正しい軌跡を区別することはできない。
表面ヒューリスティックからプロセス報酬モデルに至るまで、既存の密集した報酬代替手段は、トレーニングコーパスに存在するエキスパートソリューションを無視したり、高価なオフラインアノテーションを必要とする。
出力プロジェクション層を通り抜けたバックプロパゲーションはロールアウト毎にコンパクトな勾配ベクトルを抽出し、エキスパート・アンカー勾配とのコサイン類似性は、壁面の9%未満の高密度で理性に配慮した報酬をもたらす。
このコサインは、予測エラーとアクティベーションパターンの因子に乗法的に分解されることを証明し、アライメント信号の作用を具体的に評価する。
Qwen3-4B と Qwen3-8B では、GAR は競争レベルのベンチマークやGPQA Diamond や MMLU-Pro への転送において、GRPO や他のベースラインよりも一貫して改善されている。
コードとデータはhttps://github.com/LQgdwind/GARで公開されている。
関連論文リスト
- Latent Reward Registers for Diffusion Preference Alignment [46.49072106092868]
本稿では,中間雑音の遅延から端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のためには、Reward-Guided Sampling (RGS) はパラメータ更新なしで大小マッチングされた報酬勾配を経由する。
論文 参考訳(メタデータ) (2026-08-04T17:00:52Z) - Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning [15.386002863432678]
オープンセット半教師付き学習は、アウト・オブ・ディストリビューション・アウトリーを含む可能性のあるラベルのないデータを活用することを目的としている。
既存の手法は主に、疑わしいサンプルをフィルタリングするか、ラベルなしの目的をソフトな重み付けに組み込むという2つのパラダイムに従っている。
攻撃的フィルタリングは情報的だがハードなIDサンプルを捨てることが可能であり、一方、利用は疑似ラベルが間違っている場合に教師付き学習と矛盾する補助的な勾配を導入することができる。
教師付き勾配をアンカーとして使用するプラグインフレームワークである textitGeometric Gradient Rectification (GGR) を提案する。
論文 参考訳(メタデータ) (2026-06-25T12:45:42Z) - Gradient-Guided Reward Optimization for Inference-time Alignment [22.28081683932275]
グラデーションガイダンスによるデコーディングにおいて、ターゲットとなる最小限の介入を行う軽量な推論時手法を提案する。
実験により、GGROは安全性、有用性、推論ベンチマークを横断する推論時間アライメントを一貫して改善することが示された。
また、コンピュータのオーバーヘッドを最小限に抑えて、高品質なレスポンスと、ハッキングに報いるロバストさのカバレッジも向上する。
論文 参考訳(メタデータ) (2026-06-08T15:33:13Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents [9.505140329883762]
よりリッチな学習信号を提供するジェネレーティブ・リワード・モデル(GRM)を導入する。
GRMには、特定の行動パターンを奨励または阻止するための基準を示す、人間によって設計されたルーリックが備わっている。
SWEタスク上でRFT(Reinforced Fine-Tuning)に使用する場合,本手法は終端スコアのみのリジェクションサンプリングよりも優れる。
論文 参考訳(メタデータ) (2026-03-13T02:23:49Z) - GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning [55.03441672267886]
強化学習のための勾配整列データ選択法GradAlignを提案する。
GradAlignは,信頼できない報酬信号,分散不均衡,低ユーティリティトレーニングコーパスの3つにまたがって評価する。
論文 参考訳(メタデータ) (2026-02-25T01:54:50Z) - From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation [52.62655622099456]
検証基準ベース報酬(RLVRR)を用いた強化学習を提案する。
最後の答えをチェックする代わりに、RLVRRは高品質な参照(すなわち報酬連鎖)から順序付けられた言語信号を抽出する。
このようにして、RLVRRは報酬を2つの次元に分解する。
論文 参考訳(メタデータ) (2026-01-26T14:39:58Z) - Unbiased Risk Estimators Can Mislead: A Case Study of Learning with
Complementary Labels [92.98756432746482]
我々は,補完ラベルを用いた学習という,弱教師付き問題を研究する。
勾配推定の品質はリスク最小化においてより重要であることを示す。
本稿では,ゼロバイアスと分散の低減を両立させる新しい補助的相補的損失(SCL)フレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-05T04:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。