論文の概要: When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.34849v1
- Date: Mon, 28 Sep 2026 10:43:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 02:13:52.321876
- Title: When Sparse Reward Meets Dense Distillation: Training Dynamics of On-Policy Distillation
- Title(参考訳): スパース・リワードが高濃度蒸留と出会う時--オンライン蒸留のトレーニングダイナミクス
- Abstract要約: 検証可能な報酬による強化学習は、訓練後の疎い信号を提供する。
成長するメソッドの族は、政策段階の目的にスカラー重み付き教師KL項を付加する。
これらの信号を組み合わせる利点があるにもかかわらず、最適化中の相互作用は関節のトレーニングを不安定にすることができる。
- 参考スコア(独自算出の注目度): 25.30536937191518
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards provides a sparse post-training signal: a single binary outcome evaluates the entire rollout, and every token receives the same sequence-level advantage regardless of its individual contribution. To complement this sparse supervision, a growing family of methods adds a scalar-weighted teacher KL term to the policy-gradient objective, providing dense token-level guidance that may be unreliable at some positions. Despite the benefits of combining these signals, their interaction during optimization can destabilize joint training. To understand how this instability develops, we study the learning dynamics of hybrid reward--distillation training through a neural tangent kernel (NTK) analysis. We introduce the cross-signal NTK $K_{DR}(n)$, a token-level statistic that measures the alignment between reward and distillation gradients at position n. Through this analysis, we identify two failure modes: 1 Magnitude drowning, where the reward gradient exceeds the distillation gradient by orders of magnitude, so that even weak directional conflict can cause the distillation loss to rise despite its explicit inclusion in the training objective; and 2 Localized directional conflict, where the sequence-level advantage and the teacher's position-specific distribution induce opposing updates at the same token ($K_{DR}(n)\!<\!0$). The severity of these effects depends on the optimization regime: the gradient-norm ratio $κ\!=\!\|\nabla\mathcal{L}_R\|/\|\nabla\mathcal{L}_D\|$ varies by roughly an order of magnitude across tasks, and our experiments reveal an empirical threshold beyond which naive mixing can lead to persistent training collapse. Motivated by these findings, we introduce the M3 family, which combines magnitude normalization with three strategies...
- Abstract(参考訳): 検証可能な報酬による強化学習は、訓練後の信号として、単一のバイナリ結果がロールアウト全体を評価し、各トークンはその個々のコントリビューションに関係なく、同じシーケンスレベルのアドバンテージを受け取る。
この疎密な監督を補完するために、成長する手法のファミリーは、政策段階の目的にスカラー重み付き教師KLという用語を付加し、ある立場では信頼できないような密集したトークンレベルのガイダンスを提供する。
これらの信号を組み合わせる利点があるにもかかわらず、最適化中の相互作用は関節のトレーニングを不安定にすることができる。
この不安定性がどのように発展するかを理解するため,ニューラル・タンジェント・カーネル(NTK)分析によるハイブリッド・リターン・トレーニングの学習力学について検討した。
我々は,n位における報酬と蒸留勾配のアライメントを測定するトークンレベルの統計量であるNTK $K_{DR}(n)$を導入する。
この分析により,1マグニチュード・ドローイング(報奨勾配がマグニチュードの次数で蒸留勾配を超えた場合)と,2つの障害モードを同定した。1つの障害モードは,トレーニング目標に明示的に包含されているにもかかわらず,たとえ弱い方向性紛争であっても蒸留損失が増大する可能性があること,および2つの障害モードである。
<\!
0ドル)。
これらの効果の重大さは最適化体制に依存する: 勾配-ノルム比 $κ\!
=\!
実験の結果, ナイーブミキシングが持続的なトレーニング崩壊に繋がる経験的閾値が明らかとなった。
これらの知見に触発されて、大域正規化と3つの戦略を組み合わせたM3ファミリーを導入する。
関連論文リスト
- A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy Distillation [59.43605629311855]
学生ログに対する逆KLのトーケンK2推定器の勾配を解析した。
そこで我々は,SuReを1つの経験的インスタンス化として,K2推定器で訓練した逆KL OPDの勾配レベル評価を行った。
論文 参考訳(メタデータ) (2026-08-26T11:14:42Z) - The Distributional View of Knowledge Distillation [13.841028090842869]
トークンレベルの知識蒸留は、位置ごとに2つの条件分布に一致する。
我々は,教師が単一軟化アウトプットではなく,多温度ビューのファミリで表される分布ビューを開発する。
論文 参考訳(メタデータ) (2026-08-15T13:03:31Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning [43.9367673156851]
オンライン自己蒸留は、教師が密集したトークンレベルの監督を提供する間、独自のロールアウトで推論モデルを訓練する。
トークンレベルの更新を3つの信号で統一するEGRSD(Entropy-Guided Reinforced Self-Distillation)を提案する。
CL-EGRSDは、持続する高エントロピースパンと過渡的な高エントロピー位置を区別する因果関係の変種である。
論文 参考訳(メタデータ) (2026-05-13T09:38:20Z) - Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why [32.00194810443734]
本稿では,トークン単位,質問単位,教師単位の最高解像度で動作する無トレーニング診断フレームワークを提案する。
蒸留指導は, 不正なロールアウトにおいて, 正しいロールアウトよりも, 理想とほぼ一致していることが観察された。
論文 参考訳(メタデータ) (2026-05-11T17:33:28Z) - SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting [17.504616835765617]
両経路適応型学習フレームワークを提案する。
SCOPEは、Avg@32で11.42%、Pass@32で7.30%の平均相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-04-12T15:26:14Z) - A Unified Noise-Curvature View of Loss of Trainability [8.602734307457387]
継続的学習におけるトレーニング容易性(LoT)の喪失は、タスクが進化するにつれて、ステップが改善されなくなります。
バッチサイズ対応勾配雑音境界と曲率ボラティリティ制御境界の2つの相補的基準を導入する。
このしきい値を用いることで、各レイヤを安全な限界以下に維持する、単純なレイヤごとのスケジューラを構築します。
論文 参考訳(メタデータ) (2025-09-24T02:11:13Z) - Adaptive Federated Learning Over the Air [108.62635460744109]
オーバー・ザ・エア・モデル・トレーニングの枠組みの中で,適応勾配法,特にAdaGradとAdamの連合バージョンを提案する。
解析の結果,AdaGrad に基づくトレーニングアルゴリズムは $mathcalO(ln(T) / T 1 - frac1alpha の速度で定常点に収束することがわかった。
論文 参考訳(メタデータ) (2024-03-11T09:10:37Z) - The Equalization Losses: Gradient-Driven Training for Long-tailed Object
Recognition [84.51875325962061]
本稿では,長距離問題に対処するための勾配駆動型学習機構を提案する。
我々は、勾配駆動損失関数の新たなファミリー、すなわち等化損失を導入する。
我々の手法は一貫してベースラインモデルより優れています。
論文 参考訳(メタデータ) (2022-10-11T16:00:36Z) - Unbiased Risk Estimators Can Mislead: A Case Study of Learning with
Complementary Labels [92.98756432746482]
我々は,補完ラベルを用いた学習という,弱教師付き問題を研究する。
勾配推定の品質はリスク最小化においてより重要であることを示す。
本稿では,ゼロバイアスと分散の低減を両立させる新しい補助的相補的損失(SCL)フレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-05T04:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。