論文の概要: DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
- arxiv url: http://arxiv.org/abs/2608.06243v2
- Date: Fri, 07 Aug 2026 03:26:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.164891
- Title: DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
- Title(参考訳): DASH:Reasoning Modelのオンライン自己蒸留のためのダイバージェンス適応型スーパービジョン・ホライズン
- Authors: ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng,
- Abstract要約: 検証可能な報酬による強化学習は、大きな言語モデルの推論能力を向上させる。
On-policy self-distillationは、学生が訪問する接頭辞で特権教師に問い合わせることで、信号の疎結合を緩和する。
標準のOPSDはロールアウトの時間構造をまだ明らかにしていない。
DASHは各局所蒸留信号とシーケンスレベル平均とのギャップを適応伝搬ゲートにマッピングする。
- 参考スコア(独自算出の注目度): 26.283978881046107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) improves the reasoning capabilities of large language models using automatically verifiable outcome signals, but these signals are typically sparse and at the sequence-level. On-policy self-distillation (OPSD) mitigates this sparsity by querying a privileged teacher at student-visited prefixes and providing dense token-level distributional supervision. Although this dense supervision alleviates signal sparsity, we find that standard OPSD still underexploits the temporal structure of the rollout. It assigns every local divergence the same coefficient, regardless of its position or the divergence sequence in which it occurs. In on-policy autoregressive generation, the same divergence magnitude can follow different discrepancy histories, reflecting different evolutions of the mismatch between the teacher and student. Since the local scalar alone cannot distinguish these temporal contexts, standard OPSD cannot adapt its token-level weights to the realized discrepancy sequence. To address this limitation, we propose Divergence-Adaptive Supervision Horizons (DASH). DASH maps the gap between each local distillation signal and the sequence-level mean to an adaptive propagation gate and then uses these gates to control backward multi-step aggregation. By doing so, DASH adjusts token-level supervision weights according to how local divergences evolve during generation. Experiments on three mathematical reasoning benchmarks across three model scales show that DASH improves over our matched vanilla OPSD reruns on every benchmark at all three scales. DASH reuses the teacher and student distributions that OPSD already computes, so the gains require no additional teacher or student forward pass. Code: https://github.com/DBtxy/DASH-OPSD
- Abstract(参考訳): 検証可能な報酬(RLVR)を用いた強化学習は、自動検証結果信号を用いて、大規模言語モデルの推論能力を向上するが、これらの信号は典型的にはスパースであり、シーケンスレベルである。
On-policy Self-distillation (OPSD)は、学生が訪問する接頭辞で特権教師に質問し、トークンレベルの密度の高い分布管理を提供することによって、この空間を緩和する。
この密集した監視は信号の分散を緩和するが、標準的なOPSDはロールアウトの時間構造を過小評価している。
すべての局所発散を、その位置やそれが起こる発散シーケンスに関係なく、同じ係数に割り当てる。
政治上の自己回帰世代では、同じ分散度は、教師と学生のミスマッチの異なる進化を反映して、異なる相違履歴に従うことができる。
局所スカラーだけではこれらの時間的文脈を区別できないため、標準的なOPSDはそのトークンレベルの重みを実際の相違シーケンスに適応することはできない。
この制限に対処するため,Divergence-Adaptive Supervision Horizons (DASH)を提案する。
DASHは各局所蒸留信号とシーケンスレベルの平均値のギャップを適応伝搬ゲートにマッピングし、これらのゲートを使用して後方多段凝集を制御する。
これにより、DASHは、生成中の局所的な発散がどのように進化するかに応じてトークンレベルの監督重みを調整する。
3つのモデルスケールにわたる3つの数学的推論ベンチマークの実験により、DASHは3つのスケールすべてで、一致するバニラOPSDの再実行よりも改善されていることが示された。
DASHは、OPSDが既に計算している教師と生徒の配布を再利用するので、追加の教師や生徒のフォワードパスは不要である。
コード:https://github.com/DBtxy/DASH-OPSD
関連論文リスト
- DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation [9.897015521661915]
オンライン蒸留(OPD)は、露光バイアスを減らすために学生モデルを自身のロールアウトで訓練する。
既存のカリキュラム学習手法は、学習の進捗に応じてどの程度の教師支援が使われているかを規定するが、いつ必要かは決定できない。
DASH-OPDは,実行者を適応的に双方向に切り替える新しいエージェントOPD法である。
論文 参考訳(メタデータ) (2026-07-31T06:57:17Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning [4.663685189987781]
自己蒸留剤強化学習は、トークンレベルの蒸留損失で軌跡レベルの報酬を増大させる。
一般的なレシピでは、この損失を1つのスカラー、すなわち教師と学生の対数確率のギャップで埋める。
CRAFTは2つの制限に対処する3ピラー・クレジット・アサインメント方式である。
論文 参考訳(メタデータ) (2026-06-28T16:11:47Z) - Self-Distilled Policy Gradient [51.95967256628261]
都市の自己蒸留は、スパース・リワード強化学習のための密集した監督源として有望である。
SDPGは,グループ相対検証の利点と正規化標準偏差を組み合わせた,自己蒸留型政策段階のフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T02:31:13Z) - Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance [8.66471442661456]
隠れ状態分布は局所的推論品質に有用な信号を含むことを示す。
各GRPO群では, 局所的推論品質が変動する領域を中心に, スパンレベル隠れ状態分布間のワッサースタイン距離が増加する。
textbfSpan-level textbfHidden state textbfEd textbfAdvantage textbfReweightingを提案する。
論文 参考訳(メタデータ) (2026-04-25T14:11:23Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z) - Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes [31.95045602299568]
オンライン蒸留(OPD)は,教師の学習履歴ではなく,学生が生み出すロールアウトに対するフィードバックを評価するため,大規模言語モデル(LLM)のポストトレーニングにアピールしている。
推定器と実装側からOPDを再検討する。
不均衡な1-token信号、学生が生成した接頭辞に対する教師の信頼できない指導、トークン化器や特殊-tokenミスマッチによる歪みの3つの失敗モードを同定する。
論文 参考訳(メタデータ) (2026-03-26T15:35:59Z) - Unsupervised Controllable Generation with Self-Training [90.04287577605723]
GANによる制御可能な世代は依然として困難な研究課題である。
本稿では,自己学習を通じてジェネレータを制御する潜伏符号の分布を学習するための教師なしフレームワークを提案する。
我々のフレームワークは、変分オートエンコーダのような他の変種と比較して、より良い絡み合いを示す。
論文 参考訳(メタデータ) (2020-07-17T21:50:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。