論文の概要: From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2610.02179v1
- Date: Thu, 01 Oct 2026 17:57:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.364387
- Title: From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation
- Title(参考訳): グラディエントから能力へ:多教師のオンライン蒸留を理解する
- Abstract要約: 同じ学生からRLを訓練した4人のドメイン教師を対象にQwen3-1.7Bについて検討した。
いくつかの要因が教師の信号に影響を及ぼすことがわかった。
- 参考スコア(独自算出の注目度): 23.62452389223026
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-teacher on-policy distillation (MOPD) aims to combine the strengths of RL-trained teachers in a single student, but how teacher signals affect parameter changes remains underexplored. We study Qwen3-1.7B with four domain teachers trained with RL from the same initialization as the student, comparing gradients, optimizer updates, and task learning curves, with additional SmolLM3-3B diagnostics. We find that several factors influence teacher signals. First, loss averaging implicitly weights responses: token averaging favors longer responses, and equalizing domain contributions retains this weighting within domains. Second, Adam's first moment reduces differences in parameter updates: the cosine similarity is 0.83 between teachers and 0.96 between averaging rules, despite differences in raw gradients. Third, BF16 rounding hides small changes: about 97\% of FP32 master weights differ from initialization, but only 7--11\% of BF16 weights do. Finally, the top-64 intersection KL gradient closely matches Qwen's full-vocabulary gradient, but the effect on task performance depends on averaging: mathematics accuracy is 2.6 points higher than with sampled-token policy-gradient (PG) under response averaging and 2.1 points lower under global token averaging.
- Abstract(参考訳): マルチティーチンガー・オン・ポリシー蒸留(MOPD)は、単一学生におけるRL学習教師の強みを組み合わせることを目的としているが、教師の信号がパラメーターの変化にどう影響するかは未解明のままである。
我々は、Qwen3-1.7Bを、学生と同じ初期化からRLで訓練した4人のドメイン教師と検討し、勾配、オプティマイザ更新、タスク学習曲線を比較し、追加のSmolLM3-3B診断を行った。
いくつかの要因が教師の信号に影響を及ぼすことがわかった。
まず、損失平均化は応答を暗黙的に重み付けします。トークン平均化はレスポンスを長くし、ドメインのコントリビューションの等化はドメイン内の重み付けを保持します。
第二に、アダムの最初の瞬間はパラメータの更新の差を減らし、教師間のコサインの類似度は0.83であり、生の勾配の違いにもかかわらず平均的な規則間の0.96である。
第3に、BF16の丸めは小さな変化を隠しており、FP32の主重量の約97\%は初期化と異なるが、BF16の重みのわずか7-11\%である。
最後に、トップ64の交叉KL勾配はQwenの完全語彙勾配と密接に一致するが、タスク性能への影響は平均化に依存する。
関連論文リスト
- DMAD: Distribution Matching as Adversarial Distillation for Fast Visual Generation [50.43969311607643]
DMAD, Distribution Matching as Adversarial Distillationを導入し, 分布マッチングを分類として再放送する。
判別器では,これらの損失が分布マッチングの基礎となるDMDを回復することを示す。
DMADはFréchet Inception Distance (FID) 1.04、ImageNet-64x64 14.47、COCO-10Kの4ステップSDXL、VBenchの合計スコアは85.15、Wan2.1-T2V-14Bである。
論文 参考訳(メタデータ) (2026-10-01T17:59:01Z) - From Dissonance to Orchestration: Teacher Intervention in On-Policy Distillation [43.75423570055352]
オンライン蒸留(OPD)は、より強い教師からのフィードバックを用いて、学生を独自の推論軌道で訓練する。
より深い介入により、ロールアウトの精度が低下し、非政治負荷が増大する。
MaESTROは、教師が受け継いだときとそれが生成する時間に共同で適応するために、ローカルポリシーの不一致を使用する。
論文 参考訳(メタデータ) (2026-09-29T13:06:14Z) - Reward-Aligned Reweighting for On-Policy Distillation [17.797224736120654]
オンライン蒸留は、学生が生み出す軌跡に関するより強い教師からの強いフィードバックで、学生言語モデルを訓練する。
決定の課題価値は、学生がその後の推論をどのように完了するかに依存する。
このミスマッチは、学生が確実に実行できないパスを補強したり、実行可能な学生戦略を抑えるために模倣を引き起こす可能性がある。
本稿では,教師の指導を継続的に再配置するために,結果の合意と教師の意見の不一致の程度を生かしたR$2-OPD(Reward-Aligned Reweighting for On-Policy Distillation)を紹介する。
論文 参考訳(メタデータ) (2026-09-28T16:09:06Z) - Luck Is Not Skill: When Do Paired Rollouts Help Group-Relative RL of LLM Agents? [2.488251122211714]
グループ相対強化学習は、同じプロンプトのロールアウトを比較するが、独立した環境ノイズはこれらの比較を曖昧にする可能性がある。
本研究は,各グループ内において,各ロールアウトの周縁分布を保ちながら,イベントキー付きノイズスケジュールを共有するペア付きロールアウトについて検討する。
片側グレーダ雑音に対して、還元の正確な条件を導出し、勾配のばらつきが増大する一方、報酬のコントラストが改善する反例を与える。
論文 参考訳(メタデータ) (2026-09-21T05:55:08Z) - Data-free On-policy Distillation [49.537587070291444]
オンライン蒸留(OPD)は、フロンティア・ポストトレーニングパイプラインの標準コンポーネントとなっている。
しかし、そのトレーニングデータが実際にどれだけ貢献するかは、ほとんど検討されていない。
我々はこのことをtextbfData-free On-policy Distillation (DF-OPD) で制限する。
DF-OPDは実際のデータと一致し、さらにそのデータを生成する質問は、教師自身のポストトレーニングデータを追跡する。
論文 参考訳(メタデータ) (2026-09-12T23:51:35Z) - D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation [50.89072318748398]
マルチテラー・オン・ポリシー蒸留は、いくつかのドメイン専門家の教師を1人の学生に蒸留する。
既存のアプローチでは、トレーニング前にドメイン毎のデータ混在を修正するのが一般的である。
固定混合は、高速収束ドメイン上の計算を無駄にし、遅い収束ドメインをアンダートレインする。
D$3$-MOPDはドメイン単位の逆KL信号をオンラインに適応させるゼロオーバーヘッドスケジューラである。
論文 参考訳(メタデータ) (2026-08-25T17:57:11Z) - Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning [0.0]
Qwen2-VL-2Bが3.6%のロールアウトを正しく答える20,830のビジュアルマス問題のプールでは、GRPOロールアウトの85-97%は完全に間違っており、勾配はゼロである。
我々は、この体制で同じ条件下で11のメソッドを訓練し、それぞれ異なる事前を注入する。
これらの方法のうち、ヒント誘導による探索はヒントゲインを誘導し、批評家のMSE損失をHL-Gaussクロスエントロピーに置き換える価値は+14.4ポイントである。
論文 参考訳(メタデータ) (2026-08-22T07:17:14Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - AIS: Adaptive Importance Sampling for Quantized RL [21.387834718338496]
大規模言語モデル(LLM)の強化学習はロールアウト生成のコストに支配されている。
これは、ロールアウトトレーニングミスマッチを導入し、ポリシー勾配を偏り、推論ベンチマークでトレーニングが完全に崩壊する可能性がある。
このミスマッチは非定常的であり、二重刃の剣として機能し、初期のトレーニングでは探索ボーナスを提供し、トレーナーがアンダーサンプするトラジェクトリーへの勾配を露呈する。
本稿では,適応的重要度サンプリング(AIS)を提案する。
論文 参考訳(メタデータ) (2026-05-13T03:36:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。