論文の概要: Who Teaches Which Token? Verifier-Gated Multi-Expert On-Policy Distillation for Scientific Reasoning
- arxiv url: http://arxiv.org/abs/2609.15404v2
- Date: Tue, 15 Sep 2026 09:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.096285
- Title: Who Teaches Which Token? Verifier-Gated Multi-Expert On-Policy Distillation for Scientific Reasoning
- Title(参考訳): どれが美味しいのか? 科学的推論のための多価多価オン・ポリシック蒸留法
- Abstract要約: 複数教師によるオンライン蒸留は, 専門的能力を一つのモデルに統合する標準的な方法になりつつある。
その代わりに、教師の有用な信号は、推論軌道に沿ってスパースで不均一であることがわかった。
Verifier-Gated Multi-Expert On-Policy Distillation (VG-OPD) は検証によって答える。
- 参考スコア(独自算出の注目度): 19.276963328809092
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-teacher on-policy distillation (OPD) is becoming the standard way to integrate specialist capabilities into one model: train experts with RL, then distill them into the student on its own rollouts. Existing recipes assign supervision at the sequence level - each prompt goes to one domain teacher and every token receives the same weight - which implicitly assumes that a teacher is uniformly useful across a response. We find instead that useful teacher signal is sparse and heterogeneous along a reasoning trajectory, which raises a finer question: who should teach which token? Verifier-Gated Multi-Expert On-Policy Distillation (VG-OPD) answers it by verification: the counterfactual gain of an expert on a specific answer criterion licenses that expert to teach, its disagreement with the student localizes the supervision, and criterion importance sets its weight; the gated KL enters GRPO as an additive token-level advantage. Instantiated for scientific reasoning with RL-trained capability experts, VG-OPD attains the best overall performance on seven benchmarks for 4B and 8B students, ranking first on five at both scales, with the largest gains on knowledge-intensive scientific reasoning tasks. Further analysis shows that the gains come from localizing verified supervision rather than from adding teachers or distillation loss: misplacing the same supervision budget is the single most damaging change, and indiscriminate distillation drags RL below its own floor where gated distillation lifts it.
- Abstract(参考訳): マルチテラーオンライン蒸留(OPD)は、専門的な能力を1つのモデルに統合する標準的な方法になりつつある。
既存のレシピはシーケンスレベルで監督を割り当てる - 各プロンプトは1つのドメインの教師に渡され、各トークンは同じ重みを受け取り、教師が応答全体で均一に有用であると暗黙的に仮定する。
その代わりに、有用な教師信号は推論軌道に沿ってスパースで異質であることに気付き、誰がどのトークンを教えるべきかというより細かい疑問を提起する。
Verifier-Gated Multi-Expert On-Policy Distillation (VG-OPD)は、それを検証によって答えている: 専門家が教える特定の回答基準に関する専門家の反実的な利得、学生との意見の相違は監督をローカライズし、基準の重要性が重みを定め、ゲートKLは加法トークンレベルの優位性としてGRPOに入る。
VG-OPDは4Bと8Bの学生の7つのベンチマークにおいて、RLトレーニングされた能力の専門家と科学的推論を融合して、総合的なパフォーマンスを最高に達成し、両方のスケールで5位にランク付けし、知識集約的な科学的推論タスクにおいて最大の成果を上げている。
さらなる分析では、教師の追加や蒸留の損失ではなく、検証された監督の局所化による利益が示されており、同じ監督予算を誤用することは、最も被害の少ない唯一の変化であり、無差別な蒸留は、ゲート蒸留が上昇する自分の床の下にRLをドラッグする。
関連論文リスト
- Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance [50.77757355236912]
本稿では,RSTG(Recovering Learning Signals via Adaptive Teacher Guidance)を提案する。
RSTGは数学では+4.02%、コードでは+3.05%の速さでGRPO+OPDを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-08-01T17:29:14Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Distilled Reinforcement Learning for LLM Post-training [8.435213882597546]
大規模言語モデル(LLM)のポストトレーニングは推論、適応、アライメントの改善に不可欠である。
既存の方法は、強化学習(RL)とオンライン蒸留(OPD)の2つのパラダイムに主に従っている。
本稿では,教師の指導をRL目標に統合し,詳細な指導を行う蒸留RL(Distilled Reinforcement Learning)を提案する。
論文 参考訳(メタデータ) (2026-07-19T13:32:54Z) - Reward-Gated On-Policy Distillation [58.187458236302575]
オンライン蒸留は、強い教師から小さな学生に推論能力を伝達する強力な方法である。
RG-OPD: Reward-Gated On-Policy Distillationは、検証者フィードバックを用いて、教師のログがいつ信頼できるかを決定する。
RG-OPDは、推論とコーディングのベンチマークを通じて、より強い蒸留学生を生み出し、バニラ逆KL蒸留と最近のTLD-KDベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2026-07-04T21:51:22Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Skill-Conditioned Gated Self-Distillation for LLM Reasoning [22.02868419200851]
SD(On-policy Self-distillation)は、教師側特権情報(PI)を用いて、スパース検証結果を高密度トークンレベルの監視に変換することにより、LCM推論を改善する。
本研究では,非条件模擬ではなく,教師の仮説検証としてスキルベースSDを定式化するスキルコンディション付きゲート型自己蒸留(SGSD)を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:49:52Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Reinforcement-aware Knowledge Distillation for LLM Reasoning [63.53679456364683]
強化学習(Reinforcement Learning, RL)ポストトレーニングは、最近、大型言語モデル(LLM)の長いチェーン・オブ・プリーティングにおいて、進歩をもたらした。
既存の知識蒸留法の多くは、教師による微調整(SFT)のために設計されており、固定された教師のトレースや教師の学生であるKulback-Leibler(KL)の発散に基づく正規化に依存している。
本稿では,RLにおける選択的な模倣を行うRL-aware distillation (RLAD)を提案する。
論文 参考訳(メタデータ) (2026-02-26T00:20:39Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。