論文の概要: Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.23697v1
- Date: Sun, 20 Sep 2026 15:15:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.928312
- Title: Distill What You Trust: Reliability-Aware Multi-Teacher On-Policy Distillation
- Title(参考訳): 信頼するものを蒸留する: 信頼性に配慮したマルチ教師のオンライン蒸留
- Abstract要約: ドメイン悪用されたアプローチは、例ごとに1つの教師を選択し、レスポンス全体を通してそれを修正します。
textbfTrustMOPDは,サンプルレベルの教師選択をラベルのないトークンレベルのアロケーションアロケーションに置き換える。
- 参考スコア(独自算出の注目度): 28.795804636027977
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-teacher on-policy distillation allows a student to learn from complementary specialists on its own trajectories. Domain-routed approaches, however, select one teacher per example and keep it fixed throughout the response. This design both depends on labels that mixed training corpora often lack and cannot adapt teacher selection when the expertise required changes within a trajectory. We propose \textbf{TrustMOPD}, which replaces example-level teacher selection with label-free, token-level supervision allocation. At each student-generated prefix, TrustMOPD uses each specialist's RL-induced displacement from a shared pre-RL reference as a proxy for local reliability, calibrates these scores across teachers, and constructs a weighted distillation target. Across mathematics, code, and instruction following, TrustMOPD outperforms the strongest label-free baseline, increasing the recovery ratio from $54.4\%$ to $91.5\%$ on \textsc{SingleCap} and from $54.5\%$ to $98.0\%$ on \textsc{MultiCap}, while approaching label-based MOPD on \textsc{SingleCap}. Randomizing token-level weights independently of the student-generated prefix performs no better than uniform weighting, supporting the importance of conditioning supervision on the evolving generation context.
- Abstract(参考訳): マルチティーチンガー・オン・ポリシー蒸留(英語版)により、学生は独自の軌跡で補完的な専門家から学ぶことができる。
しかし、ドメイン悪用されたアプローチでは、例ごとに1人の教師を選択し、レスポンス全体を通してそれを固定する。
このデザインはどちらも、混合学習コーパスがしばしば欠落し、専門知識が軌道内で変化する必要がある場合、教師の選択に適応できないラベルに依存している。
本稿では,実例レベルの教師選択をラベルフリーでトークンレベルの監督アロケーションに置き換えた「textbf{TrustMOPD}」を提案する。
学生が作成した各プレフィックスでは、TrustMOPDは、各専門家のRLによって引き起こされる、共有プレRL参照からの変位を、局所的信頼性のプロキシとして使用し、これらのスコアを教師間で校正し、重み付けされた蒸留ターゲットを構築する。
数学、コード、命令全体にわたって、TrustMOPDは最強のラベルフリーベースラインを上回り、リカバリ率は544.4 %$から91.5 %$から54.5 %$から998.0 %$に増加し、ラベルベースのMOPDは \textsc{SingleCap}に接近した。
学生が生成したプレフィックスとは独立にトークンレベルの重みをランダム化することは、均一な重み付けに留まらず、進化する生成コンテキストにおける条件付けの監督の重要性を支持する。
関連論文リスト
- CALM: Class-wise Agreement and Label-gated Disagreement Modulation for Decentralized Federated Learning [1.1617094867403568]
CALMは、あらゆる難しい決定をスムーズな信頼ゲートに置き換える。
均一で硬ろ過された蒸留よりも一貫して優れており、競合する異種FL法に適合するか超えている。
論文 参考訳(メタデータ) (2026-09-05T05:13:07Z) - REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation [10.492445451268727]
REOPDは、オンデマンド蒸留のための信頼性適応型報酬外挿フレームワークである。
信頼性の高い教師参照方向に沿って選択的に外挿しながら、教師のアライメントを保ちます。
論文 参考訳(メタデータ) (2026-08-12T06:15:33Z) - ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation [25.69241346799495]
我々は,教師が生徒の接頭辞から正しい回答を得られる確率として,プロンプトレベルの教師継続信頼性を$R$と定義する。
我々は、高いR$プロンプトがより大きなOPDゲインをもたらし、下降するR$トレーニングがランダムな順序と上昇順序より優れていることを示す。
論文 参考訳(メタデータ) (2026-08-11T13:27:56Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Multi-Turn On-Policy Distillation with Prefix Replay [73.10000453999088]
エージェントタスクに対するReplayed-Prefix On-Policy Distillation (ReOPD)を提案する。
ReOPDは、プレコンパイルされた教師の軌跡を再生プレフィックスとして再利用する。
OPDレベルの精度を保存または改善し、学生のトレーニング中にゼロツールコールを使用し、PDよりもトレーニングステップあたり最低4$times$高速である。
論文 参考訳(メタデータ) (2026-07-06T07:56:53Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。