論文の概要: WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training
- arxiv url: http://arxiv.org/abs/2608.09447v1
- Date: Mon, 10 Aug 2026 11:22:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.218672
- Title: WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training
- Title(参考訳): WDL-OPD:混合拘束コレーニングによる弱駆動型オンライン蒸留
- Authors: Zehao Chen, Gongxun Li, Tianxiang Ai, Yifei Li, Zixuan Huang, Wang Zhou, Tao Huang, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban,
- Abstract要約: WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
- 参考スコア(独自算出の注目度): 48.290951447286744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) aligns a student with a teacher on trajectories sampled from the student itself, reducing the train-test state mismatch of offline distillation. The same feedback loop can nevertheless be unstable: each update changes both the policy and the states on which the next update is computed. We introduce WDL-OPD, a mixture-constrained co-training method with two trainable policies. An anchor policy generates every rollout, an auxiliary policy evaluates the same visited states, and a geometric mixture of their token distributions is matched to a frozen teacher by reverse KL. Both policies receive gradient. We show that freezing the auxiliary recovers an anchor-plus-contrast proxy target closely related to OPD$^2$ and W2S-OPD, whereas joint training creates branch-level degrees of freedom that a static delta cannot express. In recorded Qwen3 experiments at 1.7B and 4B scale, WDL-OPD produces the strongest student checkpoint in each of four scale-domain settings. It raises MATH500 accuracy from 0.630 to 0.685 at 4B and from 0.521 to 0.585 at 1.7B. In code generation, seven single-policy OPD configurations exhibit entropy growth or trajectory degradation, while co-training reaches independently re-evaluated development scores of 0.637 and 0.375. Because several comparisons differ in curriculum or initialization, these results support a stabilization hypothesis rather than a universal causal claim. We provide the exact training algorithm, failure evidence, and the controlled comparison matrix needed to test that hypothesis.
- Abstract(参考訳): オンライン蒸留(On-policy distillation、OPD)は、学生が学生自身から採取した軌跡を教師と整列させ、オフライン蒸留の試験状態のミスマッチを減らす。
それぞれの更新はポリシーと、次の更新が計算される状態の両方を変更する。
WDL-OPDは2つの訓練可能なポリシを持つ混合制約付き協調学習手法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
どちらの政策もグラデーションを受ける。
凍結はPD$^2$とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
1.7Bと4Bで記録されたQwen3実験では、WDL-OPDは4つのスケールドメイン設定で最強の学生チェックポイントを生成する。
MATH500の精度は0.630から0.685まで4Bで0.521から0.585から1.7Bで上昇する。
コード生成において、7つの単一ポリチドPD構成はエントロピー成長または軌道劣化を示し、コトレーニングは独立に0.637と0.375と再評価された開発スコアに達する。
いくつかの比較はカリキュラムや初期化で異なるため、これらの結果は普遍因果主張よりも安定化仮説を支持する。
我々は、その仮説をテストするのに必要な、正確なトレーニングアルゴリズム、失敗の証拠、および制御された比較行列を提供する。
関連論文リスト
- Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging [13.653084100002737]
教師が生徒自身が生成するサンプルを補正するオンライン蒸留は、2つのモデルが同じ言語を話すことを前提にしている。
我々は、Any-OPDについて、任意対の潜流整合発生器間のオンライン蒸留のための最初のフレームワークについて述べる。
論文 参考訳(メタデータ) (2026-08-04T08:23:57Z) - OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models [39.15861870749305]
OPTD, On-Policy Transition Distillation with consistency-guided Adaptive compression。
これは、数段階の学生自身の軌跡から部分的な状態をサンプリングし、凍結した質問のみの教師を使用して結果に整合した将来の候補者を特定し、現状の信頼でそれらを注文する。
品質効率のトレードオフを継続的に改善し、評価された数ステップのベースラインの中で、全体的な品質に制約のあるAUPを最強に達成します。
論文 参考訳(メタデータ) (2026-08-03T23:09:43Z) - Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary [0.0]
我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
定常アイテムによる人気バイアスのあるフィードバックの下では、$C$は安定した状態に収束する。
次に、その効果の限界について検討する。
論文 参考訳(メタデータ) (2026-08-03T17:33:25Z) - $β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation [85.07190808882523]
オンライン自己蒸留は推論言語モデルを改善するための有望なアプローチである。
我々は,$-OPSDがバニラOPSDを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-30T17:41:16Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation [2.587194279527956]
CADENCEは統合されたフレームワークで、各障害モードに対してターゲットとなる修正を行う。
DRIFTは、学生サンプル軌道上の前方KLと逆KLのサロゲートを混合したトーケンの凸をスケジュールする。
A)COVA、(B)FTB、(B)大域正規化エントロピー参照による高エントロピー位置での勾配集中、(D)LAP、可視性優先正しいロールアウト強化、(E)エントロピー非依存キャリブレーション
論文 参考訳(メタデータ) (2026-07-18T20:16:26Z) - Blockwise Policy-Drift Gating for On-Policy Distillation [14.61751557296924]
オンライン蒸留(OPD)は、学生自身によってサンプリングされた軌跡に基づいて計算された教師信号を用いて生徒の政策を訓練する。
本稿では,OPDをロールアウト再利用するための軽量な学生専用ドリフトコントローラであるブロックワイド・ポリシー・ドリフト・ゲーティングを紹介する。
論文 参考訳(メタデータ) (2026-06-23T02:58:16Z) - Self-Distilled Policy Gradient [51.95967256628261]
都市の自己蒸留は、スパース・リワード強化学習のための密集した監督源として有望である。
SDPGは,グループ相対検証の利点と正規化標準偏差を組み合わせた,自己蒸留型政策段階のフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T02:31:13Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - Self-Distilled RLVR [57.37526213765131]
特権教師からのみ派生した学習信号が,情報漏洩と不安定な長期学習をもたらすことを示す。
textbfSelf-textbfDistillationを用いたtextbfRLSD(textbfRLVR)を提案する。
これにより、RSSDはRLVRとOPSDの両方の強度を同時に利用でき、高い収束天井と優れたトレーニング安定性を実現することができる。
論文 参考訳(メタデータ) (2026-04-03T15:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。