論文の概要: UP-MOPD: Update Projection in Multi-Teacher On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2610.08398v1
- Date: Tue, 06 Oct 2026 14:13:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.022189
- Title: UP-MOPD: Update Projection in Multi-Teacher On-Policy Distillation
- Title(参考訳): UP-MOPD:マルチ教師オンポリティー蒸留における更新予測
- Abstract要約: UP-MOPD(Multi-Teacher On-Policy Distillation)の更新計画を提案する。
UP-MOPDは、元の混合勾配を更新し、パラメータにコミットする前に、候補を違反するだけをプロジェクト化する。
訓練後期のIFEval-loose精度をバニラM-OPDよりも2.96ポイント向上させる。
- 参考スコア(独自算出の注目度): 21.699455019842816
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: On-policy distillation from multiple teachers combines expertise from different domains in a single student, but conflicting gradients can hinder this integration. Gradient corrections directly constrain parameter updates under plain SGD. With optimizers such as AdamW, however, momentum, adaptive scaling, and weight decay can turn a corrected gradient into an update that increases a domain loss to first order. To address this gap, we propose Update Projection for Multi-Teacher On-Policy Distillation (UP-MOPD). UP-MOPD lets the original mixed gradient update the optimizer state and generate a candidate displacement, then projects only violating candidates before they are committed to the parameters. The projection gives the unique feasible update closest to the candidate in Euclidean distance. In experiments combining medical and general domains, UP-MOPD improves IFEval-loose accuracy late in training by 2.96 points over vanilla M-OPD. It achieves an average score of 60.03 across eight metrics, compared with 59.00 for gradient projection and 59.15 for update rejection. On a public benchmark covering mathematics, code, and instruction following, it achieves the best average across six tasks (32.67), leads on LiveCodeBench v5, and ties for the best IFEval result.These results support projecting optimizer updates to reduce interference between domains.
- Abstract(参考訳): 複数の教師によるオンライン蒸留は、一つの学生の異なるドメインの専門知識を組み合わせるが、矛盾する勾配は、この統合を妨げる可能性がある。
グラディエント補正は、平滑なSGDの下で直接制約パラメータの更新を行う。
しかし、AdamWのようなオプティマイザでは、モーメント、適応スケーリング、およびウェイト崩壊が修正された勾配を更新し、ドメイン損失を1次に増やすことができる。
このギャップに対処するため,マルチ教師オンポリシィ蒸留(UP-MOPD)の更新予測を提案する。
UP-MOPDは、元の混合勾配がオプティマイザ状態を更新し、候補変位を生成し、パラメータにコミットする前に候補を違反するだけを投影する。
この射影により、ユークリッド距離の候補に最も近い唯一の可能な更新が得られる。
医学領域と一般領域を組み合わせた実験では、UP-MOPDはバニラM-OPDよりも2.96ポイント遅れてIFEval-looseの精度を向上する。
8つの指標の平均スコアは60.03であり、勾配投影では59.00、更新拒否では59.15である。
数学、コード、命令に従う公開ベンチマークでは、6つのタスク(32.67)で最高の平均を達成し、LiveCodeBench v5をリードし、最高のIFEval結果の結びつきを達成している。
関連論文リスト
- D$^3$-MOPD: Adaptive Dynamic Domain ScheDuling for Efficient Multi-Teacher Distillation [50.89072318748398]
マルチテラー・オン・ポリシー蒸留は、いくつかのドメイン専門家の教師を1人の学生に蒸留する。
既存のアプローチでは、トレーニング前にドメイン毎のデータ混在を修正するのが一般的である。
固定混合は、高速収束ドメイン上の計算を無駄にし、遅い収束ドメインをアンダートレインする。
D$3$-MOPDはドメイン単位の逆KL信号をオンラインに適応させるゼロオーバーヘッドスケジューラである。
論文 参考訳(メタデータ) (2026-08-25T17:57:11Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing [44.26853590985694]
NPD(Near-Policy Distillation)は、学生生成を訓練から切り離す非同期アプローチである。
NPDは、オンラインベースラインの8.1倍のスピードアップを実現し、SFTを8.09%上回る。
本手法では,openPangu-Embedded-1Bが68.73%に達し,Qwen3-1.7Bを大きく上回っている。
論文 参考訳(メタデータ) (2026-05-07T09:50:53Z) - GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment [0.0]
GRADEは、高分散ポリシー勾配推定を直接バックプロパゲーションに置き換える手法である。
GRADE-STEはPPOの0.510+-0.313とREINFORCEの0.617+-0.378と比較して0.763+-0.344の試験報酬を得る。
論文 参考訳(メタデータ) (2025-12-30T03:45:32Z) - POME: Post Optimization Model Edit via Muon-style Projection [74.73326657229347]
POME(Post-Optimization Model Edit)は、微調整された大規模言語モデルの性能を向上させる。
デルタW$のミューオン式のプロジェクションを使い、微調整された重量と事前訓練された重量の違いを区別する。
単純な後処理ステップとして、POMEはトレーニングパイプラインから完全に分離される。
論文 参考訳(メタデータ) (2025-10-08T04:20:11Z) - Beyond Freezing: Sparse Tuning Enhances Plasticity in Continual Learning with Pre-Trained Models [10.904981532789824]
事前訓練されたモデルによる継続的な学習は、シーケンシャルなタスクにまたがる効率的な適応を大いに約束する。
既存のアプローチはPTMを凍結し、プロンプトやアダプタのような補助モジュールに依存している。
MIST(Mutual Information-Guided Sparse Tuning)は,PTMパラメータのサブセットを選択的に更新するプラグイン・アンド・プレイ方式である。
論文 参考訳(メタデータ) (2025-05-26T13:09:25Z) - Exploiting Adam-like Optimization Algorithms to Improve the Performance
of Convolutional Neural Networks [82.61182037130405]
勾配降下(SGD)は深いネットワークを訓練するための主要なアプローチです。
本研究では,現在と過去の勾配の違いに基づいて,Adamに基づく変分を比較する。
resnet50を勾配降下訓練したネットワークのアンサンブルと融合実験を行った。
論文 参考訳(メタデータ) (2021-03-26T18:55:08Z) - Kernel Based Progressive Distillation for Adder Neural Networks [71.731127378807]
追加のみを含むAdder Neural Networks(ANN)は、エネルギー消費の少ないディープニューラルネットワークを新たに開発する方法を提供する。
すべての畳み込みフィルタを加算フィルタで置き換える場合、精度の低下がある。
本稿では,トレーニング可能なパラメータを増大させることなく,ANNの性能を向上するための新しい手法を提案する。
論文 参考訳(メタデータ) (2020-09-28T03:29:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。