論文の概要: STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models
- arxiv url: http://arxiv.org/abs/2608.04887v1
- Date: Wed, 05 Aug 2026 14:11:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.95761
- Title: STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models
- Title(参考訳): STEP-OPD:拡散モデルにおけるオンライン蒸留における出力目標と内部ダイナミクスの再考
- Authors: Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang,
- Abstract要約: 本稿では,教師を超えて学習対象を拡大する画像生成のためのオンライン蒸留フレームワークSTEP-OPDを提案する。
教師を最終目標として扱う代わりに、各タスク固有の教師と共有ベースモデルの速度差を更なる学習の方向として利用する。
さらに、学生と教師の表現変化の方向と大きさを調整し、学生がどのように表現が徐々に変換されるかを学習できるようにする。
- 参考スコア(独自算出の注目度): 14.682283642975271
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) has become an effective approach for consolidating multiple task-specialized image generation models into a single student. However, existing OPD methods optimize the student mainly to match the teacher's output velocity, making the teacher the upper limit of the optimization objective. While output-level supervision alone leaves the student's blockwise representation evolution underconstrained, which weakens the transfer of capabilities that must be progressively developed across layers. We propose STEP-OPD, an on-policy distillation framework for image generation that extends the student's learning target beyond the teacher and introduces explicit constraints on its internal representation evolution. Instead of treating the teacher as the final target, we use the velocity difference between each task-specific teacher and the shared base model as a direction for further learning and add a scaled version of this difference to the teacher velocity. In addition, we align the direction and magnitude of representation changes between the student and teacher, enabling the student to learn how representations are progressively transformed across network blocks. Experiments on compositional alignment, text rendering, and human preference show that our method consistently improves Standard OPD methods. In particular, it increases the GenEval score of DiffusionOPD from 0.927 to 0.961, while also improving OCR and all preference-based metrics. The resulting unified student surpasses the corresponding single-task teachers across all three capability groups, showing that output extrapolation enables beyond-teacher learning. And representation change alignment provides complementary guidance for the student's internal transformations.
- Abstract(参考訳): オンライン蒸留(OPD)は,複数のタスク特化画像生成モデルを単一学生に集約する有効な手法となっている。
しかし,既存の OPD 手法は教師の出力速度に合わせるために生徒を最適化し,教師を最適化目標の上限にしている。
出力レベルの監督だけでは、学生のブロックワイドな表現の進化が過小評価され、層をまたいで徐々に発展しなければならない能力の移動が弱まる。
画像生成のためのオンライン蒸留フレームワークSTEP-OPDを提案する。
教師を最終目標として扱う代わりに、各タスク固有の教師と共有ベースモデルの速度差を、さらに学習するための方向として使い、この差のスケールしたバージョンを教師の速度に追加する。
さらに,学生と教師の表現変化の方向と大きさを合わせることで,学生がネットワークブロック間でどのように表現が徐々に変換されるかを学ぶことができる。
コンポジションアライメント,テキストレンダリング,人為的嗜好に関する実験により,本手法は標準PD法を一貫して改善することが示された。
特に、DiffusionOPDのGenEvalスコアを0.927から0.961に引き上げ、OCRおよびすべての選好基準を改善している。
結果として得られた統合された学生は、3つの能力グループすべてにまたがって、対応するシングルタスクの教師を超越し、アウトプットの外挿が教師以外の学習を可能にしていることを示す。
そして、表象変化アライメントは、学生の内部変換を補完するガイダンスを提供する。
関連論文リスト
- Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models [25.503555874738623]
Poly-OPDは、異種教師の相補的な強みを1つのコンパクトなフローマッチング学生に集約するフレームワークである。
各生徒生成画像は、選択した教師のエンコーダによって再符号化され、教師の騒音スケジュールに基づいて、等級に応じて精製される。
論文 参考訳(メタデータ) (2026-08-05T01:48:55Z) - Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models [23.382646724389545]
オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
論文 参考訳(メタデータ) (2026-08-02T14:16:14Z) - Contrastive On-Policy Distillation [36.47487086937924]
対照的なオンライン蒸留フレームワークである COPD を提案する。
COPDは生徒モデルに直接、より簡潔で効率的な推論戦略を学ぶよう促す。
論文 参考訳(メタデータ) (2026-07-21T12:35:04Z) - H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation [31.41588745047352]
H-OPDはマルチモーダル推論のための信頼度を考慮したヘテロジニアスマルチテラーPDフレームワークとして提案されている。
同じ推論プロセスで異種教員の相補性を検証することにより、H-OPDはタスクやサンプルレベルの教師ルーティングを置き換える。
H-OPDは、テキストのみの教師が重要な視覚的意味論にアクセスできるようにするために、視覚から言語への記述転送を利用する。
論文 参考訳(メタデータ) (2026-07-01T07:37:10Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe [53.40076304466524]
LLM(Large Language Models)とMLLM(Multimodal Large Language Models)をまたいで一般化する統一OPDフレームワークであるUni-OPDを提案する。
具体的には、学生の立場から、学習中の情報発信状態の探索を促進するために、2つのデータバランス戦略を採用する。
我々は,正しい軌道と間違った軌道の順序の整合性を取り戻すために,結果誘導マージンキャリブレーション機構を開発した。
論文 参考訳(メタデータ) (2026-05-05T12:15:21Z) - Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation [57.524909883706556]
オンライン蒸留(OPD)は、学生のパフォーマンス向上に強い経験的利益をもたらしている。
この研究は、フレキシブルな参照モデルと報酬項の相対重みをKL正規化に対して制御する報酬スケーリング係数を導入している。
特に、同じ学生モデルにドメイン固有RLを適用して得られた異なるドメインエキスパートの知識をマージする環境では、ExOPDは生徒が教師のパフォーマンス境界を越えられるようにします。
論文 参考訳(メタデータ) (2026-02-12T16:14:29Z) - Gap Preserving Distillation by Building Bidirectional Mappings with A Dynamic Teacher [43.678380057638016]
Gap Preserving Distillation (GPD) 法は、生徒にこのギャップを埋めるように訓練すると共に、スクラッチから追加の動的教師モデルを訓練する。
実験では、GPDはCNNとトランスフォーマーアーキテクチャの両方で既存の蒸留法よりも大幅に優れている。
GPDはまた、スクラッチからのトレーニングや微調整を含む事前訓練を受けた教師なしでシナリオを一般化し、ResNet18では1.80%と0.89%の大幅な改善を実現している。
論文 参考訳(メタデータ) (2024-10-05T12:29:51Z) - Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models [62.5501109475725]
知識蒸留(KD)は、より小さな学生モデルを模倣するように訓練することで、大きな教師モデルを圧縮する技術である。
本稿では、教師ネットワークが小さなオンラインモジュールを統合し、学生モデルと同時学習するオンライン知識蒸留(OKD)について紹介する。
OKDは、様々なモデルアーキテクチャやサイズにおけるリードメソッドのパフォーマンスを達成または超え、トレーニング時間を最大4倍に短縮する。
論文 参考訳(メタデータ) (2024-09-19T07:05:26Z) - Distantly-Supervised Named Entity Recognition with Adaptive Teacher
Learning and Fine-grained Student Ensemble [56.705249154629264]
NERモデルの堅牢性を改善するために,自己学習型教員学生フレームワークを提案する。
本稿では,2つの教員ネットワークからなる適応型教員学習を提案する。
微粒な学生アンサンブルは、教師モデルの各フラグメントを、生徒の対応するフラグメントの時間移動平均で更新し、各モデルフラグメントのノイズに対する一貫した予測を強化する。
論文 参考訳(メタデータ) (2022-12-13T12:14:09Z) - Representation Consolidation for Training Expert Students [54.90754502493968]
マルチヘッド多タスク蒸留法は,タスク固有の教師の表現を集約し,下流のパフォーマンスを向上させるのに十分であることを示す。
また,本手法では,複数のドメインで訓練された複数の教師の表現的知識を1つのモデルに組み合わせることができる。
論文 参考訳(メタデータ) (2021-07-16T17:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。