論文の概要: Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- arxiv url: http://arxiv.org/abs/2607.24731v2
- Date: Thu, 30 Jul 2026 05:33:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.25651
- Title: Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- Title(参考訳): オンライン拡散蒸留におけるクラシファイアフリーガイダンスの再考
- Abstract要約: オンライン蒸留(OPD)は、現在の学生が生み出す軌跡に沿って教師に質問することで拡散モデルに適応する。
既存の OPD 法は,CFG 合成予測に追従する速度マッチングを自然に拡張する。
この目的がブランチレベルで過小評価されていることを示す。
我々は、正の予測とCFG条件の方向を別々に制約する分岐認識OPD目標である正の方向マッチング(PDM)を導入する。
- 参考スコア(独自算出の注目度): 14.183839885490372
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation (OPD) adapts diffusion models by querying a teacher along trajectories generated by the current student, but how it should behave under classifier-free guidance (CFG), a default component of modern diffusion systems, remains poorly understood. Existing OPD methods naturally extend velocity matching to the CFG-composed prediction, directly matching teacher and student guided velocities. We show that this objective is under-identified at the branch level: positive- and negative-branch errors can compensate in the guided prediction. Through two contrasting cases, we find that naive matching remains effective under shared negative conditioning, where both branch errors decrease jointly. When the model's native CFG schema retains privileged information in the teacher's negative branch that is unavailable to the student, however, this joint reduction breaks down and the composed objective induces antagonistic branch-error dynamics, reducing the positive-branch error while increasing the negative-branch error. We term this failure mode Negative Branch Asymmetry (NBA). To address NBA, we introduce Positive--Direction Matching (PDM), a branch-aware OPD objective that separately constrains the positive prediction and the CFG conditional direction. We apply PDM to dense-to-sparse video control, where naive guided matching is highly sensitive to inference guidance scales, while branch-aware supervision enables more robust and effective knowledge transfer.
- Abstract(参考訳): オンライン蒸留(OPD)は、教師に現在の学生が生み出した軌跡に沿って質問することで拡散モデルに適応するが、現代の拡散システムのデフォルトコンポーネントである分類器フリーガイダンス(CFG)の下でどのように振る舞うべきかはいまだよく分かっていない。
既存の OPD 手法は,CFG が提案する予測値と,教師と生徒の指導した速度を直接マッチングする速度マッチングを自然に拡張する。
我々は,この目的が分岐レベルで過小評価されていることを示し,正と負の分岐誤差は導出予測に補うことができることを示した。
両枝の誤りが相補的に減少する共有負条件下では, ナイーブマッチングが有効であることがわかった。
しかし、モデルのネイティブCFGスキーマが生徒に利用できない教師の負のブランチに特権情報を保持すると、この共同還元は破壊され、構成された目的が反抗的な分岐エラーダイナミクスを誘導し、負のブランチエラーを増大させながら正のブランチエラーを減少させる。
この障害モードを負分岐非対称性(NBA)と呼ぶ。
NBAに対処するために、正の予測とCFG条件の方向を別々に制約する分岐対応OPD目標である正の方向マッチング(PDM)を導入する。
我々はPDMを高精細度ビデオ制御に適用し,提案手法は推論指導尺度に非常に敏感である一方,分岐認識監視はより堅牢で効果的な知識伝達を可能にする。
関連論文リスト
- Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast [15.292903130335974]
オンライン自己蒸留は、実際に学生が訪れた州について教師に質問することで、言語モデル推論を改善する。
近年の手法は、教師を特権的文脈に露出させることにより、強力な情報非対称性を生み出す。
我々は、モデル自身のロールアウトの潜在的不確実性構造から完全に信頼性の高い特権情報を生成する、完全に教師なしのフレームワークであるCoDAを紹介します。
論文 参考訳(メタデータ) (2026-08-09T15:23:25Z) - Adaptive Supervised Anchoring for On-Policy Self-Distillation [15.445625053566244]
オンライン自己蒸留は、学生から採取した軌道上の凍結教師からの指導を蒸留することにより、言語モデルに適応する。
本研究は,学生が目標軌跡から遠ざかると,教師の目標外接頭辞の条件がタスク関連監督を著しく弱めることを示す。
本稿では,2つの補完的な指導経路を分離する統合トレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T05:46:32Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks [20.760754362327933]
本稿では、二項分類を超えて誤差拡散を拡張するためのモジュロエラールーティングを提案する。
本手法で訓練したデュアルストリーム興奮抑制アーキテクチャは,MNISTの96.7%を達成している。
強化学習では,EDをPPO(Proximal Policy Optimization)と統合し,Google BraxとCraftaxの継続的制御タスクで評価する。
論文 参考訳(メタデータ) (2026-06-30T14:09:40Z) - RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation [46.554172283247915]
オンライン自己蒸留は、推論モデルに対する密集したトークンレベルの監督を提供する。
この分布ギャップから引き出された学習信号は、タスクを持つものよりもスタイルトークンに集中していることが示される。
我々は,このドリフトを緩和するためのtextbfRLCSD (Reinforcement Learning with Contrastive on-policy Self-Distillation) を提案する。
論文 参考訳(メタデータ) (2026-06-10T06:31:59Z) - Mitigating Error Amplification in Fast Adversarial Training [58.74042726356826]
FAT(Fast Adversarial Training)は、ネットワークに摂動不変表現の学習を促すことによって、モデルロバスト性の向上に有効であることが証明されている。
FATは、しばしば破滅的なオーバーフィッティング(CO)に悩まされ、モデルがトレーニングアタックに過度に適合し、目に見えないものへの一般化に失敗する。
本稿では、摂動予算と監視信号の両方を動的に調整する分散対応動的ガイダンス(DDG)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-27T11:23:18Z) - Stable On-Policy Distillation through Adaptive Target Reformulation [7.361248172930405]
ベト (Veto) は、ロジット空間に幾何学的ブリッジを構築する客観的なレベルの再構成である。
ベトは監督された微調整と既存の政治のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-12T02:57:39Z) - Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models [57.20761595019967]
注意空間にL1をベースとした正規化・精細化を施した,効率的かつトレーニング不要な機構である正規化注意誘導(NAG)を提案する。
NAGは、CFGが忠実性を維持しながら崩壊する効果的な負のガイダンスを復元する。
NAGはアーキテクチャ(UNet、DiT)、サンプリングレシスタンス(複数ステップ、複数ステップ)、モダリティ(イメージ、ビデオ)をまたいで一般化する
論文 参考訳(メタデータ) (2025-05-27T13:30:46Z) - Contrastive CFG: Improving CFG in Diffusion Models by Contrasting Positive and Negative Concepts [55.298031232672734]
As-Free Guidance (CFG) は条件拡散モデルサンプリングに有効であることが証明された。
対照的な損失を用いた負のCFG誘導を強化する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-26T03:29:27Z) - Perturbation-Invariant Adversarial Training for Neural Ranking Models:
Improving the Effectiveness-Robustness Trade-Off [107.35833747750446]
正統な文書に不可避な摂動を加えることで 敵の例を作れます
この脆弱性は信頼性に関する重大な懸念を生じさせ、NRMの展開を妨げている。
本研究では,NRMにおける有効・損耗トレードオフに関する理論的保証を確立する。
論文 参考訳(メタデータ) (2023-12-16T05:38:39Z) - ELODI: Ensemble Logit Difference Inhibition for Positive-Congruent Training [110.52785254565518]
負のフリップ率(NFR)を減少させる既存の方法は、新しいモデルに古いモデルを模倣させたり、アンサンブルを使用したりすることで、全体的な精度を犠牲にしている。
我々は、NFRの低減におけるアンサンブルの役割を分析し、通常決定境界に近くない負のフリップを取り除くことを観察する。
本稿では,誤り率とNFRの両方でパラゴン性能を実現する分類システムを訓練するためのELODI(Ensemble Logit Difference Inhibition)を提案する。
論文 参考訳(メタデータ) (2022-05-12T17:59:56Z) - Robustness through Cognitive Dissociation Mitigation in Contrastive
Adversarial Training [2.538209532048867]
本稿では,新たなニューラルネットワークトレーニングフレームワークを提案する。
本稿では,データ拡張と対向的摂動の両面に一貫性のある特徴表現を学習することで,敵攻撃に対するモデルロバスト性を改善することを提案する。
我々は,CIFAR-10データセットを用いて,教師付きおよび自己教師付き対向学習法よりも頑健な精度とクリーンな精度を両立させる手法を検証する。
論文 参考訳(メタデータ) (2022-03-16T21:41:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。