論文の概要: Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
- arxiv url: http://arxiv.org/abs/2608.03316v1
- Date: Tue, 04 Aug 2026 08:23:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.097792
- Title: Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
- Title(参考訳): Any-OPD:Representation-Space Bridgingによるフローマッチングモデルの不均一なオンポリティ蒸留
- Abstract要約: 教師が生徒自身が生成するサンプルを補正するオンライン蒸留は、2つのモデルが同じ言語を話すことを前提にしている。
我々は、Any-OPDについて、任意対の潜流整合発生器間のオンライン蒸留のための最初のフレームワークについて述べる。
- 参考スコア(独自算出の注目度): 13.653084100002737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy distillation, in which a teacher corrects samples that the student itself generates, presupposes that the two models speak the same language: identical VAE latents, matching architectures, and a common timestep grid. We ask what happens when none of this holds, as when the strongest teacher available and the student one wishes to deploy come from different model families, and find that the standard recipes have no answer: teacher latents cannot serve as targets in a foreign coordinate system, per-pixel losses against a teacher that stochastically re-draws local detail degenerate into blur or divergence, and timestep indices lose their meaning across mismatched schedules. We present Any-OPD, to our knowledge the first framework for on-policy distillation between arbitrary pairs of latent flow-matching generators. Any-OPD treats the teacher purely as a black-box sampler and connects the two models at exactly one point: a frozen, model-agnostic vision representation in which their independently decoded outputs are compared, sidestepping every assumption about latents, features, or architecture. Trajectory correspondence is recovered by matching continuous noise levels instead of step indices, and a brief anchoring phase, in which teacher samples are re-encoded through the student's own VAE, ensures the on-policy gradient measures sample quality rather than domain mismatch. Distilling the 12B FLUX.1-dev into the 2.5B SD3.5-Medium, Any-OPD lifts the student's PickScore from 0.846 to 0.884 and HPSv3 from 9.12 to 10.97, rivaling the teacher at a fifth of its size, where direct latent regression fails to train at all.
- Abstract(参考訳): 教師が生徒自身が生成するサンプルを補正するオンライン蒸留では、同一のVAE潜水器、一致するアーキテクチャ、共通のタイムステップグリッドという2つのモデルが同じ言語を話すことを前提としている。
教師は外部の座標系ではターゲットとして機能せず、教師ごとの損失は、局所的な細部がぼやけたりばらばらになったりし、タイムステップの指標は、ミスマッチしたスケジュールで意味を失います。
我々は、Any-OPDについて、任意対の潜流整合発生器間のオンライン蒸留のための最初のフレームワークについて述べる。
Any-OPDは教師をブラックボックスのサンプルとして純粋に扱い、2つのモデルを正確に1つのポイントで接続する。
学習者自身のVAEを通して教師のサンプルを再エンコードする短いアンカーフェーズでは、ドメインミスマッチではなく、オンラインの勾配がサンプルの品質を測ることによって、軌道対応が回復される。
12B FLUX.1-devを2.5B SD3.5-mediumに挿入すると、Any-OPDは学生のピックスコアを0.846から0.884に引き上げ、HPSv3は9.12から10.97に引き上げ、教師の5分の1の大きさで対抗する。
関連論文リスト
- CRAD: Class-wise Reliability-Aware Distillation for Decentralized Heterogeneous Federated Learning [3.2847672479922783]
フェデレートラーニングのためのクラスワイド・アウェア蒸留(CRAD)を提案する。
CRADはクラス毎の信頼性(精度、逆分散)で各教師を重み付けする
世界的精度で競合する手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-08-31T22:36:30Z) - Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher [36.07614733558147]
フローマッチングモデルのための教師なしOPDフレームワークである textbfSelf-OPD を紹介する。
Self-OPDは決定論的次状態予測を$K$SDE候補に分割し、ODEサンプルとロールアウトして、決定論的自己参照ベースラインと比較する。
単品と混合報酬のベンチマーク実験により、セルフOPDはタスク固有の教師を伴わずに、以前のRLとOPDメソッドよりも優れていた。
論文 参考訳(メタデータ) (2026-08-27T09:34:23Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Weak-to-Strong On-Policy Distillation [21.651421588571296]
Weak-to-Strong On-Policy Distillation (W2S-OPD)を導入した。
4つの数学と3つのコードベンチマークで、W2S-OPDはOPDを上回り、学生がドメイン教師を超越し、監督源が弱くなっても改善を続けることができる。
論文 参考訳(メタデータ) (2026-07-28T20:31:48Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms [0.0]
拡散学生は50~1-8のネットワーク評価からテキスト・ツー・イメージ・推論を減らした。
我々はスカラーを3つの層に沿って制御された摂動を注入する分解可能なプローブで置き換える。
Inception機能に対するブートストラップ中間のBures W22選択率について報告する。
論文 参考訳(メタデータ) (2026-07-03T12:18:24Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Beyond Trajectory Matching: Reflow with Marginal Distribution Alignment [7.13416637929041]
拡散および連続フロー生成モデルは高品質な生成を実現する。
リフローに基づく蒸留は、教師のODE軌道を単純化し、生徒モデルが教師の移動を少ないステップで近似できるようにする。
本稿では,各蒸留間隔の終点において,学生が引き起こした限界値とそれに対応する教師の限界値との差分をペナライズする境界アライメント正規化器を提案する。
論文 参考訳(メタデータ) (2026-06-28T09:19:44Z) - SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling [22.832360652920332]
オンライン蒸留 (On-policy distillation, OPD) は、生徒を自身の軌道で訓練し、より強い教師から集中的な指導を受ける。
本稿では,教師の信頼信号として二分検証器を用いるサインゲートオンポリシィ蒸留(SG-OPD)を提案する。
競合レベルの数学的推論ベンチマークの実験では、SG-OPDは標準PDよりも一貫して優れていた。
論文 参考訳(メタデータ) (2026-06-08T10:11:58Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals [65.71225905458182]
自己蒸留は、生徒と教師の両方と同じモデルを用いて、言語モデルが自身の軌道から政治学を学ぶことを可能にする。
このセットアップは、別の外部モデルに頼ることなく、密集したトークンレベルのフィードバックを提供する。
複数の特権情報ビューを持つ自己蒸留法であるAVSDを紹介する。
論文 参考訳(メタデータ) (2026-05-20T03:06:36Z) - DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation [49.98710755440242]
蒸留により、コンパクトなビジョンランゲージモデル(VLM)が強力な推論能力を得ることができる。
標準チャート/文書推論データセットにおけるプロンプトの最大69%は、事実上ゼロデルタである。
既存のデータセットをシードとして再利用し、学生の障害モードを積極的にターゲットとして、より良いプロンプトを生成するためのステージド合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-15T02:04:12Z) - Improved Distribution Matching Distillation for Fast Image Synthesis [54.72356560597428]
この制限を解除し、MDDトレーニングを改善する一連の技術であるMDD2を紹介する。
まず、回帰損失と高価なデータセット構築の必要性を排除します。
第2に, GAN損失を蒸留工程に統合し, 生成した試料と実画像との識別を行う。
論文 参考訳(メタデータ) (2024-05-23T17:59:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。