論文の概要: Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers
- arxiv url: http://arxiv.org/abs/2606.32020v1
- Date: Tue, 30 Jun 2026 17:51:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.343827
- Title: Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers
- Title(参考訳): クロススペース蒸留 : 近代拡散教師のワンステップ指導
- Authors: Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran,
- Abstract要約: Bridgeは、学生のラテントを学生のバックボーンを変更することなく教師空間にマッピングする軽量のラテントインターフェースである。
SD 1.5 を 5.4 から 9.4 HPSv3 に改善し、ワンステップ推論、低レイテンシ、エコシステムとの互換性を保っている。
- 参考スコア(独自算出の注目度): 47.916191066149224
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern one-step diffusion models achieve impressive quality through distribution-based timestep distillation. Yet, they rely on a critical assumption: Teacher and Student must inhabit the same latent space. This Shared-Space constraint prevents knowledge transfer from modern high-capacity Teachers (e.g., SD 3.5 and Flux) into compact, deployment-friendly Students such as SD 1.5, whose latent resolution and VAE parameterization differ from the Teacher. We formalize this overlooked regime as Cross-Space Distillation, where Teacher and Student differ in both latent resolution and VAE space. To enable distillation under this mismatch, we introduce the Bridge, a lightweight latent interface that maps Student latents into the Teacher space without modifying the Student backbone. Bridge combines a frozen Student VAE decoder as a spatial prior with a compact learnable projector, and is trained with latent reconstruction and attention fidelity objectives for stable Teacher-space alignment. Across diverse modern Teachers, Bridge enables substantial gains for compact one-step Students; for example, it improves SD 1.5 from 5.4 to 9.4 HPSv3 while preserving one-step inference, low latency, and broad ecosystem compatibility. These results show that heterogeneous large Teachers can be distilled into efficient, deployable backbones through a lightweight latent-space interface.
- Abstract(参考訳): 現代のワンステップ拡散モデルでは、分布に基づくタイムステップ蒸留によって印象的な品質が得られる。
教師と学生は同じ潜伏空間に住まわなければならない。
この共有空間制約は、現代の高容量教師(例えば、SD 3.5、Flux)からSD 1.5のようなコンパクトで展開しやすい学生への知識伝達を防止する。
我々はこの見過ごされた体制をクロススペース蒸留として定式化し、教師と学生は潜時解像度とVAE空間の両方で異なる。
このミスマッチ下での蒸留を可能にするために、学生のバックボーンを変更することなく、学生の潜伏者を教師空間にマッピングする軽量潜伏インタフェースであるブリッジを導入する。
ブリッジは、凍結された学生のVAEデコーダを、コンパクトな学習可能なプロジェクタと空間的先行として組み合わせ、安定した教師空間アライメントのための潜在再構成と注意力の目標を訓練する。
例えば、SD 1.5 を 5.4 から 9.4 HPSv3 に改善し、一段階の推論、低レイテンシ、より広いエコシステムの互換性を保っている。
これらの結果から, 異種大型教員を軽量な潜在空間インタフェースにより効率よく, 展開可能なバックボーンに蒸留できることが示唆された。
関連論文リスト
- DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation [26.38620865128242]
DuoMemは、手続き的問題解決能力を大きな教師モデルからコンパクトな学生モデルに転送する二重空間蒸留フレームワークである。
ALFWorldで評価されている。
DuoMemで強化された4Bモデルは、72Bの教師より3倍早くタスクを完了している。
論文 参考訳(メタデータ) (2026-06-29T08:38:40Z) - SWARD: Stochastic Window-Attention-Based Relational Distillation for Cross-Architectural Semantic Segmentation [1.1617094867403568]
大規模視覚基盤モデルは、セマンティックセグメンテーションのような密集した予測タスクに大きな利益をもたらした。
現代の基礎教師は、主にグローバルコンテキストを符号化するトランスフォーマーベースであるのに対し、効率的な学生は、通常、局所的に偏った受容場を持つ畳み込みネットワークである。
既存の蒸留法は主に構造的均質性を前提としており、直接的特徴模倣に依存しており、この表現的ギャップを埋めることができない。
本稿では,このギャップを2つの相補的なメカニズムで解決する知識蒸留フレームワークSWARDを提案する。
論文 参考訳(メタデータ) (2026-05-31T04:29:31Z) - BridgeTA: Bridging the Representation Gap in Knowledge Distillation via Teacher Assistant for Bird's Eye View Map Segmentation [17.072492774587456]
カメラのみのアプローチはLiDARの代替手段として注目されているが、それでもLiDAR-Camera (LC) 融合方式に遅れを取っている。
本稿では,LCフュージョンとカメラ専用モデルとの表現ギャップを埋める,費用対効果の高い蒸留フレームワークであるBridgeTAを紹介する。
提案手法は,カメラのみのベースラインよりも4.2% mIoUの改善を実現し,他の最先端KD法よりも最大45%向上した。
論文 参考訳(メタデータ) (2025-08-13T08:28:21Z) - CoMAD: A Multiple-Teacher Self-Supervised Distillation Framework [1.2172320168050466]
CoMAD (Consensus-oriented Masked Distillation) について紹介する。
自己監督型ビジョントランスフォーマーからの知識を、コンパクトな学生ネットワークに統合する。
ImageNet-1Kでは、CoMADのViT-Tinyが75.4%のTop-1を達成した。
論文 参考訳(メタデータ) (2025-08-06T18:55:14Z) - Fuse Before Transfer: Knowledge Fusion for Heterogeneous Distillation [52.0297393822012]
異質な教師と学生間の機能的知識の伝達を容易にするために,橋梁としてアシスタントモデルを導入する。
提案した設計原理の中では, クロスアーキテクチャ帰納バイアスとモジュール関数の利点を組み合わせたアシスタントモデルが提案されている。
提案手法は, CNN, ViT, 空間KDの同種モデルペアと任意の異種組み合わせを用いて評価する。
論文 参考訳(メタデータ) (2024-10-16T08:02:49Z) - Switching Temporary Teachers for Semi-Supervised Semantic Segmentation [45.20519672287495]
半教師付きセマンティックセグメンテーションで一般的な教師/学生のフレームワークは、主に指数的移動平均(EMA)を用いて、学生の量に基づいて教師の重みを更新する。
本稿では,学生のカップリング問題を軽減するために,2つの臨時教員を兼ねた,シンプルで効果的な方法であるデュアル教師を紹介する。
論文 参考訳(メタデータ) (2023-10-28T08:49:16Z) - Cross Architecture Distillation for Face Recognition [49.55061794917994]
本研究では,教師にプロンプトを組み込むことで,蒸留専門知識の管理を可能にする適応型プロンプト教師ネットワーク(APT)を開発した。
一般的な顔のベンチマークと2つの大規模な検証セットによる実験は,本手法の優位性を実証している。
論文 参考訳(メタデータ) (2023-06-26T12:54:28Z) - Faculty Distillation with Optimal Transport [53.69235109551099]
本稿では,教師の課題と生徒の課題を最適な輸送手段で結びつけることを提案する。
ラベル空間間の意味的関係に基づき、出力分布間の支持ギャップを埋めることができる。
各種条件下での実験は,提案手法の簡潔さと汎用性を示すものである。
論文 参考訳(メタデータ) (2022-04-25T09:34:37Z) - Reducing the Teacher-Student Gap via Spherical Knowledge Disitllation [67.75526580926149]
知識蒸留は、はるかに大きなものから写像関数を学習することにより、コンパクトで効果的なモデルを得ることを目的としている。
本研究では,教師と学生の信頼のギャップを調査し,容量ギャップ問題について検討する。
知識蒸留には信頼度は必要とせず,学生が自信を習得せざるを得ない場合には,学生のパフォーマンスを損なう可能性がある。
論文 参考訳(メタデータ) (2020-10-15T03:03:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。