論文の概要: Diffusable Latents from Structure-Agnostic Distillation
- arxiv url: http://arxiv.org/abs/2609.39657v1
- Date: Wed, 30 Sep 2026 12:58:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.7993
- Title: Diffusable Latents from Structure-Agnostic Distillation
- Title(参考訳): 構造非依存蒸留からの拡散性潜水剤
- Abstract要約: 事前学習された基礎モデルをオートエンコーダボトルネックに拡張することで、遅延拡散性が向上する。
標準蒸留は、潜水器を各位置に配置した教師の特徴に合わせ、潜水器のレイアウトを教師のものと結びつける。
この制約が不要であることを示し、教師の演奏に1つのプールされた画像レベル記述子を合わせるとともに、高密度な位置ワイド蒸留よりもわずかに優れていることを示す。
- 参考スコア(独自算出の注目度): 28.62241228231467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Distilling pretrained foundation models into an autoencoder bottleneck improves latent diffusability, enabling diffusion models to converge faster and reach higher sample quality. Standard distillation aligns the latent at each position to a co-located teacher feature, tying the latent layout to the teacher's. We show this constraint is unnecessary: aligning a single pooled image-level descriptor to the teacher's performs as well as or slightly better than dense position-wise distillation. We compare first-order and relational pooled objectives across latent shapes and teacher modalities. First-order matching extends naturally to 1D token-sequence latents and across modalities, where distilling a text encoder into an image autoencoder still improves diffusability; a relational objective based only on each image's nearest neighbours improves it as well. Code and blog post are available at https://github.com/AdrienRR/structure-agnostic-distillation and https://kyutai.org/blog/2026-09-28-structure-agnostic-distillation/.
- Abstract(参考訳): 事前学習された基礎モデルをオートエンコーダのボトルネックに拡張することで、遅延拡散性が向上し、拡散モデルがより早く収束し、より高いサンプル品質に達することができる。
標準蒸留は、潜水器を各位置に配置した教師の特徴に合わせ、潜水器のレイアウトを教師のものと結びつける。
プールされた画像レベルの記述子を教師の演奏に合わせるだけでなく、高密度の位置ワイド蒸留よりもわずかに優れている。
我々は,一階法とリレーショナルプールの目的を,潜在形と教師のモダリティで比較した。
画像オートエンコーダにテキストエンコーダを蒸留することで拡散性が向上し、各画像の最も近い隣人のみに基づく関係目的も改善される。
コードとブログ記事はhttps://github.com/AdrienRR/structure-agnostic-distillationとhttps://kyutai.org/blog/2026-09-28-structure-agnostic-distillation/で公開されている。
関連論文リスト
- Self-Corrected Image Generation with Explainable Latent Rewards [55.29175717238288]
我々は、説明可能なLatent RewarDを通じて生成をガイドする自己修正フレームワークであるxLARDを提案する。
xLARDは、モデル生成参照からの構造化されたフィードバックに基づいて遅延表現を洗練する軽量な修正器を導入している。
実験により、xLARDは、生成前の状態を維持しながら、意味的アライメントと視覚的忠実性を改善することが示された。
論文 参考訳(メタデータ) (2026-03-26T02:59:35Z) - End-to-End Training for Unified Tokenization and Latent Denoising [82.91537591286554]
統一トークン化と潜伏拡散のためのオートエンコーダアーキテクチャUNITEを提案する。
UNITEは、画像トークン化器と重量共有による潜伏ジェネレータの両方として機能するジェネレータで構成されている。
トークン化とスクラッチ生成の単一段階共同訓練が実現可能であることを示す。
論文 参考訳(メタデータ) (2026-03-23T17:59:49Z) - DistillLens: Symmetric Knowledge Distillation Through Logit Lens [6.545295906151773]
学生モデルと教師モデルの進化的思考過程を対称的に整列するフレームワークであるDistillLensを紹介する。
我々の分析は、この制約が両面の罰を課し、過信と過信の両方を防いでいることを証明している。
GPT-2 と Llama アーキテクチャの実験では、DistillLens が標準 KD を一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-02-14T03:01:12Z) - PRISM: Diversifying Dataset Distillation by Decoupling Architectural Priors [8.66115045973379]
PRISM (PRIors from various Source Models) は、合成中にアーキテクチャの先行を混乱させるフレームワークである。
ImageNet-1Kでは、PRISMは一貫して、再現的にシングルテラーメソッドより優れています。
論文 参考訳(メタデータ) (2025-11-13T03:06:14Z) - Score Distillation of Flow Matching Models [67.86066177182046]
我々は、Score Identity Distillation (SiD) を事前訓練されたテキスト対画像フローマッチングモデルに拡張する。
SiDは、データフリーとデータアシストの両方の設定で、これらのモデルですぐに使える。
これは、スコア蒸留がテキストと画像のフローマッチングモデルに広く適用されるという最初の体系的な証拠を提供する。
論文 参考訳(メタデータ) (2025-09-29T17:45:48Z) - Elucidating the Preconditioning in Consistency Distillation [25.213664260896103]
整合性ギャップに応じて事前条件を解析的に最適化する「textitAnalytic-Precond」を提案する。
そこで我々は,Analytic-Precondがトラジェクトリ・ジャンパーの学習を容易にし,生徒のトラジェクトリと教師のトラジェクトリのアライメントを高め,一貫性トラジェクトリモデルのトレーニングアクセラレーションを2倍から3倍に向上できることを実証した。
論文 参考訳(メタデータ) (2025-02-05T06:30:37Z) - Object-Centric Diffusion for Efficient Video Editing [64.71639719352636]
拡散ベースのビデオ編集は素晴らしい品質に達している。
このようなソリューションは通常、時間的に整合性のあるフレームを生成するために重いメモリと計算コストを発生させる。
品質を維持しつつ、大幅なスピードアップを可能にする修正を提案する。
論文 参考訳(メタデータ) (2024-01-11T08:36:15Z) - Improving Diffusion-Based Image Synthesis with Context Prediction [49.186366441954846]
既存の拡散モデルは、主に、劣化した画像から空間軸に沿って画素幅または特徴幅の制約で入力画像を再構成しようとする。
文脈予測を用いて拡散に基づく画像合成を改善するためのConPreDiffを提案する。
我々のConPreDiffは従来手法を一貫して上回り、ゼロショットFIDスコア6.21で、MS-COCO上で新たなSOTAテキスト・画像生成結果を達成する。
論文 参考訳(メタデータ) (2024-01-04T01:10:56Z) - Delta Distillation for Efficient Video Processing [68.81730245303591]
デルタ蒸留と呼ばれる新しい知識蒸留方式を提案する。
ビデオフレーム内の時間的冗長性により,これらの時間的変動を効果的に蒸留できることを実証した。
副産物として、デルタ蒸留は教師モデルの時間的一貫性を向上させる。
論文 参考訳(メタデータ) (2022-03-17T20:13:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。