論文の概要: Unveiling the Secret of AdaLN-Zero in Diffusion Transformer
- arxiv url: http://arxiv.org/abs/2608.09438v1
- Date: Mon, 10 Aug 2026 11:12:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.216046
- Title: Unveiling the Secret of AdaLN-Zero in Diffusion Transformer
- Title(参考訳): 拡散変圧器におけるAdaLN-Zeroの秘密の解明
- Authors: Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang,
- Abstract要約: DiT(Diffusion Transformer)は、画像生成のための急速に進化するアーキテクチャである。
adaLN-Zero, adaLN と比較して優れた性能を発揮する DiT の臨界条件付け機構について検討した。
我々はSE-adaLN-Zeroと呼ばれる改良されたコンディショニング機構を導入する。
- 参考スコア(独自算出の注目度): 54.52619563900124
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Diffusion transformer (DiT), a rapidly emerging architecture for image generation, has gained much attention. However, despite ongoing efforts to improve its performance, the understanding of DiT remains superficial. In this work, we delve into and investigate a critical conditioning mechanism within DiT, adaLN-Zero, which achieves superior performance compared to adaLN. Our work studies three potential elements driving this performance, including an SE-like structure, zero-initialization, and a "gradual" update order, among which zero-initialization is proved to be the most influential. Building on this understanding, we propose an analysis-guided initialization strategy, termed adaLN-Gaussian, which serves both as an empirical validation of our analysis and as a practical initialization method that consistently improves optimization efficiency. On the other hand, inspired by the SE-like structure, we introduce an improved conditioning mechanism called SE-adaLN-Zero. Extensive experiments following DiT on four datasets, especially on ImageNet1K demonstrate the effectiveness and generalization of adaLN-Gaussian and SE-adaLN-Zero. Beyond class-to-image generation, we also evaluate the generalization of the two improved methods on text-to-image generation.
- Abstract(参考訳): 画像生成のための急速に進化するアーキテクチャである拡散変換器 (DiT) が注目されている。
しかし、その性能を改善する努力が続いているにもかかわらず、DiTの理解はいまだ表面的である。
そこで本研究では,adaLN-Zero の臨界条件付け機構について検討し,adaLN と比較して優れた性能を示す。
本研究は,SEライクな構造,ゼロ初期化,段階的な更新順序を含む,この性能を駆動する3つの潜在的要素について検討する。
この理解に基づいて,分析誘導型初期化戦略であるadaLN-Gaussianを提案する。
一方,SE様構造に触発されて,SE-adaLN-Zeroと呼ばれる改良されたコンディショニング機構を導入する。
4つのデータセット、特にImageNet1K上のDiTに続く大規模な実験は、adaLN-GaussianとSE-adaLN-Zeroの有効性と一般化を実証している。
クラス・ツー・イメージ生成以外にも、テキスト・ツー・イメージ生成における2つの改善された手法の一般化も評価する。
関連論文リスト
- How Does Fourier Analysis Network Work? A Mechanism Analysis and a New Dual-Activation Layer Proposal [0.0]
以上の結果より,コサイン活性化は効果に有意な寄与を示す一方,コサイン活性化は有害である傾向が示唆された。
FANは、神経細胞が負の入力を一貫して受け取り、勾配をゼロにし、学習を停止する死のReLU問題を主に緩和する。
論文 参考訳(メタデータ) (2025-12-16T19:36:56Z) - Decoupled Global-Local Alignment for Improving Compositional Understanding [19.022748171561357]
コントラスト言語-画像事前学習(CLIP)は、画像とテキストのモダリティを調整することで、複数の下流タスクで成功している。
しかし、グローバルコントラスト学習の性質は、作曲概念を理解するCLIPの能力を制限している。
本稿では,デカップリング型グローバルローカルアライメント(DeGLA)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-23T15:20:53Z) - Efficient Diffusion as Low Light Enhancer [63.789138528062225]
RATR(Reflectance-Aware Trajectory Refinement)は、イメージの反射成分を用いて教師の軌跡を洗練するための、シンプルで効果的なモジュールである。
textbfReDDiT (textbfDistilled textbfTrajectory) は低照度画像強調(LLIE)に適した効率的で柔軟な蒸留フレームワークである。
論文 参考訳(メタデータ) (2024-10-16T08:07:18Z) - Non-asymptotic Convergence of Training Transformers for Next-token Prediction [48.9399496805422]
トランスフォーマーは、シーケンシャルなデータを扱う優れた能力のために、現代の機械学習において驚くべき成功を収めています。
本稿では, 単層変圧器のトレーニング力学の微細な非漸近解析を行う。
トレーニングされたトランスフォーマーは,データセットシフトによる非トーケン予測能力を示すことを示す。
論文 参考訳(メタデータ) (2024-09-25T20:22:06Z) - Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization [77.62516752323207]
そこで本研究では,事前訓練した重みを効率よく微調整する直交微調整法を導入し,頑健さと一般化の強化を実現した。
自己正規化戦略は、OrthSRと呼ばれるVLMのゼロショット一般化の観点から安定性を維持するためにさらに活用される。
筆者らはCLIPとCoOpを再検討し,少数の画像のクラスフィシエーションシナリオにおけるモデルの改善を効果的に行う。
論文 参考訳(メタデータ) (2024-07-11T10:35:53Z) - DiffSCI: Zero-Shot Snapshot Compressive Imaging via Iterative Spectral
Diffusion Model [18.25548360119976]
マルチスペクトル画像(MSI)におけるスナップショット圧縮画像(SCI)再構成の精度向上を目指した。
DiffSCIと呼ばれる新しいゼロショット拡散モデルを提案する。
我々は,DiffSCIが自己監督的,ゼロショット的アプローチよりも顕著な性能向上を示すことを示すため,広範囲な試験を行った。
論文 参考訳(メタデータ) (2023-11-19T20:27:14Z) - Toward Fast, Flexible, and Robust Low-Light Image Enhancement [87.27326390675155]
我々は、現実の低照度シナリオにおいて、高速でフレキシブルで頑健な鮮明化のための新しい自己校正イルミネーション(SCI)学習フレームワークを開発した。
カスケードパターンの計算負担を考慮すると、各ステージの結果の収束を実現する自己校正モジュールを構築する。
我々は,SCI固有の特性について,操作不感適応性やモデル非関係の一般性を含む包括的探索を行う。
論文 参考訳(メタデータ) (2022-04-21T14:40:32Z) - Iterative Network for Image Super-Resolution [69.07361550998318]
単一画像超解像(SISR)は、最近の畳み込みニューラルネットワーク(CNN)の発展により、大幅に活性化されている。
本稿では、従来のSISRアルゴリズムに関する新たな知見を提供し、反復最適化に依存するアプローチを提案する。
反復最適化の上に,新しい反復型超解像ネットワーク (ISRN) を提案する。
論文 参考訳(メタデータ) (2020-05-20T11:11:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。