論文の概要: LiteVAE: Lightweight and Efficient Variational Autoencoders for Latent Diffusion Models
- arxiv url: http://arxiv.org/abs/2405.14477v1
- Date: Thu, 23 May 2024 12:06:00 GMT
- ステータス: 処理完了
- システム内更新日: 2024-05-24 15:24:46.848064
- Title: LiteVAE: Lightweight and Efficient Variational Autoencoders for Latent Diffusion Models
- Title(参考訳): LiteVAE:潜在拡散モデルのための軽量かつ効率的な変分オートエンコーダ
- Authors: Seyedmorteza Sadat, Jakob Buhmann, Derek Bradley, Otmar Hilliges, Romann M. Weber,
- Abstract要約: LiteVAEは、潜在拡散モデル(LDM)のためのオートエンコーダのファミリーである
我々のモデルは、現在のLCDにおける確立されたVAEの品質と、エンコーダパラメータの6倍の削減とを一致させる。
私たちのより大きなモデルは、評価されたすべてのメトリクスで、同等の複雑さのVAEよりも優れています。
- 参考スコア(独自算出の注目度): 27.795088366122297
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Advances in latent diffusion models (LDMs) have revolutionized high-resolution image generation, but the design space of the autoencoder that is central to these systems remains underexplored. In this paper, we introduce LiteVAE, a family of autoencoders for LDMs that leverage the 2D discrete wavelet transform to enhance scalability and computational efficiency over standard variational autoencoders (VAEs) with no sacrifice in output quality. We also investigate the training methodologies and the decoder architecture of LiteVAE and propose several enhancements that improve the training dynamics and reconstruction quality. Our base LiteVAE model matches the quality of the established VAEs in current LDMs with a six-fold reduction in encoder parameters, leading to faster training and lower GPU memory requirements, while our larger model outperforms VAEs of comparable complexity across all evaluated metrics (rFID, LPIPS, PSNR, and SSIM).
- Abstract(参考訳): 遅延拡散モデル(LDMs)の進歩は高解像度画像生成に革命をもたらしたが、これらのシステムの中心となるオートエンコーダの設計空間はいまだ探索されていない。
本稿では,2次元離散ウェーブレット変換を利用して,出力品質を犠牲にすることなく,標準変分オートエンコーダ(VAE)のスケーラビリティと計算効率を向上させるLCM用オートエンコーダのファミリーであるLiteVAEを紹介する。
また、LiteVAEのトレーニング手法とデコーダアーキテクチャについても検討し、トレーニングのダイナミクスと再構築品質を改善するためのいくつかの拡張を提案する。
我々のベースとなるLiteVAEモデルは、現在のLCDにおける確立されたVAEの品質と、6倍のエンコーダパラメータの削減により、高速なトレーニングとGPUメモリ要求の低減を実現しています。
関連論文リスト
- PassionSR: Post-Training Quantization with Adaptive Scale in One-Step Diffusion based Image Super-Resolution [87.89013794655207]
拡散に基づく画像超解像(SR)モデルでは、複数のデノナイジングステップのコストで優れた性能を示す。
本稿では,一段階拡散(OSD)画像SR,PassionSRにおける適応スケールの学習後量子化手法を提案する。
我々のPassionSRは、画像SRの最近の先進的な低ビット量子化法に対して大きな利点がある。
論文 参考訳(メタデータ) (2024-11-26T04:49:42Z) - Boosting Latent Diffusion with Perceptual Objectives [29.107038084215514]
遅延拡散モデル (LDMs) パワー・オブ・ザ・アート高分解能画像モデル。
我々は,遅延知覚損失(LPL)を定義するためにデコーダの内部的特徴を活用することを提案する。
この損失により、モデルはよりシャープでリアルなイメージを作成することができる。
論文 参考訳(メタデータ) (2024-11-06T16:28:21Z) - ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation [83.62931466231898]
本稿では,長期ビデオ生成のための自己回帰モデルを用いた拡散変換器を高速化するフレームワークARLONを提案する。
潜在ベクトル量子変分オートコーダ(VQ-VAE)は、DiTモデルの入力潜時空間をコンパクトなビジュアルトークンに圧縮する。
適応ノルムベースのセマンティックインジェクションモジュールは、ARモデルから粗い離散視覚ユニットをDiTモデルに統合する。
論文 参考訳(メタデータ) (2024-10-27T16:28:28Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Deep Autoencoder with SVD-Like Convergence and Flat Minima [1.0742675209112622]
我々は,コルモゴロフ障壁を克服するために,学習可能な重み付きハイブリッドオートエンコーダを提案する。
トレーニングされたモデルは、他のモデルに比べて何千倍もシャープさが小さいことを実証的に見出した。
論文 参考訳(メタデータ) (2024-10-23T00:04:26Z) - Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis [62.06970466554273]
SDXLのような最先端拡散モデルに匹敵するレベルまで、非自己回帰マスク型画像モデリング(MIM)のテキスト・ツー・イメージが増大するMeissonicを提案する。
高品質なトレーニングデータを活用し、人間の嗜好スコアから得られるマイクロ条件を統合し、特徴圧縮層を用いて画像の忠実度と解像度をさらに向上する。
我々のモデルは、高画質の高精細画像を生成する際に、SDXLのような既存のモデルに適合するだけでなく、しばしば性能を上回ります。
論文 参考訳(メタデータ) (2024-10-10T17:59:17Z) - LinFusion: 1 GPU, 1 Minute, 16K Image [71.44735417472043]
我々は,広く普及している線形トークンミキサーの低ランク近似を導入する。
蒸留したLinFusionは,元のSDと同等以上の性能を示す。
SD-v1.5、SD-v2.1、SD-XLの実験は、LinFusionが良好なゼロショットクロスレゾリューション生成を可能にすることを示した。
論文 参考訳(メタデータ) (2024-09-03T17:54:39Z) - Attentive VQ-VAE [0.0]
本稿では,残像エンコーダと残像アテンション層(AREN)を統合することで,VQ-VAEモデルの能力を高める新しいアプローチを提案する。
ARENは複数のレベルで効果的に動作し、多様なアーキテクチャの複雑さを収容するように設計されている。
論文 参考訳(メタデータ) (2023-09-20T21:11:36Z) - Complexity Matters: Rethinking the Latent Space for Generative Modeling [65.64763873078114]
生成的モデリングにおいて、多くの成功したアプローチは、例えば安定拡散のような低次元の潜在空間を利用する。
本研究では, モデル複雑性の観点から潜在空間を再考することにより, 未探索の話題に光を当てることを目的としている。
論文 参考訳(メタデータ) (2023-07-17T07:12:29Z) - Algorithm and Hardware Co-Design of Energy-Efficient LSTM Networks for
Video Recognition with Hierarchical Tucker Tensor Decomposition [22.502146009817416]
長期記憶(Long Short-term memory、LSTM)は、シーケンス解析やモデリングアプリケーションで広く使われている強力なディープニューラルネットワークである。
本稿では,高性能エネルギー効率LSTMネットワークに向けたアルゴリズムとハードウェアの共同設計を提案する。
論文 参考訳(メタデータ) (2022-12-05T05:51:56Z) - An Efficient Deep Learning Model for Automatic Modulation Recognition
Based on Parameter Estimation and Transformation [3.3941243094128035]
本稿では,位相パラメータ推定と変換に基づく効率的なDL-AMRモデルを提案する。
我々のモデルは、類似の認識精度を持つベンチマークモデルよりも、トレーニング時間とテスト時間で競争力がある。
論文 参考訳(メタデータ) (2021-10-11T03:28:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。