論文の概要: Post-Training Pruning for Diffusion Transformers
- arxiv url: http://arxiv.org/abs/2607.00927v1
- Date: Wed, 01 Jul 2026 13:30:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.90223
- Title: Post-Training Pruning for Diffusion Transformers
- Title(参考訳): 拡散変圧器の後処理
- Authors: Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu,
- Abstract要約: 拡散変換器(DiT)は、画像生成において顕著な性能を示したが、かなりの計算オーバーヘッドとリソース消費に悩まされている。
伝統的なプルーニング法は、サリエンシ計量における重量の相対的な寄与を増幅する。
本研究では、カスタマイズされたサリエンシ基準を導入し、粒度を刻むことにより、プルーニング性能を向上させるDiTプルーニングを提案する。
- 参考スコア(独自算出の注目度): 23.732968732627825
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion Transformers (DiTs) have demonstrated impressive performance in image generation but suffer from substantial computational overhead and resource consumption. Post-training pruning offers a promising solution; however, due to DiTs' unique architectural design and parameter distribution, traditional pruning methods are inapplicable, leading to significant performance degradation. Specifically, prior methods developed for LLMs, which derive metrics through a series of approximations, amplify the relative contribution of weights in the saliency metric. In addition, weights in DiTs exhibit significantly larger magnitudes than those in LLMs. Moreover, existing pruning granularity overlooks variations in model structures. In this paper, we propose DiT-Pruning, which improves pruning performance by introducing customized saliency criteria and pruning granularity. We design a novel metric that balances the contributions of weights and activations from an energy-based perspective, enabling more effective identification of important elements. Furthermore, we observe distinct clustering patterns in the two-dimensional weight space. Accordingly, we adopt a clustering-aware pruning granularity, enabling effective sparse allocation. Extensive evaluations on various DiTs show that our method consistently preserves image quality, especially under high sparsity. For FLUX.1-dev at 512x512 resolution on MJHQ, DiT-Pruning achieves only a 0.001 loss in CLIP score at 50% sparsity, dramatically outperforming recent pruning methods.
- Abstract(参考訳): 拡散変換器(DiT)は、画像生成において顕著な性能を示したが、かなりの計算オーバーヘッドとリソース消費に悩まされている。
ポストトレーニングプルーニングは有望な解決策を提供するが、DiTsのユニークなアーキテクチャ設計とパラメータ分布のため、従来のプルーニング手法は適用できないため、性能が著しく低下する。
具体的には、一連の近似を通してメトリクスを導出するLCM向けに開発された先行手法は、サリエンシ計量における重量の相対的寄与を増幅する。
さらに、DiTsの重量はLLMよりもかなり大きい。
さらに、既存のプルーニングの粒度はモデル構造のバリエーションを見落としている。
本稿では、カスタマイズされたサリエンシ基準を導入し、粒度を刻むことにより、プルーニング性能を向上させるDiTプルーニングを提案する。
我々は、エネルギーベースの観点から重量と活性化の寄与のバランスを保ち、重要な要素のより効果的な同定を可能にする新しい計量を設計する。
さらに,2次元の重み空間における異なるクラスタリングパターンを観察する。
したがって、クラスタリング対応のプルーニング粒度を採用し、効率的なスパースアロケーションを可能にする。
各種DiTの広範囲な評価から, 画像品質, 特に高空間下では, 常に画像品質を保ち続けることが示唆された。
MJHQの512x512解像度のFLUX.1-devでは、DiT-PruningはCLIPスコアを50%の間隔で0.001の損失しか得られず、最近のプルーニング法よりも劇的に向上している。
関連論文リスト
- RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models [5.786869511584382]
重みよりもN:M半構造スペーサー化に対して,DiTの活性化は本質的に疎く,より頑健であることを示す。
アクティベーションにN:Mスペーシフィケーションを適用したRT-Lynxを提案する。
論文 参考訳(メタデータ) (2026-05-26T07:09:49Z) - Sparsity Induction for Accurate Post-Training Pruning of Large Language Models [23.002927923453118]
PTS(Post-training Sparsity)は、高密度ネットワークから重みを取り除き、モデルコストを削減する。
しかし、原生の密度の強い行列は疎度を欠いているため、重量を直接除去する既存のアプローチはモデル状態を破壊している。
刈り込み前の分布レベルと特徴レベルの両方において,より高い疎度に向けてモデルを促進するスペーサ性誘導法を提案する。
論文 参考訳(メタデータ) (2026-02-25T07:25:01Z) - Towards Extreme Pruning of LLMs with Plug-and-Play Mixed Sparsity [32.668409666483626]
既存のプルーニング手法は主に、プルーニングをガイドするネットワークコンポーネントの重要性を測定するためにメトリクスを設計することに焦点を当てている。
本稿では,FIM(Fiher Information Matrix)のトレースに基づく効率的な手法を提案する。
そこで本研究では,異なる層に対する最適スパシティレベルを決定するために,プルーニング指向の進化的アルゴリズム(EA)を用いたMixed Sparsity Pruning (MSP)を提案する。
論文 参考訳(メタデータ) (2025-03-14T08:05:49Z) - RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models [53.571195477043496]
本稿では,RoSTE (Rotated Straight-Through-Estimator) というアルゴリズムを提案する。
RoSTEは、量子化を意識した微調整(QA-SFT)と適応的な回転戦略を組み合わせることで、アクティベーションアウトリーを減少させる。
その結果, 予測誤差は収束重みの量子化誤差と直接比例し, 最適化された回転構成により効果的に管理できることが判明した。
論文 参考訳(メタデータ) (2025-02-13T06:44:33Z) - Search for Efficient Large Language Models [52.98684997131108]
大規模言語モデル(LLMs)は、人工知能研究の領域で長い間停滞してきた。
軽量プルーニング、量子化、蒸留がLLMの圧縮に取り入れられ、メモリの削減と推論の加速を狙った。
ほとんどのモデル圧縮技術は、最適アーキテクチャの探索を見越して重量最適化に重点を置いている。
論文 参考訳(メタデータ) (2024-09-25T21:32:12Z) - SPP: Sparsity-Preserved Parameter-Efficient Fine-Tuning for Large Language Models [53.638791265113625]
空間保存型大規模言語モデルのための効率的な微調整法
コードはhttps://github.com/Lucky-Lance/SPP.comで公開される。
論文 参考訳(メタデータ) (2024-05-25T04:55:27Z) - Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models [30.246821533532017]
数十億のパラメータを持つ大規模言語モデル(LLM)は、ネットワークプルーニングの主要なターゲットであり、性能を損なうことなくモデルの重みを取り除く。
グラディエントベース言語モデルプルーナー (GBLM-Pruner) と呼ばれる, プレトレーニング済みLLMに対する新しいスペーサ中心プルーニング法を提案する。
論文 参考訳(メタデータ) (2023-11-08T18:59:54Z) - LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning [56.88751562302793]
低ランク適応 (LoRA) が大型言語モデル (LLM) に登場した。
LoRAPruneは、高度にメモリ効率の良い正確な構造化プルーンドモデルを提供する新しいフレームワークである。
LoRAPruneはWikiText2では4.81、TBでは3.46、メモリ使用量は52.6%減少している。
論文 参考訳(メタデータ) (2023-05-28T15:15:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。