論文の概要: MMOE: Modernizing Diffusion Transformers with Efficient Expert Design
- arxiv url: http://arxiv.org/abs/2607.24665v1
- Date: Mon, 27 Jul 2026 17:05:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.518504
- Title: MMOE: Modernizing Diffusion Transformers with Efficient Expert Design
- Title(参考訳): MMOE: 効率的なエキスパート設計による拡散変換器の近代化
- Authors: Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li,
- Abstract要約: 現代の大規模言語モデルは、キャパシティの増大と効率のペアリング、トーケン毎の維持、およびキャパシティの増大に伴うデプロイメントコストの制御によって、うまくスケールする。
近年の取り組みは, LLMのスケーリングを実践する効率メカニズムをインポートすることなく, 全パラメータ数と空間比を大きくした。
我々は、ルーティングされた専門家、共有および軽量の専門家、ゲート-残留ルーティング、AIGC生成へのアテンション-残留情報再利用に対応する、SiTスタイルの拡散変換器の近代化であるModernMOEを紹介する。
- 参考スコア(独自算出の注目度): 76.86793131833551
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern large language models scale successfully by pairing capacity growth with efficiency, keeping per-token and deployment costs under control as capacity grows. AIGC Foundation Models (AFMs), especially diffusion-transformer backbones, have begun to adopt sparse experts, but recent efforts mostly enlarge total parameter counts and sparsity ratios without importing the efficiency mechanisms that made LLM scaling practical, so generation quality is seldom balanced against training and deployment cost. This raises a natural question: can the architectural principles behind efficient LLM scaling be adapted to AFMs in a more balanced way? We introduce ModernMOE (MMOE), a modernization of SiT-style diffusion transformers that systematically adapts routed experts, shared and lightweight experts, gate-residual routing, and attention-residual information reuse to AIGC generation. Rather than treating MoE as a single plug-in replacement, MMOE studies how different modern expert components affect convergence, efficiency, and generation quality when composed inside a diffusion transformer. Every experiment in this paper is trained on a single eight-GPU H100 node with batch size 256 for 400k steps, an accessible single-machine budget. Under matched training and sampling protocols and at this budget, MMOE reaches lower FID at every recorded checkpoint, that is, it converges faster per training step, than dense and intermediate sparse-expert baselines, and among the sparse variants it attains the best quality-cost balance. Routing analysis further shows stable expert specialization across depth, substantial use of lightweight routes, and modest step-to-step routing changes during denoising. These results suggest that AFMs can follow the balanced scaling path of LLMs by importing proven efficiency designs, rather than by simply increasing total parameters and sparsity ratios.
- Abstract(参考訳): 現代の大規模言語モデルは、キャパシティの増大と効率のペアリング、トーケン毎の維持、およびキャパシティの増大に伴うデプロイメントコストの制御によって、うまくスケールする。
AIGCファウンデーションモデル(AFM)、特に拡散変圧器のバックボーンはスパースの専門家を採用し始めているが、近年の取り組みは、LLMのスケーリングを現実的にする効率メカニズムをインポートすることなく、総パラメータ数と空間比を拡大し、トレーニングやデプロイメントコストとはほとんどバランスが取れない。
効率的なLLMスケーリングの背景にあるアーキテクチャ原則は、よりバランスの取れた方法でAFMに適応できるか?
我々は,SiT方式の拡散変換器の近代化であるModernMOE(MMOE)を紹介した。これは,ルーティングされた専門家,共有および軽量の専門家,ゲート-残留ルーティング,AIGC生成への注目-残留情報再利用を体系的に適応させるものだ。
MMOEは、MoEを単一のプラグイン代替品として扱うのではなく、拡散変圧器内で構成する際の収束、効率、生成品質に、現代の異なる専門家コンポーネントがどのように影響するかを研究する。
本稿では,1つの8GPU H100ノードに対して,バッチサイズ256を400kステップでトレーニングする。
一致したトレーニングおよびサンプリングプロトコルの下で、この予算では、MMOEは記録されたチェックポイント毎の低いFID、すなわち、密度と中間のスパース-エキスパートベースラインよりもトレーニングステップあたりの収束が速く、また、スパース変種の中で最高の品質とコストのバランスに達する。
ルーティング分析はさらに、奥行きのエキスパートの専門化、軽量ルートの相当な利用、およびデノナイジング中の緩やかなステップ・ツー・ステップのルーティング変更を示す。
これらの結果から, AFMは総パラメータや空間比を単純に増やすのではなく, 実効性設計を輸入することで, LLMのバランスのとれたスケーリング経路を辿ることができることが示唆された。
関連論文リスト
- Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models [11.628969213956502]
専門家選択ルーティングはトークン選択ルーティングよりも拡散言語モデルに適していることを示す。
我々は、時間に依存した専門家の能力を導入します。
DLM MoEモデルでは,ECルーティングが優れたパラダイムとして確立されている。
論文 参考訳(メタデータ) (2026-04-02T05:01:36Z) - MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models [61.89384981175277]
ローランド適応 (LoRA) とミックスオブエキスパート (MoE) を統合するための固有テキストbfMixture-of-Adapters (MoA) アプローチを提案する。
実験結果から, 不均一なMoAは均一なMoE-LoRA法よりも性能およびパラメータ効率が優れていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T09:54:19Z) - Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design [59.00758127310582]
本稿では、事前学習された高密度LCMをより小さなMoEモデルに変換する新しいフレームワークRead-MEを提案する。
当社のアプローチでは,専門家の抽出にアクティベーション空間を用いる。
Read-MEは、同様のスケールの他の人気のあるオープンソース高密度モデルよりも優れています。
論文 参考訳(メタデータ) (2024-10-24T19:48:51Z) - Layerwise Recurrent Router for Mixture-of-Experts [42.36093735411238]
Mixture-of-Experts (MoE)アーキテクチャは、トレーニングコストを大幅に増加させることなく、モデルサイズをスケールできる能力で際立っている。
現在のMoEモデルはパラメータ非効率をしばしば表示する。
我々はMixture-of-Experts(RMoE)のためのLayerwise Recurrent Routerを紹介する。
論文 参考訳(メタデータ) (2024-08-13T10:25:13Z) - Taming Sparsely Activated Transformer with Stochastic Experts [76.0711573018493]
わずかに活性化されたモデル(SAM)は、計算コストを大幅に増加させることなく、非常に大量のパラメータを持つように容易にスケールすることができる。
本稿では,新しいエキスパートベースモデルTHOR(Transformer witH StOchastic ExpeRts)を提案する。
Switch Transformerのような古典的なエキスパートベースのモデルとは異なり、THORの専門家はトレーニングと推論の間、各入力に対してランダムにアクティベートされる。
論文 参考訳(メタデータ) (2021-10-08T17:15:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。