論文の概要: dMoE: dLLMs with Learnable Block Experts
- arxiv url: http://arxiv.org/abs/2605.30876v1
- Date: Fri, 29 May 2026 06:03:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.412182
- Title: dMoE: dLLMs with Learnable Block Experts
- Title(参考訳): dMoE: 学習可能なブロックエキスパートによるdLLM
- Abstract要約: 単純なブロックレベルのMoEフレームワークであるdMoEを提案する。
また,dMoEは,推論中に一意に活性化される専門家の数を著しく減少させることを示した。
また、メモリ使用量を76.64%から79.84%に減らし、1.14$times$から1.66$times$エンドツーエンドのレイテンシ高速化を実現している。
- 参考スコア(独自算出の注目度): 71.572316901001
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Large Language Models (dLLMs) have recently emerged as a promising alternative to autoregressive models, offering competitive performance while naturally supporting parallel decoding. However, as dLLMs are increasingly integrated with Mixture-of-Experts (MoE) architectures to scale model capacity, a fundamental mismatch arises between block parallel decoding and token-level expert selection. Specifically, each dLLM forward pass processes multiple tokens with bidirectional dependencies, whereas conventional MoE layers route each token independently. This mismatch substantially increases the number of uniquely activated experts, making inference increasingly memory-bound. To address this, we propose dMoE, a simple yet effective block-level MoE framework. The central idea of dMoE is to aggregate token-level expert distributions within each block into a unified block-level expert distribution, which is then used to guide expert routing in a more coherent manner. In this way, dMoE substantially reduces the number of uniquely activated experts during inference without sacrificing performance, thereby mitigating the memory-bound bottleneck. Extensive experiments across a variety of benchmarks demonstrate the effectiveness of dMoE. On average, dMoE reduces the number of uniquely activated experts from 69.5 to 14.6 while retaining 99.11% of the original performance. Meanwhile, it reduces memory usage by 76.64% to 79.84% and achieves 1.14$\times$ to 1.66$\times$ end-to-end latency speedup. Code is available at: https://github.com/fscdc/dMoE
- Abstract(参考訳): Diffusion Large Language Models (dLLMs)は、最近、自動回帰モデルに代わる有望な代替として登場し、並列デコーディングを自然にサポートしながら、競合するパフォーマンスを提供している。
しかし、モデルキャパシティをスケールするためにdLLMがMixture-of-Experts (MoE)アーキテクチャとますます統合されているため、ブロック並列復号とトークンレベルのエキスパートセレクションの根本的なミスマッチが発生する。
具体的には、各dLLMフォワードが双方向依存関係を持つ複数のトークンを処理するのに対して、従来のMoE層はそれぞれのトークンを独立してルーティングする。
このミスマッチは、ユニークなアクティベートされた専門家の数を大幅に増加させ、推論をメモリバウンドにする。
そこで我々は,シンプルなブロックレベルのMoEフレームワークであるdMoEを提案する。
dMoEの中心的な考え方は、各ブロック内のトークンレベルの専門家分布を統一されたブロックレベルの専門家分布に集約することで、専門家のルーティングをより一貫性のある方法でガイドするために使用される。
このようにして、dMoEは、パフォーマンスを犠牲にすることなく推論中にユニークなアクティベートされた専門家の数を大幅に減らし、メモリバウンドボトルネックを軽減します。
様々なベンチマークにわたる大規模な実験は、dMoEの有効性を実証している。
平均して、dMoEはアクティベートされた専門家の数を69.5から14.6に減らし、元のパフォーマンスの99.11%を維持している。
一方、メモリ使用量を76.64%から79.84%に減らし、1.14$\times$から1.66$\times$エンドツーエンドのレイテンシ高速化を実現している。
コードは、https://github.com/fscdc/dMoEで入手できる。
関連論文リスト
- SERE: Similarity-based Expert Re-routing for Efficient Batch Decoding in MoE Models [19.56443760368644]
類似性に基づくSERE(Expert Re-routing method for Efficient batch decoding in MoE model)を提案する。
SEREは、セカンダリエキスパートから最もよく似たプライマリエキスパートにトークンを再ルートすることで、アクティブエキスパートの数を動的に削減する。
SEREは、最小品質の損失で最大2.0倍のスピードアップを実現し、コスト効率とレイテンシに敏感な大規模なMoEデプロイメントのための実用的なソリューションを提供する。
論文 参考訳(メタデータ) (2026-02-07T16:51:16Z) - Dynamic Expert Sharing: Decoupling Memory from Parallelism in Mixture-of-Experts Diffusion LLMs [22.399470395813577]
Dynamic Expert Sharing (DES) は、MoE最適化をトークン中心のプルーニングからシーケンシャルレベルのコアセット選択に移行する新しいテクニックである。
DESは、独自の専門家アクティベーションを55%以上削減し、レイテンシを最大38%削減し、バニラ精度の99%を維持している。
論文 参考訳(メタデータ) (2026-01-31T20:01:47Z) - SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations [54.303301888915406]
混合エキスパートモデル(MoE)は、計算コストを大幅に増加させることなく、言語モデルをスケールアップするためのデファクトアーキテクチャとして登場した。
最小のアクティベーションキャッシングでMoEの前後パスを計算するメモリ効率のアルゴリズムを提案する。
また,グループ化されたGEMMカーネルのパディングによる無駄計算を最小限に抑える新しい「トークンラウンドリング」手法を提案する。
論文 参考訳(メタデータ) (2025-12-16T04:39:10Z) - MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping [52.02659589971978]
我々は,MoE MLLM推論を効果的かつ正確なものにするために,専門家を適応的にスキップする最初のトレーニングフリーフレームワークであるMoDESを提案する。
MoDESは推論速度を大幅に向上させ、プリフィルタイムを2.16$times$、デコードタイムを1.26$times$に改善する。
論文 参考訳(メタデータ) (2025-11-19T18:48:27Z) - PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference [17.441141633991197]
本稿では,2つの重要なイノベーションを通じて高精度かつ効率的な推論を実現する,トレーニング不要なMoE圧縮手法であるPuzzleMoEを紹介する。
第一に、PuzzleMoEは要素単位の重量冗長性と特殊化を識別してスパースエキスパートマージを行う。
第二に、バイナリマスクとサインの保存のオーバーヘッドを避けるために、PuzzleMoEは未使用の指数ビットを再利用するビットパック符号化方式を導入した。
論文 参考訳(メタデータ) (2025-11-06T20:53:02Z) - MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts [17.518573710849513]
MoBiLEは、プラグイン・アンド・プレイのオフロードベースのMoE推論フレームワークで、大手専門家のテキストミキサーを備えている。
MoBiLEは、コンシューマGPUシステムのベースラインと比較して1.60倍から1.72倍のスピードアップを実現し、精度の劣化は無視できる。
論文 参考訳(メタデータ) (2025-10-14T10:22:44Z) - ResMoE: Space-efficient Compression of Mixture of Experts LLMs via Residual Restoration [61.579842548990754]
複数現象言語モデルのバックボーンであるMixture-of-Experts (MoE) Transformerは、各入力トークンに対して少数のモデルパラメータのみをアクティベートすることで、空間性を利用する。
ResMoEは、Wasserstein Barycenterを利用した革新的なMoE近似フレームワークで、共通の専門家(バリセンターエキスパート)を抽出し、このバリセンターエキスパートと元の専門家の間の残差を近似する。
論文 参考訳(メタデータ) (2025-03-10T03:15:54Z) - MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Experts [63.67734699877724]
MoE++は、Feed-Forward Network(FFN)とゼロ計算の専門家を統合した、汎用的で異種なMoEフレームワークである。
MoE++は、1.1-2.1xのエキスパートの前方スループットを同じサイズのバニラのMoEモデルと比較すると、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2024-10-09T18:01:27Z) - Unchosen Experts Can Contribute Too: Unleashing MoE Models' Power by Self-Contrast [58.98411447739218]
Mixture-of-Experts (MoE) は、計算効率を保ちながら、モデルサイズをスケールするための顕著なアーキテクチャとして登場した。
本研究では,無声専門家を推論中に自己コントラスト的に活用する学習自由戦略である自己コントラスト混合(SCMoE)を提案する。
我々の手法は概念的には単純で計算量も軽量であり、グリージー復号法に比べて最小限の遅延を発生させる。
論文 参考訳(メタデータ) (2024-05-23T12:45:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。