論文の概要: REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2608.01784v1
- Date: Mon, 03 Aug 2026 06:59:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.363629
- Title: REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
- Title(参考訳): REFLEX:拡散言語モデルにおけるRefinement-Aware Compute AllocationとしてのMoE推論の再考
- Abstract要約: Mixture-of-experts (MoE)モデルはトークンごとに少数の専門家のみを活性化することでパラメータ容量を増加させる。
しかし、拡散言語モデル(DLMs)では、それぞれが高度に異なる洗練された要求にもかかわらず、全てのトークンの位置を共同で再定義する。
したがって、DLMにおけるMoE推論は、不均一なトークン精錬状態にまたがる洗練された計算割り当てと見なされるべきである。
- 参考スコア(独自算出の注目度): 15.630466998208261
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-experts (MoE) models increase parameter capacity by activating only a small subset of experts for each token. This conditional-computation paradigm has enabled autoregressive language models to scale model capacity without a proportional increase in per-token computation. In diffusion language models (DLMs), however, each denoising forward jointly revisits all token positions despite their sharply different refinement demands, while the default fixed token-choice routing assigns them a uniform expert budget, creating a mismatch between expert computation and refinement demand. We argue that MoE inference in DLMs should therefore be viewed as refinement-aware compute allocation across heterogeneous token refinement states. We propose REFLEX (\textbf{RE}finement-aware \textbf{FLEX}ible expert allocation), a training-free method that keeps the default router unchanged while reorganizing expert computation around the evolving refinement process. Specifically, REFLEX introduces a coarse-to-fine hierarchy for expert-budget allocation that aligns computation with block-relative refinement roles while using the Frontier-Progress Score to resolve active-block priorities. Across multiple widely used benchmarks on two representative MoE-based DLMs, LLaDA-MoE and LLaDA2.0-mini, REFLEX reduces allocated expert computation by 15\% on average while preserving or even improving generation quality on most benchmarks relative to default routing. Compared with autoregressive-style variable-expert routing methods, REFLEX also yields a more consistent quality--computation trade-off, further supporting the importance of allocating expert computation according to the heterogeneous refinement demands exposed within each denoising forward.
- Abstract(参考訳): Mixture-of-experts (MoE)モデルはトークンごとに少数の専門家のみを活性化することでパラメータ容量を増加させる。
この条件計算パラダイムにより、自動回帰言語モデルでは、トーケン毎の計算量が比例的に増加することなく、モデルのキャパシティを拡張できるようになった。
しかし、拡散言語モデル(DLMs)では、それぞれが高度に異なる洗練された要求にもかかわらず、全てのトークンの位置を共同で修正する一方、デフォルトの固定されたトークン選択ルーティングは、専門家の予算を均一に割り当て、専門家の計算と洗練された要求のミスマッチを生成する。
したがって、DLMにおけるMoE推論は、不均一なトークン精錬状態にまたがる洗練された計算割り当てと見なされるべきである。
進化する精錬プロセスのエキスパート計算を再編成しながら、デフォルトルータを一定に保ちながらトレーニング不要なREFLEX(\textbf{RE}finement-aware \textbf{FLEX}ible expert allocation)を提案する。
具体的には、REFLEXは、Frontier-Progress Scoreを使用して、計算をブロック相対的な洗練された役割と整合させ、アクティブブロックの優先順位を解決する、エキスパート予算割り当てのための粗い階層を導入している。
代表的なMoEベースのDLMであるLLaDA-MoEとLLaDA2.0-miniのベンチマークでは、REFLEXは割り当てられた専門家の計算を平均15倍に削減し、デフォルトのルーティングと比較してほとんどのベンチマークで生成品質を維持または改善している。
自己回帰型変数エキスパートルーティング法と比較すると、REFLEXはより一貫した品質-計算のトレードオフをもたらす。
関連論文リスト
- Distribution-Consistent Inference for Dynamic Sparse Mixture-of-Experts [48.294824672909876]
推論時動的top-k$ルーティングは、再トレーニングせずに計算を削減できる。
アクティベートした専門家の数を減らせば、SMoE出力のRMSスケールと分散が一貫して増加することを示す。
そこで我々は,レイヤワイズ・キャリブレーションの統計値を用いて,最小構成の縮小表現を整列する軽量な推論時間補正法であるレイヤワイズ・アライメント・アライメント(LDA)を提案する。
論文 参考訳(メタデータ) (2026-09-08T06:23:07Z) - SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs [10.607329413550223]
離散的ルーティングをトラッピングしたソフトトップ-k$LapSum緩和に置き換えるSoftMoEを提案する。
さらに、各レイヤごとのアクティブエキスパートの平均数をパラメータ化し、グローバルな予算制約を課します。
SoftMoEは、自動回帰モデリングと、言語モデリングとダウンストリームタスクのスパースMoEに匹敵するパフォーマンスと完全に互換性がある。
論文 参考訳(メタデータ) (2026-06-16T14:05:41Z) - Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models [50.34585122347149]
これは連続的なトランスフォーマー層にまたがるエキスパートパラメータを共有するアーキテクチャ修正である。
我々は、OLMoE、Qwen3、DeepSeekスタイルのMoEなど、一般的な最先端アーキテクチャにおけるこのアプローチを評価した。
論文 参考訳(メタデータ) (2026-06-15T15:08:09Z) - Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models [6.871645384293096]
Mixture-of-Experts (MoE)モデルは、トークンごとに専門家のサブセットだけを活性化することで、ファンデーションモデルを効率的にスケールする。
MoEモデルはルーティングの不安定性に敏感で、小さな量子化によって引き起こされる摂動は、トップ$kのエキスパート選択を変えることができる。
我々は、量子化の下でのエキスパート選択行動を維持するために、量子化のための値と構造のルーティングアライメント(VSRAQ)を提案する。
論文 参考訳(メタデータ) (2026-06-04T04:13:05Z) - DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts [56.175408382091796]
本研究では, 標準重み付け集約を構造集約に置き換えることにより, 専門家やルータを変更することなく, 専門家合成空間を拡大することを示す。
DAG-MoEは軽量モジュールを用いて,選択した専門家の最適な集約構造を自動的に学習するスパースMoEフレームワークである。
論文 参考訳(メタデータ) (2026-05-31T07:08:16Z) - UB-SMoE: Universally Balanced Sparse Mixture-of-Experts for Resource-adaptive Federated Fine-tuning of Foundation Models [2.3099144596725565]
エキスパート利用の不均衡とTop-Kルーティング問題に対処するために,Universally Balanced Sparse Mixture-of-Experts (UB-SMoE)を提案する。
UB-SMoEは、低リソースクライアントの計算コストを最大45.0%削減し、既存のヘテロジニアスなLoRA-rank手法に比べて8.7倍の性能向上を実現している。
論文 参考訳(メタデータ) (2026-05-15T23:06:59Z) - Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts [27.40662720929157]
Mixture-of-Experts (MoE) は大規模言語モデルをスケールするための主要なアーキテクチャとなっている。
本稿では,専門家数を増やすことで,MoE容量を段階的に拡大する専門家アップサイクリングを提案する。
筆者らの7B-13B総合パラメータ実験では,GPU時間の32%を節約しながら,検証損失の固定サイズベースラインと一致した。
論文 参考訳(メタデータ) (2026-04-21T05:53:33Z) - Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models [11.628969213956502]
専門家選択ルーティングはトークン選択ルーティングよりも拡散言語モデルに適していることを示す。
我々は、時間に依存した専門家の能力を導入します。
DLM MoEモデルでは,ECルーティングが優れたパラダイムとして確立されている。
論文 参考訳(メタデータ) (2026-04-02T05:01:36Z) - A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs [64.8510381475827]
SMOE(Sparse Mixture-of-Experts)アーキテクチャは、大規模言語モデルを効率的にスケールするためにますます使われている。
SMoEモデルは専門家間で厳しい負荷不均衡に悩まされることが多く、専門家のごく一部がほとんどのトークンを受け取り、他のモデルは未利用である。
推定中のエキスパートルーティングの体系的解析を行い, (i) 負荷不均衡が持続し, バッチサイズが大きくなる, (ii) 選択頻度が, 専門家の重要度を確実に反映しない, (iii) 専門家の全体負荷と重要性を, キャリブレーションセットを用いて推定できる,という3つの知見を同定する。
論文 参考訳(メタデータ) (2026-02-23T15:11:16Z) - DSMoE: Matrix-Partitioned Experts with Dynamic Routing for Computation-Efficient Dense LLMs [86.76714527437383]
本稿では,事前学習したFFN層を計算ブロックに分割することで,分散化を実現するDSMoEを提案する。
我々は,Sigmoid アクティベーションとストレートスルー推定器を用いた適応型エキスパートルーティングを実装し,トークンがモデル知識の様々な側面に柔軟にアクセスできるようにする。
LLaMAモデルを用いた実験により、DSMoEは既存のプルーニング法やMoE法に比べて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-02-18T02:37:26Z) - FactorLLM: Factorizing Knowledge via Mixture of Experts for Large Language Models [50.331708897857574]
本稿では,高度に訓練された高密度FFNを余分なサブネットワークに分解する新しいアプローチであるFacterLLMを紹介する。
FactorLLMは、最大85%のモデル性能を確保しながら、推論速度を30%以上増加させながら、ソースモデルに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-08-15T16:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。