論文の概要: MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2511.21089v1
- Date: Wed, 26 Nov 2025 06:14:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-27 18:37:58.986171
- Title: MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts
- Title(参考訳): MLPMoE:高密度LCM MLPのゼロショット構造変態
- Abstract要約: 大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are predominantly deployed as dense transformers, where every parameter in every feed-forward block is activated for every token. While architecturally simple, this is computationally inefficient, since inference costs scale linearly with parameter count. Recent upcycling methods such as MoEfication, CMoE, ToMoE, and MoORE reveal that much of the useful computation lives in sparse, semi-modular substructures inside dense feed-forward networks, but these approaches typically rely on clustering, activation profiling, singular value decomposition, or custom routing that requires calibration data. This paper introduces MLPMoE (MLP Mixture-of-Experts), a training-free, deterministic transformation that restructures the dense MLP in transformer blocks into a static, high-cardinality mixture of experts. The transformation uses simple tensor slicing and summation, reinterpreting the algebra of tensor parallelism as a topological conversion rather than a distributed training pattern. We further introduce Fractal Fade (differential branch sparsity) and Compensated Pruning (variance-preserving branch reduction) as lightweight mechanisms for structured sparsity. On Qwen2.5-0.5B-Instruct and DeepSeek-R1-Distill-Llama-8B, the zero-shot MLPMoE transform changes a proxy perplexity metric by less than 0.05 percent while keeping the parameter count effectively constant. On the 8B model, differential sparsity removes about 20 percent of MLP parameters while keeping perplexity within about 2 percent of the dense baseline. The method operates entirely post hoc on existing checkpoints and does not require gradients, calibration sets, or router training. Code is available at https://gist.github.com/iwallarm/fc2ef1eddf226ca7814f9e5e2ae9bad1
- Abstract(参考訳): 大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
推論コストはパラメータ数とともに線形にスケールするため、アーキテクチャ上は単純であるが、これは計算的に非効率である。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法では、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブストラクチャに有用な計算の大部分が存在しているが、これらのアプローチはクラスタリング、アクティベーションプロファイリング、特異値分解、キャリブレーションデータを必要とするカスタムルーティングに依存している。
本稿では,MLPMoE(MLP Mixture-of-Experts)について紹介する。
この変換は単純なテンソルスライシングと和を使い、テンソル並列性の代数を分散トレーニングパターンではなくトポロジカル変換として再解釈する。
さらに, Fractal Fade (差分枝幅) と Compensated Pruning (分散保存枝縮小) を, 構造的疎結合の軽量化機構として導入する。
Qwen2.5-0.5B-InstructとDeepSeek-R1-Distill-Llama-8Bでは、ゼロショットMLPMoE変換は、パラメータカウントを効果的に一定に保ちながらプロキシパープレキシティメトリックを0.05パーセント以下に変化させる。
8Bモデルでは, MLPパラメータの約20%を除去し, 密度ベースラインの約2%にパープレキシティを保持する。
この方法は既存のチェックポイントで完全にポストホックで動作し、勾配、校正セット、ルータのトレーニングを必要としない。
コードはhttps://gist.github.com/iwallarm/fc2ef1eddf226ca7814f9e5e5e9bad1で公開されている。
関連論文リスト
- Dense Structural Compression of Transformers via Gauge-Correct Channel Removal [11.681900731333926]
トークン当たりの推論エネルギーは、デプロイされたトランスフォーマーのコストと炭素フットプリントを駆動する。
我々は,単位計算当たりの実用性を最大化するために,訓練中に構造的複雑性を適応させる手法を開発した。
チャネルペナルティはテンソルスライス全体をゼロにし、密度とネットワーク機能を保ちながら物理的除去を可能にする。
論文 参考訳(メタデータ) (2026-09-07T09:20:59Z) - Low-Rank Ternary Adaptation for Fine-Tuning Transformers [54.3230438745856]
3次変換器は、極端なメモリと計算効率を提供する。
既存のロービットのLoRAベースの手法では、3次重みを直接微調整することはできない。
3次重みの離散的な更新を表す3次乗法適応を提案する。
論文 参考訳(メタデータ) (2026-08-25T12:15:56Z) - Sparse Weight Decomposition for Efficient Circuit Extraction [36.87892448834478]
複雑な事前訓練された変換器は、回路抽出のための解釈可能なユニットを自然に公開しない。
本稿では,各重み行列を2つのスパース因子に分解することで,事前学習した射影を分解するスパース重み分解法を提案する。
SWDは,非ゼロ因子値の微調整後,すべての注意および重み行列のフルモデル置換に有効であることを示す。
論文 参考訳(メタデータ) (2026-08-04T16:40:48Z) - cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs [3.50654760771471]
cMoLLMは、完全に微分可能な動的畳み込みを通じて、エンドツーエンドのストリームをルーティングする、畳み込みでゲートされたLLMの混合である。
FineWebでトレーニングされたGPT-2スタイルのモデルでは、cMoLLMは言語モデリングの難易度と下流GLUEとSQuADの精度を改善している。
論文 参考訳(メタデータ) (2026-06-06T13:51:15Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - A general tensor-structured compression scheme for efficient large language models [8.85443988406591]
対象とする密度線形層をテンソル作用素の実行可能な混合に置き換える一般的なテンソル構造圧縮スキームを提案する。
MixTはTransformerベースの大規模言語モデル(LLM)や他の高密度ニューラルネットワークにも適用可能である。
LLaMA2-7B遷移境界において、MixTはフルモデルパラメータを47.5%、推論FLOPを37.1%、FLOPを52.1%、ピーク推論メモリを60.4%削減する。
論文 参考訳(メタデータ) (2026-05-25T02:00:41Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts [71.91042186338163]
ALoREは、Kroneckerによって構築された超複素パラメータ化空間をAggregate Low Rank Expertsに再利用する新しいPETL法である。
巧妙な設計のおかげで、ALoREは無視できる余分なパラメータを保持し、凍ったバックボーンに強制的にマージできる。
論文 参考訳(メタデータ) (2024-12-11T12:31:30Z) - ADMM Based Semi-Structured Pattern Pruning Framework For Transformer [4.02487511510606]
本稿では,アクティベーションマップの分布を再構成する,ADMM(Alternating Direction Method of Multipliers)に基づくパターン解析フレームワークを提案する。
GLUEデータセット上の分類タスクについて広範な実験を行った。
GLUEデータセットの総合スコア80.1を維持しながら圧縮率50%を達成した。
論文 参考訳(メタデータ) (2024-07-11T09:35:08Z) - SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models [63.118592279833656]
後学習量子化(PTQ)は,大規模言語モデル(LLM)の圧縮に有効な手法である
本稿では,SliM-LLMを提案する。SliM-LLMは,グループ単位でビット幅を割り当てるサリエンス駆動の混合精度量子化フレームワークである。
実験により、SliM-LLMは低ビット幅の様々なLLMにおいて優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-05-23T16:21:48Z) - SCHEME: Scalable Channel Mixer for Vision Transformers [52.605868919281086]
ビジョントランスフォーマーは多くの計算タスクで素晴らしいパフォーマンスを達成した。
密度の高い接続は、より大きな膨張比をサポートするスパースブロック対角構造に置き換えることができることを示す。
また、トレーニング中に並列分岐として、軽量でパラメータフリーなチャネル共分散アテンション機構を提案する。
論文 参考訳(メタデータ) (2023-12-01T08:22:34Z) - Federated Learning Using Variance Reduced Stochastic Gradient for
Probabilistically Activated Agents [0.0]
本稿では,各エージェントが各反復において任意の選択の確率を持つような最適解に対して,分散低減と高速収束率の両方を達成する2層構造を持つフェデレートラーニング(FL)のアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-10-25T22:04:49Z) - Efficient Language Modeling with Sparse all-MLP [53.81435968051093]
すべてのMLPは、言語モデリングにおいてTransformerと一致するが、下流タスクではまだ遅れている。
特徴量と入力量の両方でMoE(Mix-of-Experts)を混合したスパースオールMLPを提案する。
6つの下流タスクにおいて、ゼロショットのインコンテキスト学習性能を評価し、トランスフォーマーベースのMoEや高密度トランスフォーマーを上回る結果を得た。
論文 参考訳(メタデータ) (2022-03-14T04:32:19Z) - Exact Backpropagation in Binary Weighted Networks with Group Weight
Transformations [0.0]
量子化に基づくモデル圧縮は、推論のためのハイパフォーマンスで高速なアプローチとして機能する。
重みをバイナリ値に制限するモデルは、ユビキタスドット製品の効率的な実装を可能にします。
論文 参考訳(メタデータ) (2021-07-03T10:29:34Z) - Bayesian Transformer Language Models for Speech Recognition [59.235405107295655]
トランスフォーマーで表現される最先端のニューラルネットワークモデル(LM)は非常に複雑である。
本稿では,トランスフォーマーLM推定のためのベイズ学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-02-09T10:55:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。