論文の概要: cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs
- arxiv url: http://arxiv.org/abs/2607.22577v1
- Date: Sat, 06 Jun 2026 13:51:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.974854
- Title: cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs
- Title(参考訳): cMoLLMのスケール:LLMの水平スケーリング法則
- Abstract要約: cMoLLMは、完全に微分可能な動的畳み込みを通じて、エンドツーエンドのストリームをルーティングする、畳み込みでゲートされたLLMの混合である。
FineWebでトレーニングされたGPT-2スタイルのモデルでは、cMoLLMは言語モデリングの難易度と下流GLUEとSQuADの精度を改善している。
- 参考スコア(独自算出の注目度): 3.50654760771471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling large language models (LLMs) has driven their success, yet dense Transformers couple capacity and computation: every parameter is activated for every token, making training and inference costs grow linearly with model size-a critical bottleneck as models approach trillion-parameter regimes. We aim to scale capacity through MoE-style mixture throughout the LLM pipeline rather than only the FFN. Prior pipeline-level approaches include ParaScale, which introduces virtual tokens and parallel streams but incurs substantial overhead and suffers from homogenized routing and gradient collapse, and AltUp, which uses an auxiliary prediction branch but offers limited adaptivity and slow convergence. We establish that MoE-style mixture layers can be reformulated as variable-kernel dynamic convolutions, where each expert corresponds to a $1{\times}1$ convolutional kernel and routing implements input-conditioned kernel aggregation. Building on this equivalence, we introduce cMoLLM: a convolutionally gated mixture-of-LLMs that routes over end-to-end streams through fully differentiable dynamic convolution. In GPT-2-style models trained on FineWeb, cMoLLM improves language modeling perplexity and downstream GLUE and SQuAD accuracy under matched compute, with better stream utilization, more stable optimization, and favorable scaling compared to ParaScale- and AltUp-style baselines.
- Abstract(参考訳): 大規模言語モデル(LLM)のスケーリングは成功を導いてきたが、密度の高いトランスフォーマーはキャパシティと計算を2つに分けている。
FFNのみでなく,LLMパイプライン全体のMoEスタイルの混合により容量を拡大することを目指している。
以前のパイプラインレベルのアプローチには、仮想トークンと並列ストリームを導入したが、かなりのオーバーヘッドが発生し、均質なルーティングと勾配崩壊に苦しむParaScaleや、補助的な予測ブランチを使用しているが、限定的な適応性と緩やかな収束を提供するAltUpなどがある。
我々は、MoE型混合層を可変カーネル動的畳み込みとして再構成できることを確立し、各専門家が1{\times}1$畳み込みカーネルに対応し、ルーティングが入力条件のカーネルアグリゲーションを実装している。
この等価性に基づいて、完全に微分可能な動的畳み込みを通してエンドツーエンドのストリームをルーティングする畳み込みゲート付きLLMであるcMoLLMを紹介する。
FineWebでトレーニングされたGPT-2スタイルのモデルでは、cMoLLMは、マッチした計算の下で言語モデリングの難易度と下流GLUEとSQuADの精度を改善し、ストリーム利用の改善、より安定した最適化、ParaScale-やAltUp-スタイルのベースラインよりも優れたスケーリングを実現している。
関連論文リスト
- Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors [110.10775872372047]
EmphMagnitude-Direction-Direction (MD) Decouplingを提案する。
これは、各重量をハイパースフィア上の固定ノルム方向に分解し、学習可能な1ローとカラムごとのマグニチュードゲインを、別々の学習速度で更新する。
アダムとムーンの双方で、MD Decouplingはよく調整されたベースラインを改善し、モデルの幅を調整せずに最適なLRを転送し、大規模なMixture-of-Expertsモデルのスケールに役立っている。
論文 参考訳(メタデータ) (2026-06-24T15:40:26Z) - Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers [42.7047638496247]
事前学習したトランスにLCCをベースとしたモデルマージを実現するための新しいフレームワークを提案する。
本手法は,パラメータ化機能保存変換を適切に適用し,両モデルが対応する解を共同で学習する2つの学習手順を導入する。
経験的に,本手法はWikiTextにおける中規模パラメータを持つ言語モデルに対するほぼゼロに近い損失障壁を示し,この規模でのニアバリアフリー線形接続の実証実験である。
論文 参考訳(メタデータ) (2026-06-22T17:08:28Z) - LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling [36.7482623230111]
スパースルーティングと反復重み付き計算を統合したループ型MoE言語モデルであるLoopMoEを提案する。
設計により、Vanilla MoEに対してループ式MoEを厳格に制御し、ヘッド・ツー・ヘッドで評価することができる。
論文 参考訳(メタデータ) (2026-06-03T04:38:12Z) - FLARE: Diffusion for Hybrid Language Model [72.60770374799634]
FLAREは、ハイブリッドアテンションな大規模言語モデルのための体系的な変換フレームワークである。
トークン平等なAR/拡散目標、ハードウェア対応カーネル、統一推論を組み合わせることで、ひとつのチェックポイントがARスタイルの検証された復号化と拡散スタイルの並列復号化の両方をサポートすることができる。
この結果から,実際のdLLMは復号化アルゴリズムだけでなく,データ品質や現在のブロック拡散目標のトレーニング非効率によって制限されていることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T06:58:15Z) - Generalization and Scaling Laws for Mixture-of-Experts Transformers [0.0]
我々は,Mixture-of-Experts (MoE) 変換器の一般化とスケーリングの理論を開発する。
本手法は, アクティブパラメータの予算で計量エントロピーがスケールする超ノルム被覆数界を導出し, MoE 固有のルーティングオーバヘッドを発生させる。
我々は,MoE アーキテクチャの構成的近似定理を証明し,近似構成の下では,アクティブキャパシティのスケーリングや専門家数の増加によって誤差が減少することを示した。
論文 参考訳(メタデータ) (2026-04-10T09:59:48Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations [55.047454145941366]
Streaming Mergingは、反復最適化プロセスとしてマージを概念化する革新的なモデル更新パラダイムである。
ARMは勾配勾配勾配のダイナミクスを近似するために設計された戦略である。
ARMは初期のSFTチェックポイントしか必要とせず、反復的なマージによって完全に収束したSFTモデルを上回る。
論文 参考訳(メタデータ) (2026-02-03T08:15:57Z) - WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving [9.719456684859606]
本稿では,VLAモデルであるWAM-Flowを紹介し,Ego-trajectory Planningをトークン空間上の離散フローマッチングとして利用する。
WAM-Flowは完全に並列で双方向のデノゲーションを実行し、調整可能な計算精度トレードオフによる粗い微細化を可能にする。
これらの結果は、エンド・ツー・エンド・エンドの自律運転に期待できる新しいパラダイムとして離散フローマッチングが確立される。
論文 参考訳(メタデータ) (2025-12-05T19:36:46Z) - DPWMixer: Dual-Path Wavelet Mixer for Long-Term Time Series Forecasting [6.01829429039985]
長期時系列予測は計算知能において重要な課題である。
本稿では,計算効率の良いDual-PathアーキテクチャDPWMixerを提案する。
8つの公開ベンチマーク実験により,本手法は最先端のベースラインよりも一貫した改善を達成できることが示された。
論文 参考訳(メタデータ) (2025-11-30T03:12:50Z) - SCHEME: Scalable Channel Mixer for Vision Transformers [52.605868919281086]
ビジョントランスフォーマーは多くの計算タスクで素晴らしいパフォーマンスを達成した。
密度の高い接続は、より大きな膨張比をサポートするスパースブロック対角構造に置き換えることができることを示す。
また、トレーニング中に並列分岐として、軽量でパラメータフリーなチャネル共分散アテンション機構を提案する。
論文 参考訳(メタデータ) (2023-12-01T08:22:34Z) - AMT: All-Pairs Multi-Field Transforms for Efficient Frame Interpolation [80.33846577924363]
ビデオフレームギスブのための新しいネットワークアーキテクチャであるAMT(All-Pairs Multi-Field Transforms)を提案する。
まず、すべての画素に対して双方向のボリュームを構築し、予測された両側フローを用いて相関関係を検索する。
第2に、入力フレーム上で逆向きのワープを行うために、一対の更新された粗い流れから細粒度の流れ場の複数のグループを導出する。
論文 参考訳(メタデータ) (2023-04-19T16:18:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。