論文の概要: Scaling Laws for Looped Mixture of Experts
- arxiv url: http://arxiv.org/abs/2609.40316v1
- Date: Wed, 30 Sep 2026 17:53:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.289448
- Title: Scaling Laws for Looped Mixture of Experts
- Title(参考訳): 専門家のループ混合のスケーリング法則
- Abstract要約: ループトランスとMixture-of-Experts (MoE)は、効率的なスケーリングのための補完ルートを提供する。
ループスケーリング法則(Loop Scaling Laws)は、モデルのサイズとデータとともに、繰り返しとスパーシを共同でモデル化する最初のスケーリング法則である。
- 参考スコア(独自算出の注目度): 30.777075170729983
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped transformers and Mixture-of-Experts (MoE) offer complementary routes to efficient scaling: recurrence increases computational depth at fixed parameters, while MoE sparsity expands total capacity at fixed active compute. Yet existing scaling laws model recurrence or sparsity in isolation. In this work, we introduce Loop Scaling Laws, the first scaling law to jointly model recurrence and sparsity alongside model size and data. At its core is a bounded, sparsity-conditional recurrence mapping that characterizes the effective-parameter gain from looping and how sparsity raises this gain. The laws predict the held-out loss of looped models more accurately than prior alternatives, and recover the standard dense and MoE scaling laws as special cases. Beyond prediction, the fitted laws provide a principled foundation for designing looped MoE models under compute and memory constraints. Downstream evaluations further demonstrate the complementary benefits of the two axes: sparsity delivers ~3x active-parameter efficiency, recurrence yields ~2x total-parameter efficiency on reasoning, and joint scaling further advances the performance frontier. As a practical extension, we show these gains hold at trillion-token scale: at matched training compute, a looped MoE with law-derived recurrence matches a ~2x larger non-looped MoE on the reasoning benchmarks, while enabling test-time scaling through recurrence.
- Abstract(参考訳): ループ変換器とMixture-of-Experts (MoE)は効率的なスケーリングのための補完ルートを提供する。
しかし、既存のスケーリング法則は、分離された繰り返しまたは疎結合をモデル化する。
本研究では,ループスケーリング法則を導入する。この法則は,モデルのサイズとデータとともに,再現性と空間性を共同でモデル化する最初のスケーリング法則である。
中心となるのは、ループによる有効パラメータゲインと、このゲインをいかにスパシティが引き起こすかを特徴付ける、境界付き、疎度条件付きリカレンスマッピングである。
これらの法則は、ループモデルが従来の法則よりも正確に失われることを予測し、標準密度およびMoEスケーリング法則を特別な場合として回復する。
予測以外にも、適合法則は、計算とメモリの制約の下でループ化されたMoEモデルを設計するための原則化された基礎を提供する。
下流評価は2つの軸の相補的な利点をさらに示している: スパーシティは ~3倍のアクティブパラメータ効率、再帰収率 ~2倍のトータルパラメータ効率を推理で示し、共同スケーリングはパフォーマンスフロンティアをさらに前進させる。
実際の拡張として、これらのゲインを1兆倍のスケールで保持することを示す: 一致したトレーニング計算では、法由来のリカレンスを持つループ型MoEが推論ベンチマークで約2倍大きな非ループ型MoEと一致し、リカレンスによるテストタイムスケーリングを可能にする。
関連論文リスト
- SGD in Multiclass Logistic Regression: Sequential Learning and Scaling Laws [55.81298869922287]
多数のクラスを持つ高次元ガウス混合モデルにおける多クラスロジスティック回帰のトレーニングダイナミクスについて検討する。
我々は,勾配に基づく最適化の下で,クロスエントロピーリスクを規定する厳密なスケーリング法則を確立する。
論文 参考訳(メタデータ) (2026-09-07T18:30:09Z) - LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models [129.64558694024126]
拡散言語モデル(dLLM)は自己回帰(AR)言語モデリングの代替を提供する。
我々は, MoE dLLM に対するハイパーパラメータ, 計算割り当て, アーキテクチャスケールの最適化を特徴付ける。
23.5Tトークンで30B-A3B dLLMのLLaDA MoE v2をスクラッチからトレーニングします。
論文 参考訳(メタデータ) (2026-08-04T10:53:02Z) - LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling [36.7482623230111]
スパースルーティングと反復重み付き計算を統合したループ型MoE言語モデルであるLoopMoEを提案する。
設計により、Vanilla MoEに対してループ式MoEを厳格に制御し、ヘッド・ツー・ヘッドで評価することができる。
論文 参考訳(メタデータ) (2026-06-03T04:38:12Z) - Generalization and Scaling Laws for Mixture-of-Experts Transformers [0.0]
我々は,Mixture-of-Experts (MoE) 変換器の一般化とスケーリングの理論を開発する。
本手法は, アクティブパラメータの予算で計量エントロピーがスケールする超ノルム被覆数界を導出し, MoE 固有のルーティングオーバヘッドを発生させる。
我々は,MoE アーキテクチャの構成的近似定理を証明し,近似構成の下では,アクティブキャパシティのスケーリングや専門家数の増加によって誤差が減少することを示した。
論文 参考訳(メタデータ) (2026-04-10T09:59:48Z) - Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory [77.27772368491698]
Muonのようなスペクトルは、最近、大規模な言語モデルトレーニングにおいて、強い経験的パフォーマンスを示している。
我々はこの問題を線形連想記憶問題を通して研究する。
また,Muonの貯蔵能力はSGDよりも有意に高いことがわかった。
論文 参考訳(メタデータ) (2026-03-27T16:13:18Z) - Towards Robust Scaling Laws for Optimizers [89.21160945066737]
経験的スケーリング法則は、モデルのサイズやトレーニングデータの増加に伴って損失を予測するために広く使用されている。
本研究では, 損失分解を既約, 近似, 最適化誤差に分解した結果, チンチラ方式のスケーリング法則が自然に現れることを示す。
論文 参考訳(メタデータ) (2026-02-07T21:40:33Z) - Theoretical Foundations of Scaling Law in Familial Models [46.506708373314375]
モデルサイズ(N)とトレーニングトークン(D)とともに、基本的なスケーリング変数としてグラニュラリティ(G)を導入します。
この結果から, 極小指数の乗法則に準じる粒度ペナルティが明らかとなった。
のパラダイムを検証することで、デプロイメントの柔軟性が達成可能であることを実証しています。
論文 参考訳(メタデータ) (2025-12-29T12:01:58Z) - Compression Scaling Laws:Unifying Sparsity and Quantization [65.05818215339498]
プレトレーニング中の大規模言語モデル(LLM)のスケーリング挙動に異なる圧縮手法がどう影響するかを検討する。
重みのみの量子化は強力なパラメータ効率乗算器を実現する一方で、重みとアクティベーションの完全な量子化は低ビット幅でのリターンの低下を示す。
以上の結果から,異なる圧縮手法を共通のスケーリング法枠組みの下で統一できることが示唆された。
論文 参考訳(メタデータ) (2025-02-23T04:47:36Z) - Unifying Two Types of Scaling Laws from the Perspective of Conditional Kolmogorov Complexity [13.954122805140145]
2020年、OpenAIは最初のタイプのスケーリング法則を提案し、モデル損失とパラメータ、データ、トレーニング計算のスケールの関係について説明した。
2024年、OpenAIは第2のスケーリング法則を提案し、モデル推論性能と推論計算の関係を説明した。
論文 参考訳(メタデータ) (2025-01-12T12:52:52Z) - Slice Sampling for General Completely Random Measures [74.24975039689893]
本稿では, 後続推定のためのマルコフ連鎖モンテカルロアルゴリズムについて, 補助スライス変数を用いてトランケーションレベルを適応的に設定する。
提案アルゴリズムの有効性は、いくつかの一般的な非パラメトリックモデルで評価される。
論文 参考訳(メタデータ) (2020-06-24T17:53:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。