論文の概要: SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
- arxiv url: http://arxiv.org/abs/2609.01343v2
- Date: Mon, 07 Sep 2026 14:35:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.337938
- Title: SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
- Title(参考訳): SMELT:Compute-Matched MoE Looped Transformersのスケーリング法則
- Authors: Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu, Wenhao Huang, Shen Yan, Jian Li,
- Abstract要約: ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
- 参考スコア(独自算出の注目度): 50.00050394179417
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Looped Transformers increase effective depth by iterating a shared block of layers, but most evaluations compare at fixed model size, conflating architectural advantage with extra FLOPs. We study looping on Mixture-of-Experts Transformers while closely matching per-token FLOPs, total non-embedding parameters, and KV cache. Through a series of ablations, we arrive at a recipe we call SMELT (Sparse MoE Transformer, middle layers Loop Twice), which loops the middle half of layers twice while matching the unlooped Baseline on all three budgets. We scale SMELT across four sizes up to 54B non-embedding parameters and fit a separate Chinchilla-style scaling law for each architecture. SMELT's loss drops faster with compute, saving 6.8--18.0\% of training FLOPs on the compute-optimal frontier. The advantage transfers to downstream benchmarks beyond what validation loss predicts, is largest on Code, and grows with sample length and the number of in-context examples. Mechanistic analysis shows that the second visit reduces the attention sink and redirects mass toward content-relevant tokens, an inductive bias that may underlie the observed performance gains. These results show that looping can improve Transformers even under budget matching, offering a practical recipe that turns depth reuse into measurable gains.
- Abstract(参考訳): ループ変換器は、レイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズで比較され、アーキテクチャ上の利点は追加のFLOPと融合する。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
SMELT(Sparse MoE Transformer、中層Loop Twice)と呼ばれるレシピは、3つの予算で未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
我々はSMELTを4つのサイズに拡張し、54Bの非埋め込みパラメータに拡張し、各アーキテクチャに個別のChinchillaスタイルのスケーリング法則を適合させる。
SMELTの損失は計算処理によって速くなり、計算最適化フロンティア上でのトレーニングFLOPの6.8--18.0\%が節約される。
利点は、検証損失の予測以上のダウンストリームベンチマークへの転送であり、コード上で最大であり、サンプルの長さとコンテキスト内サンプルの数で増加する。
メカニスティック分析により、第2の訪問は注意シンクを減少させ、観察されたパフォーマンス向上を損なう可能性のある帰納バイアスであるコンテンツ関連トークンに質量をリダイレクトすることを示している。
これらの結果から,ループ処理は予算整合下においてもトランスフォーマーを改良し,深度再利用を測定可能なゲインに変換する実用的なレシピを提供することがわかった。
関連論文リスト
- DeepLoop: Depth Scaling for Looped Transformers [91.7922038545625]
ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
論文 参考訳(メタデータ) (2026-07-15T06:37:05Z) - Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling [72.71005779366162]
本研究では,ゲインコストの観点から,ループ数選択について検討する。
この研究は18Tトークンのスクラッチからループ数が異なるループ数でLoopCoder-v2をトレーニングし、それにマッチした命令チューニングと評価を行う。
実証的には、この2ループ版はコード生成、コード推論、エージェントソフトウェアエンジニアリング、ツールスベンチマークなど、非ループベースラインよりも幅広い利益をもたらしている。
論文 参考訳(メタデータ) (2026-06-16T15:03:05Z) - N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation [68.47358899451255]
N-vium (N-vium) は、標準ハードウェア上での計算を部分的に並列化する変圧器である。
N-Viumは複数の深さで予測ヘッドを付加し、次のトーケン分布をこれらの出口上の学習混合物として定義する。
論文 参考訳(メタデータ) (2026-05-13T08:46:17Z) - Relaxed Recursive Transformers: Effective Parameter Sharing with Layer-wise LoRA [38.30350849992281]
再帰的(recursive)"言語モデルは、パフォーマンスの損失を最小限に抑えたレイヤ間でパラメータを共有する。
Recursive Transformerは、標準的な事前トレーニングされたトランスフォーマーから効率よく利用できるが、単一のユニークなレイヤブロックしか使用せず、ループ内で何度も繰り返される。
我々のモデルは、類似サイズのバニラ事前学習モデルと知識蒸留ベースラインの両方より優れていることを示す。
論文 参考訳(メタデータ) (2024-10-28T02:15:45Z) - Mixture-of-Modules: Reinventing Transformers as Dynamic Assemblies of Modules [96.21649779507831]
そこで我々は,Mix-of-modules (MoM) と呼ばれる新しいアーキテクチャを提案する。
MoMは、任意の層がその位置に関係なくトークンを計算することができるという直感によって動機付けられている。
MoMはトランスフォーマーのための統一されたフレームワークを提供するだけでなく、冗長性を減らすための柔軟で学習可能なアプローチを提供する。
論文 参考訳(メタデータ) (2024-07-09T08:50:18Z) - SMILE: Scaling Mixture-of-Experts with Efficient Bi-level Routing [47.11171833082974]
我々は、異種ネットワーク帯域を利用するSMILEを導入し、シングルステップのルーティングをバイレベルルーティングに分割する。
提案手法は, コンバージェンス速度を損なうことなく, コロッサルクリーンクローリングコーパスのプリトレーニングスループットにおいて, スイッチ変換器の2.5倍の高速化が得られることを示す。
論文 参考訳(メタデータ) (2022-12-10T03:44:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。