論文の概要: Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts
- arxiv url: http://arxiv.org/abs/2610.01153v1
- Date: Thu, 01 Oct 2026 06:32:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.934791
- Title: Looping Beyond Twice: A Scalable Recipe for Looped Mixture-of-Experts
- Title(参考訳): Looping Beyond Twice: Looped Mixture-of-Expertsのためのスケーラブルなレシピ
- Abstract要約: Looped Transformerは、LSMの新たなスケーリング軸として、リカレントディープを導入している。
FLOPとマッチングした大規模MOE LLMのループ化の利点はいまだ不明である。
各ループは、リカレント状態を安定に保ちながら、新しい計算に寄与すべきである。
- 参考スコア(独自算出の注目度): 22.782568599870235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Looped Transformers introduce recurrent depth as a new scaling axis for LLMs: by repeatedly applying shared Transformer blocks, they increase effective depth without increasing parameter count. However, the benefits of looping remain unclear for large MoE LLMs under FLOPs-matched comparisons. The main reason is that the gains from additional iterations diminish quickly and can even turn into degradation, so the extra FLOPs spent on looping yield little substantial improvement. Consequently, prior work typically settles on two loops. We identify two main obstacles to scaling looped MoE. First, looping inherits and amplifies the curse of depth: hidden-state variance grows with each iteration as residual updates accumulate, which destabilizes deep recurrence and causes representations to drift. Second, looped MoE suffers from expert selection collapse: routers repeatedly select the same experts across loops, so extra iterations add computation without adding computational diversity. Guided by this diagnosis, we propose LOOM, built on a single principle: each loop should contribute new computation while keeping the recurrent state stable. LOOM stabilizes recurrence by scaling residual updates to bound variance growth and re-injecting the input embedding at every loop, and diversifies it through per-loop routers that engage different experts and a Looping Residual that carries earlier outputs forward. Experiments across 100M-1.7B models show stable scaling to 9-12 loops. Under near-iso-FLOP, the 700M model performs best at 5 loops, reducing perplexity from 18.36 to 16.54 and improving average zero-shot accuracy from 38.84% to 39.53% over the non-looped baseline. Without FLOP matching, the 1.7B model trained on 60B tokens peaks at 9 loops, reducing perplexity from 9.62 to 7.77 and improving average zero-shot accuracy from 42.4% to 47.7%. Code is available https://github.com/hed-ucas/LOOM.
- Abstract(参考訳): Looped Transformer は LLM の新たなスケーリング軸としてリカレントディープを導入し、共有トランスフォーマーブロックを繰り返し適用することで、パラメータ数を増やすことなく効果的なディープを増大させる。
しかし、FLOPとマッチングした大規模MOE LLMではループ化の利点は明らかでない。
主な理由は、追加のイテレーションから得られる利益が急速に減少し、さらに劣化する可能性があるため、ループに費やした追加のFLOPは大幅に改善されることがほとんどないからである。
その結果、通常、事前の作業は2つのループに落ち着く。
ループ化されたMoEのスケーリングには2つの障害がある。
まず、ループは深さの呪いを継承し増幅する:隠れ状態のばらつきは、残余の更新が蓄積するごとに増大し、深い再発を不安定化し、表現がドリフトする。
第2に、ループ化されたMoEは専門家の選択の崩壊に悩まされている。ルータは繰り返しループ全体で同じ専門家を選択するため、余分な反復は計算の多様性を追加することなく計算を追加する。
この診断で導かれたLOOMは、1つの原理に基づいて構築され、各ループは再帰状態を維持しながら新しい計算に寄与すべきである。
LOOMは、制限付き分散成長への残差更新をスケーリングし、各ループに入力の埋め込みを再注入することで、リカレンスを安定化し、異なる専門家と以前の出力を転送するLooping Residualをルータ毎のルータで分散させる。
100M-1.7Bモデルに対する実験では、安定な9-12ループへのスケーリングが示されている。
ほぼFLOPの下で700Mモデルは5ループで最高の性能を発揮し、18.36から16.54にパープレキシティを低下させ、平均ゼロショット精度を38.84%から39.53%に改善した。
FLOPマッチングがなければ、60Bトークンでトレーニングされた1.7Bモデルは9ループでピークに達し、パープレキシティは9.62から7.77に減少し、平均ゼロショット精度は42.4%から47.7%に向上する。
コードはhttps://github.com/hed-ucas/LOOM.comで入手できる。
関連論文リスト
- Decoding Looped Transformers Better for (Almost) Free [27.670056718185677]
LoopCDはトレーニング不要のコントラストデコーディングフレームワークである。
最終予測と以前の繰り返しパスとを対比することでトークン選択を導く。
推論計算を大幅に削減しつつ、より優れた復号性を実現する。
論文 参考訳(メタデータ) (2026-10-01T17:58:38Z) - Looped Diffusion Transformer [126.10100109922593]
分割ステップ毎に共有トランスフォーマーブロックを繰り返し実行することで、計算をスケールする別の方法を模索する。
ナイーブループは 画像の質を 常に向上させません
ループ型拡散変換器(Looped Diffusion Transformer, Looped-DiT)を提案する。
論文 参考訳(メタデータ) (2026-09-30T17:52:08Z) - Improving Test-Time Scaling with Adaptive Looped Transformers [27.116908391880568]
テスト時間復号化FLOPの倍率当たりの精度ゲインとして測定された精度計算傾きについて検討した。
既存のループ変換器は、ループのないベースラインよりも急勾配になることが多いが、一致した計算では性能が劣る。
ループ化の恩恵を受けるトークンに余分なイテレーションを集中させることができるTaH2を提案する。
論文 参考訳(メタデータ) (2026-09-28T17:56:55Z) - RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory [25.81050020222202]
Loop Memory Attentionでは、ループ時間軸に沿った以前のイテレーションから、ループされた各レイヤが自身の状態に参加することができる。
RecurTraceは平均2.0ループで56.9%の精度を達成し、一致した計算で2.2ポイントの最良の固定ループ深さを超えた。
論文 参考訳(メタデータ) (2026-09-03T05:29:24Z) - SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - DeepLoop: Depth Scaling for Looped Transformers [91.7922038545625]
ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
論文 参考訳(メタデータ) (2026-07-15T06:37:05Z) - Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping [56.14767235650558]
共有トランスブロックを繰り返し適用するLooped Transformerは、可変長の計算タスクに自然に適合するアーキテクチャである。
この差分を、列長とループ数の間の単純なアルゴリズムタスクにおける突発的相関に追従する。
私たちの研究は、"停止する時"は単なる推論時間割当ルールではなく、トレーニング設計の選択として扱われるべきであることを示唆しています。
論文 参考訳(メタデータ) (2026-06-29T08:58:09Z) - LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling [72.71005779366162]
本研究では,ゲインコストの観点から,ループ数選択について検討する。
この研究は18Tトークンのスクラッチからループ数が異なるループ数でLoopCoder-v2をトレーニングし、それにマッチした命令チューニングと評価を行う。
実証的には、この2ループ版はコード生成、コード推論、エージェントソフトウェアエンジニアリング、ツールスベンチマークなど、非ループベースラインよりも幅広い利益をもたらしている。
論文 参考訳(メタデータ) (2026-06-16T15:03:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。