論文の概要: Sparse Layers are Critical to Scaling Looped Language Models
- arxiv url: http://arxiv.org/abs/2605.09165v1
- Date: Sat, 09 May 2026 20:58:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.096354
- Title: Sparse Layers are Critical to Scaling Looped Language Models
- Title(参考訳): ループ言語モデルのスケーリングにはスパース層が不可欠
- Abstract要約: Looped-MoEモデルは標準ベースラインよりもスケールが良いが、高密度ループモデルはそうではない。
各ループは最終的な出力を生成するのと同じ層で終わるので、ループ境界はより優れた出口点である。
早期出口を持つLooped-MoEモデルは、標準的なトランスフォーマーを大規模に打ち負かすだけでなく、品質の低下を最小限に抑えながら、メモリと推論の大幅な節約を可能にする。
- 参考スコア(独自算出の注目度): 26.915905657879218
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped language models repeat a set of transformer layers through depth, reducing memory costs and providing natural early-exit points at loop boundaries. However, looped models do not scale as favorably as standard transformers with unique layers. We compare standard and Mixture-of-Experts (MoE) transformers, with and without looping, and find two main results. First, we find Looped-MoE models scale better than the standard baseline while dense looped models do not. We trace this to routing divergence between loops: in Looped-MoE models, different experts are activated on each pass through the same shared layers, recovering expressivity without additional parameters. Our second finding is that looped models have better compute-quality trade-offs with early exits than standard models. Because each loop ends with the same layers that produce the final output, loop boundaries are superior exit points, as confirmed by earlier output convergence at these points. In sum, we provide a clear direction for scaling looped models: a Looped-MoE model with early exits can not only beat standard transformers at scale, but also enable significant memory and inference savings with minimal degradation in quality.
- Abstract(参考訳): ループ言語モデルは、深さを通じてトランスフォーマー層のセットを繰り返し、メモリコストを低減し、ループ境界における自然な早期終了点を提供する。
しかし、ループ化されたモデルは、ユニークな層を持つ標準のトランスフォーマーほど好ましくない。
標準およびMixture-of-Experts (MoE) 変換器をループと無ループで比較し, 2つの主要な結果を得た。
まず,Looped-MoEモデルは標準ベースラインよりもスケールが良いが,高密度ループモデルはそうでない。
Looped-MoEモデルでは、各パスで異なる専門家が同じ共有層を通過して、追加パラメータなしで表現性を回復します。
第2の発見は、ループモデルでは、標準モデルよりも早期のエグジットによる計算品質のトレードオフが優れていることです。
各ループは最終的な出力を生成するのと同じ層で終わるため、ループ境界はこれらの点における以前の出力収束によって確認されたより優れた出口点である。
早期出口を持つLooped-MoEモデルは、標準変圧器を大規模に打ち負かすだけでなく、品質の低下を最小限に抑えながら、メモリと推論の大幅な節約を可能にする。
関連論文リスト
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - Training-Free Hidden-State Refinement for Flow-Matching Image Generators [13.43479682921888]
着信毎に選択したトランスフォーマー層を繰り返し適用する学習自由ループフレームワークを提案する。
2つのスケール-RAEモデルスケールで、ループ変種は、競合する品質-効率のトレードオフを伴う一次および補助的な品質指標を改善する。
論文 参考訳(メタデータ) (2026-08-29T09:17:02Z) - Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling [36.7482623230111]
スパースルーティングと反復重み付き計算を統合したループ型MoE言語モデルであるLoopMoEを提案する。
設計により、Vanilla MoEに対してループ式MoEを厳格に制御し、ヘッド・ツー・ヘッドで評価することができる。
論文 参考訳(メタデータ) (2026-06-03T04:38:12Z) - Coupling Models for One-Step Discrete Generation [50.37847093567075]
カップリングモデル(英: Coupling Models)は、離散列とガウス列の間の直接結合を学習する一段階の離散生成モデルである。
単純なデータ間結合と手動で特定したデータ間結合による複雑な連続フローを回避する。
LM1Bテキスト生成パープレキシティを最低パープレキシティ動作ポイントで33%削減する。
論文 参考訳(メタデータ) (2026-05-08T03:40:39Z) - Adaptive Loops and Memory in Transformers: Think Harder or Know More? [2.141762982579701]
思考の連鎖は言語モデルにおける推論を可能にするが、中間段階の明示的な言語化を必要とする。
ループ変換器は、隠された状態内の表現を反復的に精製する代替手段を提供する。
適応型層間ループとゲート型メモリバンクの両方を特徴とするトランスモデルについて検討する。
論文 参考訳(メタデータ) (2026-03-09T13:49:03Z) - Two-Scale Latent Dynamics for Recurrent-Depth Transformers [18.852161704625562]
トークンを出力する前に遅延計算を繰り返すことにより、電流深度変換器の幾何学がテスト時間計算をスケールする。
チェックポイント全体では、ループステップがより小さくなり、互いに直交する傾向が増している。
これらのダイナミクスは、ステップサイズにおけるモデルの2階差に基づく早期退避機構を動機付けている。
論文 参考訳(メタデータ) (2025-09-27T14:01:40Z) - A correlation-permutation approach for speech-music encoders model merging [80.83944654755022]
本稿では,音楽エンコーダの内部層を音声エンコーダと整合させる相関置換手法を提案する。
この方法は、モデルの特徴的相互相関層を層単位で最大化する置換行列を計算する。
この作業により、独立に訓練されたエンコーダから統一されたオーディオモデルを作成することができる。
論文 参考訳(メタデータ) (2025-06-13T02:04:33Z) - Parallelizing Linear Transformers with the Delta Rule over Sequence Length [49.88826673324244]
この研究は、デルタ則で線形変圧器を訓練するためのハードウェア効率の良いアルゴリズムについて述べる。
我々は100Bトークンに対して1.3Bモデルをトレーニングし、最近の線形時間ベースラインよりも優れていることを発見した。
論文 参考訳(メタデータ) (2024-06-10T17:24:42Z) - Long Range Arena: A Benchmark for Efficient Transformers [115.1654897514089]
ロングレンジアリーナベンチマーク(Long-rangearena benchmark)は、1Kドルから16Kドルまでの一連のタスクからなるスイートである。
我々は,新たに提案したベンチマークスイートを用いて,よく確立された10種類の長距離トランスフォーマーモデルを体系的に評価した。
論文 参考訳(メタデータ) (2020-11-08T15:53:56Z) - Parallel Rescoring with Transformer for Streaming On-Device Speech
Recognition [36.86458309520383]
2パスモデルは、デバイス上での音声認識において、より良い速度品質のトレードオフを提供する。
第2パスモデルは、従来のモデルを上回るエンドツーエンドモデルの品質改善において重要な役割を果たす。
本研究では,第2パスリスコラーのLSTM層をTransformer層に置き換えることを検討した。
論文 参考訳(メタデータ) (2020-08-30T05:17:31Z) - On the Discrepancy between Density Estimation and Sequence Generation [92.70116082182076]
log-likelihoodは、同じファミリー内のモデルを考えるとき、BLEUと非常に相関している。
異なる家族間でのモデルランキングの相関はみられない。
論文 参考訳(メタデータ) (2020-02-17T20:13:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。