論文の概要: DeepLoop: Depth Scaling for Looped Transformers
- arxiv url: http://arxiv.org/abs/2607.13491v1
- Date: Wed, 15 Jul 2026 06:37:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.671235
- Title: DeepLoop: Depth Scaling for Looped Transformers
- Title(参考訳): DeepLoop: ループ変換器の深さスケーリング
- Authors: Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang,
- Abstract要約: ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
- 参考スコア(独自算出の注目度): 91.7922038545625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Looped Transformers scale sequential computation by applying a compact stack of physical blocks for multiple rounds, increasing unrolled depth without increasing stored parameters. This reuse changes the residual-scaling problem: in an untied Transformer, each residual branch receives and applies its own parameter update, whereas in a looped Transformer one shared update aggregates gradients from repeated visits and is read back by those same visits in the next linearized forward pass. We formalize this tied-depth effect through a first-order perturbation bound controlled by a visit-alignment coefficient $κ_R$. The bound recovers the DeepNorm exponent when visits decorrelate, but in the conservative aligned regime it requires the exponent to increase from $1/4$ to $1/2$ as loop count grows at fixed physical depth. The resulting method, \textbf{DeepLoop}, keeps the Post-LN DeepNorm architecture and sets $α=(2N)^{1/2}$ and $β=(8N)^{-1/2}$ for unrolled depth $N$. On GPT-style looped language models at GPT-2 small and GPT-2 medium scale, DeepLoop is neutral when no physical block is revisited and improves validation loss and downstream accuracy once recurrent depth is activated. These results show that stable recurrent depth requires residual scaling rules that account for parameter visits, not only nominal layer count.
- Abstract(参考訳): ループトランスフォーマーは、複数のラウンドに物理ブロックのコンパクトなスタックを適用することでシーケンシャルな計算をスケールし、格納されたパラメータを増大させることなく、アンロールされた深さを増大させる。
未処理のTransformerでは、各残枝が独自のパラメータ更新を受け取り、適用する一方、ループ化されたTransformerでは、共有された更新は繰り返し訪問からの勾配を集約し、次の線形化されたフォワードパスで同じ訪問によって読み返される。
我々は、この結合深さ効果を、訪問配向係数$κ_R$で制御された一階摂動によって定式化する。
このバウンドは、訪問時にDeepNorm指数を回復するが、保守的な体制では、ループ数が固定された物理的深さで増加するにつれて、指数を1/4ドルから1/2ドルに増やす必要がある。
結果のメソッドである \textbf{DeepLoop} は Post-LN DeepNorm アーキテクチャを保持し、$α=(2N)^{1/2}$ と $β=(8N)^{-1/2}$ を非ロール深度$N$ に設定する。
GPT-2 と GPT-2 の中規模での GPT スタイルのループ言語モデルでは,物理ブロックが再検討されない場合,DeepLoop は中立であり,再帰深度が活性化されると検証損失と下流精度が向上する。
これらの結果から,安定な再電流深度はパラメータ訪問を考慮に入れた残留スケーリングルールを必要とすることが示唆された。
関連論文リスト
- Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - On the Residual Scaling of Looped Transformers: Stability and Transferability [31.27468588849646]
1/N$のスケーリングは、トレーニング性を改善し、ループ数で1/sqrtN$のスケーリングよりも優れた損失をもたらすことを示す。
ループ変換器の実験では、1/N$のスケーリングがトレーニング性を改善し、ループ数を越えたスケールで1/sqrtN$よりもよい損失をもたらすことが確認されている。
論文 参考訳(メタデータ) (2026-06-16T22:39:13Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - The Recurrent Transformer: Greater Effective Depth and Efficient Decoding [48.9323408950142]
Recurrent Transformerは、各レイヤがそれぞれのアクティベーションから計算されたキーと値のペアに付随する、シンプルなアーキテクチャ変更である。
このアーキテクチャは, (i) 従来のトランスフォーマーと (ii) トークン・ツー・グレッシブ・リカレント更新の両方を軽度な仮定でエミュレートできることを示す。
論文 参考訳(メタデータ) (2026-04-23T02:12:58Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - MeSH: Memory-as-State-Highways for Recursive Transformers [23.995570647573484]
パラメータが少ない再帰モデルは、マッチした計算の下では非再帰的モデルよりも遅れることが多い。
隠れた状態を探索することで、このパフォーマンスギャップを2つの主要なボトルネックにトレースします。
メモリ管理を明示的なメモリバッファに外部化するメモリ・アズ・ステート・ハイウェイ方式を導入する。
論文 参考訳(メタデータ) (2025-10-09T03:23:38Z) - Arithmetic-Mean $μ$P for Modern Architectures: A Unified Learning-Rate Scale for CNNs and ResNets [9.94514344279733]
Arithmetic-Mean $mu$P は個々の層ではなく、ネットワーク全体の平均1ステップのプレアクティベーション第2モーメントを一定スケールに制限する。
1次元および2次元の畳み込みネットワークの場合、最大更新学習率は$etastar(L)propto L-3/2$; を満足する。
論文 参考訳(メタデータ) (2025-10-05T19:22:50Z) - Scaling Up Liquid-Resistance Liquid-Capacitance Networks for Efficient Sequence Modeling [50.994194925685434]
LrcSSMは$textitnon-linear$リカレントモデルで、現在の線形状態空間層と同じくらい高速に長いシーケンスを処理する。
ヤコビ行列を対角線に強制することにより、全列を並列に解くことができる。
LrcSSMは、Liquid-S4のような他の入力変化系が提供しないことを保証する形式的な勾配安定性を提供する。
論文 参考訳(メタデータ) (2025-05-27T20:02:59Z) - Approximation Bounds for Transformer Networks with Application to Regression [9.549045683389085]
H"older 関数と Sobolev 関数に対する Transformer ネットワークの近似機能について検討する。
シーケンス・ツー・シーケンス・マッピングを近似した標準トランスフォーマー・ネットワークのための新しい上限を確立する。
トランスフォーマーの自己アテンション層がカラム平均化を行うことができれば,ネットワークはシーケンス・ツー・シーケンスのH"older関数を近似することができることを示す。
論文 参考訳(メタデータ) (2025-04-16T15:25:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。