論文の概要: Mobius Learning: Cyclic Depth Folding in Transformers
- arxiv url: http://arxiv.org/abs/2607.17843v1
- Date: Mon, 20 Jul 2026 11:37:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.605938
- Title: Mobius Learning: Cyclic Depth Folding in Transformers
- Title(参考訳): Mobius Learning: トランスフォーマーにおける周期的な深さのフォールディング
- Authors: Tongtian Zhu,
- Abstract要約: トランスフォーマーベースの言語モデルは、順序付けられた深さ軸に沿って計算を整理する。
循環深度折り畳みに基づくトレーニングアーキテクチャであるMobius Learningを紹介する。
Muon を用いた 2.5B FineWeb トークン上で訓練された GPT-2 小 (124M) モデルを用いた4人の労働者実験において,Mobius Learning は固定順序ループ変換器よりも検証損失が低い。
- 参考スコア(独自算出の注目度): 5.234095716846224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transformer-based language models organize computation along an ordered depth axis, where shallow and deep blocks often develop distinct representational roles. We challenge the conventional view that these roles must remain tied to a block's position in the ordered sequence. We introduce Mobius Learning, a training architecture based on cyclic depth folding, in which different data streams follow cyclically shifted block orders. The same block group is therefore applied early in the block sequence for some data streams and late for others, so it is optimized in both shallow and deep roles, a phenomenon we call depth-role superposition. Surprisingly, in four-worker experiments with a modded GPT-2 small (124M) model trained on 2.5B FineWeb tokens using Muon, Mobius Learning achieves lower validation loss than a fixed-order looped Transformer at larger numbers of Transformer block-sequence passes. This counterintuitive result shows that a block group need not remain confined to one fixed shallow or deep role within the block sequence and opens a new design space based on cyclic depth folding. Crucially, this structure makes Mobius Learning particularly well suited to memory-constrained distributed training: raw training data remain local, while each worker stores one block group rather than the complete Transformer block stack.
- Abstract(参考訳): トランスフォーマーベースの言語モデルは、命令された深さ軸に沿って計算を整理し、浅いブロックと深いブロックは、しばしば異なる表現的役割を発達させる。
我々は、これらの役割は順序付けられたシーケンスにおけるブロックの位置に結びついなければならないという従来の見解に挑戦する。
本稿では,周期的な深度折り畳みに基づく学習アーキテクチャであるMobius Learningを紹介する。
したがって、同じブロック群はブロックシーケンスの初期に適用され、他のデータストリームは遅くなるので、浅い役割と深い役割の両方で最適化される。
驚いたことに、Muonを用いた2.5B FineWebトークンでトレーニングされた修正GPT-2 small (124M)モデルを用いた4人の労働者実験において、Mobius Learningは、多くのTransformerブロックシーケンスパスにおいて、固定順序ループ変換器よりも低いバリデーション損失を達成する。
この直感的な結果から、ブロック群はブロック列内の1つの固定された浅いあるいは深い役割に留まらず、循環的な深さの折りたたみに基づく新しい設計空間を開く必要があることが分かる。
生のトレーニングデータはローカルのままであり、各ワーカーは完全なTransformerブロックスタックではなく、1つのブロックグループを格納する。
関連論文リスト
- Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - Sparsity Moves Computation: How FFN Architecture Reshapes Attention in Small Transformers [0.0]
本稿では,トランスフォーマーフィードフォワードネットワーク(FFN)内のアーキテクチャ選択が,他のモデルで学習した計算をどのように作り直すかを検討する。
我々は、この再分配を、専門家間でのFFN容量の削減とスパースパーティショニングに分解する。
パラメータマッチング,アクティベーション・ファンクション,ワイド・スケーリング分析など,ランダム・ルーティング,狭小FFN,トップ2 MoE コントロールを用いて,これらの結論を検証した。
論文 参考訳(メタデータ) (2026-05-10T08:05:49Z) - Depth-Wise Representation Development Under Blockwise Self-Supervised Learning for Video Vision Transformers [0.6445605125467574]
我々は、エンコーダによるマスク付き自動符号化ビデオビジョン変換器にブロックワイズ学習を適用した。
我々は,深さ方向の陰極性,ブロック間類似性,パッチレベルの診断を解析する。
これらの結果から, 残差への寄与として, 遅延ブロック飽和と界面形成が示唆された。
論文 参考訳(メタデータ) (2026-01-14T00:12:43Z) - From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs [58.640039233470766]
原理的AR-to-block-diffusion適応は,DLMをスクラッチからトレーニングする上で,有効かつ効率的な代替手段であることを示す。
NBDiff-7B(BaseとInstruct)は、長文のモデリングと推論機能を継承し、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-07T10:28:21Z) - TNT: Improving Chunkwise Training for Test-Time Memorization [62.78875147721906]
タイタンスやTTTのような深いテストタイム記憶モジュールを持つリカレントニューラルネットワーク(RNN)は、トランスフォーマーとは異なる有望で線形にスケールするパラダイムである。
TNTは,2段階のプロセスを通じて,推論性能からトレーニング効率を分離する,新たなトレーニングパラダイムである。
TNTはトレーニング速度を最も正確なベースライン構成の17倍に高速化する。
論文 参考訳(メタデータ) (2025-11-10T17:45:09Z) - Poolformer: Recurrent Networks with Pooling for Long-Sequence Modeling [0.0]
PoolformerはSequence-to-Sequenceモデルで、自己アテンションをリカレントレイヤに置き換え、シーケンス長を削減するためにプール操作を組み込む。
以上の結果から,プールはトレーニングを大幅に加速し,知覚的指標(FID,IS)が向上し,過度な適合を防ぐことが示唆された。
将来の方向性には、テキストとビジョンのアプリケーションや、マルチモーダルシナリオが含まれる。
論文 参考訳(メタデータ) (2025-10-02T16:52:45Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation [11.910667302899638]
DiffusionBlocksは、トランスフォーマーベースのネットワークを独立したトレーニング可能なブロックに変換するための、原則化されたフレームワークである。
本実験は,DiffusionBlocksトレーニングがエンドツーエンドトレーニングの性能に合致することを示すものである。
論文 参考訳(メタデータ) (2025-06-17T05:44:18Z) - BatchFormerV2: Exploring Sample Relationships for Dense Representation
Learning [88.82371069668147]
BatchFormerV2はより一般的なバッチトランスフォーマーモジュールである。
BatchFormerV2は、現在のDETRベースの検出方法を1.3%以上改善している。
論文 参考訳(メタデータ) (2022-04-04T05:53:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。