論文の概要: Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling
- arxiv url: http://arxiv.org/abs/2606.07404v1
- Date: Fri, 05 Jun 2026 15:48:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-08 14:33:29.836002
- Title: Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling
- Title(参考訳): 可逆的ファウンデーション:状態保存スケーリングによる120BスパースMoEのトレーニング
- Authors: Rohan Shravan,
- Abstract要約: LightningLM 0.1Vは、小さな高密度の種から460の経路を持つ専門家を持つ120Bモデルまで、4段階で成長した反復バックボーン言語モデルである。
全系統は8Kコンテキストでより大きなステージである単一ノード上で実行され、120Bスケールで1.78のトレーニング損失がリリースされている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper reports on training a hundred-billion-parameter sparse mixture of experts on a single eight-GPU node, end to end. LightningLM 0.1V is a recurrence-backbone language model family grown in four stages from a small dense seed, through a 5B and a 9B mixture of experts, to a 120B model with 460 routed experts under top-12 routing. Each larger model is grown from the trained weights of the smaller one; active parameters rise monotonically from 1.78B at the dense seed to 5.93B at 120B (about 5% of the 118.67B stored). The full lineage runs on single nodes, the larger stages at 8K context, reaching a released training loss of 1.78 at 120B scale. This is a systems and experience report. It is organized around three disciplines. Reversibility: a reversible recurrence stack reconstructs activations in the backward pass instead of storing them, holding activation memory flat as the model grows. State-preserving growth: each expansion (dense to MoE, shallow to deep, few experts to many) is given as a reproducible principle paired with the failure that results from getting it wrong; several failures are silent. Single-node economics: the 120B trains through TQP, a strategy of quantized base expert weights and trained low-rank adapters that carries optimizer state on 2.26B adapter parameters rather than 100B+ resident in routed experts, cutting expert-path optimizer state by a factor of ~45. What is new is the integration of known primitives, not any primitive in isolation: one grown lineage running end to end on a single node, documented at practitioner level, with per-domain held-out loss as evidence that targeted capabilities (multilingual Indic competence, code) were learned by construction. Model family, tokenizer, and training code are released.
- Abstract(参考訳): 本稿では,1つの8GPUノード上で,100億パラメーターのスパースミックスをトレーニングする。
LightningLM 0.1Vは、小さな高密度のシードから5Bと9Bのエキスパートの混合物を経て、120Bモデルで4段階に成長し、上位12のルーティングの下で460のルーティングされたエキスパートを持つ。
それぞれの大きなモデルは、より小さなモデルの訓練された重量から成長し、活性パラメータは、密度の高い種子で1.78Bから120Bで5.93B(保存された118.67Bの約5%)まで単調に上昇する。
全系統は8Kコンテキストでより大きなステージである単一ノード上で実行され、120Bスケールで1.78のトレーニング損失がリリースされている。
これはシステムとエクスペリエンスに関するレポートです。
組織は3つの分野に分かれている。
可逆性: 可逆的再帰スタックは、モデルが成長するにつれてアクティベーションメモリをフラットに保持する代わりに、後方パスでアクティベーションを再構築する。
状態保存の成長: 各拡張(MoEは浅く、深く、多くの専門家は少ない)は、失敗が原因で生じる失敗と組み合わさった再現可能な原則として与えられる。
単一ノード経済:120BはTQPを経由し、量子化された基礎専門家の重量と訓練された低ランクアダプターの戦略により、100B+の経路の専門家ではなく2.26Bのパラメータでオプティマイザ状態を実行し、エキスパートパスオプティマイザ状態を45倍に削減した。
新しいのは、既知のプリミティブの統合であり、いかなるプリミティブも独立していない: 単一のノードで終端を走る成長した1つの系統は、実践者レベルで文書化され、ドメインごとのホールドアウト損失は、ターゲットの能力(複数のインデックス能力、コード)が構築によって学習された証拠である。
モデルファミリ、トークンライザ、トレーニングコードもリリースされている。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies [4.738949927143789]
言語モデル自身の出力に対する連続的な自己学習は、フラット化のプロセスとして広く特徴づけられる。
この特徴が不完全であることを示す。
5つのモデルでの11世代にわたるセルフトレーニングでは、言語は均一にフラット化されていない。
論文 参考訳(メタデータ) (2026-05-20T01:44:47Z) - FORGE: Self-Evolving Agent Memory With No Weight Updates via Population Broadcast [3.774094352572544]
FORGEは反射式内部ループをラップし、専用の反射エージェントが失敗した軌道を再利用可能な知識アーティファクトに変換する。
我々は,ネットワーク防御のPOMDPであるCybORG CAGE-2を,Bライン攻撃に対する30ステップの地平線上で評価した。
ゼロショットベースラインとリフレクションベースライン(分離シングルストリーム学習)の両方と比較して、FOGEはゼロショットよりも1.7-7.7$times$の平均評価リターンを改善する。
論文 参考訳(メタデータ) (2026-05-15T17:42:49Z) - Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock [0.0]
本稿では,ビデオ拡散変換器におけるToken-Choice sparse Mixture-of-Experts(MoE)の学習障害モードを系統的に診断する。
ルーティングされた専門家は元のFFN重みを正確にクローンし、共有された専門家は検証のためにゼロに、そして実際のトレーニングのために極端に小さな非ゼロノイズに変換する。
論文 参考訳(メタデータ) (2026-05-12T17:57:13Z) - Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts [76.12264847243816]
本稿では、独立したドメインエキスパートを訓練するBARについて、それぞれ独自の中級訓練、教師付き微調整、強化学習パイプラインを用いて、軽量ルータトレーニングを備えたMixture-of-Expertsアーキテクチャを用いて構成する。
7Bスケールでは、数学、コード、ツールの使用、安全性の専門家がおり、総合スコアは49.1である。
各ドメインを分離することで、後期のRLが早期のトレーニング段階から機能を低下させたときに発生する破滅的な忘れを回避し、ドメインの更新や追加のコストと複雑さを著しく低減する。
論文 参考訳(メタデータ) (2026-04-20T16:24:41Z) - Surgical Repair of Collapsed Attention Heads in ALiBi Transformers [0.0]
変換言語モデルのBLOOMファミリーにおいて,系統的な注意崩壊病理を同定する。
ALiBiの位置エンコーディングは31-44%のアテンションヘッドを、ほぼ完全にシーケンス開始トークンに出席させる。
ゼロ出力プロジェクションを用いた標的Q/K/V再初期化について検討した。
論文 参考訳(メタデータ) (2026-03-10T12:57:49Z) - Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm [12.526901917227425]
本研究では,SParse Expert Synchronization (SPES)を提案する。
SPESはノードごとに専門家のサブセットのみを訓練し、メモリフットプリントを大幅に低下させる。
7Bモデルをスクラッチから,9Bモデルを高密度チェックポイントからアップサイクルすることで,スケーラビリティを実証する。
論文 参考訳(メタデータ) (2026-02-12T04:02:45Z) - Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs [80.72350166388601]
Nemotron Elasticは推論指向のLLMを構築するためのフレームワークである。
ネストしたサブモデルを単一の親モデルに組み込む。
これらのサブモデルはそれぞれ、親モデルと重みを共有し、デプロイ中にゼロショットを抽出できる。
論文 参考訳(メタデータ) (2025-11-20T18:59:21Z) - GDP: Stabilized Neural Network Pruning via Gates with Differentiable
Polarization [84.57695474130273]
ゲートベースまたは重要度に基づくプルーニング手法は、重要度が最小のチャネルを削除することを目的としている。
GDPは、各チャネルのオン・アンド・オフを制御するために、ベルやホイッスルのない畳み込み層の前に接続することができる。
CIFAR-10とImageNetデータセットを用いて行った実験は、提案したGDPが最先端のパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2021-09-06T03:17:10Z) - ConvBERT: Improving BERT with Span-based Dynamic Convolution [144.25748617961082]
BERTはグローバルな自己保持ブロックに大きく依存しているため、大きなメモリフットプリントと計算コストに悩まされる。
そこで本研究では,これらの自己注意型ヘッドを置き換え,局所的依存関係を直接モデル化する,スパンベースの動的畳み込みを提案する。
新たな畳み込み頭は、他の自己注意頭と共に、グローバルな文脈学習とローカルな文脈学習の両方においてより効率的である、新しい混合注意ブロックを形成する。
論文 参考訳(メタデータ) (2020-08-06T07:43:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。