論文の概要: SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning
- arxiv url: http://arxiv.org/abs/2609.35440v1
- Date: Mon, 28 Sep 2026 15:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 05:26:27.792868
- Title: SOLO: Pretraining Billion-Parameter Language Models with Shared-Output Local Learning
- Title(参考訳): SOLO: 共有出力ローカル学習による10億パラメータ言語モデルの事前学習
- Abstract要約: ローカル学習は、各モジュールをトレーニングして、自身の読み込みを通じてターゲットを予測することで、更新ロックを削除する。
そこで我々は,SOLO(Shared-Output LOcal Learning)を提案する。
- 参考スコア(独自算出の注目度): 21.015060900689424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are trained with backpropagation, whose global gradient coordinates all layers but forces each to hold its activations and wait for the gradient to pass back through every deeper layer. Conventional local learning removes this update locking by training each module to predict the target through its own readout, but has not scaled to billion-parameter pretraining. We identify these private readouts as a key weakness, since they leave each module without information from deeper modules. We propose Shared-Output LOcal learning (SOLO), which replaces them with a shared, read-only copy of the final module's readout, the only one trained on the output of the whole network. Taken from the previous step, the copy transmits information from the final module without passing gradients between modules or reintroducing update locking. SOLO approaches backpropagation on Transformers of 340M to 2B parameters pretrained on 15B tokens, staying within one point in average zero-shot accuracy with a perplexity gap that narrows with scale. Readout ablations attribute SOLO's improvement over private readouts to sharing. Without update locking, each of p pipeline stages holds activations for O(1) micro-batches instead of O(p). The freed memory permits larger micro-batches, which reach up to 1.44x the best measured throughput of pipeline backpropagation on the same partition. To our knowledge, SOLO is the first local learning method to show such memory and throughput gains in billion-parameter language-model pretraining. Local learning thus becomes a practical alternative to backpropagation for large-scale pretraining.
- Abstract(参考訳): 大規模な言語モデルはバックプロパゲーションで訓練され、グローバルな勾配はすべてのレイヤを調整しますが、それぞれのアクティベーションを保持して、すべての深いレイヤに勾配が戻るのを待ちます。
従来のローカル学習では、この更新ロックは各モジュールをトレーニングして、自身の読み出しを通じてターゲットを予測することで取り除かれるが、数十億パラメータの事前トレーニングにはスケールしていない。
これらのプライベートな読み出しは、より深いモジュールからの情報なしで各モジュールを離れるため、重要な弱点であると考えています。
ネットワーク全体の出力に基づいてトレーニングされた唯一のモジュールである最終モジュールの読み出しのみの共有コピーに代えて,SOLO(Shared-Output LOcal Learning)を提案する。
前のステップから取得したコピーは、モジュール間の勾配を通過させることなく最終モジュールから情報を送信し、更新ロックを再導入する。
SOLOは、15Bトークンで事前訓練された340Mから2Bパラメータの変換子のバックプロパゲーションにアプローチする。
読み出しアブレーションは、プライベートな読み出しよりもSOLOの改善が共有に寄与している。
更新ロックなしでは、各pパイプラインステージはO(p)の代わりにO(1)マイクロバッチのアクティベーションを保持する。
解放されたメモリはより大きなマイクロバッチを許容し、同じパーティション上でのパイプラインバックプロパゲーションの最高のスループットである1.44倍に達する。
我々の知る限り、SOLOは10億パラメータ言語モデルの事前学習において、そのようなメモリとスループットの獲得を示す最初のローカル学習手法である。
これにより、局所学習は大規模な事前学習のバックプロパゲーションの代替となる。
関連論文リスト
- Learning the Signature of Memorization in Autoregressive Language Models [3.6048665052465663]
我々は,任意のコーパス上の任意のモデルを微調整することで,ラベル付きデータを無制限に生成する,最初のトランスファー可能な学習攻撃を導入する。
これにより、シャドーモデルボトルネックが取り除かれ、深層学習時代へのメンバシップ推論がもたらされる。
論文 参考訳(メタデータ) (2026-04-03T17:17:51Z) - From Projection to Prediction: Beyond Logits for Scalable Language Models [0.28647133890966986]
大規模言語モデル(LLM)のトレーニングは通常、出力層で2段階のパイプラインを伴います。
隠れ状態とターゲットトークンの損失を直接計算することにより、当社のアプローチは明示的なロジットの実体化をバイパスする。
論文 参考訳(メタデータ) (2025-11-18T02:23:47Z) - Reinforcement Learning for Long-Horizon Interactive LLM Agents [56.9860859585028]
インタラクティブデジタルエージェント(IDA)は、ステートフルなデジタル環境のAPIを利用して、ユーザの要求に応じてタスクを実行する。
対象環境で直接IDAを訓練する強化学習(RL)手法を提案する。
我々は、近似ポリシー最適化のデータおよびメモリ効率の亜種である LOOP を導出する。
論文 参考訳(メタデータ) (2025-02-03T18:35:42Z) - Learning to Route for Dynamic Adapter Composition in Continual Learning with Language Models [56.93608812478369]
本稿では,新たなPEFTモジュールのトレーニングを分離し,タスクの専門化を保証する手法であるL2Rを提案する。
その後、L2Rは学習したモジュールを学習し、以前見たタスクの例を含む小さなメモリを利用するルータのネットワークをトレーニングする。
その結果,L2RはPEFTモジュールの効率的な構成を提供し,他の手法と比較して一般化と性能が向上した。
論文 参考訳(メタデータ) (2024-08-16T23:57:29Z) - Beyond Next Token Prediction: Patch-Level Training for Large Language Models [69.67438563485887]
大規模言語モデル(LLM)に対するパッチレベルのトレーニングを導入する。
パッチレベルのトレーニングでは、言語モデルの短いパッチシーケンスをフィードし、次のパッチを予測するようにトレーニングします。
パッチレベルのトレーニングは、モデルのパフォーマンスを損なうことなく、全体のトレーニングコストを0.5$times$に削減できることを示す。
論文 参考訳(メタデータ) (2024-07-17T15:48:39Z) - Towards Efficient Post-training Quantization of Pre-trained Language
Models [85.68317334241287]
PLMのポストトレーニング量子化(PTQ)について検討し,モジュール単位の量子化誤差最小化(MREM)を提案する。
GLUEとSQuADベンチマークの実験により、提案したPTQソリューションはQATに近く動作するだけでなく、トレーニング時間、メモリオーバーヘッド、データ消費を大幅に削減できることがわかった。
論文 参考訳(メタデータ) (2021-09-30T12:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。