論文の概要: Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models
- arxiv url: http://arxiv.org/abs/2607.13332v1
- Date: Tue, 14 Jul 2026 23:32:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.605263
- Title: Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models
- Title(参考訳): Agora: 大規模言語モデルの集合的かつ無許可なインターネット規模の事前トレーニング
- Abstract要約: Agoraは、インターネットグレードリンク上の帯域効率の高いパイプライン並列モデルシャーディングと、複数パーティのフォールトトレラントな集団操作を組み合わせる。
Pluralis-8BはFineWeb-Eduの500Bトークン上の8.6B-パラメータモデルのオープンで無許可の事前トレーニング実行である。
- 参考スコア(独自算出の注目度): 50.733497395381164
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training large language models at the multi-billion to trillion parameter scale is confined to datacenters, where data-parallel (DP) and model-parallel (MP) techniques presume homogeneous accelerators, high-speed interconnects, and a single orchestrating entity. Frontier model development is thereby concentrated among the few groups able to assemble such clusters. Meanwhile, an enormous pool of compute remains unusable for training: consumer and professional GPUs that are heterogeneous, preemptible, individually owned, and connected only by the internet. We present Agora, a system that makes efficient use of this compute. Agora combines bandwidth-efficient pipeline-parallel model sharding over internet-grade links with multi-party, fault-tolerant collective operations. Each participant holds only one stage of the model, and no single party ever possesses the full weights. We term this setup Protocol Learning: it enables collectively trained, collectively owned models, opening a path to open-source frontier training with economic sustainability. This report presents the outcome of a research effort spanning communication-efficient parallelism, asynchronous optimization, and fault-tolerant systems design. It culminates in the first demonstration of its kind: Pluralis-8B, an open, permissionless pretraining run of an 8.6B-parameter model on 500B tokens of FineWeb-Edu. The model was trained over 40 days by 330 contributor nodes, predominantly consumer GPUs on internet connections, joining and leaving throughout. The run sustained ~170k tokens/s and 4.2 tokens per TFLOP of pooled compute, 63% of the efficiency of a centralized H100 baseline, and converged to within a small margin of a centralized reference run.
- Abstract(参考訳): マルチビリオンから1兆のパラメータスケールでの大規模言語モデルのトレーニングはデータセンターに限られており、データ並列(DP)とモデル並列(MP)技術は、同種加速器、高速相互接続、単一オーケストレーションエンティティを前提としている。
したがって、フロンティアモデルの開発は、そのようなクラスターを組み立てることのできる数少ないグループに集約される。
コンシューマとプロフェッショナルのGPUは、異質でプリエンプティブルで、個別に所有され、インターネットでのみ接続される。
本稿では,この計算を効率的に利用するシステムであるAgoraを紹介する。
Agoraは、インターネットグレードリンク上の帯域効率の高いパイプライン並列モデルシャーディングと、複数パーティのフォールトトレラントな集団操作を組み合わせる。
各参加者はモデルの1つのステージしか持たず、単一のパーティがフルウェイトを持つことはない。
集合的に訓練された、集合的に所有されたモデルを可能にし、経済的持続可能性を備えたオープンソースのフロンティアトレーニングへの道を開く。
本稿では,通信効率の高い並列処理,非同期最適化,フォールトトレラントシステム設計を対象とする研究成果について述べる。
Pluralis-8BはFineWeb-Eduの500Bトークン上の8.6Bパラメータモデルのオープンで無許可の事前トレーニング実行である。
モデルは、インターネット接続上のコンシューマGPUを中心に、330のコントリビュータノードによって40日間にわたってトレーニングされた。
この実行は、プール化された計算のTFLOPあたり170kトークン/sと4.2トークンを持続し、中央のH100ベースラインの効率の63%を占め、中央の参照ランの小さなマージンに収束した。
関連論文リスト
- Unextractable Protocol Models: Collaborative Training and Inference without Weight Materialization [58.14514930760722]
参加者が協力して大規模なニューラルネットワークを訓練し、提供する分散セットアップを検討する。
このセットアップでは、フルウェイトセットがどの参加者にも利用できないような、非機械的なウェイトの可能性を探る。
我々は、シャードモデルセットアップを利用するトレーニングおよび推論フレームワーク、Unextractable Protocol Models (UPMs)を紹介する。
論文 参考訳(メタデータ) (2026-05-22T10:24:57Z) - On Harnessing Idle Compute at the Edge for Foundation Model Training [7.228241542082645]
我々はCleaveを紹介し、新しい選択型ハイブリッドテンソル並列化法により、トレーニング操作を微妙に分割する。
Cleaveは、大規模なモデルや数千のデバイスに効率的にスケーリングすることで、クラウドベースのGPUトレーニングにマッチし、ベースラインのエッジトレーニングアプローチよりも最大8倍のデバイスをサポートする。
最先端のエッジトレーニング手法を、バッチ毎のトレーニング時間で最大10倍に向上し、デバイス障害を効率的に処理し、従来の方法よりも少なくとも100倍高速なリカバリを実現している。
論文 参考訳(メタデータ) (2025-12-13T20:57:43Z) - NoLoCo: No-all-reduce Low Communication Training Method for Large Models [0.310688583550805]
大規模言語モデルのトレーニングは、一般的に数万のアクセラレータを含むクラスタ上で最適化手法によって行われる。
NoLoCoは、モデルウェイトをランダムに選択された他のウェイトと部分的に平均化することで、Nesterov運動量の新しい変種を介してモデルウェイトを暗黙的に同期させる。
提案手法は, 完全シャードデータ並列訓練や, 広範に使用されている低通信訓練であるDiLoCoよりも通信オーバーヘッドをはるかに少なくする。
論文 参考訳(メタデータ) (2025-06-12T17:23:23Z) - Decentralized Diffusion Models [53.89995588977048]
大規模なAIモデルトレーニングでは、数千のGPU間で作業が分割され、各ステップでグラデーションが同期される。
これにより、集中型のモノリシッククラスタしかサポートできない、ネットワークの重大な負担が発生する。
独立クラスタ間で拡散モデルのトレーニングを分散するスケーラブルなフレームワークである分散拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-01-09T18:59:56Z) - ATOM: Asynchronous Training of Massive Models for Deep Learning in a Decentralized Environment [7.916080032572087]
Atomは、分散化された環境で巨大なモデルの非同期トレーニング用に設計された、レジリエントな分散トレーニングフレームワークである。
atomは、スワップをシームレスにモデルし、トレーニングスループットを最適化するために複数のコピーを同時にトレーニングすることで、1つのホスト(ピア)に完全なLLMを適合させることを目的としている。
異なるGPT-3モデル構成を用いて実験したところ、最適ネットワーク接続のシナリオでは、原子は最先端の分散パイプライン並列化アプローチを組み込んだ場合、トレーニング効率を最大20倍に向上させることができることがわかった。
論文 参考訳(メタデータ) (2024-03-15T17:43:43Z) - Ravnest: Decentralized Asynchronous Training on Heterogeneous Devices [0.0]
Ravnestは、計算ノードをクラスタに効率的に整理することで、分散トレーニングを促進する。
遅延更新を伴うブロック構造最適化問題として,非同期SGD損失関数のフレーム化を行った。
論文 参考訳(メタデータ) (2024-01-03T13:07:07Z) - SWARM Parallelism: Training Large Models Can Be Surprisingly
Communication-Efficient [69.61083127540776]
ディープラーニングアプリケーションは、数十億のパラメータを持つ大きなモデルを使用することの恩恵を受ける。
これらのモデルのトレーニングは、特殊なHPCクラスタを必要とするため、非常に高価である。
安価な"プリエンプティブル"インスタンスを使用するか、あるいは複数のリージョンから既存のリソースをプールする。
論文 参考訳(メタデータ) (2023-01-27T18:55:19Z) - Decentralized Training of Foundation Models in Heterogeneous
Environments [77.47261769795992]
GPT-3 や PaLM のようなトレーニング基盤モデルは、非常に高価である。
ヘテロジニアスネットワーク上での分散型システムにおけるモデル並列化を用いた大規模基盤モデルのトレーニングに関する最初の研究について述べる。
論文 参考訳(メタデータ) (2022-06-02T20:19:51Z) - Training Recommender Systems at Scale: Communication-Efficient Model and
Data Parallelism [56.78673028601739]
通信効率のよいハイブリッドトレーニングのためのDCT(Dynamic Communication Thresholding)という圧縮フレームワークを提案する。
DCTは、それぞれDPとMPの間に、少なくとも$100times$と$20times$の通信を削減します。
最先端の産業レコメンデーションモデルのエンドツーエンドのトレーニング時間を、パフォーマンスを損なうことなく、37%改善する。
論文 参考訳(メタデータ) (2020-10-18T01:44:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。