論文の概要: BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training
- arxiv url: http://arxiv.org/abs/2605.09994v2
- Date: Fri, 15 May 2026 02:55:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:25.936115
- Title: BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training
- Title(参考訳): BatchWeave: 大規模ファンデーションモデルトレーニングのための一貫性のあるオブジェクト-Store-Nativeデータプレーン
- Authors: Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie,
- Abstract要約: BatchWeaveは、分散FMトレーニングのためのオブジェクトストアネイティブなトレーニングデータプレーンである。
バージョン管理されたマニフェストと条件付きオブジェクト書き込みを実装し、バッチパブリッシュ、リカバリ、ライフサイクル管理を調整する。
完全な障害分離を提供し、Apache Kafkaの取り込みスループットを上回り、Kafkaよりもコンシューマの読み取りレイテンシを低くする。
- 参考スコア(独自算出の注目度): 13.09314762856332
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern Large Foundation Model (LFM) training has transformed the data pipeline from a static ingestion layer into a dynamic component that must co-evolve with the training process. Existing systems are ill-equipped: colocated dataloaders offer no failure isolation, while message queue-based disaggregated dataloaders operate on a record/offset abstraction that cannot express the batch-level semantics required by distributed training. We present BatchWeave, an object-store-native training data plane for distributed LFM training. BatchWeave uses versioned manifests and conditional object writes to coordinate batch publication, recovery, and lifecycle management. First, it introduces the Transactional Global Batch (TGB), which builds on versioned-manifest ACID storage semantics and extends them with training-specific consistency, including atomic all-rank batch visibility, a globally ordered step sequence, checkpoint-aligned lifecycle management, and end-to-end exactly-once recovery. Second, it realizes recovery and retention directly in the storage layer, by durably persisting producer state through the commit protocol and tying reclamation to distributed checkpoint state. Third, its Decentralized Adaptive Commit (DAC) algorithm sustains stable ingestion throughput as the manifest grows, without any inter-producer communication. Evaluations on large-scale multimodal pre-training and SFT workloads using 64 GPUs show that BatchWeave outperforms colocated dataloader throughput while providing full failure isolation, outperforms Apache Kafka in ingestion throughput, and achieves lower consumer read latency than Kafka.
- Abstract(参考訳): Modern Large Foundation Model(LFM)トレーニングは、データパイプラインを静的な取り込み層から、トレーニングプロセスと共進化しなければならない動的コンポーネントに変換する。
メッセージキューベースの非集約データローダは、分散トレーニングで必要とされるバッチレベルのセマンティクスを表現できないレコード/オフセットの抽象化で動作します。
分散LFMトレーニングのためのオブジェクトストアネイティブトレーニングデータプレーンであるBatchWeaveを提案する。
BatchWeaveでは、バージョン付きのマニフェストと条件付きオブジェクト書き込みを使用して、バッチパブリッシュ、リカバリ、ライフサイクル管理を調整する。
まず、トランザクショングローバルバッチ(TGB)を導入し、バージョン管理されたACIDストレージセマンティクスに基づいて、アトミックなオールランクバッチ可視性、グローバルに順序付けられたステップシーケンス、チェックポイント整合ライフサイクル管理、エンドツーエンドの正確に1回のリカバリなど、トレーニング固有の一貫性で拡張する。
第2に、コミットプロトコルを介してプロデューサ状態を永続的に保持し、分散チェックポイント状態にタイリングすることで、ストレージ層に直接のリカバリと保持を実現する。
第3に、分散適応コミット(DAC)アルゴリズムは、プロデューサ間通信を使わずに、マニフェストが大きくなるにつれて安定した取り込みスループットを維持する。
64GPUを使用した大規模マルチモーダル事前トレーニングとSFTワークロードの評価によると、BatchWeaveは、完全な障害分離を提供しながら、コロケーションされたデータローダのスループットを上回り、Apache Kafkaの取り込みスループットを上回り、Kafkaよりもコンシューマの読み取りレイテンシを低くする。
関連論文リスト
- Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale [12.736059967085025]
現代のディープラーニング勧告モデル(DLRM)は、シーケンス長のスケーリング法則に従う。
Fat Row"パラダイムは、これらのシーケンスをトレーニングのすべての例にプリマテリアル化し、ストレージとI/Oウォールを作成します。
本稿では、UIHを正規化不変層に一度保存することで、この冗長性を解消するエンバージョン遅延物質化パラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-27T06:41:39Z) - SENTINEL: Stagewise Integrity Verification for Pipeline Parallel Decentralized Training [54.8494905524997]
分散トレーニングは、信頼できない、地理的に分散したノードで実行される場合、重大なセキュリティリスクをもたらす。
重複のないパイプライン並列性(PP)トレーニングの検証機構であるSENTINELを提案する。
実験では、モデル収束と性能を維持しながら、最大176人の労働者を持つ信頼できない分散環境における最大4BパラメータLSMのトレーニングを成功させた。
論文 参考訳(メタデータ) (2026-03-03T23:51:10Z) - Pull Requests as a Training Signal for Repo-Level Code Editing [49.82435173554125]
Clean Pull Request(Clean-PR)は、現実のGitHubプルリクエストをリポジトリレベルの編集のトレーニングシグナルとして活用する、トレーニング中のパラダイムである。
ノイズの多いプルリクエストの差分を,再構築と検証を通じて検索/リプレース編集ブロックに変換する,スケーラブルなパイプラインを導入する。
SWE-benchでは,SWE-bench Liteが13.6%,SWE-bench Verifiedが12.3%,命令調整ベースラインが大幅に向上した。
論文 参考訳(メタデータ) (2026-02-07T09:22:25Z) - Nimbus: A Unified Embodied Synthetic Data Generation Framework [51.55989844555466]
データボリュームと多様性のスケーリングは、インボディードインテリジェンスを一般化するために重要である。
我々は、異種ナビゲーションと操作パイプラインを統合するために設計された統合合成データ生成フレームワークであるNimbusを紹介する。
評価の結果,Nimbusは最適化されていないベースラインに比べてエンドツーエンドのスループットが2~3倍向上していることがわかった。
論文 参考訳(メタデータ) (2026-01-29T09:27:31Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z) - The Streaming Batch Model for Efficient and Fault-Tolerant Heterogeneous Execution [28.768566833298365]
異種バッチ推論パイプラインのスループットを2.5~12$times$で向上するストリーミングバッチシステムであるRay Dataを紹介します。
Ray Dataは、シングルノードMLデータローダと比較して、安定拡散のようなマルチモーダルモデルのトレーニングスループットを31%改善する。
論文 参考訳(メタデータ) (2025-01-16T19:54:01Z) - TensAIR: Real-Time Training of Neural Networks from Data-streams [1.409180142531996]
本稿では,ANNをリアルタイムにトレーニングする最初のOLシステムであるTensAIRについて述べる。
TensAIRは、分散化および非同期アーキテクチャを使用してANNモデルをトレーニングすることで、優れたパフォーマンスとスケーラビリティを実現する。
我々は、(1)ネットワークにデプロイされたワーカノードの数、(2)データバッチが到着するスループットの観点から、TensAIRがほぼ線形なスケールアウト性能を達成することを実証的に実証した。
論文 参考訳(メタデータ) (2022-11-18T15:11:44Z) - Acceleration of Federated Learning with Alleviated Forgetting in Local
Training [61.231021417674235]
フェデレートラーニング(FL)は、プライバシを保護しながら機械学習モデルの分散最適化を可能にする。
我々は,FedRegを提案する。FedRegは,局所的な訓練段階において,知識を忘れることなくFLを加速するアルゴリズムである。
我々の実験は、FedRegはFLの収束率を著しく改善するだけでなく、特にニューラルネットワークアーキテクチャが深い場合にも改善することを示した。
論文 参考訳(メタデータ) (2022-03-05T02:31:32Z) - How Well Self-Supervised Pre-Training Performs with Streaming Data? [73.5362286533602]
ストリーミング形式でデータが収集される現実のシナリオでは、ジョイントトレーニングスキームは通常、ストレージ重大で時間を要する。
ストリーミングデータでどのように連続的な自己監督プリトレーニングが実行されるかは不明です。
ストリーミングデータ内の分散シフトが軽度である場合,逐次自己教師付き学習は共同学習とほぼ同等の性能を示す。
論文 参考訳(メタデータ) (2021-04-25T06:56:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。