論文の概要: DeadPool: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint
- arxiv url: http://arxiv.org/abs/2607.01646v1
- Date: Thu, 02 Jul 2026 03:17:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.648601
- Title: DeadPool: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint
- Title(参考訳): DeadPool:ゼロオーバーヘッドチェックポイントによるホットスワッピングによる回復力のあるLLMトレーニング
- Abstract要約: ホットスワッピングによる大規模言語モデル(LLM)トレーニングを復元するフォールトトレランス機構であるDeadPoolを提案する。
DeadPoolはゼロオーバーヘッドエラーのない実行と極めて低いリカバリコストの両方を同時に実現します。
- 参考スコア(独自算出の注目度): 11.750747594417339
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-of-the-art large language model (LLM) training takes tens of thousands of graphics processing units (GPUs) for months and encounters failures across the software and hardware stack. Existing fault-tolerance mechanisms either impose non-trivial overhead during failure-free execution or suffer from prolonged recovery latency, particularly under scenarios where a small subset of compute nodes experience permanent failures. %The tradeoff between failure-free overhead and recovery latency forms a space forms a Pareto frontier We present DeadPool to simultaneously address both optimization objectives. DeadPool incorporates a fault-tolerance mechanism that restores LLM training via hot-swapping, namely by replacing failed nodes with spare nodes without terminating the complete job. The hot-swapping of DeadPool is enabled by two ideas: First, it exploits an off-critical-path in-memory checkpointing mechanism for spatial redundancy. Second, it introduces a communicator reconstruction protocol that replaces failed nodes with spare nodes at runtime. DeadPool efficiently overlaps the in-memory checkpointing with computation, thus introducing zero overhead during error-free execution. Upon permanent node failures, DeadPool can rebuild memory states with minimal recomputation by leveraging in-memory checkpoints. We evaluate DeadPool across scales (up to 512 NVIDIA A100 GPUs) and LLMs (up to 65B parameters), and observe zero checkpoint overhead with hot-swapping recovery completing in under 40 seconds. These results show that DeadPool simultaneously achieves both zero-overhead error-free execution and extremely low recovery cost.
- Abstract(参考訳): 最先端の大規模言語モデル(LLM)トレーニングは、数ヶ月間数万のグラフィックス処理ユニット(GPU)を要し、ソフトウェアとハードウェアスタックにまたがる障害に遭遇する。
既存のフォールトトレランスメカニズムは、障害のない実行中に非自明なオーバーヘッドを課すか、特に少数の計算ノードが永続的な障害を経験するシナリオにおいて、回復遅延の長期化に苦しむ。
% 障害のないオーバーヘッドとリカバリ遅延の間のトレードオフが空間を形成し、Paretoフロンティアを形成します。
DeadPoolにはフォールトトレランス機構があり、ホットスワッピングによってLLMトレーニングを復元する。
DeadPoolのホットスワッピングは、2つのアイデアによって実現されている。
第二に、実行時に失敗したノードをスペアノードに置き換えるコミュニケータ再構築プロトコルを導入する。
DeadPoolはインメモリのチェックポイントと計算を効率的に重複させ、エラーのない実行時にオーバーヘッドをゼロにする。
永続的なノード障害が発生すると、DeadPoolはインメモリチェックポイントを利用することで、最小限の再計算でメモリ状態を再構築できる。
我々はDeadPoolをスケール(最大512 NVIDIA A100 GPU)とLLM(最大65Bパラメータ)で評価し、ホットスワッピングリカバリを40秒以内で完了してゼロチェックポイントオーバーヘッドを観測した。
これらの結果から,DeadPoolはゼロオーバーヘッドエラーのない実行と極めて低いリカバリコストの両方を同時に実現することがわかった。
関連論文リスト
- Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding [51.48425605758328]
我々は,Faster Flash Decoding (FFD) という,長文デコーディングにおいてメモリ壁を壊すように設計されたハードウェア・アルゴリズムの共同設計フレームワークを提示する。
FFDはセレクタとコンピュータを完全に融合したカーネルに統合し、外部メタデータのインデックスをコンテンツ認識スキャンに置き換える。
最大11.6倍のカーネルレベルのスピードアップと256Kコンテキスト長のスケーリングを実現し、2.37倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-08-31T15:13:20Z) - SCOUT: Symmetric Consensus Outlier Detection for Failure Localization in LLM Pre-Training [7.018753691717986]
事前トレーニングでは、同期は、ランクローカルなストール、スローダウン、数値的なエラーをジョブワイドな症状へと伝播し、その起源を隠蔽する。
SCOUTは1つの設計原則に基づいて構築された統一型ランタイム障害局所化フレームワークである。
SCOUTはトレーニングループやフレームワークソースの変更なしに、PyTorch、TorchTitan、Megatron-Core、DeepSpeedと統合されている。
論文 参考訳(メタデータ) (2026-08-11T15:12:14Z) - Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers [0.0]
実行状態を維持して、実行を中断し、クラッシュを生き残るためのフレームワークは、すでに発生した影響に対して、再開が何を意味するのかを判断し続けなければなりません。
5つの広くデプロイされたエージェントワークフローフレームワークがそれぞれ異なる答えを出し、マシンチェック可能なコントラクトを公開することはない。
LangGraph 1.2.9は2度目の履歴書値を記録し、それを参照せず、無意味な状態を静かに持続し、実際のSIGKILLの後、永続的に記録された作業を再実行する。
論文 参考訳(メタデータ) (2026-08-04T15:45:31Z) - Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving [0.5076419064097734]
我々は、低レイテンシ、小バッチ、デバイス上の物理AIサービスという、反対の体制について研究する。
完全復元可能な状態に対するグラフバウンドチェックポイントと復元機構である実行状態カプセルを導入する。
これにより、トークンアドレス付きKVフラグメントからグラフバウンド実行状態境界への再利用が実現される。
論文 参考訳(メタデータ) (2026-06-18T17:49:36Z) - Don't Let a Few Network Failures Slow the Entire AllReduce [7.373533433335005]
非対称ネットワーク帯域におけるAllReduce完了時間に対する情報理論の下限について述べる。
次に、この低いバウンダリにアプローチする4段パイプラインAllReduceアルゴリズムであるOpsCCを設計します。
SimAIの実験では、OptCCが既存のフォールトトレラント方式で残っているギャップを埋めていることが確認されている。
論文 参考訳(メタデータ) (2026-06-01T04:40:41Z) - Towards Distributed Inference of LLMs on a P2P Network [1.1458853556386797]
プレフィックスキャッシュは、共有プロンプトでリクエスト間でKVキャッシュを再利用することで、LLM推論のレイテンシを低減することができる。
ピアツーピアLLMサービスのための分散型プレフィックスキャッシュ対応ルーティング方式を提案する。
論文 参考訳(メタデータ) (2026-05-07T15:40:51Z) - DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks [54.32016216994156]
本稿では,DINOv3特徴を生成対象として用い,視覚ノイズから相互作用意味を乱す因果潜在世界モデル(CLWM)を提案する。
メモリスケーリングを克服するため、CLWMはDual-State Test-Time Training (TTT)メモリを備えている。
EmbodiChainは、トレーニング中に物理基底軌道の無限の流れを注入することによって効率法を確立するオンラインフレームワークである。
論文 参考訳(メタデータ) (2026-04-13T03:19:36Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - Training LLMs with Fault Tolerant HSDP on 100,000 GPUs [9.97532556913539]
同期トレーニングは、頻繁な障害と長い回復時間により、効率が低下する。
我々は、FT-HSDP(Fault Tolerant Hybrid-Shared Data Parallelism)を提案する。
FT-HSDPはフォールトトレランスの単位としてデータ並列レプリカを使用する。
論文 参考訳(メタデータ) (2026-01-30T19:57:36Z) - Reliable and Resilient Collective Communication Library for LLM Training and Serving [5.400838203617311]
マルチNICハードウェア用のフォールトトレラント通信ライブラリであるR$2$CCLを提案する。
R$2$CCLは、高速な接続マイグレーション、帯域幅対応ロード再分配、および障害時の進捗を維持するための回復力のある集合アルゴリズムを実行する。
実験によると、R$2$CCLはNIC障害に対して非常に堅牢であり、トレーニングは1%未満、推論オーバーヘッドは3%未満である。
論文 参考訳(メタデータ) (2025-12-31T18:53:11Z) - All is Not Lost: LLM Recovery without Checkpoints [0.1638581561083717]
CheckFreeは、失敗するステージを最も近いステージの重み付き平均で置き換える効率的なリカバリ手法である。
CheckFreeとCheckFree+は、ウォールクロック時間の収束率でチェックポイントと冗長な計算を12%以上上回った。
論文 参考訳(メタデータ) (2025-06-18T13:48:33Z) - Rectified Sparse Attention [61.7702154360081]
効率的なロングシーケンス生成は、大規模言語モデルにとって重要な課題である。
本稿では,ブロックスパースアテンションと周期的な密度補正を組み合わせた簡易かつ効果的な方法であるRectified Sparse Attention (ReSA)を提案する。
数学推論、言語モデリング、検索タスクにわたる実験は、ReSAがほぼ無作為な生成品質を達成することを示す。
論文 参考訳(メタデータ) (2025-06-04T16:01:48Z) - Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models [50.260693393896716]
拡散モデル(DM)は高忠実度画像を生成できる強力な生成モデルであるが、高い計算コストで制約される。
我々は、事前訓練されたパラメータを変更することなく、生成スケジュールとモデルアーキテクチャを協調的に最適化する、トレーニング不要なNASフレームワークFlexiffusionを提案する。
我々の研究は、品質を犠牲にすることなく高速DMを検索するための資源効率の良いパラダイムを開拓した。
論文 参考訳(メタデータ) (2025-06-03T06:02:50Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - ReCycle: Resilient Training of Large DNNs using Pipeline Adaptation [2.0181279529015925]
ReCycleは、障害発生時の効率的なトレーニング用に設計されたシステムである。
分散トレーニングシステムに固有の機能的冗長性を活用する。
複数の障害で高いトレーニングスループットを実現していることを示す。
論文 参考訳(メタデータ) (2024-05-22T21:35:56Z) - AdaPool: Exponential Adaptive Pooling for Information-Retaining
Downsampling [82.08631594071656]
畳み込み層は畳み込みニューラルネットワーク(CNN)の重要な構成要素である
適応的で指数関数的に重み付けされたアダプール法を提案する。
adaPoolは画像やビデオの分類やオブジェクト検出など,さまざまなタスクを通じて,ディテールの保存性の向上を実証する。
論文 参考訳(メタデータ) (2021-11-01T08:50:37Z) - Refining activation downsampling with SoftPool [74.1840492087968]
畳み込みニューラルネットワーク(cnns)は、アクティベーションマップのサイズを減らすためにプールを使用する。
指数重化アクティベーションダウンサンプリングの高速かつ効率的な方法であるSoftPoolを提案します。
SoftPoolは、アクティベーションマップの縮小でより多くの情報を保持できることを示します。
論文 参考訳(メタデータ) (2021-01-02T12:09:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。