論文の概要: Leto: Fast In-Place Recovery for LLM Training on Surviving Hardware
- arxiv url: http://arxiv.org/abs/2610.00687v1
- Date: Wed, 30 Sep 2026 20:29:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.759381
- Title: Leto: Fast In-Place Recovery for LLM Training on Surviving Hardware
- Title(参考訳): Leto: 生存中のハードウェア上でのLCMトレーニングのための高速インレースリカバリ
- Abstract要約: ハードウェア操作可能な障害(HOF)は、大規模言語モデル(LLM)のトレーニングを中断するが、リセット、修復、置換なしに同じハードウェアでのリカバリを許可する。
本稿では,生存ハードウェアを活用した耐故障性トレーニングシステムであるLetoについて紹介する。
- 参考スコア(独自算出の注目度): 8.045943039007309
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Hardware-operable failures (HOFs) interrupt large language model (LLM) training but permit recovery on the same hardware without reset, repair, or replacement. Existing recovery systems nevertheless reload checkpoints, recompute lost progress, and rebuild process state, idling GPUs that could otherwise continue training. We present Leto, a fault-tolerant training system that leverages surviving hardware to enable efficient in-place recovery. Our key insight is that the state needed to resume training can be retained or prepared outside the active training process while remaining on the same hardware. Leto retains the working model state and the reusable process state, and preinitializes the remaining state in a shadow trainer. We devise two-tier erasure protection and chunk-level transactional updates to keep the retained model state recoverable and consistent, and reclaim the shadow state when active training needs its GPU memory. Evaluation on 6- and 72-GPU NVIDIA A100 clusters shows that Leto recovers 3.6--6.5$\times$ faster than the best-performing checkpointing baselines and improves productive training time by up to 13.7 percentage points. Large-scale simulation shows over 95% productive training time on a 131,072-GPU cluster.
- Abstract(参考訳): ハードウェア操作可能な障害(HOF)は、大規模な言語モデル(LLM)のトレーニングを中断するが、リセット、修復、置換なしに同じハードウェアでのリカバリを許可する。
それにもかかわらず、既存のリカバリシステムは、チェックポイントを再ロードし、失われた進捗を再計算し、プロセス状態を再構築する。
本稿では,生存ハードウェアを活用した耐故障性トレーニングシステムであるLetoについて紹介する。
私たちの重要な洞察は、トレーニングを再開するために必要な状態は、同じハードウェアに留まりながら、アクティブなトレーニングプロセスの外で維持または準備できるということです。
レトは作業モデル状態と再利用可能なプロセス状態を保持し、残りの状態をシャドウトレーナーで初期化する。
我々は、2階層の消去保護とチャンクレベルのトランザクション更新を考案し、保持されたモデル状態を回復可能で一貫した状態に保つとともに、アクティブトレーニングがGPUメモリを必要とする場合のシャドウ状態を回復する。
6-GPUと72-GPUのNVIDIA A100クラスタの評価によると、Letoは最高のチェックポイントベースラインよりも3.6--6.5$\times$で回復し、最大13.7ポイントの生産性トレーニング時間を改善する。
大規模シミュレーションでは、131,072-GPUクラスタ上で95%以上の生産的なトレーニング時間を示している。
関連論文リスト
- ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload [18.933354857797056]
大規模GPUクラスタ上での大規模言語モデルの事前トレーニングは、ハードウェア障害を稀ではなく日常的なものにしている。
一つの不変量を保持するレジリエントな事前学習システムであるReCoVerを提案する。
チェックポイントとリスタートのベースラインと比較して、ReCoVerは連続する障害の後、より効果的なスループットを2.23タイムで示す。
論文 参考訳(メタデータ) (2026-05-11T20:28:31Z) - Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity [57.83511884904928]
本研究では,実証分析による自己回帰映像生成モデルの訓練を高速化する手法を検討する。
その結果,少ないビデオフレームでのトレーニングではトレーニング時間が大幅に短縮される一方で,エラーの蓄積が悪化し,生成したビデオに矛盾が生じることが判明した。
リプシッツ連続性に触発されて、生成されたビデオの一貫性を改善するためにRepresentation Continuity(ReCo)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-08T09:43:03Z) - TTT3R: 3D Reconstruction as Test-Time Training [69.51086319339662]
テストタイムトレーニングの観点から3次元再構築基盤モデルを再考する。
メモリ状態と受信した観測値のアライメントの信頼性を利用して、クローズドフォーム学習率を導出する。
この訓練のない介入はTTT3Rと呼ばれ、長さの一般化を大幅に改善する。
論文 参考訳(メタデータ) (2025-09-30T17:59:51Z) - MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment [14.392166280035122]
エッジサーバにデプロイされる大規模言語モデル(LLM)は、パーソナライズされたアシスタント、レコメンデーション、コンテンツモデレーションといった遅延に敏感なアプリケーションでますます利用されている。
既存のリトレーニング戦略は、モデル更新の遅延、再トレーニングのための過剰コミットリソース、イテレーションレベルのリトレーニングの粒度を見落としている。
我々は,同時推論(プリフィル,デコード)と微調整を同時に行うハイブリッドLLMシステムであるMACEを提案し,知的メモリ管理により,推論スループットを約束しながらタスク性能を最大化する。
論文 参考訳(メタデータ) (2025-09-28T18:45:28Z) - Lazarus: Resilient and Elastic Training of Mixture-of-Experts Models [39.860441918723]
大規模言語モデル(LLM)の弾力性と弾力性を備えたトレーニングシステムであるLazarusについて述べる。
Lazarusはエキスパートのレプリカを適応的に割り当てて、専門家のワークロードの固有の不均衡に対処し、トレーニングをスピードアップする。
評価の結果、Lazarusはノード障害の頻度で5.7倍、実際のインスタンストレースで3.4倍、既存のMoEトレーニングシステムよりも優れていた。
論文 参考訳(メタデータ) (2024-07-05T17:13:41Z) - ProTrain: Efficient LLM Training via Memory-Aware Techniques [18.30799115938978]
本稿では,メモリ,計算,IOの調整によってメモリ使用量と性能のバランスをとる新しいトレーニングシステムであるProTrainを提案する。
ProTrainは、SOTAのトレーニングシステムと比較して、トレーニングのスループットを1.43$times$から2.71$timesに改善する。
論文 参考訳(メタデータ) (2024-06-12T15:40:06Z) - Fast Machine Unlearning Without Retraining Through Selective Synaptic
Dampening [51.34904967046097]
Selective Synaptic Dampening (SSD)は高速で、訓練データの長期保存を必要としない。
高速で性能が高く,トレーニングデータの長期保存を必要としない,新しい2段階のポストホック,リトレーニングフリーなマシンアンラーニング手法を提案する。
論文 参考訳(メタデータ) (2023-08-15T11:30:45Z) - Simplifying Deep Reinforcement Learning via Self-Supervision [51.2400839966489]
自己改善強化学習(Self-Supervised Reinforcement Learning, SSRL)は、純粋に監督された損失を伴うポリシーを最適化する単純なアルゴリズムである。
SSRLは、より安定した性能と実行時間の少ない現代アルゴリズムと驚くほど競合することを示す。
論文 参考訳(メタデータ) (2021-06-10T06:29:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。