論文の概要: Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training
- arxiv url: http://arxiv.org/abs/2606.19004v1
- Date: Wed, 17 Jun 2026 12:31:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:51.161578
- Title: Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training
- Title(参考訳): Spotlight: DiT RLポストトレーニングのためのシード探索とスポットGPUの同期
- Authors: Ruiqi Lai, Dakai An, Wei Gao, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Dmitrii Ustiugov, Wei Wang,
- Abstract要約: Reinforcement Learning (RL) after-training of Diffusion Transformers (DiTs)は、非常に高価であり、数千のハイエンドGPUを必要とする。
本稿では,DiT RLのポストトレーニング用GPUを抽出する最初のシステムであるSpotlightを紹介する。
オープンソースのRLプラットフォームROLLでSpotlightを実装し,Qwen-Imageポストトレーニングで評価する。
- 参考スコア(独自算出の注目度): 9.410918874958803
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning (RL) post-training of Diffusion Transformers (DiTs) is prohibitively expensive, requiring thousands of high-end GPUs. Existing works explore two directions to reduce cost: seed exploration improves training convergence by selecting high-contrast samples, yet adds compute to the critical path; spot GPUs offer 69--77\% lower cost, yet sit idle during training because DiT rollouts finish nearly simultaneously, which prevents LLM-style pipelining of rollout with training. Spot preemptions further break Sequence Parallelism (SP) groups, fragmenting GPU topology. We present Spotlight, the first system that harvests spot GPUs for DiT RL post-training. Spotlight rests on two key insights we devise: (1)~we show that exploration can tolerate stale model weights because exploration that uses the model weights from the previous iteration preserves the relative ranking of random seeds, allowing exploration to run on idle spot GPUs during training. (2)~SP reconfiguration can reuse on-node state, reducing group recovery from minutes to sub-second launches. Built on these insights, Spotlight introduces three techniques: a bandit-based exploration planner that maximizes reward variance within the training time budget, elastic sequence parallelism that reconfigures SP groups on the fly via persistent schedulers and intra-node weight copying, and a preemption-aware pull-based request scheduler that balances load and commits in-flight state upon preemption. We implement Spotlight on the open-source RL platform ROLL and evaluate it on Qwen-Image post-training. Spotlight reaches the same target validation score $4\times$ faster than baselines, reducing total cost by $1.4$-$6.4\times$ while achieving superior image quality on DeepSeek-OCR and Geneval datasets with resolution $512\times512$ and $1280\times1280$.
- Abstract(参考訳): 拡散変換器(DiT)のトレーニング後の強化学習(RL)は、非常に高価であり、数千のハイエンドGPUを必要とする。
既存の作業では、高いコントラストサンプルを選択してトレーニング収束を改善するが、クリティカルパスに計算を追加する。スポットGPUは69~77倍のコストを提供するが、DiTロールアウトがほぼ同時に終了するため、トレーニング中にアイドル状態になる。
スポットプリエンプションはさらにSequence Parallelism(SP)グループを破り、GPUトポロジを断片化する。
本稿では,DiT RLポストトレーニングのためのスポッティングGPUを抽出する最初のシステムであるSpotlightを紹介する。
1) - 前回のイテレーションからモデルウェイトを使用した探索は、ランダムなシードの相対的なランキングを保持し、トレーニング中にアイドルスポットGPU上での探索を可能にするため、古いモデルウェイトを許容できることを示します。
2)~SP再構成は、ノード状態の再利用を可能にし、グループリカバリを数分から秒未満の起動に短縮する。
これらの洞察に基づいて、Spotlightでは、トレーニング時間予算内の報酬分散を最大化するバンディットベースの探索プランナ、永続的なスケジューラとノード内の重み付けを通じてSPグループを再構成するエラスティックシーケンス並列性、プリエンプション時に負荷とコミットのバランスをとるプリエンプション対応のプルベースの要求スケジューラの3つのテクニックを紹介している。
オープンソースのRLプラットフォームROLLでSpotlightを実装し,Qwen-Imageポストトレーニングで評価する。
Spotlightはベースラインよりも4ドル、総コストを1.4ドルから6.4ドル、解像度512ドル、1280ドルという高画質のDeepSeek-OCRとGenevalデータセットで優れた画質を実現している。
関連論文リスト
- Libra: Efficient Resource Management for Agentic RL Post-Training [11.701871372256205]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)を有能なエージェントに変換するための訓練後の標準パラダイムとして登場した。
エージェントRLでは、ロールアウトステージはツールを呼び出しながら軌道を生成し、長い尾と静止しないワークロードを生成する。
両課題に対処するリソース管理システムLibraについて,2つのコアメカニズムを用いて紹介する。
論文 参考訳(メタデータ) (2026-06-02T03:09:13Z) - Near-Future Policy Optimization [51.760544033045726]
検証可能な報酬(RLVR)による強化学習は、学習後の中核的なレシピとなっている。
textbfNear-Future textbfPolicy textbfOptimization (textbfNPO)を提案する。
論文 参考訳(メタデータ) (2026-04-22T16:20:41Z) - Just-In-Time Reinforcement Learning: Continual Learning in LLM Agents Without Gradient Updates [53.3717573880076]
JitRL(Just-In-Time Reinforcement Learning、ジャスト・イン・タイム強化学習)は、テスト時間ポリシーの最適化を可能にするトレーニング不要のフレームワークである。
JitRLは、経験の動的で非パラメトリックな記憶を維持し、関連する軌跡を取得して、オンザフライでのアクションの利点を推定する。
WebArenaとJerrichoの実験では、JitRLがトレーニング不要メソッドの間に新しい最先端技術を確立していることが示されている。
論文 参考訳(メタデータ) (2026-01-26T14:16:51Z) - AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs [24.96730768606278]
異種対応非同期RLトレーニングシステムであるAReaL-Hexを提案する。
ヘテロジニアスGPU上でロールアウト生成とポリシモデルのトレーニングを実行する方法を、効果的にスケジュールする。
最大1.50倍のトレーニングスループットと1.46倍のトレーニングコストの削減を提供する。
論文 参考訳(メタデータ) (2025-11-02T04:17:30Z) - RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs [48.94639777633359]
RLBoostは、プリエンプティブルGPUリソースを抽出するコスト効率のよいRLトレーニングのための体系的なソリューションである。
RLBoostはトレーニングのスループットを1.51x-1.97x向上し、オンデマンドGPUリソースのみを使用する場合に比べてコスト効率は28%-49%向上した。
論文 参考訳(メタデータ) (2025-10-22T04:19:37Z) - Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts [28.17839625646103]
ロールアウト前に非形式的なプロンプトをスキップすることで,計算オーバーヘッドのかなりの部分が回避可能であることを示す。
我々は,非形式的プロンプトを予測・スキップするオンライン軽量プリロールアウトフィルタリングアルゴリズムであるGRESOを提案する。
GRESOは, ロールアウト時に最大2.4倍, トレーニング時間全体で最大2.0倍の高速化を達成でき, 精度は低下しない。
論文 参考訳(メタデータ) (2025-06-02T19:03:00Z) - Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training [71.16258800411696]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)のポストトレーニングにおいて重要な要素である。
ポストトレーニングに使われている既存のオンラインアルゴリズムは、経験的リプレイバッファの使用と本質的に相容れない。
本稿では,TBA(Trajectory Balance with Asynchrony)によるバッファの再生を効率よく行うことを提案する。
論文 参考訳(メタデータ) (2025-03-24T17:51:39Z) - Posterior Coreset Construction with Kernelized Stein Discrepancy for
Model-Based Reinforcement Learning [78.30395044401321]
我々は、強化学習(MBRL)のための新しいモデルベースアプローチを開発する。
ターゲット遷移モデルの仮定を緩和し、混合モデルの一般的な族に属する。
連続的な制御環境では、壁時計の時間を最大50%削減することができる。
論文 参考訳(メタデータ) (2022-06-02T17:27:49Z) - RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch [23.104546205134103]
深層強化学習(DRL)モデルの訓練は通常、高いコストを必要とする。
DRLモデルの圧縮は、トレーニングアクセラレーションとモデル展開に大きな可能性を秘めている。
我々は,「textbfRigged textbfReinforcement textbfLearning textbfLottery (RLx2) 」という,新しいスパースDRLトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2022-05-30T12:18:43Z) - ElegantRL-Podracer: Scalable and Elastic Library for Cloud-Native Deep
Reinforcement Learning [141.58588761593955]
クラウドネイティブな深層強化学習のためのライブラリElegantRL-podracerを提案する。
数百万のコアを効率的にサポートし、複数のレベルで大規模な並列トレーニングを実行する。
低レベルでは、各ポッドは1つのGPUで7,000近いGPUコアをフル活用することで、エージェントと環境のインタラクションを並列にシミュレートする。
論文 参考訳(メタデータ) (2021-12-11T06:31:21Z) - Exploiting Activation based Gradient Output Sparsity to Accelerate
Backpropagation in CNNs [15.465530153038927]
多くの最先端技術の背後にある原動力として、機械学習(ML/DL)ベースの技術が登場している。
しかし、大きなパラメータを含むこれらのモデルをトレーニングすることは、時間とエネルギーの両方を消費する。
論文 参考訳(メタデータ) (2021-09-16T04:12:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。