論文の概要: MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
- arxiv url: http://arxiv.org/abs/2607.22696v1
- Date: Fri, 17 Jul 2026 19:30:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.031446
- Title: MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion
- Title(参考訳): MegaSlide-DiT : 効率的なビデオ拡散のためのメモリ中心適応と変形可能な局所アテンション
- Abstract要約: MegaSlide-DiTは、1.5TBのホストRAMを持つ単一のH200 GPU上で、事前トレーニングされた105B DiTをどのように適用できるかを示すプロトタイプである。
私たちの考えでは、すべての永続的な重み、マスターウェイト、モーメントがホストメモリに留まるわけではなく、オンデマンドでGPUにストリームされるのは一時的なシャードだけなのです。
- 参考スコア(独自算出の注目度): 3.7821833028870038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-resolution video diffusion models built on Diffusion Transformers (DiTs) deliver strong fidelity but quickly exhaust the memory budget of a single workstation. A 100 billion-plus parameter DiT easily requires over a terabyte of persistent state, while naive spatiotemporal self-attention grows quadratically in sequence length. These two walls -- parameter memory and activation memory -- prevent researchers from adapting massive generative models without large GPU clusters. We revisit this problem from a systems perspective and introduce MegaSlide-DiT, a prototype that demonstrates how a pre-trained 105B DiT can be adapted on a single H200 GPU with 1.5 TB of host RAM. Our key insight is that the GPU need not own the model state: all persistent weights, master weights and optimizer moments remain in host memory, while only transient shards are streamed to the GPU on demand. Simultaneously, we replace quadratic global attention with 3D Deformable Slide Attention (3D-DSA), a motion-adaptive local attention operator that reduces both memory and computational complexity to linear in the sequence length. We report detailed memory accounting, execution traces and evaluation results to substantiate our design. MegaSlide-DiT does not claim to train a 105B model from scratch on a single GPU, nor does it magically solve bandwidth limits; rather, it offers a pragmatic path for full-parameter adaptation of massive video diffusion models on high-end workstations.
- Abstract(参考訳): Diffusion Transformers (DiTs) 上に構築された高解像度ビデオ拡散モデルは、強い忠実さを提供するが、単一のワークステーションのメモリ予算を急速に消費する。
1000億以上のパラメータ DiT は1テラバイト以上の永続的な状態を容易に要求する一方、単純で時空間的な自己注意はシーケンス長で2次的に増加する。
これら2つの壁 -- パラメータメモリとアクティベーションメモリ -- は、研究者が大きなGPUクラスタなしで大規模な生成モデルを適用するのを防ぐ。
MegaSlide-DiTは、トレーニング済みの105B DiTが、1.5TBのホストRAMを持つ1つのH200 GPUにどのように適応できるかを示すプロトタイプである。
永続的な重み、マスターウェイト、オプティマイザモーメントはすべてホストメモリに残っていますが、オンデマンドでGPUにストリームされるのは一時的なシャードだけです。
同時に、二次的グローバルアテンションを3Dデフォルマブルスライドアテンション(3D-DSA)に置き換える。
本稿では,詳細なメモリ会計,実行トレース,評価結果を報告する。
MegaSlide-DiTは、単一のGPU上で105Bモデルをスクラッチからトレーニングするのではなく、帯域幅制限を魔法のように解決する。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models [1.1011268090482575]
自律運転のためのビジョンランゲージ・アクション(VLA)モデルは、単一ニューラルネットワークにおける知覚、推論、制御を統一する。
本稿では,VRAM制約付きGPU上でメモリ効率のよいVLA推論を実現するフレームワークを提案する。
私たちの作業は、完全なBF16精度を維持しながら、Accelerateのオフロードよりも最大3.55倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2026-05-12T07:37:10Z) - FlashMem: Supporting Modern DNN Workloads on Mobile with GPU Memory Hierarchy Optimizations [10.92493656178845]
FlashMemは、大規模で現代的なディープニューラルネットワークとマルチDNNワークロードを効率的に実行するように設計されたメモリストリーミングフレームワークである。
我々は、既存のフレームワークと比較して、FlashMemが2.0倍から8.4倍のメモリ削減と1.7倍から75.0倍のスピードアップを達成することを示した。
11モデルの結果、FlashMemは既存のフレームワークと比較して2.0倍から8.4倍のメモリ削減と1.7倍から75.0倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-02-17T06:23:40Z) - Horizon-LM: A RAM-Centric Architecture for LLM Training [26.927410607740025]
Horizon-LMは、大規模なモデル最適化のためにCPUとGPUの役割を再定義するメモリ中心のトレーニングシステムである。
1.5,TBのホストRAMを持つ1つのH200 GPU上で、Horizon-LMは120Bパラメータまでのモデルを確実にトレーニングする。
標準的なシングルA100マシンでは、Horizon-LMはCPUオフロードのDeepSpeed ZeRO-3よりも最大12.2$timesのトレーニングスループットを実現している。
論文 参考訳(メタデータ) (2026-02-04T18:04:46Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing [52.050036778325094]
Video-Ma$2$mbaは、Mamba-2フレームワークにステートスペースモデル(SSM)を組み込んだ新しいアーキテクチャである。
本手法は,標準勾配チェックポイントに比べてメモリフットプリントを大幅に削減する。
時間的ダイナミクスの詳細なキャプチャーを維持することで、長いビデオ理解タスクにおける応答の精度と関連性を改善することができる。
論文 参考訳(メタデータ) (2024-11-29T04:12:13Z) - LiVOS: Light Video Object Segmentation with Gated Linear Matching [116.58237547253935]
LiVOSはリニアアテンションによるリニアマッチングを利用する軽量メモリネットワークである。
長くて高解像度のビデオでは、STMベースのメソッドと53%のGPUメモリで一致し、32Gの消費者向けGPU上で4096pの推論をサポートする。
論文 参考訳(メタデータ) (2024-11-05T05:36:17Z) - Adaptive Caching for Faster Video Generation with Diffusion Transformers [52.73348147077075]
拡散変換器(DiT)はより大きなモデルと重い注意機構に依存しており、推論速度が遅くなる。
本稿では,Adaptive Caching(AdaCache)と呼ばれる,ビデオDiTの高速化のためのトレーニング不要手法を提案する。
また,AdaCache内で動画情報を利用するMoReg方式を導入し,動作内容に基づいて計算割り当てを制御する。
論文 参考訳(メタデータ) (2024-11-04T18:59:44Z) - AI and Memory Wall [81.06494558184049]
メモリ帯域幅がデコーダモデルの主要なボトルネックとなることを示す。
私たちは、このメモリ制限を克服するためのモデルアーキテクチャ、トレーニング、デプロイメント戦略の再設計を主張します。
論文 参考訳(メタデータ) (2024-03-21T04:31:59Z) - DeepSpeed Inference: Enabling Efficient Inference of Transformer Models
at Unprecedented Scale [20.558091867632445]
DeepSpeed Inferenceは、トランスフォーマーモデル推論のための包括的なシステムソリューションである。
レイテンシ指向シナリオの最先端よりもレイテンシを最大7.3倍削減し、スループット指向シナリオのスループットを1.5倍向上する。
GPUのみのソリューションよりも25倍大きなモデルを推論でき、高いスループットは84 TFLOPS(A6000ピークの50ドル以上)を提供する。
論文 参考訳(メタデータ) (2022-06-30T18:01:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。