論文の概要: Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
- arxiv url: http://arxiv.org/abs/2609.20744v2
- Date: Mon, 21 Sep 2026 22:33:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.856016
- Title: Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation
- Title(参考訳): Video DeltaNet:ライブストリームビデオ生成のためのビデオネイティブハイブリッドアテンション
- Abstract要約: Video DeltaNet (VDN) は、Softmaxのローカルな注意と、長距離コンテキストビデオのための双方向リニアメモリを組み合わせたものだ。
We instantiate VDN on MiniMax H3, using the hybrid to video-to- video interaction while keeping Softmax。
8段階の蒸留と最適化されたSG供給スタックにより、VDN-H3は14.3秒、768pのビデオを6.70秒でDiTデノイングする。
- 参考スコア(独自算出の注目度): 52.14962478768438
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video diffusion models repeatedly process long spatiotemporal token sequences during denoising, making attention a major computational bottleneck. Linear attention offers an appealing alternative and has been widely adopted in recent large language models, but directly applying it to video models often fails to preserve the fine-grained interactions required for high-quality generation. We present Video DeltaNet (VDN), which combines local Softmax attention with bidirectional linear memory for long-range video context. Its linear branch introduces Video Delta Attention (VDA), which updates memory once per frame by jointly incorporating its spatial tokens. Separate output projections and learnable gates calibrate the two branches, while a staged teacher-alignment recipe progressively introduces the new pathway into pretrained models. We instantiate VDN on MiniMax H3, applying the hybrid to video-to-video interactions while retaining Softmax for interactions involving text or audio. With eight-step distillation and an optimized SGLang serving stack, VDN-H3 completes DiT denoising for a 14.3-second, 768p video in 6.70 seconds on eight NVIDIA B200 GPUs, corresponding to a 14.5x speedup over the 50-step dense H3 baseline on the same GPU count. GitHub code available at: https://github.com/OpenVDN/vdn-minimax-h3. Weights available at: https://huggingface.co/OpenVDN/vdn-minimax-h3
- Abstract(参考訳): ビデオ拡散モデルは、復調中に長時間の時空間トークンシーケンスを繰り返し処理し、注意を大きな計算ボトルネックにする。
線形アテンションは魅力的な代替手段であり、近年の大規模言語モデルで広く採用されているが、ビデオモデルに直接適用しても、高品質な生成に必要なきめ細かい相互作用を保たないことが多い。
本稿では,VDN(Video DeltaNet)について述べる。VDN(VDN)は,ローカルなSoftmaxアテンションと,長距離ビデオコンテキストのための双方向リニアメモリを組み合わせたものだ。
線形ブランチでは、VDA(Video Delta Attention)が導入され、空間トークンを共同で組み込むことで、フレーム毎にメモリを更新する。
出力プロジェクションと学習可能なゲートは2つのブランチをキャリブレーションし、段階的な教師調整レシピは、事前訓練されたモデルに新しいパスを徐々に導入する。
我々は、MiniMax H3上でVDNをインスタンス化し、テキストや音声のやりとりにSoftmaxを保ちながら、ビデオ間インタラクションにハイブリッドを適用する。
8ステップの蒸留と最適化されたSGLangサービススタックにより、VDN-H3は、同じGPU数で50ステップの高密度H3ベースラインよりも14.5倍のスピードアップに対応する8つのNVIDIA B200 GPU上で、14.3秒、768pのビデオのDiTデノイングを6.70秒で完了した。
GitHubのコードは、https://github.com/OpenVDN/vdn-minimax-h3.comで入手できる。
重量:https://huggingface.co/OpenVDN/vdn-minimax-h3
関連論文リスト
- SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation [62.15917923814872]
5Bおよび14Bスケールでインスタンス化されたハイブリッドビデオ拡散変換器であるSANA-Video 2.0を紹介する。
フルソフトのビデオDiTと品質で一致し、線形アテンションの長い連続スケーリングを維持している。
40ステップのサンプリングにより、SANA-Video 2.0は1つのH100でVBenchスコアが84.30で13.2秒で480pに達した。
論文 参考訳(メタデータ) (2026-07-23T17:36:05Z) - Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation [16.611062315689306]
本稿では,時間的情報保持と計算効率を協調的に最適化するハイブリッド・フォースを提案する。
我々のモデルは、量子化やモデル圧縮なしで、単一のNVIDIA H100 GPU上で29.5 FPSでリアルタイムな832x480ビデオ生成を実現する。
論文 参考訳(メタデータ) (2026-04-11T08:54:07Z) - ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers [10.830662834634879]
ReHyAtは、ソフトマックスアテンションの忠実度と線形アテンションの効率を結合するハイブリッドアテンション機構である。
実験により,ReHyAtは2次から線形への注目コストを低減しつつ,最先端の映像品質を実現することが示された。
論文 参考訳(メタデータ) (2026-01-07T19:26:30Z) - Rolling Forcing: Autoregressive Long Video Diffusion in Real Time [86.40480237741609]
Rolling Forcingは、エラーの最小限の蓄積で長いビデオをストリーミングできる、新しいビデオ生成技術である。
転がり強制力には3つの新しい設計が伴う。第一に、エラー伝播を加速する個別のフレームを反復的にサンプリングする代わりに、共同演示方式を設計する。
第2に,アテンションシンク機構を長軸ストリームビデオ生成タスクに導入し,初期フレームのキー値状態をグローバルなコンテキストアンカーとして保持する。
第3に,大半が拡張された遮音窓上での無段蒸留を可能にする効率的な訓練アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-09-29T17:57:14Z) - SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer [116.17385614259574]
SANA-Videoは、720×1280の解像度と分長のビデオを効率よく生成できる小さな拡散モデルである。
2つのコア設計により、効率的な、効果的で、長いビデオ生成が保証されます。
コストの安いSANA-Videoは、現代の最先端の小さな拡散モデルと比較して、競争性能を達成している。
論文 参考訳(メタデータ) (2025-09-29T12:28:09Z) - VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges [39.666361965650836]
VideoLLaMBは、長いビデオ理解のためのフレームワークである。
SceneTilingアルゴリズムは、ビデオをコヒーレントなセマンティックユニットに分割する。
VideoLLaMBは1つのNvidia A100 GPUを使用して最大320フレームを処理する。
論文 参考訳(メタデータ) (2024-09-02T08:52:58Z) - NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation [157.07019458623242]
NUWA-XLは、eXtremely Long 世代のための新しい拡散アーキテクチャである。
当社のアプローチでは,動画を同じ粒度で並列に生成できる粗大な「微細化」プロセスを採用している。
実験の結果,グローバル・ローカル・コヒーレンスの両方で高品質な長編ビデオを生成するだけでなく,平均推定時間を7.55分から26秒に短縮できることがわかった。
論文 参考訳(メタデータ) (2023-03-22T07:10:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。