論文の概要: MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- arxiv url: http://arxiv.org/abs/2607.06173v1
- Date: Tue, 07 Jul 2026 11:52:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.505435
- Title: MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- Title(参考訳): MobileWan:モバイルビデオ拡散のためのクオリティギャップを閉鎖
- Abstract要約: MobileWanは、商用モバイルデバイスにデプロイ可能な最初の5Bスケールビデオ拡散モデルである。
システムでは5秒の480x832ビデオが16 FPSで20秒間のレイテンシで生成され、VBenchスコアは83.79である。
- 参考スコア(独自算出の注目度): 53.20920841863923
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in video diffusion have been driven by scaling transformer-based architectures to billions of parameters, substantially improving visual fidelity and motion coherence. In contrast, existing mobile video diffusion models remain limited to relatively small parameter budgets, typically 0.4-1.8B, restricting generation quality. In this work, we show that high-quality mobile video generation does not require small models. Instead, we demonstrate that a server-scale 5B-parameter video diffusion transformer can be deployed efficiently on memory-constrained mobile hardware through recurrent reformulation and structured compression. Starting from Wan2.2-5B, we rely on a recurrence distillation framework that converts video generation into a chunk-wise autoregressive process with constant-memory attention computation. Combined with causal linear attention, the model operates as an RNN at inference time while preserving temporal coherence across chunks. We further propose a learnable attention head pruning method based on binary per-head gates optimized end-to-end using a noise-biased sparsity objective and distillation-based finetuning. Together with sampling-step distillation and memory-optimized VAE decoding, MobileWan becomes the first 5B-scale video diffusion model deployable on a commercial mobile device. Our system generates 5-second 480x832 videos at 16 FPS in 20 seconds end-to-end latency, achieving a VBench score of 83.79 and establishing a new state of the art in mobile video generation. Project page: https://qualcomm-ai-research.github.io/mobilewan
- Abstract(参考訳): ビデオ拡散の最近の進歩は、トランスフォーマーベースのアーキテクチャを数十億のパラメータに拡張し、視覚的忠実度とモーションコヒーレンスを大幅に向上させることによって推進されている。
対照的に、既存のモバイルビデオ拡散モデルは比較的小さなパラメータ予算(典型的には0.4-1.8B)に限られており、生成品質が制限されている。
本研究では,高品質なモバイルビデオ生成には小型モデルを必要としないことを示す。
代わりに、サーバスケールの5Bパラメトリックビデオ拡散トランスフォーマを、リカレントな再構成と構造化圧縮により、メモリ制約のあるモバイルハードウェアに効率よく展開できることを実証した。
Wan2.2-5Bを皮切りに、ビデオ生成を一定のメモリアテンション計算を伴うチャンクワイズ自己回帰プロセスに変換する再蒸留フレームワークに依存している。
因果線形注意と組み合わせて、モデルは、チャンク全体の時間的コヒーレンスを保持しながら、推論時にRNNとして機能する。
さらに, ノイズバイアスによる疎度目標と蒸留法に基づく微調整を用いて, 両ヘッドゲート最適化による学習可能なアテンションヘッドプルーニング手法を提案する。
サンプリングステップの蒸留とメモリ最適化されたVAEデコーディングとともに、MobileWanは商用モバイルデバイスにデプロイ可能な最初の5Bスケールビデオ拡散モデルとなった。
本システムでは5秒間480x832ビデオが16 FPSで20秒間に生成され,VBenchスコア83.79が達成され,モバイルビデオ生成における新たな最先端技術が確立された。
プロジェクトページ:https://qualcomm-ai-research.github.io/mobilewan
関連論文リスト
- CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation [17.654969014220033]
CineMobileは49フレームの480pビデオを生成し、NVIDIA H200 GPUでは0.6秒、MediaTek Dimensity 8400 Ultimate 5Gプラットフォームでは20秒を遅延する。
CineMobileは、ビジュアル品質を同等に保ちながら、世代別40倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-07-04T10:24:35Z) - Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds [91.56929670753226]
Diffusion Transformer (DiT) はビデオ生成タスクにおいて高いパフォーマンスを示しているが、その高い計算コストは、スマートフォンのようなリソース制約のあるデバイスでは実用的ではない。
本稿では,ビデオ生成の大幅な高速化と,モバイルプラットフォームへの実用的な展開を実現するための新しい最適化手法を提案する。
論文 参考訳(メタデータ) (2025-07-17T17:59:10Z) - SnapGen-V: Generating a Five-Second Video within Five Seconds on a Mobile Device [61.42406720183769]
本稿では,大規模ビデオ拡散モデルのパワーをエッジユーザーにもたらすための包括的加速フレームワークを提案する。
我々のモデルは0.6Bのパラメータしか持たないため、iPhone 16 PMで5秒以内に5秒のビデオを生成することができる。
論文 参考訳(メタデータ) (2024-12-13T18:59:56Z) - From Slow Bidirectional to Fast Autoregressive Video Diffusion Models [48.35054927704544]
現在のビデオ拡散モデルは、印象的な生成品質を実現するが、双方向の注意依存のため、インタラクティブなアプリケーションに苦戦する。
この制限には、事前訓練された双方向拡散変換器を自己回帰変換器に適応させ、フレームをオンザフライで生成することで対処する。
我々のモデルは、VBench-Longベンチマークで84.27点のスコアを達成し、以前のすべてのビデオ生成モデルを上回った。
論文 参考訳(メタデータ) (2024-12-10T18:59:50Z) - Mobile Video Diffusion [11.568267488097401]
ビデオモデルは印象的なリアリズムと制御性を達成したが、計算要求によって制限されている。
本稿では,モバイル最適化ビデオ拡散モデルについて紹介する。
我々のモデルはMobileVDと呼ばれ、より効率が523倍(181対4.34 TFLOs)で、品質はわずかに低下する。
論文 参考訳(メタデータ) (2024-12-10T15:19:10Z) - Adaptive Caching for Faster Video Generation with Diffusion Transformers [52.73348147077075]
拡散変換器(DiT)はより大きなモデルと重い注意機構に依存しており、推論速度が遅くなる。
本稿では,Adaptive Caching(AdaCache)と呼ばれる,ビデオDiTの高速化のためのトレーニング不要手法を提案する。
また,AdaCache内で動画情報を利用するMoReg方式を導入し,動作内容に基づいて計算割り当てを制御する。
論文 参考訳(メタデータ) (2024-11-04T18:59:44Z) - Video Mobile-Former: Video Recognition with Efficient Global
Spatial-temporal Modeling [125.95527079960725]
トランスフォーマーベースのモデルは、主要なビデオ認識ベンチマークで最高のパフォーマンスを達成した。
Video Mobile-Formerはトランスフォーマーベースの最初のビデオモデルであり、1G FLOP内で計算予算を制限している。
論文 参考訳(メタデータ) (2022-08-25T17:59:00Z) - Real-Time Video Inference on Edge Devices via Adaptive Model Streaming [9.101956442584251]
携帯電話やドローンなどのエッジデバイス上でのリアルタイムビデオ推論は、Deep Neural Networksのコストが高いため、難しい。
本稿では、エッジデバイス上での映像推論のための効率的な軽量モデルの性能向上のための新しいアプローチであるAdaptive Model Streaming (AMS)を提案する。
論文 参考訳(メタデータ) (2020-06-11T17:25:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。