論文の概要: Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
- arxiv url: http://arxiv.org/abs/2605.20624v1
- Date: Wed, 20 May 2026 02:16:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.43981
- Title: Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models
- Title(参考訳): 自己回帰拡散モデルを用いたビデオ逆問題解の高速化
- Abstract要約: 拡散モデルは、ゼロショットビデオ逆問題に対して強力な先行情報を提供する。
彼らのリアルタイムデプロイメントは、2つの非効率さによって妨げられている: 全体的ビデオ復元による高い初期遅延と、複数のVAEパスによる低スループットである。
本稿では,これらの制限を克服するために,自動回帰ビデオ逆問題解法(AVIS)を提案する。
- 参考スコア(独自算出の注目度): 59.36933513963735
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion models provide powerful priors for zero-shot video inverse problems, but their real-time deployment is hindered by two inefficiencies: high initial latency caused by holistic video restoration, and low throughput resulting from multiple VAE passes to enforce measurement consistency in pixel space. To overcome these limitations, we propose Autoregressive Video Inverse problem Solver (AVIS). The AVIS framework leverages autoregressive video diffusion models to restore videos in a streaming manner, naturally eliminating latency bottlenecks. Specifically, AVIS initializes reverse diffusion with a measurement-consistent estimate, reducing the required sampling steps. Compared to leading non-autoregressive solvers, AVIS drastically reduces initial latency from 114s to 4s and increases throughput from 0.71 to 1.18 FPS while achieving superior restoration quality. We further introduce a highly accelerated variant, dubbed AVIS Flash, that enforces measurement consistency solely on the first chunk. AVIS Flash substantially boosts throughput to 5.91 FPS on a single RTX 4090 GPU while maintaining competitive performance and achieving a favorable efficiency-performance trade-off, paving the way toward real-time deployment.
- Abstract(参考訳): 拡散モデルはゼロショットビデオ逆問題に対して強力な先行性を提供するが、そのリアルタイム展開は2つの非効率性によって妨げられている。
これらの制限を克服するために,自動回帰ビデオ逆問題ソルバー(AVIS)を提案する。
AVISフレームワークは、自動回帰ビデオ拡散モデルを利用して、動画をストリーミング形式で復元し、レイテンシのボトルネックを自然に排除する。
具体的には、AVISは測定一貫性のある推定値で逆拡散を初期化し、必要なサンプリングステップを減らす。
AVISは非自己回帰解法と比較して、初期レイテンシを114sから4sに大幅に削減し、スループットを0.71FPSから1.18FPSに向上し、より優れた復元品質を実現している。
さらに、第1チャンクのみに測定一貫性を強制する、AVIS Flashと呼ばれる高度に高速化された亜種を導入する。
AVIS Flashは、1つのRTX 4090 GPU上でのスループットを5.91 FPSまで大幅に向上し、競争性能を維持し、良好な効率と性能のトレードオフを実現し、リアルタイムデプロイメントへの道を歩む。
関連論文リスト
- MobileWan: Closing the Quality Gap for Mobile Video Diffusion [53.20920841863923]
MobileWanは、商用モバイルデバイスにデプロイ可能な最初の5Bスケールビデオ拡散モデルである。
システムでは5秒の480x832ビデオが16 FPSで20秒間のレイテンシで生成され、VBenchスコアは83.79である。
論文 参考訳(メタデータ) (2026-07-07T11:52:46Z) - DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation [24.843472730316503]
ビデオ拡散トランスフォーマーは最先端の視覚的品質を達成したが、その高い推論コストは、リアルタイムアプリケーションにとって大きなボトルネックであり続けている。
本稿では、ARビデオ拡散のための信頼性誘導適応フレームワークであるDSAを提案する。
論文 参考訳(メタデータ) (2026-06-03T04:25:11Z) - DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression [38.495966630021556]
我々は、リアルタイム拡散に基づくニューラルビデオ圧縮(NVC)を実現するための最初のフレームワークであるDiffVC-RTを提案する。
DiffVC-RTは、NVIDIA H800 GPU上の720pビデオに対して、リアルタイムエンコーディングとデコード速度206/30 fpsのHEVCデータセット上で、LPIPSよりもVTM-17.0よりも80.1%のパーセプティカルセーブを実現していることを示す。
論文 参考訳(メタデータ) (2026-01-28T12:59:25Z) - Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion [10.847237180991948]
Stream-DiffVSRは効率的なオンラインVSRのための因果条件付き拡散フレームワークである。
GTX4090 GPUで0.328秒で720pのフレームを処理する。
知覚品質(LPIPS +0.095)を向上し、レイテンシを130倍以上削減する。
論文 参考訳(メタデータ) (2025-12-29T18:59:57Z) - InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior [13.775331675468024]
InstantViRは、事前訓練されたビデオ拡散を利用した超高速ビデオ再構成のためのアモータイズされた推論フレームワークである。
InstantViRは、リアルタイム、インタラクティブ、編集可能、ストリーミングのシナリオと互換性があることを示し、高品質のビデオ復元を現代の視覚システムの実用的なコンポーネントに変える。
論文 参考訳(メタデータ) (2025-11-18T07:40:38Z) - FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution [61.284842030283464]
FlashVSRは、リアルタイムVSRに向けた最初の拡散ベースのワンステップストリーミングフレームワークである。
A100 GPUで768x1408ビデオの約17FPSで動作する。
超高解像度に確実にスケールし、従来の1ステップ拡散VSRモデルよりも最大12倍のスピードアップで最先端の性能を達成する。
論文 参考訳(メタデータ) (2025-10-14T17:25:54Z) - Real-Time Motion-Controllable Autoregressive Video Diffusion [79.32730467857535]
本稿では,AR-Dragを提案する。このAR-Dragは,多様なモーション制御を備えたリアルタイム画像・ビデオ生成のための,RLで拡張された最初の数ステップのARビデオ拡散モデルである。
まず,基本動作制御をサポートするためのベースI2Vモデルを微調整し,さらに軌道ベース報酬モデルによる強化により改良する。
本設計では、自己学習機構を通じてマルコフ特性を保存し、ステップを選択的に分解することで訓練を加速する。
論文 参考訳(メタデータ) (2025-10-09T12:17:11Z) - Asymmetric VAE for One-Step Video Super-Resolution Acceleration [63.419142632861345]
本稿では,高圧縮VAEを実装することにより,計算コストを大幅に削減するFastVSRを提案する。
FastVSRは、マルチステップモデルに比べて111.9倍、既存のワンステップモデルより3.92倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-09-29T00:36:14Z) - BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation [27.57431718095974]
本稿では,ビデオ推論のためのデータフリー共同学習フレームワークBLADEを紹介する。
異なるスケールで顕著な効率向上を示す。
短いビデオシーケンス長を持つCagVideoX-5Bのようなモデルでは、我々のフレームワークはロバストな8.89倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2025-08-14T15:58:59Z) - From Slow Bidirectional to Fast Autoregressive Video Diffusion Models [48.35054927704544]
現在のビデオ拡散モデルは、印象的な生成品質を実現するが、双方向の注意依存のため、インタラクティブなアプリケーションに苦戦する。
この制限には、事前訓練された双方向拡散変換器を自己回帰変換器に適応させ、フレームをオンザフライで生成することで対処する。
我々のモデルは、VBench-Longベンチマークで84.27点のスコアを達成し、以前のすべてのビデオ生成モデルを上回った。
論文 参考訳(メタデータ) (2024-12-10T18:59:50Z) - StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation [52.56469577812338]
本稿では,インタラクティブな画像生成のためのリアルタイム拡散パイプラインStreamDiffusionを紹介する。
既存の拡散モデルは、テキストや画像プロンプトから画像を作成するのに適しているが、リアルタイムのインタラクションでは不足することが多い。
本稿では,従来のシーケンシャル・デノナイジングをデノナイジング・プロセスに変換する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2023-12-19T18:18:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。