論文の概要: VoRTeC: Taming Foundation Flow for One-step Real time Video Compression
- arxiv url: http://arxiv.org/abs/2609.02291v2
- Date: Thu, 03 Sep 2026 02:54:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.307159
- Title: VoRTeC: Taming Foundation Flow for One-step Real time Video Compression
- Title(参考訳): VoRTeC:一段階のリアルタイムビデオ圧縮のための基礎フローのモデリング
- Abstract要約: $mathttVoRTeC$は、基礎フローモデル(Wan2.1)の上に構築されたビデオ圧縮フレームワークである。
本手法は,従来の拡散法に比べてビット消費を58%削減する。
$mathttVoRTeC$は720pで13FPS、480pで32FPSの復号速度を達成する。
- 参考スコア(独自算出の注目度): 38.79321243531853
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ultra-low bitrate video compression still faces critical challenges: traditional neural video compression inevitably introduces blurring artifacts, while diffusion-based generative video compression suffers from excessive decoding latency and poor temporal consistency. To address these issues, we propose $\mathtt{VoRTeC}$, a Video Compression framework built upon a foundational flow model (Wan2.1). By compactly encoding latent video representations, predicting the positions of compressed representations along flow trajectories, and integrating multi-scale priors, $\mathtt{VoRTeC}$ enables the compressor to harness generative video flow priors effectively. Without accessing the parameters or gradients of flow matching networks, our framework achieves one-step decoding and reconstructions with high perceptual fidelity. Meanwhile, we maintain consistency across frame groups via tail-frame reuse and prior caching. Extensive experiments demonstrate that our method reduces bit consumption by 58\% compared to prior diffusion-based approaches, with decoding speed boosted by 3 to 197 times: $\mathtt{VoRTeC}$ achieves a decoding speed of 13 FPS at 720p and 32 FPS at 480p.
- Abstract(参考訳): 従来のニューラルビデオ圧縮は必然的にぼやけたアーティファクトを導入し、拡散ベースの生成ビデオ圧縮は過剰な復号遅延と時間的一貫性に悩まされる。
これらの問題に対処するために、基礎フローモデル(Wan2.1)上に構築されたビデオ圧縮フレームワークである$\matht{VoRTeC}$を提案する。
遅延ビデオ表現をコンパクトに符号化し、フロー軌跡に沿って圧縮された表現の位置を予測し、マルチスケールの事前処理を統合することにより、$\mathtt{VoRTeC}$により、圧縮機は生成ビデオの先行処理を効果的に活用することができる。
フローマッチングネットワークのパラメータや勾配にアクセスすることなく、我々のフレームワークは高い知覚的忠実度で一段階の復号化と再構成を実現している。
一方、テールフレームの再利用と事前キャッシュを通じて、フレームグループ間の一貫性を維持します。
拡張実験により,従来の拡散法に比べてビット消費を58倍に削減し,復号速度を3~197倍に向上した。
関連論文リスト
- ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors [52.50325804778549]
我々はゼロショット生成ビデオ圧縮フレームワークZeroGVCを提案する。
ZeroGVCは、画像群(GOP)の最初のフレームを符号化し、Codebook-Guided Autoregressive Latent Compressionを通じてその後のPフレームを表現する。
標準ビデオ圧縮ベンチマークの実験では、ZeroGVCは、追加のトレーニングを伴わずに、超低速度での知覚的再構成品質が優れたことを実証している。
論文 参考訳(メタデータ) (2026-06-21T07:46:14Z) - Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors [30.653078447499894]
超低ビットレート画像圧縮(ULB-IC)のための新しいパラダイムを提案する。
我々はデコード中の明示的な中間状態(コンパクトアンカーフレーム)を定義する。
次に、生成復号化を、このアンカーから最終的な再構成画像への仮想時間遷移として再解釈する。
論文 参考訳(メタデータ) (2026-03-16T11:24:26Z) - DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression [38.495966630021556]
我々は、リアルタイム拡散に基づくニューラルビデオ圧縮(NVC)を実現するための最初のフレームワークであるDiffVC-RTを提案する。
DiffVC-RTは、NVIDIA H800 GPU上の720pビデオに対して、リアルタイムエンコーディングとデコード速度206/30 fpsのHEVCデータセット上で、LPIPSよりもVTM-17.0よりも80.1%のパーセプティカルセーブを実現していることを示す。
論文 参考訳(メタデータ) (2026-01-28T12:59:25Z) - HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming [58.55148690302855]
HiStreamは、3つの軸にわたる冗長性を体系的に低減する効率的な自動回帰フレームワークである。
1080pのベンチマークでは、主要なHiStreamモデル(i+ii)は最先端のビジュアル品質を実現し、Wan2.1ベースラインと比較して76.2倍高速なデノイングを実現した。
より高速なHiStream+は3つの最適化を全て適用し、ベースライン上で107.5倍の高速化を実現しています。
論文 参考訳(メタデータ) (2025-12-24T18:59:58Z) - Low-Bitrate Video Compression through Semantic-Conditioned Diffusion [19.21409064179896]
本報告では, 先行前の生成の詳細を頼りながら, 最も意味のある情報のみを伝達する重大障害を提案する。
条件付きビデオは、セマンティック、外観、モーションキューから高品質で時間的に整合したビデオを再構成する。
論文 参考訳(メタデータ) (2025-11-29T09:38:16Z) - VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction [55.66673587952058]
ビデオ理解モデルは、大規模データセットの禁止ストレージと計算コストによって、ますます制限されている。
VideoCompressaはビデオデータ合成のための新しいフレームワークで、動的潜在圧縮として問題を再構成する。
論文 参考訳(メタデータ) (2025-11-24T07:07:58Z) - Accelerating Learned Video Compression via Low-Resolution Representation Learning [18.399027308582596]
低解像度表現学習に焦点を当てた学習ビデオ圧縮のための効率最適化フレームワークを提案する。
提案手法は,H.266参照ソフトウェアVTMの低遅延P構成と同等の性能を実現する。
論文 参考訳(メタデータ) (2024-07-23T12:02:57Z) - Fast-Vid2Vid: Spatial-Temporal Compression for Video-to-Video Synthesis [40.249030338644225]
映像合成 (Vid2Vid) は, セマンティックマップのシーケンスから写真リアルな映像を生成することで, 顕著な成果を上げている。
Fast-Vid2Vidは20 FPSのリアルタイムパフォーマンスを実現し、1つのV100 GPUで約8倍の計算コストを節約する。
論文 参考訳(メタデータ) (2022-07-11T17:57:57Z) - Conditional Entropy Coding for Efficient Video Compression [82.35389813794372]
本稿では,フレーム間の条件エントロピーをモデル化することのみに焦点を当てた,非常にシンプルで効率的なビデオ圧縮フレームワークを提案する。
まず、画像遅延符号間のエントロピーをモデル化する単純なアーキテクチャが、他のニューラルビデオ圧縮やビデオコーデックと同等の競争力を持つことを示す。
次に、このアーキテクチャの上に新しい内部学習拡張を提案し、復号速度を抑えることなく10%の節約を実現した。
論文 参考訳(メタデータ) (2020-08-20T20:01:59Z) - Content Adaptive and Error Propagation Aware Deep Video Compression [110.31693187153084]
本稿では,コンテンツ適応型・誤り伝搬対応型ビデオ圧縮システムを提案する。
本手法では, 複数フレームの圧縮性能を1フレームではなく複数フレームで考慮し, 共同学習手法を用いる。
従来の圧縮システムでは手作りのコーディングモードを使用する代わりに,オンラインエンコーダ更新方式をシステム内に設計する。
論文 参考訳(メタデータ) (2020-03-25T09:04:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。