論文の概要: ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
- arxiv url: http://arxiv.org/abs/2607.28144v1
- Date: Thu, 30 Jul 2026 12:52:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.5681
- Title: ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate
- Title(参考訳): ReGenVC:極低ビットレートでのリアルタイム生成ビデオ符号化
- Abstract要約: ReGenVCは、トーキングヘッドビデオを超低ビットストリームに圧縮し、リアルタイムでデコードする、エンドツーエンドの生成ビデオシステムである。
4段階蒸留と3つのモデル保存システム技術を用いてデコーダをリアルタイムに作成する。
- 参考スコア(独自算出の注目度): 10.718733716698333
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present ReGenVC, an end-to-end generative video codec that compresses talking-head video to an ultra-low bitrate and decodes it in real time. The encoder reduces a source clip to a compact bitstream -- a neurally compressed first frame, per-frame pose keypoints, and metadata -- totaling about 26 kB for a 77-frame sequence. The decoder is a four-step distilled diffusion transformer that reconstructs the video conditioned on the transmitted pose and reference frame. Compared with x264/x265, ReGenVC reduces the bitrate to roughly one tenth of that required by traditional codecs (about 26 kB vs. 250--280 kB for essentially artifact-free reconstruction); at a matched ultra-low bitrate, conventional codecs collapse into blocking artifacts while ReGenVC stays sharp by exploiting a strong generative prior. The central obstacle to deploying such a codec is decoder latency: multi-step sampling with transformer and VAE components is too slow for interactive use. We make the decoder real-time through four-step distillation and three model-preserving system techniques: (i) eight-GPU unified sequence parallelism (Ulysses & Ring), (ii) a spatially-split VAE, and (iii) a three-stage overlapped pipeline; an analytical timing model characterizes the real-time feasibility region. On an 8-GPU node, the system sustains 24 fps output (972 ms per 25-frame window, within the 1000 ms budget), enabling a live browser stream without observed frame underruns. A hybrid CPU-GPU deployment further runs the encoder on the CPU at 24 fps and offloads the decoder-side one-shot conditioning encoders to the CPU, reducing the per-GPU memory peak from 21.1 GB to about 7.7 GB. To our knowledge, ReGenVC is the first end-to-end generative video codec to combine ultra-low-bitrate encoding with real-time decoding on an 8-GPU system.
- Abstract(参考訳): 本稿では,会話ヘッド映像を超低ビットレートに圧縮し,リアルタイムに復号するビデオコーデックReGenVCを提案する。
エンコーダはソースクリップをコンパクトなビットストリーム(ニューラルネットワークで圧縮された第1フレーム、フレームごとのポーズキーポイント、メタデータ)に還元する。
デコーダは、4段階の蒸留拡散変圧器であり、送信されたポーズと参照フレームに設定された映像を再構成する。
ReGenVCはx264/x265と比較してビットレートを従来のコーデックの約10分の1(基本的にアーティファクトのない再構築のために約26kB vs. 250--280kB)に削減する。
トランスフォーマーとVAEコンポーネントを使用したマルチステップサンプリングは、インタラクティブな使用には遅すぎる。
4段階蒸留と3つのモデル保存システム技術を用いてデコーダをリアルタイムに作成する。
(i)8GPU統一シーケンス並列性(ユリシーズ&リング)
(ii)空間分割型VAE、及び
3)3段階重なり合うパイプライン。解析的タイミングモデルがリアルタイム実現可能性領域を特徴付ける。
8GPUノードでは、システムは24fpsの出力(25フレームのウィンドウあたり972ms、1000msの予算内で)を保ち、フレームのアンダーランを行わないライブブラウザストリームを可能にする。
ハイブリッドCPU-GPUデプロイメントでは、CPU上のエンコーダを24fpsで実行し、デコーダ側のワンショットコンディショニングエンコーダをCPUにオフロードすることで、GPU当たりのメモリピークを21.1GBから約7.7GBに短縮する。
我々の知る限り、ReGenVCは8-GPUシステム上で超低ビットレート符号化とリアルタイムデコーディングを組み合わせた最初のエンドツーエンドビデオコーデックである。
関連論文リスト
- ZipCodec: Ultra-Low-Frame-Rate Streaming Speech Coding [27.32235541083431]
ZipCodecは6.25Hzと0.80kbpsで動作し、理論的遅延は160msである。
提案手法は,大規模なWavLM蒸留と再設計されたトランスベースアーキテクチャを組み合わせたものである。
ZipCodecは、コンシューマグレードのCPU上でリアルタイムのシングルストリーム推論を実現する。
論文 参考訳(メタデータ) (2026-09-10T14:49:54Z) - VoRTeC: Taming Foundation Flow for One-step Real time Video Compression [38.79321243531853]
$mathttVoRTeC$は、基礎フローモデル(Wan2.1)の上に構築されたビデオ圧縮フレームワークである。
本手法は,従来の拡散法に比べてビット消費を58%削減する。
$mathttVoRTeC$は720pで13FPS、480pで32FPSの復号速度を達成する。
論文 参考訳(メタデータ) (2026-09-02T08:39:23Z) - FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers [43.94286178727893]
FlashDecoderは高速でメモリ効率の良い純粋なトランスフォーマービデオデコーダである。
最大1080pの解像度で、ラテントをピクセルフレームにデコードできる。
論文 参考訳(メタデータ) (2026-07-16T12:16:12Z) - Data-driven Video Codec with Implicit Neural Representations [0.0]
ビデオは、時空座標をRGB値とオーディオ振幅にマッピングする単一正弦波表現ネットワーク(SIREN)の重みとして保存する。
オーバーフィットした教師ネットワークは、応答に基づく知識蒸留によってより小さな学生に圧縮される。
1ビットから32ビットまでのビット幅の量子化は、再構成の品質が16ビットで飽和することを示している。
論文 参考訳(メタデータ) (2026-07-02T17:11:52Z) - Ultra-Fast Neural Video Compression [29.065189275652944]
本稿では,レート・歪み・複雑さのトレードオフを大幅に改善するために,チャンクベースのコーディングフレームワークを提案する。
フレームを逐次処理する代わりに、複数のフレームの断片を1つのコンパクトな潜在表現に符号化し、同時にデコードする。
これらのイノベーションに基づいて、我々は、新しいSOTAのパフォーマンスを規定する新しいNVCであるDCVC-UFを紹介します。
論文 参考訳(メタデータ) (2026-06-03T03:38:05Z) - DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder [55.26098043655325]
DC-VideoGenは、事前訓練されたビデオ拡散モデルに適用することができる。
軽量な微調整を施した深部圧縮潜伏空間に適応することができる。
論文 参考訳(メタデータ) (2025-09-29T17:59:31Z) - SIEDD: Shared-Implicit Encoder with Discrete Decoders [36.705337163276255]
Inlicit Neural Representations (INR)は、ビデオごとの最適化機能を学ぶことによって、ビデオ圧縮に例外的な忠実度を提供する。
既存のINRエンコーディングの高速化の試みは、しばしば再建品質や重要な座標レベルの制御を犠牲にしている。
これらの妥協なしにINRエンコーディングを根本的に高速化する新しいアーキテクチャであるSIEDDを紹介する。
論文 参考訳(メタデータ) (2025-06-29T19:39:43Z) - QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design [54.38970077613728]
ビデオ監視、会議要約、教育講義分析、スポーツ放送といった現実の応用において、ロングビデオ理解が重要な機能として現れてきた。
我々は,リアルタイムダウンストリームアプリケーションをサポートするために,長時間ビデオ理解を大幅に高速化するシステムアルゴリズムの共同設計であるQuickVideoを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:26:50Z) - REGEN: Learning Compact Video Embedding with (Re-)Generative Decoder [52.698595889988766]
生成モデルのためのビデオ埋め込み学習について,新しい視点を提示する。
入力ビデオの正確な再生を必要とせず、効果的な埋め込みは視覚的に妥当な再構築に焦点を当てるべきである。
本稿では,従来のエンコーダ・デコーダ・ビデオ埋め込みをエンコーダ・ジェネレータ・フレームワークに置き換えることを提案する。
論文 参考訳(メタデータ) (2025-03-11T17:51:07Z) - A Coding Framework and Benchmark towards Low-Bitrate Video Understanding [63.05385140193666]
我々は,従来のコーデックとニューラルネットワーク(NN)の両方を活用する,従来型ニューラル混合符号化フレームワークを提案する。
このフレームワークは、動画の移動効率の良いセマンティック表現を確実に保持することで最適化される。
8つのデータセットに3つのダウンストリームタスクを備えた低ビットレートビデオ理解ベンチマークを構築し、このアプローチの顕著な優位性を実証した。
論文 参考訳(メタデータ) (2022-02-06T16:29:15Z) - SoundStream: An End-to-End Neural Audio Codec [78.94923131038682]
本稿では,音声,音楽,一般音声を効率よく圧縮できる新しいニューラルオーディオシステムSoundStreamを紹介する。
SoundStreamは完全な畳み込みエンコーダ/デコーダネットワークと残留ベクトル量子化器に頼っている。
エンコーダまたはデコーダ側で、追加のレイテンシなしで、共同圧縮と拡張を行うことができます。
論文 参考訳(メタデータ) (2021-07-07T15:45:42Z) - Conditional Entropy Coding for Efficient Video Compression [82.35389813794372]
本稿では,フレーム間の条件エントロピーをモデル化することのみに焦点を当てた,非常にシンプルで効率的なビデオ圧縮フレームワークを提案する。
まず、画像遅延符号間のエントロピーをモデル化する単純なアーキテクチャが、他のニューラルビデオ圧縮やビデオコーデックと同等の競争力を持つことを示す。
次に、このアーキテクチャの上に新しい内部学習拡張を提案し、復号速度を抑えることなく10%の節約を実現した。
論文 参考訳(メタデータ) (2020-08-20T20:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。