論文の概要: Generative Video Compression with Adaptive Score Distillation
- arxiv url: http://arxiv.org/abs/2607.22772v1
- Date: Fri, 24 Jul 2026 05:28:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.873367
- Title: Generative Video Compression with Adaptive Score Distillation
- Title(参考訳): アダプティブスコア蒸留による映像圧縮
- Abstract要約: 我々は、圧縮のためにスクラッチからトレーニングされたビデオ拡散モデルに基づいて構築されたジェネラティブビデオコーデック(GenVC)を紹介する。
実験結果から,GenVCは超低FIDで最先端の知覚品質を実現することが示された。
- 参考スコア(独自算出の注目度): 27.528262844772993
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Diffusion models provide strong generative capabilities for video compression at ultra-low bitrates. Existing diffusion-based video codecs adapt base models originally developed for text-conditioned generation, whereas diffusion models designed and trained specifically for compression remain unexplored. To fill this gap, we introduce our Generative Video Codec (GenVC), built on a video diffusion model trained from scratch for compression. To our knowledge, this is the first compression-oriented video diffusion model. We realize this model directly in pixel space with a global-to-local hierarchy that recovers fine spatio-temporal details, enabling high-quality generative reconstruction from compressed representations. To accelerate inference, we distill the multi-step model into one step using distribution matching distillation (DMD). Applying DMD directly, however, drives the student toward motion-stalled reconstructions. We trace this to a teacher-side guidance failure: once student-induced perturbations leave the frozen teacher's training region, its guidance can become misleading, causing DMD updates to reinforce rather than correct the student drift. To break the resulting feedback loop, we propose Adaptive Score Distillation, which gates DMD updates according to their alignment with the ground-truth direction, enabling high-quality reconstruction with coherent motion. Experimental results show that GenVC achieves state-of-the-art perceptual quality at ultra-low bitrates, with average bitrate savings of 62.5% at matched LPIPS and 71.3% at matched FID over GLVC. Unlike prior codecs that inherit billion-scale pretrained backbones, our diffusion model has only 478.0M parameters and decodes 1080p video in a single step at 15.1 fps on an A100 GPU.
- Abstract(参考訳): 拡散モデルは、超低ビットレートでの映像圧縮に強力な生成機能を提供する。
既存の拡散ベースのビデオコーデックは、もともとテキスト条件付き生成のために開発されたベースモデルに適応するが、圧縮用に特別に設計・訓練された拡散モデルはまだ探索されていない。
このギャップを埋めるために、圧縮のためにスクラッチからトレーニングされたビデオ拡散モデルに基づいて構築されたGenerative Video Codec(GenVC)を紹介します。
我々の知る限り、これが最初の圧縮指向ビデオ拡散モデルである。
我々は,このモデルを直接画素空間内で実現し,微細な時空間の詳細を復元し,圧縮表現から高品質な生成的再構成を実現する。
シミュレーションを高速化するために,分散マッチング蒸留(DMD)を用いて多段階モデルを1段階に蒸留する。
しかし、DMDを直接適用することで、学生はモーション・スターリング・リコンストラクション(英語版)へと進む。
学生が引き起こした摂動が凍った教師のトレーニングエリアを離れると、その指導は誤解を招く可能性があり、DMD更新は学生のドリフトを正すのではなく、強化される。
得られたフィードバックループを断ち切るために,DMD更新を接地軌道方向に合わせてゲートするアダプティブスコア蒸留法を提案し,コヒーレント動作による高品質な再構成を実現する。
実験の結果、GenVCは超低ビットレートで最先端の知覚品質を達成し、平均ビットレートは一致したLPIPSで62.5%、GLVCで一致したFIDで71.3%であった。
数十億の事前訓練されたバックボーンを継承する以前のコーデックとは異なり、我々の拡散モデルは478.0Mパラメータしか持たず、A100 GPU上の15.1fpsで1ステップで1080pのビデオをデコードする。
関連論文リスト
- Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout [28.90854720290184]
DMD(Distribution Matching Distillation)を通して、訓練済み双方向ビデオ拡散モデルから因果AR学生を抽出する最近の方法
生成されたビデオは、しばしば過飽和と過スムースな問題に悩まされ、視覚的品質とリアリズムが制限される。
本研究では,モード崩壊を緩和するために,AR学生の自己ロールアウトを妨害するデュアルノイズマスキング・ロールアウト戦略であるマスクフォーシングを提案する。
論文 参考訳(メタデータ) (2026-09-08T17:50:05Z) - ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors [52.50325804778549]
我々はゼロショット生成ビデオ圧縮フレームワークZeroGVCを提案する。
ZeroGVCは、画像群(GOP)の最初のフレームを符号化し、Codebook-Guided Autoregressive Latent Compressionを通じてその後のPフレームを表現する。
標準ビデオ圧縮ベンチマークの実験では、ZeroGVCは、追加のトレーニングを伴わずに、超低速度での知覚的再構成品質が優れたことを実証している。
論文 参考訳(メタデータ) (2026-06-21T07:46:14Z) - CoD-Lite: Real-Time Diffusion-Based Generative Image Compression [58.56387132156189]
実時間および軽量拡散コーデックの設計について検討する。
生成指向事前学習は小さなモデルスケールでは効果が低いのに対して,圧縮指向事前学習では性能が一貫して向上することがわかった。
論文 参考訳(メタデータ) (2026-04-14T09:56:25Z) - CoD: A Diffusion Foundation Model for Image Compression [57.572664625372106]
既存の拡散コーデックは、通常、安定拡散のようなテキストから画像への拡散基盤モデルに基づいて構築される。
textbfCoDは、圧縮と生成の両方のエンドツーエンドの最適化を可能にするために、ゼロからトレーニングすることができる。
論文 参考訳(メタデータ) (2025-11-24T03:00:15Z) - InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior [13.775331675468024]
InstantViRは、事前訓練されたビデオ拡散を利用した超高速ビデオ再構成のためのアモータイズされた推論フレームワークである。
InstantViRは、リアルタイム、インタラクティブ、編集可能、ストリーミングのシナリオと互換性があることを示し、高品質のビデオ復元を現代の視覚システムの実用的なコンポーネントに変える。
論文 参考訳(メタデータ) (2025-11-18T07:40:38Z) - Rethinking Video Tokenization: A Conditioned Diffusion-based Approach [58.164354605550194]
新しいトークン化ツールであるDiffusion Conditioned-based Gene Tokenizerは、GANベースのデコーダを条件付き拡散モデルで置き換える。
再建に基本的MSE拡散損失とKL項,LPIPSを併用した訓練を行った。
CDTのスケールダウン版(3$times inference speedup)でさえ、トップベースラインと互換性がある。
論文 参考訳(メタデータ) (2025-03-05T17:59:19Z) - From Slow Bidirectional to Fast Autoregressive Video Diffusion Models [48.35054927704544]
現在のビデオ拡散モデルは、印象的な生成品質を実現するが、双方向の注意依存のため、インタラクティブなアプリケーションに苦戦する。
この制限には、事前訓練された双方向拡散変換器を自己回帰変換器に適応させ、フレームをオンザフライで生成することで対処する。
我々のモデルは、VBench-Longベンチマークで84.27点のスコアを達成し、以前のすべてのビデオ生成モデルを上回った。
論文 参考訳(メタデータ) (2024-12-10T18:59:50Z) - Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition [124.41196697408627]
本稿では,映像生成のための事前学習画像拡散モデルの拡張として,コンテントモーション潜時拡散モデル(CMD)を提案する。
CMDは、映像を(画像のような)コンテンツフレームと低次元モーションラテント表現の組み合わせとしてエンコードする。
我々は、予め訓練された画像拡散モデルを微調整し、コンテンツフレームを生成し、新しい軽量拡散モデルをトレーニングすることで、動き潜在表現を生成する。
論文 参考訳(メタデータ) (2024-03-21T05:48:48Z) - Extreme Video Compression with Pre-trained Diffusion Models [11.898317376595697]
本稿では,デコーダにおける拡散型生成モデルの予測力を活用した,極端な映像圧縮のための新しい手法を提案する。
ビデオ全体が順次エンコードされ、知覚品質の指標を考慮し、視覚的に快く再現される。
その結果、生成モデルを用いて映像データの時間的関係を活用できる可能性が示された。
論文 参考訳(メタデータ) (2024-02-14T04:23:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。