論文の概要: Entropy-Coded MS-VQ-VAE with Learned Priors for Ultra-Low Bitrate Video Compression
- arxiv url: http://arxiv.org/abs/2607.02562v1
- Date: Sun, 28 Jun 2026 20:09:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.323291
- Title: Entropy-Coded MS-VQ-VAE with Learned Priors for Ultra-Low Bitrate Video Compression
- Title(参考訳): 超低ビットレートビデオ圧縮のための先行学習を用いたエントロピー符号化MS-VQ-VAE
- Authors: Manikanta Kotthapalli, Banafsheh Rekabdar,
- Abstract要約: 連続潜在表現に基づくビデオコーデックは、1ピクセルあたり0.1ビット以下で確実に動作するのに苦労する。
離散潜在表現が、この制限を完全に横切ることを示す。
我々は、重要なトレーニング勾配不安定性を特定し、解決する。
- 参考スコア(独自算出の注目度): 1.332091725929965
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Learned video codecs based on continuous latent representations struggle to operate reliably below 0.1 bits per pixel~(bpp): without a differentiable rate signal, Lagrangian optimisation cannot effectively trade reconstruction quality for bitrate at extreme compression ratios. We demonstrate that discrete latent representations sidestep this limitation entirely. In a vector-quantized~(VQ) codec, the codebook size~$K$ imposes a hard information ceiling of $\log_2 K$ bits per symbol; a learned autoregressive prior then exploits the non-uniform distribution of code usage -- which we show follows a power law -- to push actual bitrates well below this ceiling, without any rate-penalty tuning. Building on the MS-VQ-VAE architecture introduced in~\cite{kotthapalli2026msvqvae}, we sweep $K \in \{128, 256, 512, 1024\}$ under a uniform training protocol to trace four operating points on the rate-distortion~(RD) curve. We identify and resolve a critical training instability: gradient-based VQ collapses catastrophically at $K \leq 512$, whereas EMA-stabilised codebook updates with dead-code restart maintain full utilisation across all configurations. On 500 UCF101 test clips ($64\!\times\!64$, 32~frames), our models operate at 0.043-0.064~bpp -- 3.3-5$\times$ below H.264's practical floor and $5$-$7.6\times$ below H.265's floor at this resolution. Every MS-VQ-VAE configuration outperforms H.265 CRF\,36 on perceptual quality (LPIPS) despite using $5$-$7.6\times$ fewer bits. At $K{=}1024$, the model surpasses H.265 CRF\,36 on LPIPS by a margin of 0.072 absolute while using $5.1\times$ fewer bits. Codebook analysis confirms power-law index distributions and 70-85\% entropy efficiency, establishing the pipeline as a principled learned entropy coder.
- Abstract(参考訳): 連続潜在表現に基づく学習ビデオコーデックは、微分可能なレート信号がなければ、極端な圧縮比でビットレートの再構成品質を効果的に交換することはできない。
離散潜在表現が、この制限を完全に横切ることを実証する。
ベクトル量子化された~(VQ)コーデックでは、コードブックサイズ~K$はシンボルあたり$\log_2 K$ bitsというハードな情報天井を課します。
kotthapalli2026msvqvae} で導入された MS-VQ-VAE アーキテクチャに基づいて、均一なトレーニングプロトコルの下で$K \in \{128, 256, 512, 1024\}$ を探索し、レート歪み~(RD) 曲線上の4つの演算点をトレースする。
勾配ベースのVQは破滅的に$K \leq 512$で崩壊するのに対して、EMAが安定化したコードブックのアップデートでは、デッドコードの再起動による全構成のフル活用が維持されます。
500 UCF101のテストクリップ(64ドル!
タイムズ!
64$, 32~frames) 我々のモデルは0.043-0.064~bpp -- 3.3-5$\times$以下のH.264の実用的なフロアと5-$7.6\times$以下のH.265のフロアで動作する。
すべてのMS-VQ-VAE構成がH.265より優れている
CRF\,36 知覚品質 (LPIPS) は 5$-$7.6\times$ less bits である。
K{=}1024$で、H.265を超える。
CRF\,36 on LPIPS by 0.072 absolute のマージンで、5.1\times$ less bits を使用する。
Codebook Analysiss confirmeds power-law index distributions and 70-85\% entropy efficiency, established the pipeline as a principled learned entropy coder。
関連論文リスト
- Spatial Artifact Coherence Determines Codec Robustness in Patch-Based rPPG [0.0]
Photoplethysmography (r) は、遠隔医療、新生児ICU、ドライバ疲労の応用において、圧縮されたビデオチャネル上に展開されているベンチマークで低い心拍数誤差を達成している。
事前の作業では、圧縮下でのグローバル射影法を上回る物理量を決定するものはない。
本研究では,4x4のグリーンチャネル間グリーンチャネルにおいて,オフパスと対角エネルギーの比として定義される空間アーチファクトコヒーレンス(マクロ)を提案する。
論文 参考訳(メタデータ) (2026-06-02T20:33:36Z) - A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks [19.742094573993132]
トーキングヘッドビデオはリアルタイムコミュニケーションにおける主要なコンテンツタイプである。
我々は847件のトーキングヘッド記録のほぼRAWデータセットをオープンソース化した。
このデータセットは、これまでで最大規模のトーキングヘッドWebカメラデータセットのスケールを5ドルタイムで提供する。
論文 参考訳(メタデータ) (2026-03-23T20:51:35Z) - Fair Decoder Baselines and Rigorous Finite-Size Scaling for Bivariate Bicycle Codes on the Quantum Erasure Channel [0.14323566945483496]
BB符号のBP-OSDデコードと並行して,非インフォームおよびエンフェラジャー対応のサーフェスコードベースラインを動作させる。
標準偏極重みMWPMと消去情報がないため、消去チャネル上でのランダムな推測と性能は一致しない。
BB at $N=1296$は、表面符号の2倍の閾値で、12$times$より低い正規化オーバーヘッドを持つ。
論文 参考訳(メタデータ) (2026-03-19T15:53:51Z) - TeCoNeRV: Leveraging Temporal Coherence for Compressible Neural Representations for Videos [51.99176811574457]
Inlicit Neural Representations (INRs) は、最近ビデオ圧縮における印象的な性能を実証した。
しかし、エンコーディング効率を維持しながら高解像度ビデオへのスケーリングは依然として大きな課題である。
3つの重要なコントリビューションを通じて、これらの基本的な制限に対処します。
我々は,UVG,HEVC,MCL-JCVで480p,720p,1080pで実験を行った最初のハイパーネットワークアプローチである。
論文 参考訳(メタデータ) (2026-02-18T18:59:55Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - Don't be so Stief! Learning KV Cache low-rank approximation over the Stiefel manifold [7.162701793686856]
StiefAttentionは、出力再構成誤差を直接最小化し、インフォノーマルプロジェクションベースを学習するKV-cache圧縮手法である。
これは、C4の難易度が11.9ドル、0ショットMMLUの精度が5.4%でEigenAttentionを上回り、元のデコーダ層出力に対する相対誤差が低く、コサイン類似度も高い。
論文 参考訳(メタデータ) (2026-01-29T13:19:24Z) - Generative Latent Coding for Ultra-Low Bitrate Image and Video Compression [61.500904231491596]
画像圧縮とビデオ圧縮のほとんどの手法は、画素空間における変換符号化を行い、冗長性を低減する。
画像とビデオの圧縮, GLCイメージ, GLC-Video のための textbfGenerative textbfLatent textbfGLC (textbfGLC) モデルを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:31:33Z) - ELF-VC: Efficient Learned Flexible-Rate Video Coding [61.10102916737163]
低レイテンシモードの性能向上を実現するための,学習ビデオ圧縮のための新しいアイデアをいくつか提案する。
一般的なビデオテストセット UVG と MCL-JCV 上で,ELF-VC と呼ぶ手法をベンチマークする。
我々の手法は少なくとも5倍高速に動作し、これらの数値を報告するすべてのMLコーデックよりもパラメータが少ない。
論文 参考訳(メタデータ) (2021-04-29T17:50:35Z) - Conditional Entropy Coding for Efficient Video Compression [82.35389813794372]
本稿では,フレーム間の条件エントロピーをモデル化することのみに焦点を当てた,非常にシンプルで効率的なビデオ圧縮フレームワークを提案する。
まず、画像遅延符号間のエントロピーをモデル化する単純なアーキテクチャが、他のニューラルビデオ圧縮やビデオコーデックと同等の競争力を持つことを示す。
次に、このアーキテクチャの上に新しい内部学習拡張を提案し、復号速度を抑えることなく10%の節約を実現した。
論文 参考訳(メタデータ) (2020-08-20T20:01:59Z) - Learning for Video Compression with Recurrent Auto-Encoder and Recurrent
Probability Model [164.7489982837475]
本稿では、リカレントオートエンコーダ(RAE)とリカレント確率モデル(RPM)を用いたリカレントラーニングビデオ圧縮(RLVC)手法を提案する。
RAEは、ビデオフレーム間の時間的相関を利用するために、エンコーダとデコーダの両方で繰り返しセルを使用する。
提案手法は,PSNRとMS-SSIMの両方の観点から,最先端の学習ビデオ圧縮性能を実現する。
論文 参考訳(メタデータ) (2020-06-24T08:46:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。