論文の概要: Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video Compression
- arxiv url: http://arxiv.org/abs/2607.23366v1
- Date: Sat, 25 Jul 2026 21:16:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.083672
- Title: Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video Compression
- Title(参考訳): 階層型離散ビデオ圧縮における知覚品質に関するコードブック能力の検討
- Abstract要約: 知覚品質はコードブックの容量に大きく依存するが,空間分解能にのみ依存することを示す。
コードブックの容量は、ログユニット当たりの空間解像度よりも約10倍の影響力を持つ。
これらの結果は, 空間分解能ではなく, コードブックサイズ$K$が, 知覚圧縮品質を規定する主要な設計変数であることが示唆された。
- 参考スコア(独自算出の注目度): 1.332091725929965
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Learned video codecs based on continuous latent representations typically require resolution-specific retraining or rate-distortion (RD) recalibration when scaling to new spatial resolutions, because entropy models and Lagrangian weights are tightly coupled to the operating point. We investigate whether hierarchical discrete latent codecs exhibit the same sensitivity. Using a controlled empirical study of MS-VQ-VAE video compression across codebook sizes $K \in \{128,256,512,1024\}$ and resolutions $64\times64$, $128\times128$, and $256\times256$ on UCF101, we show that perceptual quality (LPIPS) depends strongly on codebook capacity but only negligibly on spatial resolution. Fitting a log-linear model $Q(K,r) = α\log_2 K + β\log_2 r + γ$ to all 12 operating points yields $α=-0.0094$ ($t=-6.6$, $p<0.001$) and $β=-0.0009$ ($t=-0.43$, $p=0.68$, not significant), with $R^2=0.82$. Codebook capacity is therefore roughly $10\times$ more influential than spatial resolution per log-unit increase. In parallel, bottom-level entropy efficiency $η=H(z)/\log_2 K$ remains stable or improves with resolution (84-87% at $64\times64$; 92-94% at $256\times256$), confirming that larger spatial grids are utilized more efficiently rather than less. Across all resolutions and codebook sizes, our models outperform H.264 on LPIPS at matched or lower bitrate, with gains of 25-52% at $128\times128$ and 21-37% over H.265 at $256\times256$. These findings suggest that codebook size $K$, not spatial resolution, is the dominant design variable governing perceptual compression quality in hierarchical discrete video codecs -- a property that may simplify multi-resolution deployment and inform the design of scalable discrete tokenizers for generative video models.
- Abstract(参考訳): 連続ラグランジアン表現に基づく学習ビデオコーデックは、エントロピーモデルとラグランジアン重みが操作点と密結合しているため、新しい空間分解能にスケーリングする際に、通常、解像度特異的なリトレーニングやレート歪曲(RD)再校正を必要とする。
階層的な離散潜在コーデックが同一の感度を示すかどうかを検討する。
K \in \{128,256,512,1024\}$と6,4\times64$,128\times128$,2,56\times256$のコードブックサイズにわたるMS-VQ-VAEビデオ圧縮に関する実証的研究を用いて、知覚品質(LPIPS)は、コードブックの容量に強く依存するが、空間解像度にのみ依存することを示した。
対数線型モデル $Q(K,r) = α\log_2 K + β\log_2 r + γ$ をすべての 12 個の演算点に適用すると、$α=-0.0094$$$t=-6.6$, $p<0.001$) と $β=-0.0009$$$t=-0.43$, $p=0.68$, $R^2=0.82$ が得られる。
したがって、コードブックの容量はログ単位当たりの空間分解能よりも約10\times$の影響力がある。
平行して、ボトムレベルエントロピー効率$η=H(z)/\log_2 K$は安定であり、解像度が84-87%で6,4\times64$;92-94%で256\times256$)、より大きな空間格子がより効率的に利用されることを確認する。
すべての解像度とコードブックサイズで、私たちのモデルはLPIPSでH.264よりも良く、マッチレートまたは低ビットレートで25~52%、H.265で128ドル、21~37%、2456ドルだった。
これらの結果は、コードブックサイズが空間解像度ではなく$Kが階層的な離散ビデオコーデックにおける知覚的圧縮品質を規定する主要な設計変数であることを示唆している。
関連論文リスト
- Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling [49.11379121512358]
本稿では,事前学習した拡散変圧器を組み込んだ統合生成フレームワークを提案し,高い知覚品質を極端に低速で達成する。
提案手法は,空間的細部が豊富で時間的整合性が強い,最先端の知覚的忠実度を実現する。
論文 参考訳(メタデータ) (2026-07-21T06:36:32Z) - Entropy-Coded MS-VQ-VAE with Learned Priors for Ultra-Low Bitrate Video Compression [1.332091725929965]
連続潜在表現に基づくビデオコーデックは、1ピクセルあたり0.1ビット以下で確実に動作するのに苦労する。
離散潜在表現が、この制限を完全に横切ることを示す。
我々は、重要なトレーニング勾配不安定性を特定し、解決する。
論文 参考訳(メタデータ) (2026-06-28T20:09:45Z) - Generative Latent Coding for Ultra-Low Bitrate Image Compression [61.71793017252801]
本稿では,生成ベクトル量子化変分自動エンコーダ(VQ-VAE)の潜時空間で変換符号化を行う生成潜時符号化アーキテクチャを提案する。
生成潜伏空間は、より空間性が高く、より豊かな意味を持ち、人間の知覚との整合性が良く、高現実性および高忠実性圧縮を達成するのに有利である。
論文 参考訳(メタデータ) (2025-12-23T09:35:40Z) - Generative Latent Coding for Ultra-Low Bitrate Image and Video Compression [61.500904231491596]
画像圧縮とビデオ圧縮のほとんどの手法は、画素空間における変換符号化を行い、冗長性を低減する。
画像とビデオの圧縮, GLCイメージ, GLC-Video のための textbfGenerative textbfLatent textbfGLC (textbfGLC) モデルを提案する。
論文 参考訳(メタデータ) (2025-05-22T03:31:33Z) - Improving the Diffusability of Autoencoders [54.920783089085035]
高品質な画像やビデオを生成するための主要なアプローチとして、潜伏拡散モデルが登場している。
我々は、現代のオートエンコーダのスペクトル分析を行い、その潜在空間における不規則な高周波成分を同定する。
我々は、この高周波成分が拡散合成プロセスの粗大な微細な性質に干渉し、生成品質を阻害する仮説を立てた。
論文 参考訳(メタデータ) (2025-02-20T18:45:44Z) - Hierarchical Patch Diffusion Models for High-Resolution Video Generation [50.42746357450949]
我々は,階層的な方法で,コンテキスト情報を低スケールから高スケールのパッチに伝播する深層文脈融合を開発する。
また,ネットワーク容量の増大と,粗い画像の細部への演算を行う適応計算を提案する。
得られたモデルは、クラス条件のビデオ生成において66.32の最先端FVDスコアと87.68のインセプションスコアを新たに設定する。
論文 参考訳(メタデータ) (2024-06-12T01:12:53Z) - DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention [82.24166963631949]
Diffusion Gated Linear Attention Transformers (DiG) は、最小限のパラメータオーバーヘッドを持つ単純で適用可能なソリューションである。
より優れた効率性と競争効率を示す、平易なU字型アーキテクチャの2つのバリエーションを提供する。
論文 参考訳(メタデータ) (2024-05-28T17:59:33Z) - Efficient Scale-Invariant Generator with Column-Row Entangled Pixel
Synthesis [3.222802562733787]
本研究では,空間的畳み込みや粗大な設計を使わずに,効率的かつスケール平等な新しい生成モデルを提案する。
FFHQ、LSUN-Church、MetFaces、Flickr-Sceneryなど、さまざまなデータセットの実験では、CREPSのスケール一貫性とエイリアスのない画像を合成する能力が確認されている。
論文 参考訳(メタデータ) (2023-03-24T17:12:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。