論文の概要: Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models
- arxiv url: http://arxiv.org/abs/2603.07615v1
- Date: Sun, 08 Mar 2026 12:55:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-10 15:13:14.912048
- Title: Compression as Adaptation: Implicit Visual Representation with Diffusion Foundation Models
- Title(参考訳): 適応としての圧縮:拡散基礎モデルによる視覚表現を暗示する
- Abstract要約: 信号を関数としてエンコードする新しい視覚表現フレームワークを提案する。
このような視覚信号の暗黙的な表現は、単一のコンパクトベクトルにハッシュすることができる。
- 参考スコア(独自算出の注目度): 44.87688838240146
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern visual generative models acquire rich visual knowledge through large-scale training, yet existing visual representations (such as pixels, latents, or tokens) remain external to the model and cannot directly exploit this knowledge for compact storage or reuse. In this work, we introduce a new visual representation framework that encodes a signal as a function, which is parametrized by low-rank adaptations attached to a frozen visual generative model. Such implicit representations of visual signals, \textit{e.g.}, an 81-frame video, can further be hashed into a single compact vector, achieving strong perceptual video compression at extremely low bitrates. Beyond basic compression, the functional nature of this representation enables inference-time scaling and control, allowing additional refinement on the compression performance. More broadly, as the implicit representations directly act as a function of the generation process, this suggests a unified framework bridging visual compression and generation.
- Abstract(参考訳): 現代の視覚生成モデルは、大規模なトレーニングを通じて豊富な視覚知識を取得するが、既存の視覚表現(ピクセル、ラテント、トークンなど)はモデルの外にあり、コンパクトな記憶や再利用のために直接この知識を利用することはできない。
本研究では,凍結した視覚生成モデルに付加された低ランク適応によってパラメータ化される信号を関数として符号化する新しい視覚表現フレームワークを提案する。
このような視覚信号の暗黙的な表現である 81 フレームのビデオである \textit{e g } は、さらに単一のコンパクトベクトルにハッシュすることができ、非常に低ビットレートで強力な知覚ビデオ圧縮を実現する。
基本的な圧縮以外にも、この表現の機能的性質は推論時のスケーリングと制御を可能にし、圧縮性能のさらなる改善を可能にしている。
より広義には、暗黙の表現が生成プロセスの関数として直接作用するため、これは視覚的圧縮と生成をブリッジする統一されたフレームワークを示唆している。
関連論文リスト
- Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification [80.62512020268626]
UniARは統合された自己回帰フレームワークであり、単一のビジュアルトークン化器が理解と生成の鍵となる。
UniARは、マルチレベル特徴融合とルックアップフリービットワイド量子化スキームを備えた事前訓練されたビジョンエンコーダを適応する。
拡散に基づく視覚デコーダは、離散的な視覚トークンで高忠実度画像をデコードする。
論文 参考訳(メタデータ) (2026-06-16T17:59:22Z) - Conditional Video Generation for High-Efficiency Video Compression [48.32125957038998]
本稿では,条件付き拡散モデルを利用した映像圧縮フレームワークを提案する。
具体的には、映像圧縮を条件生成タスクとして再構成し、生成モデルがスパース信号から映像を合成する。
論文 参考訳(メタデータ) (2025-07-21T06:16:27Z) - RepVideo: Rethinking Cross-Layer Representation for Video Generation [53.701548524818534]
テキスト・ビデオ拡散モデルのための拡張表現フレームワークであるRepVideoを提案する。
近隣層からの機能を蓄積してリッチな表現を形成することで、このアプローチはより安定したセマンティック情報をキャプチャする。
我々の実験は、RepVideoが正確な空間的外観を生成する能力を著しく向上するだけでなく、ビデオ生成における時間的一貫性も向上することを示した。
論文 参考訳(メタデータ) (2025-01-15T18:20:37Z) - VNVC: A Versatile Neural Video Coding Framework for Efficient
Human-Machine Vision [59.632286735304156]
コード化された表現をピクセルに復号することなく直接拡張・解析することがより効率的である。
再構成と直接拡張/分析の両方をサポートするために,コンパクト表現の学習を目標とする汎用型ニューラルビデオ符号化(VNVC)フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-19T03:04:57Z) - FFNeRV: Flow-Guided Frame-Wise Neural Representations for Videos [5.958701846880935]
ビデオ中のフレーム間の時間的冗長性を利用するために,フロー情報をフレームワイズ表現に組み込む新しい手法であるFFNeRVを提案する。
モデル圧縮技術により、FFNeRVは広く使われている標準ビデオコーデック(H.264とHEVC)より優れ、最先端のビデオ圧縮アルゴリズムと同等に動作する。
論文 参考訳(メタデータ) (2022-12-23T12:51:42Z) - Video Coding Using Learned Latent GAN Compression [1.6058099298620423]
ビデオの表現と圧縮にはStyleGANなどのGANの生成能力を活用する。
各フレームはStyleGANの潜在空間で反転され、そこから最適な圧縮が学習される。
論文 参考訳(メタデータ) (2022-07-09T19:07:43Z) - 3D Scene Compression through Entropy Penalized Neural Representation
Functions [19.277502420759653]
新しいビジュアルメディアは、元のビューの離散セットを補間することにより、視聴者が任意の視点から3dシーンを探索できるようにする。
これらのタイプのアプリケーションには、はるかに大量のストレージスペースが必要です。
3Dシーンを圧縮するための既存のアプローチは、圧縮とレンダリングの分離に基づいている。
我々は、空間座標を放射ベクトル場にマッピングする関数であるシーンの暗黙の表現を直接圧縮することでこれらのステップを統一し、任意の視点を描画するためにクエリすることができる。
本手法はシーン圧縮の最先端手法を著しく上回り,同時に高品質な再構成を実現する。
論文 参考訳(メタデータ) (2021-04-26T10:36:47Z) - Lossless Compression with Latent Variable Models [4.289574109162585]
我々は「非対称数値系を持つビットバック」(bb-ans)と呼ぶ潜在変数モデルを用いる。
この方法は、エンコードおよびデコードステップをインターリーブし、データのバッチ圧縮時に最適なレートを達成する。
我々は,深層生成モデルを用いた圧縮の高速プロトタイピングのために開発したモジュール型ソフトウェアフレームワークである'craystack'について述べる。
論文 参考訳(メタデータ) (2021-04-21T14:03:05Z) - An Emerging Coding Paradigm VCM: A Scalable Coding Approach Beyond
Feature and Signal [99.49099501559652]
Video Coding for Machine (VCM)は、視覚的特徴圧縮と古典的なビデオ符号化のギャップを埋めることを目的としている。
我々は,学習した動きパターンのガイダンスを用いて,映像フレームを再構成するために条件付き深層生成ネットワークを用いる。
予測モデルを介してスパース動作パターンを抽出することを学ぶことにより、特徴表現をエレガントに活用し、符号化されたフレームの外観を生成する。
論文 参考訳(メタデータ) (2020-01-09T14:18:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。