論文の概要: Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere
- arxiv url: http://arxiv.org/abs/2608.01271v1
- Date: Sun, 02 Aug 2026 14:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.146036
- Title: Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere
- Title(参考訳): ビデオのトーケン圧縮を世界的コードブックで再考: 一度学習し、どこでも圧縮する
- Abstract要約: ビデオ大言語モデル (Video-LLMs) は、映像を視覚トークンの高密度なシーケンスとして表現し、その長さは入力の時間的および空間的範囲で増大する。
既存のトークン圧縮手法(プルーニングやマージなど)は、推論中にオンラインで圧縮を行う。
オフラインからオンラインへのパラダイムを導入するプラグインビデオトークン圧縮フレームワークである textbfONCE を提案する。
- 参考スコア(独自算出の注目度): 5.7189025167000205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video large language models (Video-LLMs) represent videos as dense sequences of visual tokens, whose length grows with the temporal and spatial extent of the input. These tokens often contain substantial redundancy arising from repeated visual patterns, leading to unnecessary computation in the subsequent language-model processing. Existing token compression methods, including pruning and merging, perform compression online during inference, repeatedly incurring additional computation for each input video and often relying on model-specific designs that limit their generality, we instead rethink this paradigm by shifting the costly compression process offline. We propose \textbf{ONCE}, a plug-in video token compression framework that introduces an offline-to-online paradigm: a frequency-aware global codebook is learned once in the visual feature space and reused for lightweight online compression through codebook lookup and aggregation, reducing repeated per-video computation and the need for model-specific compression designs. Extensive experiments across multiple video understanding benchmarks and against diverse compression baselines demonstrate that our approach achieves a strong accuracy-efficiency trade-off, maintaining competitive performance while achieving the lowest inference latency among compared methods.
- Abstract(参考訳): ビデオ大言語モデル (Video-LLMs) は、映像を視覚トークンの高密度なシーケンスとして表現し、その長さは入力の時間的および空間的範囲で増大する。
これらのトークンは、しばしば繰り返し視覚パターンから生じるかなりの冗長性を含み、その後の言語モデル処理において不要な計算をもたらす。
既存のトークン圧縮手法(プルーニングやマージなど)は、推論中にオンライン圧縮を行い、各入力ビデオに対して繰り返し計算を行い、その一般性を制限するモデル固有の設計に依存している場合が多いため、コストのかかる圧縮プロセスをオフラインにすることで、このパラダイムを再考する。
周波数対応のグローバルコードブックは、視覚的特徴空間において一度学習され、コードブックのルックアップとアグリゲーションを通じて軽量なオンライン圧縮のために再利用され、ビデオ毎の繰り返し計算とモデル固有の圧縮設計の必要性が軽減される。
複数のビデオ理解ベンチマークや多種多様な圧縮ベースラインに対する大規模な実験により,提案手法は高い精度・効率のトレードオフを実現し,競合性能を維持しつつ,比較手法の推論遅延を最低に抑えることができた。
関連論文リスト
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression [52.23010472235226]
視覚言語モデル(VLM)は大量の視覚トークンを処理し、かなりの推論とオーバーヘッドレイテンシをもたらす。
本稿では,VLM自体を固有圧縮機として再利用する,トレーニング効率のよい自己圧縮フレームワークであるVisCoを提案する。
論文 参考訳(メタデータ) (2026-07-14T13:21:36Z) - ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors [52.50325804778549]
我々はゼロショット生成ビデオ圧縮フレームワークZeroGVCを提案する。
ZeroGVCは、画像群(GOP)の最初のフレームを符号化し、Codebook-Guided Autoregressive Latent Compressionを通じてその後のPフレームを表現する。
標準ビデオ圧縮ベンチマークの実験では、ZeroGVCは、追加のトレーニングを伴わずに、超低速度での知覚的再構成品質が優れたことを実証している。
論文 参考訳(メタデータ) (2026-06-21T07:46:14Z) - End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention [23.015486635502437]
ビデオ言語モデル(ビデオ-LLM)は、大量の視覚トークンのために高い計算コストに直面している。
グローバルな選択トークンに意味的類似性を重み付けする統一選択機構を提案する。
選択されていないトークンはクラスタリングとリフィルによってマージされ、情報の整合性を保持する。
我々の統合的時間トークン圧縮戦略は,超低トークン保持下での映像理解における最先端技術を確立する。
論文 参考訳(メタデータ) (2026-03-23T13:15:22Z) - ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling [10.843021248963305]
本稿では,プログレッシブ・トランスミッション,効率的なエントロピー・コーディング,ディテール・シンセサイザーを統一したプログレッシブ・ベース・ジェネレーティブ・ビデオ圧縮フレームワークを提案する。
ProGVCは、ビデオを階層的なマルチスケールの残留トークンマップにエンコードし、粗いサブセットをプログレッシブな方法で送信することで、フレキシブルなレート適応を可能にする。
論文 参考訳(メタデータ) (2026-03-18T09:51:39Z) - LoViC: Efficient Long Video Generation with Context Compression [68.22069741704158]
百万単位のオープンドメインビデオに基づいてトレーニングされたDiTベースのフレームワークであるLoViCを紹介する。
当社のアプローチの核心はFlexFormerです。ビデオとテキストを統合された潜在表現に共同で圧縮する表現型オートエンコーダです。
論文 参考訳(メタデータ) (2025-07-17T09:46:43Z) - PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models [64.9366388601049]
ビジュアルトークン圧縮は、視覚入力の相当なトークン長を減らすために利用される。
我々は,プログレッシブ・ビジュアル・トークン圧縮と呼ばれる統一的なトークン圧縮戦略を導入する。
本モデルは,様々なビデオ理解ベンチマークにおいて,最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-12-12T18:59:40Z) - High-Efficiency Neural Video Compression via Hierarchical Predictive Learning [27.41398149573729]
強化されたDeep Hierarchical Video Compression(DHVC 2.0)は、優れた圧縮性能と目覚ましい複雑さの効率を導入する。
階層的な予測符号化を使用して、各ビデオフレームをマルチスケール表現に変換する。
トランスミッションフレンドリーなプログレッシブデコーディングをサポートしており、パケットロスの存在下では特にネットワーク化されたビデオアプリケーションに有利である。
論文 参考訳(メタデータ) (2024-10-03T15:40:58Z) - Content Adaptive and Error Propagation Aware Deep Video Compression [110.31693187153084]
本稿では,コンテンツ適応型・誤り伝搬対応型ビデオ圧縮システムを提案する。
本手法では, 複数フレームの圧縮性能を1フレームではなく複数フレームで考慮し, 共同学習手法を用いる。
従来の圧縮システムでは手作りのコーディングモードを使用する代わりに,オンラインエンコーダ更新方式をシステム内に設計する。
論文 参考訳(メタデータ) (2020-03-25T09:04:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。