論文の概要: Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
- arxiv url: http://arxiv.org/abs/2608.24293v2
- Date: Thu, 27 Aug 2026 05:50:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.800556
- Title: Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation
- Title(参考訳): コンパクトビデオ表現のための適応型トケナイザ
- Abstract要約: 非形式的トークンを捨てる適応トークンセレクタを提案する。
実験により,本モデルが最先端圧縮比で強い復元と生成品質を実現することを示す。
- 参考スコア(独自算出の注目度): 3.7696381512190804
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Latent diffusion models have emerged as a dominant framework for high-fidelity image and video synthesis, operating in compact latent spaces with variational autoencoders (VAEs) to enhance computational efficiency without compromising visual quality. However, conventional VAEs are suboptimal for video data as they employ fixed compression ratios that cannot adapt to the varying complexity of spatio-temporal content. We present KATok (Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation), a transformer-based VAE that incorporates an adaptive token selector which is jointly learned with latent tokens. By evaluating each token's content-richness as keep-or-drop probability, the token selector effectively discards uninformative tokens, naturally allowing data-dependent compression. Applying adaptive tokenization to diffusion models may cause spatial misalignment, as token dropping can disturb the original spatio-temporal structure. To alleviate this issue, we propose two position-prediction strategies: cascaded and joint generation, to ensure spatial consistency. We empirically show that our model achieves strong reconstruction and generation quality at a state-of-the-art compression ratio. Further analysis on video data reveals that this improvement is primarily achieved by reducing spatio-temporal redundancy and removing uninformative tokens, as supported by both quantitative and qualitative results.
- Abstract(参考訳): 遅延拡散モデルは、視覚的品質を損なうことなく計算効率を向上させるために、可変オートエンコーダ(VAE)を備えたコンパクトな遅延空間で動作する、高忠実な画像合成とビデオ合成の主流のフレームワークとして登場した。
しかし、従来のVAEは、時空間コンテンツの複雑さの変化に適応できない固定圧縮比を使用するため、ビデオデータに最適ではない。
KATok (Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation) は,適応トークンセレクタを組み込んだトランスフォーマーベースのVAEである。
トークンセレクタは、各トークンのコンテンツ豊かさを保持またはドロップ確率として評価することにより、非形式的トークンを効果的に破棄し、データ依存圧縮を自然に許可する。
拡散モデルに適応的なトークン化を適用すると、トークンのドロップが元の時空間構造を乱すため、空間的不整合を引き起こす可能性がある。
この問題を軽減するために,空間的整合性を確保するために,カスケードとジョイントジェネレーションという2つの位置予測戦略を提案する。
実験により,本モデルが最先端圧縮比で強い復元と生成品質を実現することを示す。
ビデオデータに関するさらなる分析により、この改善は主に時空間冗長性を低減し、量的および定性的な結果の両方で支持される不定形トークンを除去することで達成されることが明らかとなった。
関連論文リスト
- CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models [9.660619113725843]
我々はCRAFT: Resive Adaptive Fusion Video Tokensによる圧縮を提案する。
CRAFTは、最先端のトークン圧縮手法よりも一貫して優れている。
圧縮価格は約8ドルで、バックボーンの平均精度の約97%を保持します。
論文 参考訳(メタデータ) (2026-08-03T03:27:46Z) - STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation [60.597357847359255]
ビデオセグメンテーションでは、複雑な自然言語クエリの下で数百フレームにわたるピクセル精度の高いオブジェクトトラッキングが要求される。
既存のメソッドはトークン圧縮を通じてこの問題に対処するが、典型的には時間的コンテキストを持たない機能で動作する。
状態空間モデルは、この制約を解決し、その線形反復性は、各トークンを時間的文脈で選択的に$mathcalO(T)$コスト圧縮して減少させる。
論文 参考訳(メタデータ) (2026-07-03T03:28:25Z) - Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention [23.015486635502437]
ビデオ言語モデル(ビデオ-LLM)は、大量の視覚トークンのために高い計算コストに直面している。
グローバルな選択トークンに意味的類似性を重み付けする統一選択機構を提案する。
選択されていないトークンはクラスタリングとリフィルによってマージされ、情報の整合性を保持する。
我々の統合的時間トークン圧縮戦略は,超低トークン保持下での映像理解における最先端技術を確立する。
論文 参考訳(メタデータ) (2026-03-23T13:15:22Z) - On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression [22.436953683970007]
既存のエンコーダベースの攻撃は、圧縮視覚言語モデル(LVLM)の堅牢性を大幅に過大評価できることを示す。
本稿では, 圧縮機構やトークンの予算を仮定することなく, 摂動最適化と圧縮推論を一致させる圧縮-AliGnEd攻撃(CAGE)を提案する。
論文 参考訳(メタデータ) (2026-01-29T10:47:21Z) - Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models [19.536595270049016]
本稿では,VoCo-LLaMAを適応圧縮のための軽量な予測器で拡張するフレームワークであるAdaptive-VoCoを提案する。
実験結果から,本手法は複数のマルチモーダルタスクの固定レートベースラインを一貫して上回ることがわかった。
論文 参考訳(メタデータ) (2025-12-20T20:24:07Z) - InfoTok: Adaptive Discrete Video Tokenizer via Information-Theoretic Compression [114.03378443007074]
現在のトークンライザは、すべてのコンテンツを固定レートで厳格に圧縮し、冗長性や情報損失につながる。
本稿では,適応型ビデオトークン化のための原則的フレームワークであるInfoTokを紹介する。
我々は,適応トークン化を実現するトランスベースの適応圧縮機を開発した。
論文 参考訳(メタデータ) (2025-12-18T17:13:59Z) - Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space [94.07013629356113]
AdapTokは、ビデオコンテンツに基づいて異なるフレームに対してフレキシブルにトークンを割り当てる適応的時間的因果的ビデオトークンライザである。
AdapTokは、異なるトークン予算の下で、再構築品質と生成パフォーマンスを継続的に改善する。
論文 参考訳(メタデータ) (2025-05-22T17:59:02Z) - Learned Video Compression via Heterogeneous Deformable Compensation
Network [78.72508633457392]
不安定な圧縮性能の問題に対処するために,不均一変形補償戦略(HDCVC)を用いた学習ビデオ圧縮フレームワークを提案する。
より具体的には、提案アルゴリズムは隣接する2つのフレームから特徴を抽出し、コンテンツ近傍の不均一な変形(HetDeform)カーネルオフセットを推定する。
実験結果から,HDCVCは最近の最先端の学習ビデオ圧縮手法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2022-07-11T02:31:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。