論文の概要: WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation
- arxiv url: http://arxiv.org/abs/2607.23265v2
- Date: Mon, 03 Aug 2026 14:35:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 21:56:46.322694
- Title: WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation
- Title(参考訳): WaveZip: ビデオトーケン凝縮のためのウェーブレット駆動の時空間デカップリング
- Authors: Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo,
- Abstract要約: WaveZipは、効率的なビデオ推論のための共同信号周波数領域フレームワークである。
長いビデオ理解ベンチマークの実験では、WaveZipは完全なパフォーマンスの99.6%を維持している。
- 参考スコア(独自算出の注目度): 69.37452950816122
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing Large Vision-Language Models (LVLMs) struggle with long-form video understanding due to the quadratic computational cost of visual tokens. While recent efficient methods attempt to compress tokens via hard pruning or uniform merging, they operate strictly in the spatial feature domain, where robust structural context and discriminative semantic details are inherently entangled. In this work, we propose WaveZip, a joint signal-frequency-domain framework for efficient video inference. Driven by the insight that temporal redundancy resides in low-pass approximation scales while spatial saliency strongly correlates with high-frequency components, WaveZip leverages Discrete Wavelet Transforms (DWT) to disentangle these signals. Temporally, it employs 1D DWT to analyze query-frame relevance, and the resulting high-frequency coefficients are further gated by inter-frame differences, with both signals jointly driving the dynamic allocation of a precise frame-level token budget. Spatially, a 2D DWT decomposes features into low-frequency approximations and high-frequency detail components, where the high-frequency coefficients are modulated within query-salient regions to regulate spatial reconstruction. Importantly, WaveZip requires no task-specific training and can be seamlessly integrated into off-the-shelf LVLMs to boost inference efficiency. Extensive experiments on long video understanding benchmarks demonstrate that WaveZip retains 99.6% of the full performance under an extreme 10x compression ratio, consistently outperforming state-of-the-art methods.
- Abstract(参考訳): 既存のLVLM(Large Vision-Language Models)は、視覚トークンの2次計算コストのため、長めのビデオ理解に苦慮している。
最近の効率的な方法では、ハードプルーニングや均一なマージによってトークンを圧縮しようとするが、頑健な構造的コンテキストと識別的意味的詳細が本質的に絡み合っている空間的特徴領域で厳密に機能する。
本研究では,効率的なビデオ推論のための共同信号周波数領域フレームワークであるWaveZipを提案する。
時間的冗長性は低域近似スケールに存在し、空間的サリエンシは高周波成分と強く相関し、WaveZipは離散ウェーブレット変換(DWT)を利用してこれらの信号をアンタングルする。
時折、1D DWTを用いてクエリフレームの関連性を分析し、その結果の高周波係数はフレーム間の差によってさらに解放され、両方の信号が正確なフレームレベルのトークン予算の動的割り当てを共同で駆動する。
空間的に2次元DWTは、特徴を低周波近似と高周波詳細成分に分解する。
重要なのは、WaveZipはタスク固有のトレーニングを必要とせず、推論効率を高めるために、既製のLVLMにシームレスに統合できることです。
長いビデオ理解のベンチマークに関する大規模な実験では、WaveZipは10倍の圧縮比で完全なパフォーマンスの99.6%を維持しており、一貫して最先端の手法よりも優れていた。
関連論文リスト
- FATE: Pillar Encoding and Frequency-Aware Training for Event-Based Object Detection [0.0]
イベントカメラは、高速かつ高ダイナミックレンジのシナリオに固有の利点を提供する。
現在のアプローチでは、蓄積ウィンドウを固定時間サブビンに分割する。
本稿では,新しい空間的枠組みを基盤とした統合フレームワークであるFATEを提案する。
論文 参考訳(メタデータ) (2026-06-15T22:32:09Z) - SONAR: Spectral-Contrastive Audio Residuals for Generalizable Deepfake Detection [6.042897432654865]
Spectral-cONtrastive Audio Residuals (AR)は、ディープフェイクオーディオ検出器のための周波数誘導フレームワークである。
ARは音声信号を補完表現に切り離す。
ASVspoof 2021およびin-the-wildベンチマークで評価した。
論文 参考訳(メタデータ) (2025-11-26T12:16:38Z) - FLaTEC: Frequency-Disentangled Latent Triplanes for Efficient Compression of LiDAR Point Clouds [52.997038111673966]
FLaTECは、圧縮率の高いフルスキャンの圧縮を可能にする周波数対応圧縮モデルである。
ボキセル化埋め込みを三面体表現に変換することで、空間性、計算コスト、ストレージ要件を低減する。
提案手法は,最先端の速度歪み性能を実現し,標準コーデックのBDレートを78%,94%向上させる。
論文 参考訳(メタデータ) (2025-11-25T08:37:49Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Dynamic Frame Interpolation in Wavelet Domain [57.25341639095404]
ビデオフレームは、より流動的な視覚体験のためにフレームレートを上げることができる、重要な低レベルな計算ビジョンタスクである。
既存の手法は、高度なモーションモデルと合成ネットワークを利用することで大きな成功を収めた。
WaveletVFIは、同様の精度を維持しながら最大40%の計算を削減できるため、他の最先端技術に対してより効率的に処理できる。
論文 参考訳(メタデータ) (2023-09-07T06:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。