論文の概要: Small Vision-Language Models are Smart Compressors for Long Video Understanding
- arxiv url: http://arxiv.org/abs/2604.08120v1
- Date: Thu, 09 Apr 2026 11:40:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.890345
- Title: Small Vision-Language Models are Smart Compressors for Long Video Understanding
- Title(参考訳): 長期ビデオ理解のためのスマート圧縮機としての小型ビジョンランゲージモデル
- Abstract要約: 長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
- 参考スコア(独自算出の注目度): 73.65465038390771
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting Multimodal Large Language Models (MLLMs) for hour-long videos is bottlenecked by context limits. Dense visual streams saturate token budgets and exacerbate the lost-in-the-middle phenomenon. Existing heuristics, like sparse sampling or uniform pooling, blindly sacrifice fidelity by discarding decisive moments and wasting bandwidth on irrelevant backgrounds. We propose Tempo, an efficient query-aware framework compressing long videos for downstream understanding. Tempo leverages a Small Vision-Language Model (SVLM) as a local temporal compressor, casting token reduction as an early cross-modal distillation process to generate compact, intent-aligned representations in a single forward pass. To enforce strict budgets without breaking causality, we introduce Adaptive Token Allocation (ATA). Exploiting the SVLM's zero-shot relevance prior and semantic front-loading, ATA acts as a training-free $O(1)$ dynamic router. It allocates dense bandwidth to query-critical segments while compressing redundancies into minimal temporal anchors to maintain the global storyline. Extensive experiments show our 6B architecture achieves state-of-the-art performance with aggressive dynamic compression (0.5-16 tokens/frame). On the extreme-long LVBench (4101s), Tempo scores 52.3 under a strict 8K visual budget, outperforming GPT-4o and Gemini 1.5 Pro. Scaling to 2048 frames reaches 53.7. Crucially, Tempo compresses hour-long videos substantially below theoretical limits, proving true long-form video understanding relies on intent-driven efficiency rather than greedily padded context windows.
- Abstract(参考訳): 1時間のビデオにMLLM(Multimodal Large Language Models)を適用することは、コンテキスト制限によってボトルネックとなる。
複雑なビジュアルストリームはトークンの予算を飽和させ、失った中間現象を悪化させる。
スパースサンプリングや均一プールのような既存のヒューリスティックは、決定的な瞬間を捨て、無関係な背景に帯域を浪費することによって、不確実性を盲目的に犠牲にする。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テンポは局所的な時間圧縮機としてSmall Vision-Language Model (SVLM)を活用し、早期のクロスモーダル蒸留プロセスとしてトークン還元を鋳造し、1つのフォワードパスでコンパクトで意図に整合した表現を生成する。
因果関係を壊さずに厳格な予算を強制するために、適応的トークン割当(ATA)を導入する。
SVLMのゼロショット関連性とセマンティックフロントローディングを爆発させ、ATAはトレーニング不要な$O(1)$ dynamic routerとして機能する。
クエリクリティカルなセグメントに密度の高い帯域幅を割り当て、グローバルなストーリーラインを維持するために冗長性を最小の時間アンカーに圧縮する。
我々の6Bアーキテクチャは、アグレッシブな動的圧縮(0.5-16トークン/フレーム)で最先端のパフォーマンスを実現する。
極長のLVBench (4101s)では、Tempoは厳格な8K視覚予算で52.3得点し、GPT-4oとGemini 1.5 Proを上回った。
2048フレームへのスケーリングは53.7に達する。
重要なことに、Tempoは1時間の動画を理論上の限界以下に圧縮し、真のロングフォームなビデオ理解は、ぼんやりとしたパドのコンテキストウィンドウではなく、意図駆動の効率に頼っていることを証明している。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding [51.08792182064565]
長いビデオ理解は、膨大なフレーム数のため、視覚言語モデル(VLM)にとって本質的に困難である。
通常、ビデオフレームは数十から数百のトークンに拡張されるため、大きな言語モデル(LLM)のコンテキスト長は制限され、VLMはフレームをわずかに知覚し、時間的情報を失う。
本稿では,XComp という長大なビデオ理解のための極端な圧縮モデルを提案する。
論文 参考訳(メタデータ) (2026-04-15T17:59:52Z) - PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference [46.18482046594169]
PackForcingは、単一のH200 GPU上で16 FPSでコヒーレントな2分832x480ビデオを生成する。
わずか4GBのバウンドKVキャッシュを実現し、ゼロショットまたは5秒のクリップでトレーニングされた24倍の時間(5秒から120秒)を効果的に動作させることができる。
論文 参考訳(メタデータ) (2026-03-26T17:59:05Z) - Accelerating Streaming Video Large Language Models via Hierarchical Token Compression [12.247532124314402]
Streaming Video Large Language Models (VideoLLMs)は、様々なビデオ理解タスクで素晴らしいパフォーマンスを誇示している。
連続したビデオストリームから高密度のビジュアルトークンを処理する計算コストが高いため、リアルタイムデプロイメントにおいて大きな課題に直面している。
textbfStreaming textbfToken textbfCompression (textbfSTC)を提案する。
論文 参考訳(メタデータ) (2025-11-30T13:44:28Z) - StreamingTOM: Streaming Token Compression for Efficient Video Understanding [6.9203477336374775]
既存のアプローチはLLM後のkv-cacheのみを規制し、コストのかかるLLM前のプリフィルは変わらない。
StreamingTOMは,LLM前とLLM後の両方のボトルネックに,予測可能なレイテンシで対処する,トレーニングフリーでプラグイン&プレイの2段階フレームワークです。
実験では, 従来のSOTAと比較して, 15.7 時間で kv-cache 圧縮, 12 時間で低ピークメモリ, 2 時間で速い TTFT 圧縮を実現している。
論文 参考訳(メタデータ) (2025-10-21T03:39:41Z) - Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference [5.146388234814547]
長いビデオはしばしば現代の言語モデルのトークン予算を超え、厳しいコンテキスト制限とレイテンシの問題に繋がる。
本稿では,時間的に静的なパッチを識別・プルーニングすることで,ビデオ中のトークンの冗長性を低減できる簡易なプラグイン・アンド・プレイ方式であるEfficient Video Sampling (EVS)を紹介する。
EVSは意味的忠実性を維持しながらトークン数を大幅に削減し、より高速な推論とより長い入力シーケンスを可能にする。
論文 参考訳(メタデータ) (2025-10-16T12:34:38Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding [55.320254859515714]
ReTaKeは、ビデオLLMsが8倍のフレーム(最大2048年まで)を処理し、類似のモデルも3~5%縮小し、ビデオMME、MLVU、LongVideoBench、LVBenchなどと競合する。
私たちのコードはhttps://github.com/SCZwangxiao/video-ReTaKe.comで公開されています。
論文 参考訳(メタデータ) (2024-12-29T15:42:24Z) - LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding [65.46303012350207]
LongVUは、長いビデオの視覚的詳細を保存しながら、ビデオトークンの数を減らす適応圧縮機構である。
DINOv2の機能を利用して、高い類似性を示す冗長なフレームを削除します。
時間的依存関係に基づいて,フレーム間の空間トークン削減を行う。
論文 参考訳(メタデータ) (2024-10-22T21:21:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。