論文の概要: CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2605.14310v1
- Date: Thu, 14 May 2026 03:22:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-16 00:43:04.087936
- Title: CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding
- Title(参考訳): CoRDS: ストリームビデオ理解のためのコアセットベース代表・異種選択
- Authors: Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal,
- Abstract要約: 大規模な視覚言語モデル(VLM)によるビデオ理解のストリーミングには、成長を続ける視覚履歴に対する将来の推論をサポートするためのコンパクトなメモリが必要である。
一般的な解決策はキー値(KV)キャッシュを圧縮することだが、既存のストリーミングメソッドは通常、ローカルトークンに頼っている。
我々は,KV-cache圧縮を,保持のために独立にトークンをスコアリングするのではなく,コアセット選択問題とみなす。
- 参考スコア(独自算出の注目度): 30.287018710590257
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding with large vision-language models (VLMs) requires a compact memory that can support future reasoning over an ever-growing visual history. A common solution is to compress the key-value (KV) cache, but existing streaming methods typically rely on local token-wise heuristics, such as recency, temporal redundancy, or saliency, which do not explicitly optimize whether the retained cache is representative of the accumulated history. We propose to view KV-cache compression as a coreset selection problem: rather than scoring tokens independently for retention, we select a small subset that covers the geometry of the accumulated visual cache. Our method operates in a joint KV representation and introduces a bicriteria objective that balances coverage in key and value spaces, preserving both retrieval structure and output-relevant information. To encourage a more diverse retained subset, we further introduce an orthogonality-driven diversity criterion that favors candidates contributing new directions beyond the current selection, and connect this criterion to log-determinant subset selection. Across four open-source VLMs and five long-video and streaming-video benchmarks, our method improves over heuristic streaming compression baselines under a fixed cache budget. These results highlight that representative coreset selection offers a more effective principle, than token-wise pruning, for memory-constrained streaming video understanding.
- Abstract(参考訳): 大規模な視覚言語モデル(VLM)によるビデオ理解のストリーミングには、成長を続ける視覚履歴に対する将来の推論をサポートするためのコンパクトなメモリが必要である。
一般的な解決策は、キー値(KV)キャッシュを圧縮することであるが、既存のストリーミング手法は、通常、保存されたキャッシュが蓄積された履歴を表すかどうかを明示的に最適化しない、正確性、時間的冗長性、サリエンシといった局所的なトークン単位のヒューリスティックに依存している。
我々は,KVキャッシュ圧縮をコアセット選択問題として,保持のためにトークンを独立にスコアリングするのではなく,蓄積したビジュアルキャッシュの幾何学をカバーする小さなサブセットを選択することを提案する。
提案手法は共同KV表現で動作し,鍵空間と値空間のカバレッジのバランスを保ち,検索構造と出力関連情報を両立させるビクリテリア対象を導入する。
より多様な残留部分集合を奨励するために、直交型多様性基準を導入し、この基準を対数決定的部分集合選択に結びつける。
提案手法は,4つのオープンソースVLMと5つの長ビデオおよびストリーミングビデオベンチマークにおいて,固定キャッシュ予算下でのヒューリスティックなストリーミング圧縮ベースラインよりも改善されている。
これらの結果は、メモリ制約のあるストリーミングビデオ理解において、代表コアセット選択の方がトークンワイドプルーニングよりも効果的な原理であることを示している。
関連論文リスト
- Multi-Vector Index Compression in Any Modality [73.7330345057813]
後期の相互作用は、テキスト、画像、ビジュアルドキュメント、ビデオにおける情報検索の主要なパラダイムとして現れてきた。
インデックス圧縮には,シーケンスリサイズ,メモリトークン,階層プール,新しいアテンション誘導クラスタリング(AGC)の4つのアプローチを導入する。
AGCは、ドキュメントの最もセマンティックな領域をクラスタセントロイドとして識別し、トークンの集合を重み付けするために注意誘導機構を使用する。
論文 参考訳(メタデータ) (2026-02-24T18:57:33Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference [14.17979669446161]
トレーニング不要な動的圧縮フレームワークであるHeteroCacheを提案する。
We show that HeteroCache achieves state-of-the-art performance on multiple long-context benchmarks and accelerates decoding by up $3times$ in the original model in the 224K context。
論文 参考訳(メタデータ) (2026-01-20T07:35:06Z) - PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache [61.57938553036056]
トレーニング不要なKVキャッシュ管理手法であるPackCacheを導入し,KVキャッシュを3つの協調機構でコンパクト化する。
効率の面では、PackCacheは48フレームの長いシーケンスで1.7-2.2倍のエンドツーエンド生成を高速化する。
論文 参考訳(メタデータ) (2026-01-07T19:51:06Z) - StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression [95.59657871147846]
我々は,ビデオLLMと高度なKVキャッシュの検索と圧縮をシームレスに行うフレームワークである textbfStreamKV を提案する。
公開StreamingVQAベンチマークの実験では、StreamKVが既存のオンラインビデオ-LLMを著しく上回っていることが示されている。
論文 参考訳(メタデータ) (2025-11-10T16:25:03Z) - AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference [11.73134417321505]
本稿では,LVLM推論の高速化を目的とした新しいKVキャッシュ圧縮手法であるAirCacheを提案する。
本手法は,視覚的KVキャッシュの10%を保ちながら,フルキャッシュに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-03-31T11:13:18Z) - Efficient Inference of Vision Instruction-Following Models with Elastic Cache [76.44955111634545]
我々は,命令追従型大規模視覚言語モデルの効率的なデプロイのための新しい戦略であるElastic Cacheを紹介する。
本稿では,冗長キャッシュを具現化する重要なキャッシュマージ戦略を提案する。
命令符号化では,キャッシュの重要性を評価するために周波数を利用する。
様々なLVLMの結果は、Elastic Cacheが効率を向上するだけでなく、言語生成における既存のプルーニングメソッドよりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-25T15:29:05Z) - Action Keypoint Network for Efficient Video Recognition [63.48422805355741]
本稿では、時間的・空間的な選択をアクションキーポイントネットワーク(AK-Net)に統合することを提案する。
AK-Netは、アクションキーポイントのセットとして任意の形状の領域に散在する情報的ポイントを選択し、ビデオ認識をポイントクラウド分類に変換する。
実験結果から,AK-Netは複数のビデオ認識ベンチマークにおいて,ベースライン手法の効率と性能を一貫して向上させることができることがわかった。
論文 参考訳(メタデータ) (2022-01-17T09:35:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。