論文の概要: ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory
- arxiv url: http://arxiv.org/abs/2606.26762v1
- Date: Thu, 25 Jun 2026 08:47:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.219826
- Title: ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory
- Title(参考訳): ProtoKV: 遅延クエリによるビデオ理解のストリーミング
- Authors: Le Tu Ngoc Minh, Jinyeong Lim, Dongsu Han,
- Abstract要約: ProtoKV は一定フットプリント SVU メモリであり、固定容量の要約状態として長い歴史を表す。
長遅延状態におけるSVUベンチマークのトークン保持ベースラインよりも最大12.5ポイント精度が向上する。
- 参考スコア(独自算出の注目度): 3.4115268101762983
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding (SVU) must answer queries that arrive asynchronously while visual tokens stream continuously under strict GPU-memory and query-time latency budgets. A key challenge is delayed query: decisive cues may appear briefly, yet many subsequent updates occur before the query arrives, increasing the risk that those cues are evicted or diluted under bounded memory. We propose ProtoKV, a constant-footprint SVU memory that represents far history as a fixed-capacity summary state rather than retaining token instances. ProtoKV keeps an exact near-window KV cache and aggregates older content into a semantic-spatial prototype bank with residual statistics. At query time, each prototype is exposed through a bounded pseudo-token interface that is drop-in compatible with standard attention. Under matched budgets and comparable query-time cost, ProtoKV improves accuracy by up to 12.5 points over token-retention baselines on SVU benchmarks in the long-delay regime, with gains that grow as query delay increases.
- Abstract(参考訳): ストリーミングビデオ理解(SVU)は非同期にやってくるクエリに答えなければならないが、ビジュアルトークンは厳格なGPUメモリとクエリ時間レイテンシの予算の下で継続的にストリーミングされる。
重要な課題は、遅延クエリである:決定的キューは短時間で現れるかもしれないが、クエリが到着する前に多くの後続の更新が行われ、これらのキューが境界メモリの下で削除または希釈されるリスクが増大する。
本稿では,トークンインスタンスを保持せず,固定容量のサマリ状態として歴史を表現した,一定のフットプリントSVUメモリであるProtoKVを提案する。
ProtoKVは、正確な近窓KVキャッシュを保持し、古いコンテンツを残存統計を持つ意味空間のプロトタイプバンクに集約する。
クエリ時には、各プロトタイプは、標準の注意と互換性のあるバウンド擬似トークンインターフェースを通じて公開される。
一致した予算と同等のクエリ時間コストの下で、ProtoKVは、長遅延状態のSVUベンチマークのトークン保持ベースラインよりも最大12.5ポイント精度を向上し、クエリ遅延が増加するにつれて増加します。
関連論文リスト
- Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting [18.71433885255431]
適応的ビデオトークン化(Adaptive Video tokenisation)は、シーケンスの基盤となる視覚的複雑さに基づいて、トークンの予算を動的に割り当てる。
凍結連続ビデオトークンの潜伏空間は,直接利用可能な時間的冗長性を本質的に符号化していることを示す。
パラメータフリー適応トークン割り当て機構を導入し,時間-L1差分に対する固定しきい値を適用した。
論文 参考訳(メタデータ) (2026-06-04T13:31:12Z) - Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers [0.0]
Flash Queriesは、データ到着間のアイドルサイクルを再利用し、登録された質問を事前に評価し、ユーザが尋ねる前にキャッシュされた回答を返す。
セル予算の受け入れとプレフィックスを意識したグループプレフィルを備えたマルチテナント連続バッチスケジューラは、数十のステートフルセッションを1つのGPU上で共存させることができる。
ストリーミング市場データベンチマークでは、参照実装は従来の推論エンジンよりも最大5.9倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2026-05-13T17:06:15Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - Kwai Summary Attention Technical Report [69.40814939510126]
長文の能力は、次世代の大規模言語モデルの最も重要な方向性の1つになっている。
標準ソフトマックスアテンションは、シーケンスの長さに関して2次時間複雑性を示す。
歴史的文脈を圧縮することでシーケンスモデリングコストを削減する新しいアテンションメカニズムであるKwai Summary Attention (KSA)を提案する。
論文 参考訳(メタデータ) (2026-04-27T12:59:53Z) - Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queries [39.38028687042293]
キーバリュー(KV)キャッシュは、効率的なLarge Language Models(LLM)推論に不可欠である。
既存のKVキャッシュ圧縮手法は、プリフィル段階でトークンの重要性を推定するために入力側注意パターンに依存している。
位置認識型擬似クエリ(DapQ)を提案し,位置認識型擬似クエリによるKVキャッシュ圧縮を近似する。
論文 参考訳(メタデータ) (2026-03-12T05:36:32Z) - S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference [11.779449360037518]
S3-Attentionは,長期コンテキスト処理を注目に順応した内因性検索として扱うメモリファースト推論時フレームワークである。
S3-Attentionは、軽量なスパースオートエンコーダを使用して、トランジェントキーとクエリプロジェクションをトップkスパース機能識別子にデコードする。
単一のストリーミングスキャン中にトークンの位置やスパンにCPUベースの逆インデックスマッピング機能を構築する。
論文 参考訳(メタデータ) (2026-01-25T05:25:22Z) - SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference [49.84148668264725]
SparseVILAは効率的なVLM推論のための新しいパラダイムであり、前処理と復号の段階で視覚空間を疎結合する。
AWQ最適化推論パイプライン上に構築されたSparseVILAは、プリフィルの最大4.0倍、デコーディングの2.5倍、長文ビデオタスクの2.6倍のエンドツーエンド高速化を実現している。
論文 参考訳(メタデータ) (2025-10-20T17:35:47Z) - AttentionPredictor: Temporal Patterns Matter for KV Cache Compression [64.75459635661562]
我々は,KVキャッシュ圧縮とクリティカルトークン識別のための注意パターンを直接予測する,学習に基づく最初の手法であるAttentionPredictorを提案する。
AttentionPredictorは、注意スコアを正確に予測し、無視可能なメモリを消費する統一予測モデルを共有する。
注意情報の大半を保持することで、AttentionPredictorは、キャッシュオフロードシナリオで13$times$KVキャッシュ圧縮と5.6$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-06T13:41:46Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。