論文の概要: ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2609.02780v1
- Date: Wed, 02 Sep 2026 16:14:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.46687
- Title: ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
- Title(参考訳): ShallowStream: ビデオ理解のストリーミングに深く答えるインデックス
- Authors: Jitai Hao, Ke Yang, Qiang Huang, Jun Yu,
- Abstract要約: ストリーミングビデオ理解は、現実世界のアプリケーションにとって重要な機能である。
ShallowStreamはMLLMの浅い層を利用してフレームエンコーディングと検索インデックス構築を同時に行う新しいフレームワークである。
ShallowStreamは、フレームごとのプリフィルレイテンシと10秒間のエンドツーエンドのレイテンシをそれぞれ52.1xと1.9xに削減しながら、既存の最強のストリーミング手法と同等に実現している。
- 参考スコア(独自算出の注目度): 16.068802214957014
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding is a critical capability for real-world applications, including embodied intelligence, autonomous driving, industrial monitoring, surveillance and early warning, and wearable assistants. However, processing continuous video streams with multimodal large language models (MLLMs) is computationally expensive. Existing efforts have explored reducing streaming overhead through visual token pruning, token merging, quantization, on-demand frame retrieval, and context offloading. However, most existing methods overlook the dimension of model depth. Repeatedly executing full-depth MLLM prefill over incoming frames is prohibitively expensive, incurring substantial computational overhead and causing the KV cache to grow at a rate directly proportional to the prefill depth. To address these challenges, we propose ShallowStream, a novel framework that leverages the shallow layers of an MLLM to simultaneously perform frame encoding and retrieval index building. During stream processing, ShallowStream maintains an always-on lightweight index using the KV cache of shallow layers. During query-time answering, we leverage the attention scores generated by the shallow layers to score context frames and employ a diversity-aware selection strategy to retrieve precise and comprehensive evidence. ShallowStream achieves performance on par with the strongest existing streaming methods, while reducing per-frame prefill latency and 10-second end-to-end latency by up to 52.1x and 11.9x, respectively. Our code is available at https://github.com/CURRENTF/ShallowStream.
- Abstract(参考訳): ストリーミングビデオ理解は、インテリジェンス、自律運転、産業監視、監視と早期警告、ウェアラブルアシスタントなど、現実世界のアプリケーションにとって重要な機能である。
しかし,マルチモーダル大言語モデル (MLLM) を用いた連続ビデオストリームの処理には計算コストがかかる。
既存の取り組みでは、ビジュアルトークンプルーニング、トークンマージ、量子化、オンデマンドフレーム検索、コンテキストオフロードによるストリーミングオーバーヘッドの削減が検討されている。
しかし、既存のほとんどの手法はモデル深さの次元を見落としている。
入ってくるフレーム上で完全深度MLLMプリフィルを繰り返し実行するのは非常に高価であり、かなりの計算オーバーヘッドを発生させ、プリフィル深さに比例する速度でKVキャッシュを成長させる。
これらの課題に対処するために,MLLMの浅い層を利用してフレーム符号化と検索インデックス構築を同時に行う新しいフレームワークであるShallowStreamを提案する。
ストリーム処理の間、ShallowStreamは浅いレイヤのKVキャッシュを使用して、常時オンの軽量インデックスを維持している。
問合せ時応答では,浅層層が生み出す注目スコアを利用してコンテキストフレームをスコアし,多様性に配慮した選択戦略を用いて,正確かつ包括的な証拠を検索する。
ShallowStreamは、フレームごとのプリフィルレイテンシと10秒間のエンドツーエンドのレイテンシをそれぞれ52.1xと1.9xに削減しながら、既存の最強のストリーミング手法と同等のパフォーマンスを実現している。
私たちのコードはhttps://github.com/CURRENTF/ShallowStreamで利用可能です。
関連論文リスト
- ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference [28.470202983949886]
ViCoStreamは、チャンクワイズ実行、ビジュアルトークン制御、バウンドビジュアルアテンション、クエリサイド検索、メモリコストを組み合わせた、ステージワイドなストリーミングフレームワークである。
ViCoStreamは、1つのA100 GPU上で134FPSビデオスループットと50ms TTFT未満のTTFTを実現し、全方位ベースラインに近い精度を維持していることを示す。
論文 参考訳(メタデータ) (2026-06-18T06:57:31Z) - CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference [4.835489391255295]
我々は、圧縮の副産物として、ビデオコーデックが各ストリームの時間的・空間的構造を抽出しているというキー観測に基づいて構築されたストリーミングビデオ分析システム、CodecSightを提案する。
CodecSightはこのメタデータを低コストの信号として扱い、ビデオデコード、ビジュアルプロセッシング、LLMプリフィルのランタイム最適化を統一する。
実験によると、CodecSightはスループットを最大3$times$で改善し、GPU計算を最先端のベースラインよりも最大87%削減し、競争精度を維持している。
論文 参考訳(メタデータ) (2026-04-07T16:31:45Z) - Stream2LLM: Overlap Context Streaming and Prefill for Reduced Time-to-First-Token (TTFT) [2.8350851063316873]
ストリーミングコンテキスト – 推論による重なり合う検索 – は、このレイテンシを軽減することができる。
本稿では,ストリーミング対応LLMサービスシステムStream2LLMについて述べる。
論文 参考訳(メタデータ) (2026-03-29T06:49:12Z) - CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management [9.03430145112447]
トレーニング不要で曲率を考慮した階層型ビジュアルメモリ管理フレームワークであるCurveStreamを提案する。
我々のアプローチは、連続的な特徴軌跡に沿った高曲率領域が重要なグローバルセマンティックトランジションと密接に一致していることの鍵となる観察によって動機付けられている。
この幾何学的洞察に基づいて、CurveStreamはCurvature Scoreを介してリアルタイムセマンティックインテンシティを評価し、オンラインK-Sigmaダイナミックしきい値を統合し、フレームをクリアでファジィなメモリ状態に適応的にルーティングする。
論文 参考訳(メタデータ) (2026-03-20T02:28:57Z) - Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory [50.30283773196725]
既存のアプローチは、時間とともにフレームレベルの詳細を蓄積するためにキーバリューキャッシングに依存していますが、フレーム毎に限られた数のトークンを使用します。
より詳細な時間的理解と推論を可能にするためにトークン予算のスケーリングを提案する。
論文 参考訳(メタデータ) (2026-02-20T18:59:50Z) - Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding [36.74241893088594]
拡散大言語モデル(dLLM)は、自然言語生成に魅力的なパラダイムを提供する。
最近の研究はKVキャッシュの再利用や復号化を通じて推論を加速しているが、ブロックワイド拡散プロセスにおける本質的な非効率性を見落としている。
本稿では,空間次元と時間次元の両方にわたって推論を合理化する学習自由フレームワークStreaming-dLLMを提案する。
論文 参考訳(メタデータ) (2026-01-25T17:36:04Z) - HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding [92.59317281526239]
HERMESは、ビデオストリームのリアルタイムかつ正確な理解のためのトレーニング不要アーキテクチャである。
HermesはコンパクトなKVキャッシュを再利用し、リソース制約下で効率的なストリーミング理解を可能にする。
Hermesはすべてのベンチマークで優れた精度または同等の精度を実現しており、ストリーミングデータセットでは最大11.4%向上している。
論文 参考訳(メタデータ) (2026-01-21T07:26:15Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。