論文の概要: CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference
- arxiv url: http://arxiv.org/abs/2604.06036v3
- Date: Thu, 09 Apr 2026 09:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 14:10:47.885108
- Title: CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference
- Title(参考訳): CodecSight: 効率的なストリーミングVLM推論のためのビデオコーデック信号の活用
- Abstract要約: 我々は、圧縮の副産物として、ビデオコーデックが各ストリームの時間的・空間的構造を抽出しているというキー観測に基づいて構築されたストリーミングビデオ分析システム、CodecSightを提案する。
CodecSightはこのメタデータを低コストの信号として扱い、ビデオデコード、ビジュアルプロセッシング、LLMプリフィルのランタイム最適化を統一する。
実験によると、CodecSightはスループットを最大3$times$で改善し、GPU計算を最先端のベースラインよりも最大87%削減し、競争精度を維持している。
- 参考スコア(独自算出の注目度): 4.835489391255295
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video streaming analytics is a crucial workload for vision-language model serving, but the high cost of multimodal inference limits scalability. Prior systems reduce inference cost by exploiting temporal and spatial redundancy in video streams, but they target either the vision transformer (ViT) or the LLM with a limited view, leaving end-to-end opportunities untapped. Moreover, existing methods incur significant overhead to identify redundancy, either through offline profiling and training or costly online computation, making them ill-suited for dynamic real-time streams. We present CodecSight, a codec-guided streaming video analytics system, built on a key observation that video codecs already extract the temporal and spatial structure of each stream as a byproduct of compression. CodecSight treats this codec metadata as a low-cost runtime signal to unify optimization across video decoding, visual processing, and LLM prefilling, with transmission reduction as an inherent benefit of operating directly on compressed bitstreams. This drives codec-guided patch pruning before ViT encoding and selective key-value cache refresh during LLM prefilling, both of which are fully online and do not require offline training. Experiments show that CodecSight achieves an improvement in throughput of up to 3$\times$, and a reduction of up to 87% in GPU compute over state-of-the-art baselines, maintaining competitive accuracy with only 0$\sim$8% F1 drop.
- Abstract(参考訳): ビデオストリーミング分析は、視覚言語モデル提供にとって重要な作業負荷であるが、マルチモーダル推論のコストが高いためスケーラビリティが制限される。
従来のシステムは、ビデオストリームの時間的および空間的冗長性を利用して推論コストを削減するが、視覚変換器(ViT)またはLLMを限定的な視点でターゲットとし、エンドツーエンドの機会を未然に残す。
さらに、既存の手法では、オフラインのプロファイリングとトレーニング、あるいはコストのかかるオンライン計算によって、冗長性を特定するためにかなりのオーバーヘッドが生じるため、動的リアルタイムストリームには適さない。
我々は,コーデック誘導型ストリーミングビデオ分析システムであるCodecSightについて,ビデオコーデックが圧縮の副産物として各ストリームの時間的・空間的構造を既に抽出しているというキー観測に基づいて述べる。
CodecSightは、このコーデックメタデータを低コストのランタイム信号として扱い、ビデオデコーディング、ビジュアルプロセッシング、LCMプリフィルの最適化を統一する。
これにより、ViTエンコーディング前のコーデック誘導パッチプルーニングと、LLMプリフィル中の選択キー値キャッシュリフレッシュが実行され、どちらも完全にオンラインであり、オフライントレーニングを必要としない。
実験によると、CodecSightはスループットを最大3$\times$で改善し、最先端のベースラインよりも最大87%のGPU計算を削減し、競争精度を0$\sim$8%のF1ドロップで維持している。
関連論文リスト
- LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs [90.77662862634509]
LiteFrameは、ビデオ大言語モデルのための強力な、しかし非常に効率的なバックボーンである。
LiteFrameはエンドツーエンドのレイテンシを35%削減し、8$times$より多くのフレームを処理する。
計算予算の固定化により,より長めの映像理解を解き明かす可能性を示した。
論文 参考訳(メタデータ) (2026-05-17T05:02:52Z) - CoPE-VideoLM: Codec Primitives For Efficient Video Language Models [56.76440182038839]
ビデオ言語モデル(Video Language Models, ビデオ言語モデル)は、ビデオの時間的ダイナミクスを理解するためのAIシステムである。
現在の方法では、マクロレベルのイベントとマイクロレベルの詳細の両方を見逃すことができるサンプリングを使用する。
多くのフレームに対して高価なフルイメージエンコーディングを必要とせず、ビデオ冗長性と疎結合性を符号化するビデオプリミティブを活用することを提案する。
論文 参考訳(メタデータ) (2026-02-13T18:57:31Z) - V-Rex: Real-Time Streaming Video LLM Acceleration via Dynamic KV Cache Retrieval [1.677021230191566]
ビデオ大言語モデル(LLM)のストリーミングは、ビデオキャプション、質問応答、会話エージェント、拡張現実といったリアルタイムなマルチモーダルタスクにますます利用されている。
これらのモデルは、キー値(KV)キャッシュが連続的なストリーミングビデオ入力によって大幅に増大するため、基本的なメモリと計算上の課題に直面している。
我々は,ストリーミングビデオLLM推論におけるアルゴリズム的ボトルネックとハードウェア的ボトルネックに対処する,初のソフトウェアとハードウェアの共同設計アクセラレータであるV-Rexを提案する。
論文 参考訳(メタデータ) (2025-12-13T11:02:04Z) - FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation [27.32235541083431]
FocalCodec-Streamは、音声を1つのバイナリコードブックに0.55から0.80kbpsで圧縮し、理論的な遅延は80msである。
実験によると、FocalCodec-Streamは既存のストリーム可能なコーデックを同等の性能で上回っている。
論文 参考訳(メタデータ) (2025-09-19T17:57:13Z) - SIEDD: Shared-Implicit Encoder with Discrete Decoders [36.705337163276255]
Inlicit Neural Representations (INR)は、ビデオごとの最適化機能を学ぶことによって、ビデオ圧縮に例外的な忠実度を提供する。
既存のINRエンコーディングの高速化の試みは、しばしば再建品質や重要な座標レベルの制御を犠牲にしている。
これらの妥協なしにINRエンコーディングを根本的に高速化する新しいアーキテクチャであるSIEDDを紹介する。
論文 参考訳(メタデータ) (2025-06-29T19:39:43Z) - LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval [13.891391928767195]
LiveVLMは、ストリーミング、オンラインビデオ理解、リアルタイムインタラクションに特化したトレーニング不要のフレームワークである。
LiveVLMはストリーミング指向のKVキャッシュを構築し、ビデオストリームをリアルタイムで処理し、長期のビデオの詳細を保持し、冗長なKVを排除する。
新しい質問が提案されると、LiveVLMは、短期と長期の両方の視覚情報を効率的に取得するオンラインの質問回答プロセスを導入する。
論文 参考訳(メタデータ) (2025-05-21T08:47:15Z) - Plug-and-Play Versatile Compressed Video Enhancement [57.62582951699999]
ビデオ圧縮はファイルのサイズを効果的に削減し、リアルタイムのクラウドコンピューティングを可能にする。
しかし、それは視覚的品質の犠牲となり、下流の視覚モデルの堅牢性に挑戦する。
本稿では,異なる圧縮条件下で動画を適応的に拡張する多言語対応拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-21T18:39:31Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - Low-Latency Neural Stereo Streaming [6.49558286032794]
低レイテンシ・ニューラル for Stereo Video Streaming (LLSS) は低遅延ステレオビデオストリーミング用に設計された新しいステレオビデオ符号化法である。
LLSSは、左と右のビューを並列に処理し、レイテンシを最小化します。
論文 参考訳(メタデータ) (2024-03-26T17:11:51Z) - A Coding Framework and Benchmark towards Low-Bitrate Video Understanding [63.05385140193666]
我々は,従来のコーデックとニューラルネットワーク(NN)の両方を活用する,従来型ニューラル混合符号化フレームワークを提案する。
このフレームワークは、動画の移動効率の良いセマンティック表現を確実に保持することで最適化される。
8つのデータセットに3つのダウンストリームタスクを備えた低ビットレートビデオ理解ベンチマークを構築し、このアプローチの顕著な優位性を実証した。
論文 参考訳(メタデータ) (2022-02-06T16:29:15Z) - Low-Fidelity End-to-End Video Encoder Pre-training for Temporal Action
Localization [96.73647162960842]
TALはビデオ理解の基本的な課題だが、難しい課題だ。
既存のtalメソッドは、アクション分類の監督を通じてビデオエンコーダを事前トレーニングする。
本稿では,ローファイダリティ・エンド・ツー・エンド(LoFi)ビデオエンコーダの事前学習手法を提案する。
論文 参考訳(メタデータ) (2021-03-28T22:18:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。