論文の概要: CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams
- arxiv url: http://arxiv.org/abs/2606.22804v1
- Date: Mon, 22 Jun 2026 03:29:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 04:31:45.791775
- Title: CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams
- Title(参考訳): CoVStream: 長いビデオストリームを理解するためのエッジクラウドコラボレーション
- Authors: Xu Liu, Guikun Chen, Zihao Yan, Kanzhi Wu, Wenguan Wang,
- Abstract要約: CoVStreamは、長いビデオストリームを理解するための最初のエッジクラウド協調フレームワークである。
生のビデオストリームを、コンパクトな視覚的特徴と、クラウドへの送信のためのセマンティックキャプションに蒸留し、帯域幅のコストを最小化する。
実験によると、CoVStreamは、クラウドベースラインの精度の99.2%を維持しながら、帯域幅を87.6%削減している。
- 参考スコア(独自算出の注目度): 49.92157301784352
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long, continuous video streams are an increasingly critical driver of multimedia intelligence. Existing efforts often handle long videos with a sample-encode-reason approach using large models. However, they overlook a crucial deployment fact: the stream is often produced by computationally constrained devices. This forces an untenable compromise: cloud offloading unlocks strong reasoning but incurs prohibitive bandwidth overhead, while on-device processing remains limited by edge hardware capacity. Therefore, we propose CoVStream, the first edge-cloud collaborative framework for understanding long video streams. The edge node distills raw video streams into compact visual features and semantic captions for transmission to the cloud, minimizing bandwidth costs, while the cloud server integrates this data into an entity graph and global visual context, activating the heavy reasoning model only when a user query arrives. Experiments on VideoMME-Long, LVBench, and RTV-Bench show that CoVStream reduces bandwidth usage by 87.6% while retaining 99.2% of the cloud baseline accuracy on LVBench.
- Abstract(参考訳): 長く連続したビデオストリームは、ますますマルチメディアインテリジェンスにとって重要な要素になりつつある。
既存の取り組みは、大きめのモデルを用いたサンプルエンコード・レアソンアプローチで、長いビデオを扱うことが多い。
ストリームは、しばしば計算に制約のあるデバイスによって生成される。
クラウドオフロードは強い推論を解放するが、デバイス上の処理はエッジハードウェアの能力によって制限される一方、帯域幅のオーバーヘッドは禁じられている。
そこで我々は,長いビデオストリームを理解するための,最初のエッジクラウド協調フレームワークであるCoVStreamを提案する。
エッジノードは、生のビデオストリームをコンパクトな視覚特徴とクラウドへの送信のためのセマンティックキャプションに蒸留し、帯域幅コストを最小化し、一方、クラウドサーバは、このデータをエンティティグラフとグローバルビジュアルコンテキストに統合し、ユーザクエリが到着したときのみ重大推論モデルを活性化する。
VideoMME-Long、LVBench、RTV-Benchの実験では、CoVStreamはLVBench上でのクラウドベースライン精度の99.2%を維持しながら、帯域幅を87.6%削減している。
関連論文リスト
- ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference [28.470202983949886]
ViCoStreamは、チャンクワイズ実行、ビジュアルトークン制御、バウンドビジュアルアテンション、クエリサイド検索、メモリコストを組み合わせた、ステージワイドなストリーミングフレームワークである。
ViCoStreamは、1つのA100 GPU上で134FPSビデオスループットと50ms TTFT未満のTTFTを実現し、全方位ベースラインに近い精度を維持していることを示す。
論文 参考訳(メタデータ) (2026-06-18T06:57:31Z) - Progressive Semantic Communication for Efficient Edge-Cloud Vision-Language Models [0.3004066195320147]
VLM(Vision-Language Models)は、リソース制約のある組み込みプラットフォームへのデプロイが困難である。
クラウドへの完全なオフロード推論は、帯域幅に制限のある環境では現実的ではないことが多い。
エッジクラウドVLM推論のためのプログレッシブセマンティック通信フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-29T10:16:06Z) - CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference [4.835489391255295]
我々は、圧縮の副産物として、ビデオコーデックが各ストリームの時間的・空間的構造を抽出しているというキー観測に基づいて構築されたストリーミングビデオ分析システム、CodecSightを提案する。
CodecSightはこのメタデータを低コストの信号として扱い、ビデオデコード、ビジュアルプロセッシング、LLMプリフィルのランタイム最適化を統一する。
実験によると、CodecSightはスループットを最大3$times$で改善し、GPU計算を最先端のベースラインよりも最大87%削減し、競争精度を維持している。
論文 参考訳(メタデータ) (2026-04-07T16:31:45Z) - Thinking in Streaming Video [30.61790766076081]
ThinkStreamは、Watch-Think-Speakパラダイムに基づいた、ビデオ推論をストリーミングするためのフレームワークである。
Reasoning-Compressed Streaming Memory (RCSM) は、中間的推論トレースをコンパクトなセマンティックメモリとして扱う。
複数のストリーミングビデオベンチマークの実験では、ThinkStreamが既存のオンラインビデオモデルを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-03-13T12:33:36Z) - Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams [11.495597616926274]
Event-VStreamは、連続した動画を、個別にセマンティックに一貫性のあるイベントのシーケンスとして表現する。
システムは、動き、意味、予測的手がかりを統合することで意味のある状態遷移を検出する。
システムは2時間のEgo4Dストリームで約70%のGPT-5の勝利率を維持している。
論文 参考訳(メタデータ) (2026-01-22T05:05:53Z) - Flash-VStream: Efficient Real-Time Understanding for Long Video Streams [64.25549822010372]
Flash-VStreamは、非常に長いビデオを処理し、リアルタイムでユーザークエリに応答できるビデオ言語モデルである。
既存のモデルと比較して、Flash-VStreamは推論遅延を大幅に削減する。
論文 参考訳(メタデータ) (2025-06-30T13:17:49Z) - Looking Backward: Streaming Video-to-Video Translation with Feature Banks [65.46145157488344]
StreamV2Vは、ユーザプロンプトによるリアルタイムストリーミングビデオ変換(V2V)を実現する拡散モデルである。
1つのA100 GPU上で20 FPSを実行することができ、FlowVid、CoDeF、Rerender、TokenFlowよりも15x、46x、108x、158x高速である。
論文 参考訳(メタデータ) (2024-05-24T17:53:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。