論文の概要: ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2607.28312v2
- Date: Sat, 01 Aug 2026 16:00:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.161142
- Title: ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding
- Title(参考訳): ObjectStream: ビデオ理解のストリーミングのためのメモリアンカーとしての潜在オブジェクト
- Authors: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu,
- Abstract要約: ObjectStreamはトレーニング不要のフレームワークで、ストリーミングビデオ理解のためのメモリアンカーとして潜在オブジェクトを扱う。
それは3つの補完的な証拠を保存している: 永続的なオブジェクト履歴、過渡的なオブジェクト変更、そして最近の視覚的コンテキストである。
オンラインストリーミングとオフラインの長時間ビデオベンチマークの実験は、有効性と効率の両方を示している。
- 参考スコア(独自算出の注目度): 50.17161313335395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding requires models to continuously retain useful visual evidence before future questions are known. Existing approaches primarily manage the growing visual context according to token importance, temporal redundancy, or segment-level relevance, but rarely organize evidence around objects that persist and evolve over time. Thus, in this paper, we introduce ObjectStream, a training-free framework that treats latent objects as memory anchors for streaming video understanding. ObjectStream induces spatially coherent latent objects directly from frozen Video-LLM representations, links them across frames into persistent anchors, and maintains their histories under a bounded memory budget, without requiring external object detectors or segmentation models. Built on these anchors, ObjectStream preserves three complementary forms of evidence: persistent object histories, transient object changes, and recent visual context. This design enables existing Video Large Language Models (Video-LLMs) to reason over object identities, interactions, and state changes while leaving the underlying model unchanged. Extensive experiments on online streaming and offline long-video benchmarks demonstrate both effectiveness and efficiency. In online streaming evaluation, ObjectStream improves Qwen2.5-VL-7B by 10.0 points on OVO-Bench Real-Time Visual Perception, while reducing peak GPU mem-ory and TTFT by approximately 50%. On offline long-video benchmarks, it surpasses the full-token baseline while discarding 82.5% of visual tokens. These results highlight latent objects as a practical and effective organizing principle for compact streaming video memory.
- Abstract(参考訳): ストリーミングビデオ理解には、将来の疑問が知られる前に有用な視覚的証拠を継続的に保持する必要がある。
既存のアプローチは、トークンの重要性、時間的冗長性、あるいはセグメントレベルの関連性に応じて成長する視覚的コンテキストを管理するが、時間とともに持続し進化するオブジェクトに関する証拠を整理することは滅多にない。
そこで本稿では,遅延オブジェクトをストリーミングビデオ理解のためのメモリアンカーとして扱う,トレーニング不要のフレームワークであるObjectStreamを紹介する。
ObjectStreamは、凍結したVideo-LLM表現から直接空間的に一貫性のある潜在オブジェクトを誘導し、フレームをまたいで永続的なアンカーにリンクし、外部オブジェクト検出器やセグメンテーションモデルを必要とせずに、境界メモリ予算の下でそれらの履歴を維持する。
これらのアンカー上に構築されたObjectStreamは、永続的なオブジェクト履歴、過渡的なオブジェクト変更、そして最近の視覚的コンテキストという、3つの補完的な証拠を保存している。
この設計により、既存のビデオ大言語モデル(Video-LLMs)は、オブジェクトの同一性、相互作用、状態の変化を推論し、基礎となるモデルをそのままにしておくことができる。
オンラインストリーミングとオフラインの長時間ビデオベンチマークに関する大規模な実験は、有効性と効率の両方を示している。
オンラインストリーミング評価では、ObjectStreamはQwen2.5-VL-7BをOVO-Bench Real-Time Visual Perceptionで10.0ポイント改善し、ピーク時のGPUmem-oryとTTFTを約50%削減した。
オフラインの長時間ビデオベンチマークでは、完全なベースラインを超え、82.5%のビジュアルトークンを捨てている。
これらの結果は、コンパクトなストリーミングビデオメモリのための実用的で効果的な構成原理として、潜時オブジェクトを強調している。
関連論文リスト
- FOLIO: Focused Semantic Memory for Streaming Video Understanding [7.067883491096352]
オンラインのストリーミングビデオ理解では、ビデオストリームが到着し続け、いつでもクエリが発行される可能性がある。
この履歴がストリームとともに増加するにつれて、メモリコストが増加し、多くの冗長な視覚的詳細が保持される。
トレーニング不要なセマンティックメモリシステムであるFOLIOを導入し、ストリームの重要な部分をより詳細に記録する。
論文 参考訳(メタデータ) (2026-07-14T22:09:48Z) - LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams [59.485485426790966]
このLiveStarProは、長時間のストリーミング上でのプロアクティブなビデオ理解のために設計されたライブストリーミングアシスタントである。
LiveStarProは既存のメソッドを一貫して上回り、セマンティックな正確性は28.9%向上した。
そのストリーミングキーバリューキャッシュは、キャッシュなしで同じモデル上で1.58倍の推論速度を得る。
論文 参考訳(メタデータ) (2026-06-16T11:18:05Z) - SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation [30.157534925157844]
SlotMemoryは、ビデオ拡散をストリーミングするためのオブジェクト中心のKey-Valueメモリメカニズムである。
我々のアプローチでは、イベントが発生したときのメモリ抽象化を、トランスフォーマーのキー-値多様体を分解することで、"何"が表現されているかに変換する。
論文 参考訳(メタデータ) (2026-05-29T09:04:26Z) - Thinking in Streaming Video [30.61790766076081]
ThinkStreamは、Watch-Think-Speakパラダイムに基づいた、ビデオ推論をストリーミングするためのフレームワークである。
Reasoning-Compressed Streaming Memory (RCSM) は、中間的推論トレースをコンパクトなセマンティックメモリとして扱う。
複数のストリーミングビデオベンチマークの実験では、ThinkStreamが既存のオンラインビデオモデルを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2026-03-13T12:33:36Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - StreamForest: Efficient Online Video Understanding with Persistent Event Memory [37.73273040737155]
StreamForestは、ビデオの理解をストリーミングするために設計されている。
微粒な時空間ウィンドウは、現在のシーン知覚を改善するために、詳細な短期的な視覚的手がかりをキャプチャする。
OnlineITはリアルタイム認識と将来の予測の両方においてMLLMのパフォーマンスを大幅に向上させる。
論文 参考訳(メタデータ) (2025-09-29T14:53:57Z) - Latest Object Memory Management for Temporally Consistent Video Instance Segmentation [17.805350735895114]
時間的に一貫したビデオインスタンスセグメンテーションのための最新のオブジェクトメモリ管理(LOMM)を提案する。
LOMMは、各フレームにおけるオブジェクトの存在を明示的にモデル化することで、オブジェクトの最新の状態を堅牢に追跡し、更新する。
Decoupled Object Association (DOA)は、新しく出現し、すでに存在するオブジェクトを別々に扱う戦略である。
論文 参考訳(メタデータ) (2025-07-26T02:52:41Z) - Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams [78.72965584414368]
人間の記憶機構をシミュレートしたビデオ言語モデルFlash-VStreamを提案する。
既存のモデルと比較して、Flash-VStreamは遅延推論とVRAM消費の大幅な削減を実現している。
本稿では,オンライン動画ストリーミング理解に特化して設計された質問応答ベンチマークであるVStream-QAを提案する。
論文 参考訳(メタデータ) (2024-06-12T11:07:55Z) - Region Aware Video Object Segmentation with Deep Motion Modeling [56.95836951559529]
Region Aware Video Object (RAVOS) は、効率的なオブジェクトセグメンテーションとメモリストレージのための関心領域を予測する手法である。
効率的なセグメンテーションのために、ROIに応じてオブジェクトの特徴を抽出し、オブジェクトレベルのセグメンテーションのためにオブジェクトデコーダを設計する。
効率的なメモリ記憶のために,2つのフレーム間のオブジェクトの移動経路内の特徴を記憶することで,冗長なコンテキストをフィルタリングする動作パスメモリを提案する。
論文 参考訳(メタデータ) (2022-07-21T01:44:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。