論文の概要: StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2608.10949v1
- Date: Tue, 11 Aug 2026 14:19:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:46.070424
- Title: StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
- Title(参考訳): StreamFlow: ストリームビデオ理解のための動的メモリフロー
- Authors: Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An,
- Abstract要約: StreamFlowは、歴史的視覚情報への動的なオンデマンドアクセスを可能にする効率的なビジュアルメモリフレームワークである。
最先端のストリーミングビデオ理解性能を達成し、StreamingBenchの全体的な精度は67.73%に達した。
バニラ設定とは対照的に、視覚的注意スコア(VAS)を59.1%改善し、それぞれエンドツーエンドのレイテンシとピークメモリを50.4%、21.1%削減した。
- 参考スコア(独自算出の注目度): 65.10324190760602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming video understanding requires multimodal large language models (MLLMs) to preserve relevant evidence from continuously evolving streams under strict causality and bounded memory. Yet existing paradigms remain limited: model-based methods require intrusive backbone updates, while memory-based methods expend substantial visual-encoding computation on temporally redundant content and rely on rigid access to visual history. To address these limitations, we introduce StreamFlow, an efficient visual memory framework that enables dynamic, on-demand access to historical visual information. StreamFlow combines a lightweight, dynamics-aware mid-term memory that filters temporal redundancy before visual encoding with a latent long-term memory that consolidates historical video content into visual latents accessible to subsequent reasoning. During generation, an attention-guided retrieval mechanism injects relevant visual latents when the model's reliance on visual evidence weakens. StreamFlow achieves state-of-the-art streaming video understanding performance, reaching 67.73% overall accuracy on StreamingBench, while also delivering strong performance on offline long-video benchmarks. Relative to the vanilla setting, it improves the visual attention score (VAS) by 59.1% while reducing end-to-end latency and peak memory by 50.4% and 21.1%, respectively, enabling more visually grounded and efficient reasoning.
- Abstract(参考訳): ストリーミングビデオ理解は、厳密な因果性と境界メモリの下で連続的に進化するストリームから関連する証拠を保持するために、マルチモーダルな大言語モデル(MLLM)を必要とする。
モデルベースの手法は侵入的なバックボーンの更新を必要とし、メモリベースの手法は時間的に冗長なコンテンツに対してかなりの視覚的エンコード計算を実行し、視覚履歴への厳格なアクセスに依存している。
このような制限に対処するために,従来の視覚情報への動的かつオンデマンドなアクセスを可能にする,効率的なビジュアルメモリフレームワークであるStreamFlowを紹介した。
StreamFlowは、視覚的エンコーディングの前に時間的冗長性をフィルタリングする軽量で動的に認識された中期記憶と、過去のビデオコンテンツをその後の推論にアクセスできる視覚的潜時記憶に集約する潜時記憶を組み合わせる。
生成中、注意誘導検索機構は、モデルが視覚的エビデンスに依存すると、関連する視覚的潜伏者を注入する。
StreamFlowは最先端のストリーミングビデオ理解のパフォーマンスを達成し、StreamingBenchの全体的な精度は67.73%に達した。
バニラ設定とは対照的に、視覚的注意スコア(VAS)を59.1%改善し、それぞれエンドツーエンドのレイテンシとピークメモリを50.4%、21.1%削減した。
関連論文リスト
- ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding [50.17161313335395]
ObjectStreamはトレーニング不要のフレームワークで、ストリーミングビデオ理解のためのメモリアンカーとして潜在オブジェクトを扱う。
それは3つの補完的な証拠を保存している: 永続的なオブジェクト履歴、過渡的なオブジェクト変更、そして最近の視覚的コンテキストである。
オンラインストリーミングとオフラインの長時間ビデオベンチマークの実験は、有効性と効率の両方を示している。
論文 参考訳(メタデータ) (2026-07-30T14:47:00Z) - FlowNar: Scalable Streaming Narration for Long-Form Videos [24.674831574110645]
FlowNarはスケーラブルなストリーミングビデオナレーションのための新しいフレームワークである。
FlowNarの中核は、歴史的視覚的コンテキスト削除のための動的コンテキスト管理戦略である。
Ego4D、EgoExo4D、EpicKitchens100データセットの実験は、FlowNarが強力なベースラインよりもナレーション品質を大幅に改善していることを示している。
論文 参考訳(メタデータ) (2026-05-30T08:51:28Z) - Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding [55.7992006853979]
SAVEMemは、セマンティックな認識をメモリ生成にもたらすフレームワークで、クエリ毎に検索スコープを適応させる。
SAVEMemは、メモリ生成にセマンティックな認識をもたらし、クエリ毎に検索範囲を適応させる、トレーニングフリーのデュアルステージフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T15:40:40Z) - WAT: Online Video Understanding Needs Watching Before Thinking [25.136741695647213]
WAT(Watching Before Thinking)は、オンラインビデオ推論のための2段階のフレームワークである。
処理をクエリ非依存の監視ステージとクエリトリガーの思考ステージに分離する。
オンラインビデオベンチマークでは、StreamingBenchでは77.7%、OVO-Benchでは55.2%の精度で最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-12T13:42:32Z) - StreamForest: Efficient Online Video Understanding with Persistent Event Memory [37.73273040737155]
StreamForestは、ビデオの理解をストリーミングするために設計されている。
微粒な時空間ウィンドウは、現在のシーン知覚を改善するために、詳細な短期的な視覚的手がかりをキャプチャする。
OnlineITはリアルタイム認識と将来の予測の両方においてMLLMのパフォーマンスを大幅に向上させる。
論文 参考訳(メタデータ) (2025-09-29T14:53:57Z) - Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams [78.72965584414368]
人間の記憶機構をシミュレートしたビデオ言語モデルFlash-VStreamを提案する。
既存のモデルと比較して、Flash-VStreamは遅延推論とVRAM消費の大幅な削減を実現している。
本稿では,オンライン動画ストリーミング理解に特化して設計された質問応答ベンチマークであるVStream-QAを提案する。
論文 参考訳(メタデータ) (2024-06-12T11:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。