論文の概要: ReMem: Streaming Video Understanding With Long Context Retention
- arxiv url: http://arxiv.org/abs/2610.05940v1
- Date: Mon, 05 Oct 2026 07:56:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:02:48.552151
- Title: ReMem: Streaming Video Understanding With Long Context Retention
- Title(参考訳): ReMem:長期保存によるビデオ理解のストリーミング
- Abstract要約: ReMemは、Vision Language Modelsが任意の長さのストリーミングビデオを処理できるようにする、トレーニングなし適応技術である。
提案したReMemは、様々な広く使用されているベンチマークにおいて、最先端(SOTA)のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 3.0621466794767334
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite their impressive performance on a wide range of video understanding tasks, current Vision Language Models (VLMs) are predominantly designed for offline scenarios and struggle to handle online streaming videos that demand low latency response. Several studies have explored memory and token compression strategies in an attempt to adapt offline VLMs for streaming video understanding tasks. However, through our probing experiment, we identify that most existing works tend to progressively lose long context information as length of input stream increases. To address this, we propose ReMem, a novel training-free adaptation technique that enables VLMs to process streaming videos of arbitrary lengths while improving their long context information retention capability. ReMem exploits memory from two perspectives, implemented as two core components. The Streaming Context Memory (SCM) continuously compresses historical context with query-independent attention. The Retrieved Vision Memory (RVM) then retrieves the most salient, query-relevant context from memory to augment the VLM's input. Comprehensive experiments demonstrate that the proposed ReMem achieves state-of-the-art (SOTA) performance across a variety of widely used benchmarks, spanning both streaming video and general long video understanding tasks.
- Abstract(参考訳): 幅広いビデオ理解タスクにおける優れたパフォーマンスにもかかわらず、現在のビジョン言語モデル(VLM)は、主にオフラインシナリオ用に設計されており、レイテンシの低いオンラインストリーミングビデオを扱うのに苦労しています。
いくつかの研究では、オフラインのVLMをストリーミングビデオ理解タスクに適応させるために、メモリとトークンの圧縮戦略について検討している。
しかし, 探索実験により, 入力ストリームの長さが増大するにつれて, 既存の作品の多くは, 長期の文脈情報を徐々に失う傾向にあることが分かった。
そこで本研究では,VLMが任意の長さのストリーミングビデオを処理し,長時間のコンテキスト情報保持能力を向上することのできる,新たなトレーニングフリー適応手法であるReMemを提案する。
ReMemはメモリを2つの視点から利用し、2つのコアコンポーネントとして実装する。
Streaming Context Memory (SCM) は、クエリ非依存の注意で歴史的コンテキストを継続的に圧縮する。
Retrieved Vision Memory (RVM) は、VLMの入力を増大させるために、メモリから最も正確でクエリ関連のあるコンテキストを検索する。
包括的実験により、提案されたReMemは、ストリーミングビデオと一般的なロングビデオ理解タスクの両方にまたがる、様々な広く使用されているベンチマークにおいて、最先端(SOTA)のパフォーマンスを達成することが示された。
関連論文リスト
- Harnessing Streaming Video in the Wild [53.23721420272668]
VLM(Vision-Language Models)は、ビデオコールアシスタント、ライブコメンタリー、エンボディロボットなどのアプリケーションでビデオストリームを処理するためにますます必要とされる。
理想的なストリーミングシステムは、アクティブなインタラクション、長期メモリ、リアルタイム処理をサポートする必要がある。
既存のVLMはオフラインのビデオ理解に優れていますが、ストリーミング機能に欠け、ストリーミングデプロイメント専用のインフラストラクチャが欠如しています。
論文 参考訳(メタデータ) (2026-06-07T13:00:19Z) - WAT: Online Video Understanding Needs Watching Before Thinking [25.136741695647213]
WAT(Watching Before Thinking)は、オンラインビデオ推論のための2段階のフレームワークである。
処理をクエリ非依存の監視ステージとクエリトリガーの思考ステージに分離する。
オンラインビデオベンチマークでは、StreamingBenchでは77.7%、OVO-Benchでは55.2%の精度で最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-12T13:42:32Z) - VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management [17.645183933549458]
VideoMemは、適応メモリ管理によるシーケンシャルな生成タスクとして、長いビデオ理解をモデル化する新しいフレームワークである。
我々は,VMemが,超長期ビデオ理解タスクの様々なベンチマークにおいて,既存のオープンソースモデルを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2025-12-04T07:42:13Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - video-SALMONN S: Streaming Audio-Visual LLMs Beyond Length Limits via Memory [51.03819128505358]
Video-SALMONN Sは、まず1FPSと360p解像度で3時間ビデオを処理する。
テストタイムトレーニングメモリモジュールは、トークン表現を継続的に更新して、長距離依存関係をキャプチャする。
プロンプト依存メモリリーダは、固定サイズメモリからコンテキスト関連コンテンツを検索する。
論文 参考訳(メタデータ) (2025-10-13T08:20:15Z) - Flash-VStream: Efficient Real-Time Understanding for Long Video Streams [64.25549822010372]
Flash-VStreamは、非常に長いビデオを処理し、リアルタイムでユーザークエリに応答できるビデオ言語モデルである。
既存のモデルと比較して、Flash-VStreamは推論遅延を大幅に削減する。
論文 参考訳(メタデータ) (2025-06-30T13:17:49Z) - ReWind: Understanding Long Videos with Instructed Learnable Memory [8.002949551539297]
VLM(Vision-Language Models)は、テキスト情報と視覚情報の統合的な理解を必要とするアプリケーションに不可欠である。
本稿では,時間的忠実さを保ちながら,より効率的な長時間ビデオ理解を実現するためのメモリベースの新しいVLMであるReWindを紹介する。
本稿では,視覚的質問応答(VQA)と時間的グラウンド処理におけるReWindの優れた性能を実証的に示す。
論文 参考訳(メタデータ) (2024-11-23T13:23:22Z) - Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams [78.72965584414368]
人間の記憶機構をシミュレートしたビデオ言語モデルFlash-VStreamを提案する。
既存のモデルと比較して、Flash-VStreamは遅延推論とVRAM消費の大幅な削減を実現している。
本稿では,オンライン動画ストリーミング理解に特化して設計された質問応答ベンチマークであるVStream-QAを提案する。
論文 参考訳(メタデータ) (2024-06-12T11:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。