論文の概要: Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding
- arxiv url: http://arxiv.org/abs/2608.07663v1
- Date: Fri, 07 Aug 2026 18:00:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.472511
- Title: Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding
- Title(参考訳): マルチキー・エピソード・メモリの検索をシンプルに - 超長めの映像理解のために-
- Abstract要約: 超長大映像理解のためのシンプルで効果的なフレームワークであるMERITを提案する。
我々は、微細な記憶の正確な検索を可能にするエピソードなマルチキー表現を定式化する。
MeRITは3つのロングビデオベンチマークで最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 41.45143308235023
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When videos extend from hours to days, directly processing them end-to-end becomes impractical for current Multi-modal Large Language Models (MLLMs). This ultra-long setting necessitates a two-stage paradigm: query-agnostic memory construction followed by retrieval-based inference. Prior work invests in complex memory construction to pre-model high-level relations in videos, despite not knowing the downstream query at build time. We instead prioritize high-recall retrievability during memory building, and defer query-specific, high-level relation composition to inference time. To this end, we propose MERIT(Multi-key Episodic Retrieval with Inference-time Temporal expansion), a simple yet effective agentic framework for ultra-long video understanding. First, we formulate an episodic multi-key representation that enables precise retrieval of fine-grained memories through a simple key-matching mechanism. Second, we introduce a neighbor filtering mechanism to capture broader semantic context without the massive computational overhead of global memory construction. This is achieved by expanding the temporal scope exclusively around the retrieved segments at inference time. By leveraging simple key-matching with this on-demand temporal expansion, MERIT achieves state-of-the-art performance across three long-video benchmarks: EgoLifeQA, LVBench, and Video-MME (Long).
- Abstract(参考訳): ビデオが数時間から数日に及ぶと、それらをエンドツーエンドで直接処理することは、現在のMLLM(Multi-modal Large Language Models)にとって現実的ではない。
この超長期設定は2段階のパラダイムを必要とする:クエリに依存しないメモリ構築と検索ベースの推論である。
以前の作業では、ビルド時のダウンストリームクエリを知らないにも関わらず、ビデオ内のハイレベルな関係をモデル化するための複雑なメモリ構築に投資していた。
代わりに、メモリ構築時のハイリコール検索性を優先し、クエリ固有の高レベルな関係合成を推論時間に延期する。
そこで本稿では,MERIT(Multi-key Episodic Retrieval with Inference-time Temporal expansion)を提案する。
まず、簡単なキーマッチング機構を用いて、微細な記憶の正確な検索を可能にするエピソードなマルチキー表現を定式化する。
第2に、グローバルメモリ構築の膨大な計算オーバーヘッドを伴わずに、より広いセマンティックコンテキストをキャプチャするための隣のフィルタリング機構を導入する。
これは、検索されたセグメントにのみ時間範囲を拡大することで達成される。
このオンデマンド時間拡張に単純なキーマッチングを活用することで、MERITはEgoLifeQA、LVBench、Video-MME(Long)の3つの長ビデオベンチマークで最先端のパフォーマンスを達成する。
関連論文リスト
- Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning [77.7531245219403]
textscHomerは階層型オンラインメモリ探索および推論フレームワークである。
textscHomerの記憶は、生の知覚から繰り返される実体、明示的な時間的・因果関係と結びついた出来事まで、長いビデオのマルチスケール構造を反映している。
textscHomerは、M3-Bench-robot、M3-Bench-web、Video-MME-Longで$+5.5$、$+10.8$、$+4.4$ポイントで前のベストエージェントメソッドより優れている。
論文 参考訳(メタデータ) (2026-07-01T05:53:09Z) - Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding [47.48582887762574]
ReMemは、トレーニングフリーのLongVideoQAのための時間的粒度適応選択フレームワークである。
メモリ機構で時間情報を明示的に保存することにより、ReMemは冗長性を抑え、MLLMに堅牢なマルチグラニュラビデオ推論を行う権限を与える。
論文 参考訳(メタデータ) (2026-06-30T10:55:56Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory [59.869552603264076]
GCAgent(Global-Context-Aware Agent)は,広義の長ビデオ理解を実現する新しいフレームワークである。
これは、イベントとその因果関係と時間的関係を、簡潔で組織化されたコンテキストに構造的にモデル化するものです。
実験により、GCAgentは、強力なMLLMベースライン上でのVideo-MME Long分割において、最大23.5%の精度向上を実現した。
論文 参考訳(メタデータ) (2025-11-15T04:29:00Z) - Everything Can Be Described in Words: A Simple Unified Multi-Modal Framework with Semantic and Temporal Alignment [0.0]
大規模言語モデルのための構造化テキストとして視覚と聴覚の入力を統一するフレームワークであるUMaTを提案する。
最新技術であるLong Video Question Answeringの精度を大幅に向上させる。
論文 参考訳(メタデータ) (2025-03-12T05:28:24Z) - InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions [104.90258030688256]
本研究は,ストリーミング映像とオーディオ入力とのリアルタイムインタラクションを実現するために,非絡み合いのストリーミング知覚,推論,メモリ機構を導入している。
このプロジェクトは人間のような認知をシミュレートし、多モーダルな大規模言語モデルが時間とともに継続的かつ適応的なサービスを提供できるようにする。
論文 参考訳(メタデータ) (2024-12-12T18:58:30Z) - ReWind: Understanding Long Videos with Instructed Learnable Memory [8.002949551539297]
VLM(Vision-Language Models)は、テキスト情報と視覚情報の統合的な理解を必要とするアプリケーションに不可欠である。
本稿では,時間的忠実さを保ちながら,より効率的な長時間ビデオ理解を実現するためのメモリベースの新しいVLMであるReWindを紹介する。
本稿では,視覚的質問応答(VQA)と時間的グラウンド処理におけるReWindの優れた性能を実証的に示す。
論文 参考訳(メタデータ) (2024-11-23T13:23:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。