論文の概要: EM^2Mem: Event-Centric Multimodal Memory for Large Language Models
- arxiv url: http://arxiv.org/abs/2609.00551v1
- Date: Tue, 01 Sep 2026 01:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.198227
- Title: EM^2Mem: Event-Centric Multimodal Memory for Large Language Models
- Title(参考訳): EM^2Mem:大規模言語モデルのためのイベント中心マルチモーダルメモリ
- Authors: Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng,
- Abstract要約: 本稿では,イベント中心型マルチモーダルメモリフレームワークEM2Memを提案する。
3つの長ビデオQAベンチマークで、EM2Memは最強のメモリベースラインの平均精度を2.0、2.4、および3.7ポイント改善した。
- 参考スコア(独自算出の注目度): 52.3165591032625
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal memory offers a scalable interface for long-video question answering, but existing methods often retrieve captions, frames, transcripts, summaries, or graph facts as isolated fragments. Although searchable, such fragments are not generation-ready: language models must reconstruct cross-modal and temporal alignments at inference time, when context is limited and attribution is difficult. We propose EM^2Mem, an event-centric multimodal memory framework that binds heterogeneous evidence to event anchors during memory construction. Each event-indexed memory cell aligns multimodal records, temporal context, graph-linked relations, semantic facts, and provenance, enabling compact evidence readout over grounded multimodal events rather than modality-specific fragments. Across three long-video QA benchmarks, EM^2Mem improves average accuracy over the strongest memory baseline by 2.0, 2.4, and 3.7 points, improves strict event-level Top-5 evidence recall by 7.0 points, and reduces per-query latency by 4.67 times and total inference tokens by 63.66% (The code will be integrated into https://github.com/zjunlp/LightMem).
- Abstract(参考訳): マルチモーダルメモリは、長時間ビデオの質問応答にスケーラブルなインタフェースを提供するが、既存の手法では、キャプション、フレーム、書き起こし、要約、グラフ事実を孤立した断片として取り出すことが多い。
言語モデルは、コンテキストが限定され、帰属が難しい場合、推論時にクロスモーダルと時間的アライメントを再構築する必要がある。
本稿では,イベント中心型マルチモーダルメモリフレームワークEM^2Memを提案する。
各イベントインデクシングメモリセルは、マルチモーダルレコード、時間的コンテキスト、グラフリンク関係、セマンティック事実、証明を整列し、モダリティ固有のフラグメントではなく、グラウンドドマルチモーダルイベントに対するコンパクトなエビデンスを実現する。
3つの長ビデオQAベンチマークで、EM^2Memは、最強メモリベースラインの平均精度を2.0、2.4、および3.7ポイント改善し、イベントレベルのトップ5エビデンスを7.0ポイントリコールし、クエリ毎のレイテンシを4.67倍、総推論トークンを63.66%削減する(コードはhttps://github.com/zjunlp/LightMemに統合される)。
関連論文リスト
- UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models [8.70663346892131]
我々は,高レベルのマルチモーダルメモリと低レベルの制御を1つのバックボーンの下に統一するフレームワークUniMemを提案する。
逐次記憶と空間記憶を対象とする5つのシミュレーションと4つのハードウェアタスクでUniMemを評価する。
論文 参考訳(メタデータ) (2026-08-24T06:56:02Z) - EverMemBench: Benchmarking Long-Term Interactive Memory in Large Language Models [16.865998112859604]
EverMemBenchは、100万以上のトークンにまたがる多人数のマルチグループ会話を特徴とするベンチマークである。
EverMemBenchは、1000以上のQAペアを通じて3次元にわたるメモリシステムを評価する。
論文 参考訳(メタデータ) (2026-02-01T16:13:08Z) - Beyond Dialogue Time: Temporal Semantic Memory for Personalized LLM Agents [68.84161689205779]
テンポラルセマンティックメモリ(TSM)は、ポイントワイドメモリのセマンティックタイムをモデル化するメモリフレームワークである。
TSMは既存の手法を一貫して上回り、最大12.2%の精度向上を実現している。
論文 参考訳(メタデータ) (2026-01-12T12:24:44Z) - Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents [76.76004970226485]
長期記憶はマルチモーダル大言語モデル(MLLM)エージェントにとって重要な機能である。
Mem-GalleryはMLLMエージェントのマルチモーダル長期会話メモリ評価のための新しいベンチマークである。
論文 参考訳(メタデータ) (2026-01-07T02:03:13Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - LaMemo: Language Modeling with Look-Ahead Memory [50.6248714811912]
右側トークンへの漸進的参加により再帰記憶を向上させるLook-Ahead Memory(LaMemo)を提案する。
LaMemoは、メモリ長に比例した追加のオーバーヘッドで、双方向の注意とセグメントの再発を受け入れる。
広く使われている言語モデリングベンチマークの実験は、異なる種類のメモリを備えたベースラインよりも優れていることを示した。
論文 参考訳(メタデータ) (2022-04-15T06:11:25Z) - Memory-Guided Semantic Learning Network for Temporal Sentence Grounding [55.31041933103645]
本稿では,TSGタスクにおいて稀に出現しないコンテンツを学習し,記憶するメモリ拡張ネットワークを提案する。
MGSL-Netは、クロスモーダル・インターアクション・モジュール、メモリ拡張モジュール、異種アテンション・モジュールの3つの主要な部分で構成されている。
論文 参考訳(メタデータ) (2022-01-03T02:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。