論文の概要: MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
- arxiv url: http://arxiv.org/abs/2609.40195v1
- Date: Wed, 30 Sep 2026 17:11:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.132194
- Title: MemLife: Curating and Reasoning over Long-Term Egocentric Video Memories
- Title(参考訳): MemLife:永遠のエゴセントリックなビデオ思い出のキュレーションと推論
- Abstract要約: 本稿では,マルチモーダルメモリシステムであるMemLifeについて紹介する。
トレーニングやクェリタイムのビデオアクセスなしで、MemLifeは4つのロングホライゾンベンチマークで4.6~12.0%のトレーニングなしベースラインを改善する。
MemOptは、様々なビデオや質問に対してMemLifeを2.7~5.0%改善し、ライターや読者のバックボーンやメモリシステムに一般化している。
- 参考スコア(独自算出の注目度): 49.06274199467918
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-term egocentric video enables personalized AI assistants to reason about daily life. However, as video histories grow to hundreds of hours spanning months or years, reprocessing raw clips for every query becomes computationally prohibitive. Memory systems offer a scalable alternative by compacting videos into text representations, but often fail on practical benchmarks: either the memory does not preserve key evidence, or the retriever fails to locate relevant entries due to retrieval competition in growing search spaces. To address these challenges, we introduce MemLife, a multimodal memory system that constructs entity-grounded, first-person text episodes and retrieves them via a time-indexed agentic reader. Without training or query-time video access, MemLife improves over the strongest training-free baseline by 4.6--12.0% across four long-horizon benchmarks. To further improve memory quality, we propose MemOpt, a reinforcement learning framework that optimizes the memory writer to produce faithful, informative, and retrievable memories. MemOpt consistently improves MemLife by 2.7--5.0% across different video and question distributions, with gains that generalize across writer and reader backbones and memory systems.
- Abstract(参考訳): 長期的な自我中心のビデオは、パーソナライズされたAIアシスタントが日常生活を判断することを可能にする。
しかし、ビデオ履歴が数ヶ月または数年に何百時間にも及ぶと、クエリ毎に生のクリップを再処理することは、計算的に禁止される。
メモリシステムは、動画をテキスト表現にコンパクト化することでスケーラブルな代替手段を提供するが、しばしば実用的なベンチマークで失敗する。
これらの課題に対処するために,エンティティ・グラウンドで1対1のテキスト・エピソードを構成するマルチモーダル・メモリシステムであるMemLifeを導入し,タイムインデクシングされたエージェント・リーダーを用いてそれらを検索する。
トレーニングやクェリタイムのビデオアクセスなしで、MemLifeは4つのロングホライゾンベンチマークで4.6~12.0%のトレーニングなしベースラインを改善する。
メモリ品質をさらに向上させるために,メモリライタを最適化し,忠実で情報的かつ検索可能なメモリを生成するための強化学習フレームワークであるMemOptを提案する。
MemOptは、様々なビデオや質問の配信でMemLifeを2.7~5.0%改善し、ライターや読者のバックボーンやメモリシステムに一般化している。
関連論文リスト
- MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering [54.54526361917178]
MemoryCardは長いビデオを自己完結型メモリカードに整理する。
その結果、MemoryCardは、同等の視覚的な予算の下で、長時間ビデオのQAパフォーマンスを継続的に改善することを示した。
論文 参考訳(メタデータ) (2026-06-04T09:23:31Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Personalize-then-Store: Benchmarking and Learning Personalized Memory for Long-horizon Agents [20.22872890297194]
既存の大規模言語モデル(LLM)ベースのメモリシステムは、基本的な現実を覆い隠す、普遍的で静的なポリシーを適用している。
パーソナライズされたメモリシステムを評価するための最初のベンチマークであるPerMemBenchを紹介する。
本稿では,過渡セッションのメモリ操作を選択的にバイパスする軽量フレームワークであるセッションレベルのストレージゲーティングを提案する。
論文 参考訳(メタデータ) (2026-05-25T07:48:33Z) - EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding [89.26501160264199]
EgoMemReasonは、メモリ駆動推論を通じて、1週間のエゴセントリックなビデオ理解を体系的に評価する。
EgoMemReasonには3つのメモリタイプと6つのコア課題に関する500の質問が含まれている。
EgoMemReasonをMLLMとエージェントフレームワークにまたがる17の手法で評価する。
論文 参考訳(メタデータ) (2026-05-11T01:59:59Z) - From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents [38.52713500119118]
Memoraは、数週間から数ヶ月のユーザ会話にまたがる長期メモリベンチマークです。
ベンチマークでは、記憶、推論、レコメンデーションの3つのメモリグラウンドタスクを評価している。
FAMA(Forgetting-Aware Memory Accuracy)は、古いメモリや無効メモリへの依存を罰するメトリクスである。
論文 参考訳(メタデータ) (2026-04-21T21:31:01Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。