論文の概要: PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
- arxiv url: http://arxiv.org/abs/2608.00962v1
- Date: Sun, 02 Aug 2026 03:20:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.036946
- Title: PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
- Title(参考訳): PMMC:長期LVLMエージェントのための先進的マルチモーダルメモリコンパイル
- Abstract要約: 長期記憶は、LVLMエージェントが一貫性を維持し、拡張されたマルチモーダル相互作用間で情報を統合するために不可欠である。
本稿では,メモリ推論プロセスの一部をクエリ時間からメモリ統合時間にシフトさせるフレームワークであるProspective Multimodal Memory Compilationを提案する。
マルチモーダルな長期メモリベンチマーク実験により,クエリ時間トークンと遅延コストを低減しつつ,応答品質と視覚的エビデンスリコールを改善した。
- 参考スコア(独自算出の注目度): 19.297991318803508
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-term memory is essential for LVLM agents to maintain consistency and integrate information across extended multimodal interactions. Existing agent memory systems, however, often reduce visual experiences into textual summaries or rely on static retrieve-then-reason pipelines, which are inefficient at query time and brittle when questions require image-text binding, temporal updates, or visual details. We propose Prospective Multimodal Memory Compilation, a framework that shifts part of the memory reasoning process from query time to memory consolidation time. Given accumulated multimodal interactions, a Questioner predicts future question candidates, a Planner compiles question-conditioned multimodal memory programs, and a Doubter verifies whether the planned evidence path can support the predicted answer. The verified question-program pairs form a structured question bank for efficient query-time routing and evidence retrieval. Experiments on multimodal long-term memory benchmarks show that our method improves answer quality and visual evidence recall while reducing query-time token and latency costs. Extensive ablations analyze the effects of self-feedback, dynamic planning, raw-image access, and question bank coverage.
- Abstract(参考訳): 長期記憶は、LVLMエージェントが一貫性を維持し、拡張されたマルチモーダル相互作用間で情報を統合するために不可欠である。
しかし、既存のエージェントメモリシステムは、しばしば視覚的な経験をテキストの要約に還元するか、静的検索・推論パイプラインに依存している。
本稿では,メモリ推論プロセスの一部をクエリ時間からメモリ統合時間にシフトさせるフレームワークであるProspective Multimodal Memory Compilationを提案する。
蓄積されたマルチモーダル相互作用が与えられた場合、質問者は将来の質問候補を予測し、プランナーは質問条件付きマルチモーダルメモリプログラムをコンパイルし、ダブターは、計画されたエビデンスパスが予測された回答をサポートすることができるかどうかを検証する。
検証された質問プログラムペアは、効率的なクエリ時間ルーティングとエビデンス検索のために構造化された質問バンクを形成する。
マルチモーダルな長期メモリベンチマーク実験により,クエリ時間トークンと遅延コストを低減しつつ,応答品質と視覚的エビデンスリコールを改善した。
大規模な改善は、セルフフィードバック、ダイナミックプランニング、生画像アクセス、質問銀行のカバレッジの影響を分析します。
関連論文リスト
- MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios [33.8882826707344]
MemGroundは、リッチでゲーミフィケーションされたインタラクティブシナリオを基盤とした、厳格な長期メモリベンチマークである。
メモリ利用と行動軌跡の両方を包括的に定量化するために,多次元計量スイートを提案する。
論文 参考訳(メタデータ) (2026-03-23T02:57:39Z) - Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning [18.621823772319154]
本稿では,メモリ操作と質問応答を一つのポリシーで統一するエンドツーエンド強化学習フレームワークを提案する。
UMAは、グローバルコンテキストのためのコンパクトなコアサマリと、明示的なCRUDをサポートする構造化メモリバンクという、二重メモリ表現を維持している。
Ledger-QA、Test-Time Learning、そしてCurcurate Retrievalにまたがる13のデータセットのうち、UMAは動的推論と学習タスクの長いコンテキストとRAGベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-13T16:54:23Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents [76.76004970226485]
長期記憶はマルチモーダル大言語モデル(MLLM)エージェントにとって重要な機能である。
Mem-GalleryはMLLMエージェントのマルチモーダル長期会話メモリ評価のための新しいベンチマークである。
論文 参考訳(メタデータ) (2026-01-07T02:03:13Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z) - From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents [79.87304940020256]
大言語モデル(LLM)は会話エージェントで広く採用されている。
MemGASは、多粒度アソシエーション、適応選択、検索を構築することにより、メモリ統合を強化するフレームワークである。
4つの長期メモリベンチマークの実験により、MemGASは質問応答と検索タスクの両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-05-26T06:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。