論文の概要: Beyond Retrieval: Analytic Memory for Multimodal Agents
- arxiv url: http://arxiv.org/abs/2607.29440v2
- Date: Tue, 04 Aug 2026 06:43:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.408469
- Title: Beyond Retrieval: Analytic Memory for Multimodal Agents
- Title(参考訳): Beyond Retrieval: マルチモーダルエージェントの分析メモリ
- Abstract要約: 長期的なマルチモーダルメモリは、関連する情報を取得するだけでなく、相互作用にまたがって蓄積された観測の計算もサポートしなければならない。
本稿では,検索と解析メモリを協調的にサポートするフレームワークであるAdaMMを提案する。
MemEyeとMemGalleryの2つの長期マルチモーダルメモリベンチマークの実験では、それぞれAdaMMのパフォーマンスが11.3%と6.9%向上した。
- 参考スコア(独自算出の注目度): 20.053051187012315
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Long-term multimodal memory must support not only retrieving relevant information but also computing over observations accumulated across interactions. Existing systems largely emphasize \emph{retrieval memory}, organizing interaction histories through summaries and indexes to return query-relevant information at multiple granularities, from high-level abstractions to underlying records. In this paper, we formulate \emph{analytic memory} as a complementary abstraction that organizes recurring multimodal observations into queryable structures supporting filtering, aggregation, ranking, and temporal comparison. We present AdaMM, a framework that jointly supports retrieval and analytic memory. Rather than relying on application-defined schemas, AdaMM extracts provenance-linked attribute-value observations from dialogue, images, and contextual metadata, discovers recurring field structures, and materializes them for analytical access. At inference time, a memory-aware planner decomposes queries into retrieval and analytic operations and routes each operation to the appropriate tools. Experiments on two long-term multimodal memory benchmarks, MemEye and MemGallery, show that AdaMM improves performance by up to 11.3\% and 6.9\%, respectively.
- Abstract(参考訳): 長期的なマルチモーダルメモリは、関連する情報を取得するだけでなく、相互作用にまたがって蓄積された観測の計算もサポートしなければならない。
既存のシステムは、高レベルの抽象化から基礎となるレコードまで、複数の粒度でクエリ関連情報を返却するために、要約やインデックスを通じてインタラクション履歴を整理する「emph{retrieval memory}」に重点を置いている。
本稿では,繰り返し発生する多モード観測を,フィルタリング,集約,ランキング,時間的比較をサポートする問合せ可能な構造に整理した補完的抽象化として,emph{analytic memory}を定式化する。
本稿では,検索と解析メモリを協調的にサポートするフレームワークであるAdaMMを提案する。
アプリケーション定義スキーマに頼るのではなく、AdaMMは対話、画像、コンテキストメタデータからプロファイランスリンクされた属性値の観察を抽出し、繰り返し発生するフィールド構造を発見し、分析アクセスのためにそれらを実体化する。
推測時、メモリ対応プランナはクエリを検索および解析操作に分解し、各操作を適切なツールにルーティングする。
MemEye と MemGallery の2つの長期マルチモーダルメモリベンチマークの実験では、AdaMM がそれぞれ 11.3\% と 6.9\% のパフォーマンスを改善することが示されている。
関連論文リスト
- GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory [87.58855368314693]
メモリ構造をクエリ対応エビデンス・フォレスト構築としてモデル化するグラフメモリフレームワークであるGraphMemixを提案する。
4つの長期マルチモーダルメモリベンチマークの実験結果から,異なる基礎モデルによる大幅な改善が示された。
論文 参考訳(メタデータ) (2026-08-27T11:28:49Z) - Infini Memory: Maintainable Topic Documents for Long-Term LLM Agent Memory [19.802226925602927]
長期的なLLMエージェントは、変化する事実を追跡し、セッション間で関連する証拠を提供する、永続的なメモリを必要とする。
Infini Memoryは、エージェントメモリをトピック構造化文書として扱う、保守可能なテキストベースの永続メモリアーキテクチャである。
論文 参考訳(メタデータ) (2026-06-09T10:31:51Z) - MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search [59.98962867649009]
本稿では,メモリ成長とリトラシングに基づくエージェント検索フレームワークであるMemSearch-o1を提案する。
MemSearch-o1はクエリからメモリシードトークンからきめ細かいメモリフラグメントを成長させ、コントリビューション関数を通じてメモリを再トレースし、深く洗練し、最終的にグローバルに接続されたメモリパスを再編成する。
論文 参考訳(メタデータ) (2026-04-19T05:35:06Z) - TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA [8.036549927091286]
大規模言語モデル(LLM)は、様々なドメインにわたるテキストベースのコンテキストにおいて強力な推論能力を示した。
コンテキストウィンドウの制限は、長距離推論タスクにおけるモデルの課題を引き起こす。
ツール拡張型自律メモリ検索フレームワーク(TA-Mem)を導入する。
TA-MemはLoCoMoデータセットで評価され、既存のベースラインアプローチよりも大幅にパフォーマンスが向上した。
論文 参考訳(メタデータ) (2026-03-10T07:27:01Z) - Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation [22.803751188961865]
検索は類似性マッチングを超えて移動し、代わりに潜在コンポーネントを操作するべきだと我々は主張する。
我々は、無傷ユニットの階層を構築し、検索可能な高レベルノード組織を維持するxMemoryを提案する。
論文 参考訳(メタデータ) (2026-02-02T12:04:58Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents [76.76004970226485]
長期記憶はマルチモーダル大言語モデル(MLLM)エージェントにとって重要な機能である。
Mem-GalleryはMLLMエージェントのマルチモーダル長期会話メモリ評価のための新しいベンチマークである。
論文 参考訳(メタデータ) (2026-01-07T02:03:13Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents [79.87304940020256]
大言語モデル(LLM)は会話エージェントで広く採用されている。
MemGASは、多粒度アソシエーション、適応選択、検索を構築することにより、メモリ統合を強化するフレームワークである。
4つの長期メモリベンチマークの実験により、MemGASは質問応答と検索タスクの両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-05-26T06:13:07Z) - Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions [55.19217798774033]
メモリは、大規模言語モデル(LLM)ベースのエージェントを支える、AIシステムの基本コンポーネントである。
本稿ではまず,メモリ表現をパラメトリックおよびコンテキスト形式に分類する。
次に、コンソリデーション、更新、インデックス付け、フォッティング、検索、圧縮の6つの基本的なメモリ操作を紹介します。
論文 参考訳(メタデータ) (2025-05-01T17:31:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。