論文の概要: MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents
- arxiv url: http://arxiv.org/abs/2607.24097v1
- Date: Mon, 27 Jul 2026 07:37:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.346849
- Title: MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents
- Title(参考訳): MemChain: メモリ拡張LDMエージェントのための解釈可能なメモリトレースの学習
- Authors: Yiwen Ma, Songjun Tu, Qichao Zhang, Dong Li, Linjing Li, Dongbin Zhao,
- Abstract要約: メモリ拡張LDMエージェントは通常、関連するメモリを検索し、直接回答モデルに入力することでクエリに応答する。
提案するMemChainは、検索した候補を応答対応アクティブメモリに変換する訓練後のメモリポリシーである。
MemChainは、クローズドソースとオープンウェイトフリートの両方の解答モデルにおいて、最先端のパフォーマンスを一貫して達成していることを示す。
- 参考スコア(独自算出の注目度): 26.87993979719045
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Memory-augmented LLM agents typically answer queries by retrieving relevant memories and feeding them directly to an answer model. This retrieval-as-evidence paradigm assumes retrieved memories are already suitable for reasoning, leaving the answer model to resolve redundancy, conflicts, and weak relevance while incurring substantial context overhead in long-term memory tasks. We propose MemChain, a trainable post-retrieval memory policy that transforms retrieved candidates into answer-facing active memory, represented as a compact and grounded evidence context. Given a user query and retrieved candidates, MemChain first generates a question-conditioned evidence plan, then constructs an ordered grounded evidence trace that organizes retrieved memories according to their semantic roles and dependencies, and finally executes explicit memory actions to produce a concise evidence context for answer generation. To train the mediator, we introduce a two-stage learning framework. Supervised trace learning first teaches the policy to generate structurally valid plans, traces, actions, and evidence contexts. We then propose Trace-Guided Memory Policy Optimization (TMPO), a reinforcement learning objective that optimizes the memory policy using downstream answer quality while jointly encouraging trace grounding, evidence support, structural validity, and answer stability across multiple rollouts. Experiments on LoCoMo and LongMemEval-S demonstrate that MemChain consistently achieves state-of-the-art performance across both closed-source and open-weight frozen answer models while substantially reducing the memory context passed to the answer model.
- Abstract(参考訳): メモリ拡張LDMエージェントは通常、関連するメモリを検索し、直接回答モデルに入力することでクエリに応答する。
この検索・アズ・エビデンス・パラダイムは、検索した記憶は推論にすでに適していると仮定し、長期的なメモリタスクにおいてかなりのコンテキストオーバーヘッドを発生させながら、冗長性、矛盾、および弱関連性を解決するための回答モデルを残している。
本稿では,検索した候補を対話型アクティブメモリに変換する学習後記憶ポリシーであるMemChainを提案する。
ユーザクエリと検索候補が与えられた後、MemChainはまず質問条件付きエビデンスプランを生成し、次に、そのセマンティックな役割と依存関係に従って検索されたメモリを整理する順序付きエビデンストレースを構築し、最後に明示的なメモリアクションを実行して、回答生成のための簡潔なエビデンスコンテキストを生成する。
メディエータのトレーニングには,2段階の学習フレームワークを導入する。
教師付きトレース学習はまず、構造的に有効なプラン、トレース、アクション、エビデンスコンテキストを生成するためのポリシーを教える。
そこで我々は,複数ロールアウトにおけるトレーサグラウンド,エビデンスサポート,構造的妥当性,解答安定性を共同で促進しながら,下流の応答品質を用いてメモリポリシーを最適化する強化学習目標であるトレースガイドメモリポリシー最適化(TMPO)を提案する。
LoCoMoとLongMemEval-Sの実験により、MemChainは、クローズドソースとオープンウェイトフリートの両方の解答モデルにおける最先端のパフォーマンスを一貫して達成し、解答モデルに渡されるメモリコンテキストを大幅に削減することを示した。
関連論文リスト
- Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents [51.30250860677378]
本稿では,連想記憶グラフとアクティブな再構成機構を組み合わせたフレームワークであるMRAgentを提案する。
Cue-Tag-Contentグラフ上で実行することで,メモリアクセスに直接推論を統合する。
LoCoMoベンチマークとLongMemEvalベンチマークの実験は、強いベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-04T11:29:46Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management [63.48041801851891]
Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-01-13T11:06:17Z) - Evaluating Long-Term Memory for Long-Context Question Answering [100.1267054069757]
質問応答タスクにアノテートした合成長文対話のベンチマークであるLoCoMoを用いて,メモリ拡張手法の体系的評価を行う。
以上の結果から,メモリ拡張アプローチによりトークン使用率が90%以上削減され,競争精度が向上した。
論文 参考訳(メタデータ) (2025-10-27T18:03:50Z) - Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents [33.617262543252494]
本稿では、メモリ履歴全体からの選択的検索を可能にするコールバック強化メモリを備えたメモリ拡張エージェントReMemR1を提案する。
また,RLMLR(Reinforcement Learning with Multi-Level Rewards)を提案する。
論文 参考訳(メタデータ) (2025-09-27T01:36:46Z) - ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory [21.4675019810992]
概念レベルのメモリは再利用され、ソリューショントレースから抽出されたモジュラー抽象化が自然言語に格納される。
我々は、合成一般化と抽象的推論を強調するベンチマークARC-AGIを評価する。
抽象概念は最も一貫したメモリ設計であり、全てのテストされた推論計算スケールでベースラインを上回ります。
論文 参考訳(メタデータ) (2025-09-04T17:54:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。