論文の概要: MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs
- arxiv url: http://arxiv.org/abs/2605.08374v1
- Date: Fri, 08 May 2026 18:30:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.593286
- Title: MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs
- Title(参考訳): MemQ: Q-Learningを自己進化型メモリエージェントに統合する
- Abstract要約: 本稿では,メモリQ値にTD($$)の可視性トレースを適用したMemQを紹介する。
クレジットウェイトは、DAG深さ$d$で$()d$として崩壊し、時間的距離を構造的近接に置き換える。
6つのベンチマークで、MemQは、一般化評価とランタイム学習の6つすべてで最高成功率を達成した。
- 参考スコア(独自算出の注目度): 47.66730296440261
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Episodic memory allows LLM agents to accumulate and retrieve experience, but current methods treat each memory independently, i.e., evaluating retrieval quality in isolation without accounting for the dependency chains through which memories enable the creation of future memories. We introduce MemQ, which applies TD($λ$) eligibility traces to memory Q-values, propagating credit backward through a provenance DAG that records which memories were retrieved when each new memory was created. Credit weight decays as $(γλ)^d$ with DAG depth $d$, replacing temporal distance with structural proximity. We formalize the setting as an Exogenous-Context MDP, whose factored transition decouples the exogenous task stream from the endogenous memory store. Across six benchmarks, spanning OS interaction, function calling, code generation, multimodal reasoning, embodied reasoning, and expert-level QA, MemQ achieves the highest success rate on all six in generalization evaluation and runtime learning, with gains largest on multi-step tasks that produce deep and relevant provenance chains (up to +5.7~pp) and smallest on single-step classification (+0.77~pp) where single-step updates already suffice. We further study how $γ$ and $λ$ interact with the EC-MDP structure, providing principled guidance for parameter selection and future research. Code will be available soon.
- Abstract(参考訳): エピソードメモリは、LCMエージェントが経験を蓄積して取得することを可能にするが、現在のメソッドは個々のメモリを独立して扱う。
本稿では,メモリQ値にTD($λ$)の可視性トレースを適用したMemQを紹介する。
クレジットウェイトは、DAG深さ$d$で$(γλ)^d$として崩壊し、時間的距離を構造的近接に置き換える。
本研究では,外因性タスクストリームを内因性メモリストアから切り離した外部因性コンテキスト MDP として設定する。
OSのインタラクション、関数呼び出し、コード生成、マルチモーダル推論、エンボディド推論、エキスパートレベルのQAにまたがる6つのベンチマークで、MemQは、一般化評価と実行時学習の6つすべてで最高成功率を達成している。
さらに、$γ$と$λ$がEC-MDP構造とどのように相互作用し、パラメータ選択と将来の研究の原則的なガイダンスを提供するかを研究する。
コードはまもなく利用可能になる。
関連論文リスト
- EdgeMem: LLM-Free Agent Memory Construction and Retrieval via Evidence-Preserving Multi-Anchor Hypergraph [37.27140929522461]
既存の方法は相互作用履歴を要約やその他のLCM生成表現に圧縮する。
We propose EdgeMem, a agent-Memory method built on a simple principle: maintain original interaction turn and organize them through complementary content。
論文 参考訳(メタデータ) (2026-09-03T11:17:03Z) - Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems [5.321970297768025]
既存の記憶アーキテクチャは、全ての記憶を、時代遅れの事実と共に、保存されたコンテキストを均等に永続的で体系的に汚染したものとして扱う。
メモリ当たりの時間減衰は,外部LLMエージェントメモリストアにおいて,自動分類係数$_i$として操作可能であることを示す。
本稿では,時間的一般化テスト(TGT)と,保持間隔を保ったベンチマーク,一般化ギャップ(GenGap)メトリクスを紹介する。
論文 参考訳(メタデータ) (2026-08-05T12:12:44Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - DMF: A Deterministic Memory Framework for Conversational AI Agents [0.0]
我々は、生成メモリ圧縮を完全な決定論的パイプラインに置き換えるCPUファーストアプローチである決定論的メモリフレームワーク(DMF)を提案する。
DMFは、決定論的コンテンツ信号、会話の手がかり、構造化された前兆から計算されたSurvival Scoreを、ロジスティック・プロジェクションで組み合わせて割り当てる。
LoCoMoとLongMemEvalのデータセットを使用して、目的を組み込んだベンチマークで実験を行う。
論文 参考訳(メタデータ) (2026-06-02T10:41:28Z) - Mem-$π$: Adaptive Memory through Learning When and What to Generate [65.31077328444077]
本稿では,大規模言語モデル(LLM)エージェントにおける適応メモリのためのフレームワークを提案する。
Mem-$は検索ベースとRL最適化メモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-20T17:51:05Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data [52.80567461420316]
メモリ拡張LPMに基づくマルチエージェントシステム(textbfMALMAS)を提案する。
MALMASは生成プロセスを独立した責任を持つエージェントに分解し、ルータエージェントはイテレーション毎にエージェントの適切なサブセットを起動する。
さらに、手続きメモリ、フィードバックメモリ、概念記憶を含むメモリモジュールを統合し、その後の特徴生成を適応的に導く反復的改善を可能にする。
論文 参考訳(メタデータ) (2026-04-22T07:09:30Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z) - SEDM: Scalable Self-Evolving Distributed Memory for Agents [23.182291416527764]
SEDMは、メモリをパッシブリポジトリからアクティブな自己最適化コンポーネントに変換する検証可能で適応的なフレームワークである。
また,SEDMは,強いメモリベースラインに比べてトークンオーバーヘッドを低減しつつ,推論精度を向上することを示した。
結果は、SEDMをオープンエンドのマルチエージェントコラボレーションのためのスケーラブルで持続可能なメモリメカニズムとして強調する。
論文 参考訳(メタデータ) (2025-09-11T14:37:37Z) - Memento: Fine-tuning LLM Agents without Fine-tuning LLMs [36.3424780932712]
本稿では,適応型大言語モデル(LLM)エージェントのための新しい学習パラダイムを提案する。
本手法は,メモリベースのオンライン強化学習により,低コストで連続的な適応を可能にする。
我々はエージェントモデルを,GAIA検証でトップ1に達するemphMementoというディープリサーチ環境でインスタンス化する。
論文 参考訳(メタデータ) (2025-08-22T07:25:30Z) - From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents [79.87304940020256]
大言語モデル(LLM)は会話エージェントで広く採用されている。
MemGASは、多粒度アソシエーション、適応選択、検索を構築することにより、メモリ統合を強化するフレームワークである。
4つの長期メモリベンチマークの実験により、MemGASは質問応答と検索タスクの両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-05-26T06:13:07Z) - Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions [55.19217798774033]
メモリは、大規模言語モデル(LLM)ベースのエージェントを支える、AIシステムの基本コンポーネントである。
本稿ではまず,メモリ表現をパラメトリックおよびコンテキスト形式に分類する。
次に、コンソリデーション、更新、インデックス付け、フォッティング、検索、圧縮の6つの基本的なメモリ操作を紹介します。
論文 参考訳(メタデータ) (2025-05-01T17:31:33Z) - Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory [0.5584627289325719]
大規模言語モデル(LLM)は、文脈的に一貫性のある応答を生成する際、顕著な進歩を示した。
しかし、それらの固定されたコンテキストウィンドウは、長時間のマルチセッション対話に対する一貫性を維持するための根本的な課題を生じさせる。
私たちはMem0というスケーラブルなメモリ中心アーキテクチャを導入し、進行中の会話から健全な情報を動的に抽出し、統合し、取得することでこの問題に対処します。
論文 参考訳(メタデータ) (2025-04-28T01:46:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。