論文の概要: Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.13591v1
- Date: Wed, 15 Jul 2026 08:32:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.709683
- Title: Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Title(参考訳): 制御プロセスとしてのメモリ:LLMエージェントの適応メモリ管理を学習する
- Authors: Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu,
- Abstract要約: 大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
- 参考スコア(独自算出の注目度): 72.3752981234916
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents increasingly rely on external memory systems to accumulate experience across tasks. Yet nearly all existing approaches, from graph-structured memories to reflective insight stores, access memory through fixed, hand-designed heuristics. We argue that this static view of memory is a core bottleneck for agentic learning because optimal memory behavior is fundamentally context-dependent. The early stages of the tasks, benefit from minimal retrieval because memory is sparse; recurring goal types benefit from plan reuse rather than generic nearest-neighbor lookup; stuck agents benefit from re-retrieval with alternative queries; and across long task streams, the memory store itself must be consolidated and pruned to remain useful. We present Memory as a Controlled Process (MemCon), a framework that models memory operations as a Markov Decision Process and learns an online policy that adaptively decides when, what, and how much to retrieve, when to inject a distilled plan, and when to consolidate or forget. MemCon is backend-agnostic: it wraps any existing memory implementation, learns from task-by-task binary feedback with no pretraining and no additional LLM calls, and uses a lightweight tabular contextual bandit with UCB exploration that converges within tens of tasks. Across 6 benchmarks, 3 agent frameworks, and 3 LLM backbones, MemCon consistently outperforms multiple memory baselines by up to 15.2 points in task success while reducing token consumption by 5--20%.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
しかし、グラフ構造化メモリからリフレクティブインサイトストアまで、ほとんどすべての既存のアプローチは、固定された手設計のヒューリスティックを通してメモリにアクセスする。
メモリの最適動作は基本的にコンテキスト依存であるため,この静的なメモリビューはエージェント学習のボトルネックとなる。
タスクの初期段階では、メモリが不足しているため、最小限の検索の恩恵を受ける; 繰り返し発生するゴールタイプは、一般的な隣り合うルックアップではなく、計画再利用の恩恵を受ける; スタントエージェントは、代替クエリで再検索の恩恵を受ける; そして、長いタスクストリームを通して、メモリストア自体を統合し、実行し、有用に保たなければならない。
メモリ・アズ・ア・コントロールド・プロセス(MemCon)は,メモリ操作をマルコフ決定プロセスとしてモデル化し,いつ,何,どのくらいの量を取得するか,蒸留したプランをいつ注入するか,いつ統合するか,忘れるかを適応的に決定するオンラインポリシーを学習するフレームワークである。
MemConはバックエンドに依存しない。既存のメモリ実装をラップし、事前トレーニングなしでタスク・バイ・タスクのバイナリフィードバックから学び、数十タスク以内に収束するUPB探索を備えた軽量のタブ形式のコンテキスト帯域を使用する。
6つのベンチマーク、3つのエージェントフレームワーク、3つのLLMバックボーンで、MemConは複数のメモリベースラインを最大15.2ポイント上回り、トークン消費を5-20%削減している。
関連論文リスト
- AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective [21.66000179149483]
EvoMemBenchは、メモリスコープとメモリ内容の2つの軸に沿って編成された統一ベンチマークである。
本稿では,15個の代表記憶法と強い長文ベースラインを標準プロトコルで比較する。
結果は、現在のメモリシステムは、まだ一般的な解決策には程遠いことを示している。
論文 参考訳(メタデータ) (2026-05-18T13:54:38Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z) - Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning [89.55738101744657]
大規模言語モデル(LLM)は、幅広いNLPタスクで印象的な機能を示しているが、基本的にはステートレスである。
本稿では,LLMに外部メモリを積極的に管理・活用する機能を備えた強化学習フレームワークであるMemory-R1を提案する。
論文 参考訳(メタデータ) (2025-08-27T12:26:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。