論文の概要: MemHarness: Memory Is Reconstructed, Not Replayed
- arxiv url: http://arxiv.org/abs/2607.28272v1
- Date: Thu, 30 Jul 2026 14:25:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.606838
- Title: MemHarness: Memory Is Reconstructed, Not Replayed
- Title(参考訳): MemHarness: メモリはリコンストラクションされ、リプレイされない
- Authors: Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai,
- Abstract要約: 本稿では,過去体験を積極的に活用・再構築するためのLLMエージェントを備えたフレームワークであるMemHarnessを提案する。
MemHarnessは純粋なRLと静的メモリ拡張ベースラインを大幅に上回り、アウト・オブ・ディストリビューション(OOD)シナリオで強い堅牢性を示す。
- 参考スコア(独自算出の注目度): 28.869068760142667
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieving past experiences has become a common strategy to enhance large language model agents. However, most existing memory-augmented agents treat retrieved experiences as static records to be replayed verbatim, injecting them into the context regardless of whether they align with the agent's current situation. This ``replay'' paradigm ignores the gap between the abstract, general nature of stored experience and the concrete, ever-changing states encountered at decision time, frequently causing negative transfer. In contrast, humans rarely recall past experiences verbatim; instead, they reorganize and adapt retrieved memories to fit the present context. Inspired by this, we propose MemHarness, a framework that equips LLM agents to actively harness and reconstruct past experiences based on the present context. At each decision step, a unified policy model critiques and reconstructs the retrieved experience conditioned on the current state, producing context-grounded guidance before acting. This reconstructive ability emerges naturally through end-to-end training with GRPO. Experiments on ALFWorld and WebShop show that MemHarness substantially outperforms pure RL and static memory-augmented baselines, demonstrating strong robustness in out-of-distribution (OOD) scenarios. Furthermore, our analyses reveal that this reconstruction objective not only prevents negative transfer but also serves as latent guidance during training, fundamentally improving the agent's intrinsic reasoning capabilities.
- Abstract(参考訳): 過去の経験を取り戻すことは、大きな言語モデルエージェントを強化するための一般的な戦略となっている。
しかし、既存のほとんどのメモリ拡張エージェントは、検索した経験を静的なレコードとして扱い、エージェントの現在の状況に適合するかどうかに関わらず、それらをコンテキストに注入する。
この『リプレイ』のパラダイムは、記憶された経験の抽象的で一般的な性質と決定時に遭遇する具体的で絶え間ない状態とのギャップを無視し、しばしば負の移動を引き起こす。
対照的に、人間は過去の経験を口頭で思い出すことは滅多にない。
そこで本研究では,LLMエージェントを取り入れたMemHarnessを提案する。
各決定ステップにおいて、統一されたポリシーモデルが、現在の状態に条件付けられた検索された経験を批判し、再構築し、行動前にコンテキストグラウンドのガイダンスを生成する。
この再構築能力はGRPOによるエンドツーエンドのトレーニングを通じて自然に現れる。
ALFWorldとWebShopの実験によると、MemHarnessは純粋なRLと静的メモリ拡張ベースラインを大幅に上回っており、アウト・オブ・ディストリビューション(OOD)シナリオで強い堅牢性を示している。
さらに, この再建目的は, 負の伝達を防止するだけでなく, 訓練中に潜伏誘導として機能し, エージェントの本質的推論能力を根本的に改善することを明らかにする。
関連論文リスト
- AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents [30.801952443449633]
継続的な学習は、エージェントが一連のタスクに再利用可能な経験を蓄積し、時間とともに改善し、無関係な経験からの干渉を避けることを期待する。
ほとんどの取り組みは、長いコンテキストの会話やドキュメントに対する検索と推論に重点を置いているが、最近の長命適応ベンチマークは、しばしば単純なタスクストリームに依存している。
本稿では、制御されたタスクストリームと転送利得のメトリクスに着目した連続学習エージェントのための評価フレームワークAgentCLを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:32:59Z) - When Continual Learning Moves to Memory: A Study of Experience Reuse in LLM Agents [25.09835238706609]
メモリ拡張LDMエージェントは、継続的な学習に魅力的なショートカットを提供する。
この課題は消えるのではなく、メモリレベルで再浮上することを示します。
論文 参考訳(メタデータ) (2026-04-29T04:48:02Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - Self-Consolidation for Self-Evolving Agents [51.94826934403236]
大規模言語モデル(LLM)エージェントは静的システムとして機能し、生涯にわたる相互作用を通じて進化する能力に欠ける。
相補的進化機構を導入したLLMエージェントのための新しい自己進化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-02T11:16:07Z) - Large Language Model Agents Are Not Always Faithful Self-Evolvers [84.08646612111092]
自己進化型大規模言語モデル(LLM)エージェントは、過去の経験を蓄積し再利用することによって継続的に改善される。
本稿では,経験の忠実さ,エージェントの判断が与えられた経験に因果的依存を初めて体系的に調査する。
論文 参考訳(メタデータ) (2026-01-30T01:05:15Z) - How Memory Management Impacts LLM Agents: An Empirical Study of Experience-Following Behavior [65.70584076918679]
メモリは、大きな言語モデル(LLM)ベースのエージェントにおいて重要なコンポーネントである。
本稿では,メモリ管理の選択がLLMエージェントの行動,特に長期的パフォーマンスに与える影響について検討する。
論文 参考訳(メタデータ) (2025-05-21T22:35:01Z) - LaMOuR: Leveraging Language Models for Out-of-Distribution Recovery in Reinforcement Learning [16.093659272414527]
本稿では,不確実性推定に頼らずに回復学習を可能にするLaMOuR(Language Models for Out-of-Distriion Recovery)を提案する。
LaMOuRは、エージェントを元のタスクを成功させる状態に誘導する高密度な報酬コードを生成する。
実験の結果,LaMOuRは様々な移動課題における回復効率を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-03-21T13:20:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。