論文の概要: RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
- arxiv url: http://arxiv.org/abs/2608.02508v2
- Date: Tue, 04 Aug 2026 03:26:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.438448
- Title: RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States
- Title(参考訳): RoMeRL: 自己進化型エージェントメモリにおけるフィードバックカバレッジのバランスとメモリリワードトラップ
- Authors: Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai,
- Abstract要約: 本稿では,学習型メモリシステムのための低次メモリ強化学習(RoMeRL)を提案する。
RoMeRLは、結果の極性とメモリのダイナミクスによって決定される固定次元のタスクごとのメモリ状態を用いて、成長するトラジェクトリインデックス付きユーティリティ空間を表す。
我々は,RoMeRLがタスク性能を改善し,コールドQ比を80.0%削減し,フィードバック密度を約6.0倍に向上し,保持メモリサイズを84.4%削減し,LLM呼び出しを21.1%削減することを示した。
- 参考スコア(独自算出の注目度): 38.07013893809462
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning-based memory systems for self-evolving LLM agents face two tightly coupled challenges. First, trajectory-indexed utilities grow with the interaction history, thereby dispersing limited feedback over an ever-expanding state space. Second, because trajectory-level rewards are jointly assigned to co-retrieved memories, irrelevant experiences may receive misleading utility updates and consequently enter the memory-reward trap. To address these challenges, we introduce Reduced-Order Memory Reinforcement Learning (RoMeRL), which represents the growing trajectory-indexed utility space using a fixed-dimensional per-task memory state factorized by outcome polarity and memory dynamics. RoMeRL incorporates new experiences through a fixed set of semantic coordinates whose contents are updated or replaced over time, thereby concentrating feedback over a bounded utility support. Theoretically, we show that this reduced-order parameterization increases the average feedback received by each utility coordinate and characterize the steady-state occupancy of erroneous coordinates under a generic coordinate-transition model. Empirically, across ALFWorld and LifelongAgentBench, RoMeRL improves task performance, reduces the Cold-Q ratio by 80.0%, increases feedback density by approximately 6.0 times, reduces the maintained memory size by 84.4%, and cuts LLM calls by 21.1%. These results show that reduced-order utility states support efficient self-evolving agent memory while limiting persistent reward contamination. Code is available at: https://github.com/YOUNG-fnxm/RoMeRL
- Abstract(参考訳): 自己進化型LLMエージェントのための学習ベースのメモリシステムは、2つの密結合した課題に直面している。
第一に、トラジェクトリをインデクシングしたユーティリティは、相互作用履歴とともに成長し、拡張する状態空間上で限られたフィードバックを分散させる。
第2に、トラジェクトリレベルの報酬が共同で取得された記憶に割り当てられるため、無関係な経験は誤ったユーティリティ更新を受け、その結果、メモリリワードトラップに入る可能性がある。
これらの課題に対処するために,各タスクごとの固定次元メモリ状態を用いてトラジェクトリインデックスの増大するユーティリティ空間を表現し,結果の極性とメモリのダイナミクスによって決定されるReduceed-Order Memory Reinforcement Learning (RoMeRL)を導入する。
RoMeRLは、コンテンツが時間とともに更新または置換されたセマンティック座標の固定セットを通じて、新しいエクスペリエンスを取り入れ、バウンドユーティリティサポートに対するフィードバックに集中する。
理論的には、この低次パラメータ化は、各ユーティリティ座標が受ける平均フィードバックを増大させ、一般的な座標遷移モデルの下での誤った座標の定常占有性を特徴付ける。
実証的には、ALFWorldとLifelongAgentBenchで、RoMeRLはタスクパフォーマンスを改善し、コールドQ比を80.0%削減し、フィードバック密度を約6.0倍改善し、保持メモリサイズを84.4%削減し、LLMコールを21.1%削減した。
これらの結果から,低次効用状態は永続的な報酬汚染を抑えつつ,効率的な自己進化型エージェントメモリをサポートできることが示唆された。
コードは、https://github.com/YOUNG-fnxm/RoMeRLで入手できる。
関連論文リスト
- MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents [14.82470944373943]
本稿では,関数対応メモリ調停フレームワークであるMemArbiterを提案する。
MemArbiterは、インタラクション履歴をアトミックアイテムに分解し、5つの機能的メモリバンクに編成する。
MemArbiterは、500と750の予算で82.8%、92.5%の成功率を達成した。
論文 参考訳(メタデータ) (2026-08-03T12:10:52Z) - Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry [14.02751159295063]
本稿では,大規模言語モデル (LLM) エージェントにおける経験的活用のための自己フィードバック再試行フレームワークであるPivoARLを提案する。
PivoARLは、構造的反射によるピボットの誤った回転を識別し、対応するピボット状態からのみ局所的な再試行を行う。
PivoARLはすべてのタスクでPass@2/3の大幅な改善を実現しており、MetaRLよりも平均11.5%向上している。
論文 参考訳(メタデータ) (2026-07-04T04:45:05Z) - Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents [27.2861945963127]
メモリ拡張LDMエージェントは、有限コンテキストウィンドウを超えて拡張されるインタラクションを可能にする。
マルチセッション環境における強化学習によるエージェントの育成は困難である。
メモリ拡張LDMエージェントのトレーニングフレームワークであるMemory-R2を紹介する。
論文 参考訳(メタデータ) (2026-05-20T22:02:00Z) - RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents [16.625864201773343]
RecMemは、受信するインタラクションをサブ意識のメモリ層に格納し、軽量な埋め込みモデルを使用してエンコードする。
実験により、RecMemは3つのSOTAメモリシステムのメモリ構築トークンコストを最大87%削減し、精度を上回ります。
論文 参考訳(メタデータ) (2026-05-15T15:17:36Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - MemRec: Collaborative Memory-Augmented Agentic Recommender System [57.548438733740504]
我々はメモリ管理から推論をアーキテクチャ的に分離するフレームワークであるMemRecを提案する。
MemRecは動的コラボレーティブメモリグラフを管理する専用のLM_Memを導入した。
4つのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-13T18:51:16Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。