論文の概要: Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
- arxiv url: http://arxiv.org/abs/2601.08435v1
- Date: Tue, 13 Jan 2026 11:06:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-14 18:27:19.162792
- Title: Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
- Title(参考訳): 長期記憶管理のためのファインメム/ファイングラインドフィードバックアライメント
- Abstract要約: Fine-Memは、きめ細かいフィードバックアライメントのために設計された統一されたフレームワークである。
MemalphaとMemoryAgentBenchの実験は、Fin-Memが強いベースラインを一貫して上回ることを示した。
- 参考スコア(独自算出の注目度): 63.48041801851891
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Effective memory management is essential for large language model agents to navigate long-horizon tasks. Recent research has explored using Reinforcement Learning to develop specialized memory manager agents. However, existing approaches rely on final task performance as the primary reward, which results in severe reward sparsity and ineffective credit assignment, providing insufficient guidance for individual memory operations. To this end, we propose Fine-Mem, a unified framework designed for fine-grained feedback alignment. First, we introduce a Chunk-level Step Reward to provide immediate step-level supervision via auxiliary chunk-specific question answering tasks. Second, we devise Evidence-Anchored Reward Attribution to redistribute global rewards by anchoring credit to key memory operations, based on the specific memory items utilized as evidence in reasoning. Together, these components enable stable policy optimization and align local memory operations with the long-term utility of memory. Experiments on Memalpha and MemoryAgentBench demonstrate that Fine-Mem consistently outperforms strong baselines, achieving superior success rates across various sub-tasks. Further analysis reveals its adaptability and strong generalization capabilities across diverse model configurations and backbones.
- Abstract(参考訳): 大規模な言語モデルエージェントが長い水平タスクをナビゲートするためには、効果的なメモリ管理が不可欠である。
近年,Reinforcement Learning を用いた特殊記憶管理エージェントの開発が研究されている。
しかし、既存の手法では、主要な報酬として最終タスクのパフォーマンスに依存しており、それによって深刻な報酬の分散と不効率なクレジット割り当てが発生し、個々のメモリ操作のガイダンスが不十分である。
この目的のために我々は、きめ細かいフィードバックアライメントのために設計された統合フレームワークであるFine-Memを提案する。
まず、チャンクレベルのステップリワードを導入し、補助的なチャンク固有の質問応答タスクを通じて、即座にステップレベルの監視を行う。
第2に,クレジットカードを鍵記憶操作に固定することでグローバルな報酬を再分配するエビデンス・アンコール・リワード・アトリビューション(Evidence-Anchored Reward Attribution)を考案した。
これらのコンポーネントは、安定したポリシ最適化を可能にし、ローカルメモリ操作をメモリの長期的なユーティリティと整合させる。
MemalphaとMemoryAgentBenchの実験では、Fin-Memは強いベースラインを一貫して上回り、様々なサブタスクで優れた成功率を達成している。
さらなる分析により、様々なモデル構成とバックボーンにまたがる適応性と強力な一般化能力が明らかになる。
関連論文リスト
- Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents [97.19033877543522]
本稿では,メモリ拡張剤のメモリ基板の制御ハーネス評価について述べる。
統一されたハーネスの下で26のパフォーマンスと効率のメトリクスを計測する。
これらの知見は、アダプティブエージェントメモリシステムに必要なコンポーネントとして、基質ルーティングを動機付けている。
論文 参考訳(メタデータ) (2026-08-15T03:29:48Z) - AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning [13.898789808338634]
RLを用いてメモリ構築ポリシーを学習するための帰属誘導プロセスフィードバックフレームワークを提案する。
AttriMemは、最終回答に対するトークンレベルのコントリビューションから得られる局所的な報酬で、グローバルな成果報酬を強化する。
論文 参考訳(メタデータ) (2026-07-23T09:35:34Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - MemTrain: Self-Supervised Context Memory Training [40.64801276577851]
既存のメモリエージェントアプローチは通常、下流タスクで強化学習を施したエンドツーエンドで訓練される。
MemTrainは、LLMエージェントのコンテキストメモリ能力を高めるための自己教師型トレーニングフレームワークである。
MemTrainは、異なるモデル間のダウンストリームメモリ集約推論性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-02T05:56:24Z) - Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory [53.8372503928207]
大規模言語モデル(LLM)エージェントは、一貫したパーソナライゼーションのために長期のユーザメモリを必要とする。
既存のメモリシステムは、主に静的で手作りの更新ルールに依存している。
MemCoEは認知にインスパイアされた2段階最適化フレームワークで、どのようにメモリを整理し、どの情報を更新すべきかを学ぶ。
論文 参考訳(メタデータ) (2026-05-01T14:45:20Z) - Mem-T: Densifying Rewards for Long-Horizon Memory Agents [23.19373149519922]
我々は,動的更新やストリーミング入力によるマルチターン検索を行うために,軽量な階層型メモリデータベースと対話する自律メモリエージェントMem-Tを紹介する。
また,木誘導型強化学習フレームワークであるMoT-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-30T14:23:33Z) - Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration [52.35887679314727]
長期記憶身体探索は、エージェントの探索的認知と意思決定行動を統合することを目的としている。
エージェントのメモリリコールとプロアクティブな探索能力を高めるため,我々はMemoryExplorerを提案する。
論文 参考訳(メタデータ) (2026-01-11T16:23:22Z) - HiMem: Hierarchical Long-Term Memory for LLM Long-Horizon Agents [3.9396865837159822]
HiMemは、長距離対話のための階層的長期記憶フレームワークである。
メモリ構築、検索、持続的なインタラクション中の動的更新をサポートする。
その結果、HiMemは、精度、一貫性、長期的な推論において、代表的ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-10T01:26:01Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z) - Memory in the Age of AI Agents [217.9368190980982]
この研究は、現在のエージェントメモリ研究の最新の展望を提供することを目的としている。
我々は,エージェントメモリ,すなわちトークンレベル,パラメトリック,潜時メモリの3つの支配的実現を同定する。
実用的な開発を支援するため、メモリベンチマークとオープンソースフレームワークの包括的な概要をコンパイルする。
論文 参考訳(メタデータ) (2025-12-15T17:22:34Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z) - SEDM: Scalable Self-Evolving Distributed Memory for Agents [23.182291416527764]
SEDMは、メモリをパッシブリポジトリからアクティブな自己最適化コンポーネントに変換する検証可能で適応的なフレームワークである。
また,SEDMは,強いメモリベースラインに比べてトークンオーバーヘッドを低減しつつ,推論精度を向上することを示した。
結果は、SEDMをオープンエンドのマルチエージェントコラボレーションのためのスケーラブルで持続可能なメモリメカニズムとして強調する。
論文 参考訳(メタデータ) (2025-09-11T14:37:37Z) - Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning [89.55738101744657]
大規模言語モデル(LLM)は、幅広いNLPタスクで印象的な機能を示しているが、基本的にはステートレスである。
本稿では,LLMに外部メモリを積極的に管理・活用する機能を備えた強化学習フレームワークであるMemory-R1を提案する。
論文 参考訳(メタデータ) (2025-08-27T12:26:55Z) - Stable Hadamard Memory: Revitalizing Memory-Augmented Agents for Reinforcement Learning [64.93848182403116]
現在のディープラーニングメモリモデルは、部分的に観察可能で長期にわたる強化学習環境で苦労している。
本稿では,強化学習エージェントのための新しい記憶モデルであるStable Hadamard Memoryを紹介する。
我々の手法は、部分的に観測可能なベンチマークに挑戦する上で、最先端のメモリベースの手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2024-10-14T03:50:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。