論文の概要: MemCalib: Benchmarking and Optimizing Memory Use in LLM Agents
- arxiv url: http://arxiv.org/abs/2609.24259v2
- Date: Tue, 22 Sep 2026 10:14:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.974724
- Title: MemCalib: Benchmarking and Optimizing Memory Use in LLM Agents
- Title(参考訳): MemCalib: LLMエージェントのベンチマークとメモリ使用の最適化
- Abstract要約: MemCalibは,現実的なメモリシステムシナリオをベースとしたベンチマークだ。
私たちは、フロンティアのオープンソースモデルとクローズドソースモデルがメモリを適切に使用するのに苦労していることを示します。
本稿では,順序付き双方向対物クレジットアサインメントアルゴリズムであるMemCalib-RLを提案する。
- 参考スコア(独自算出の注目度): 6.461324430516946
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The effectiveness of agent memory ultimately depends on whether the underlying LLM gives each memory in context an appropriate degree of influence over its response. Yet this capability has remained largely overlooked. To assess this capability, we introduce MemCalib, a benchmark grounded in realistic memory-system scenarios for evaluating memory use and advancing optimization algorithms. Results on the MemCalib test set reveal that frontier open- and closed-source models struggle to use memory appropriately. They frequently over-use or under-use memory rather than matching each proposition's actual use to its target level, leading to biased, low-quality responses. Experiments with common post-training algorithms, including group relative policy optimization and on-policy self-distillation, further reveal a clear directional skew: trained models improve in one direction while deteriorating in the other. We therefore propose MemCalib-RL, an ordered bidirectional counterfactual credit-assignment algorithm that separates over- and under-use signals and localizes their credit to response tokens through exact atom ablation. Results across model families and scales (Qwen3-8B, Ministral-3-8B-Instruct, and Qwen3.5-35B-A3B) show that MemCalib-RL achieves the best overall performance while better balancing over-use and under-use, with gains generalizing beyond MemCalib in external benchmark evaluation. Further experiments support its design choices and robustness and provide insight into its training dynamics.
- Abstract(参考訳): エージェントメモリの有効性は、究極的には、基礎となるLCMがそれぞれのメモリにその応答に対する適切な影響を与えるかどうかに依存する。
しかし、この能力はほとんど見過ごされている。
この能力を評価するために,メモリ使用量の評価と最適化アルゴリズムの高速化を目的とした,現実的なメモリシステムシナリオに基づくベンチマークであるMemCalibを紹介した。
MemCalibテストセットの結果、フロンティアのオープンソースモデルとクローズドソースモデルは、メモリを適切に使用するのに苦労していることが明らかになった。
それぞれの命題の実際の使用を目標レベルに適合させるのではなく、頻繁に過剰使用または低使用メモリを使用し、バイアスがあり、低品質な応答をもたらす。
グループ相対的政策最適化やオンライン自己蒸留を含む一般的なポストトレーニングアルゴリズムを用いた実験は、さらに明確な方向性の歪を明らかにしている:訓練されたモデルは一方の方向で改善され、他方の方向は劣化する。
そこで我々は,Over-およびUnder-use信号の分離と,正確な原子アブレーションによる応答トークンへのクレジットのローカライズを行う,順序付き双方向対向クレジットアサインメントアルゴリズムであるMemCalib-RLを提案する。
モデルファミリとスケール(Qwen3-8B、Ministral-3-8B-Instruct、Qwen3.5-35B-A3B)にわたる結果から、MemCalib-RLはオーバーユースとアンダーユースとのバランスを良くし、MemCalib以外のベンチマーク評価を一般化した。
さらなる実験は、設計の選択と堅牢性をサポートし、トレーニングのダイナミクスに関する洞察を提供する。
関連論文リスト
- MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use [30.64715962774191]
既存のメモリベンチマークは、情報が正しく抽出され、保存され、検索されるかどうかを主に評価する。
記憶によって引き起こされる認知的トラップは、忠実に記録され、意味的に関連する記憶でさえ、モデル推論を歪ませることができる。
本稿では,LLMにメモリトラップを回避するためのシンプルな推論時間手法であるAdaptiveMemを提案する。
論文 参考訳(メタデータ) (2026-08-20T16:00:17Z) - Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents [12.763061404384601]
大規模言語モデル(LLM)エージェントは、再利用可能な情報を保持し、有界な活動コンテキストを制御し、長い水平相互作用の間、以前の証拠を回復しなければならない。
本稿では,LTM,アクティブコンテキスト,エピソード履歴を異なる状態として表現し,一つのメモリ操作ポリシで制御するフレームワークであるVerMemを提案する。
論文 参考訳(メタデータ) (2026-08-04T05:06:24Z) - AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning [13.898789808338634]
RLを用いてメモリ構築ポリシーを学習するための帰属誘導プロセスフィードバックフレームワークを提案する。
AttriMemは、最終回答に対するトークンレベルのコントリビューションから得られる局所的な報酬で、グローバルな成果報酬を強化する。
論文 参考訳(メタデータ) (2026-07-23T09:35:34Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning [17.668597279485407]
MILESは、ステップワイズメモリを動的に拡張し、現実的なテスト時間制約の下で正確性に最適化されたメモリ構成を適用するフレームワークである。
MILESは、優れた精度と効率のトレードオフを達成しつつ、従来手法と一貫して一致または性能を向上する。
論文 参考訳(メタデータ) (2026-07-08T03:51:37Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - MemRec: Collaborative Memory-Augmented Agentic Recommender System [57.548438733740504]
我々はメモリ管理から推論をアーキテクチャ的に分離するフレームワークであるMemRecを提案する。
MemRecは動的コラボレーティブメモリグラフを管理する専用のLM_Memを導入した。
4つのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-13T18:51:16Z) - A Model or 603 Exemplars: Towards Memory-Efficient Class-Incremental
Learning [56.450090618578]
CIL(Class-Incremental Learning)は、この要件を満たすために、限られたメモリサイズでモデルをトレーニングすることを目的としている。
モデルサイズを総予算にカウントし,メモリサイズに整合する手法を比較すると,保存モデルは常に機能しないことを示す。
本稿では,メモリ効率のよい拡張可能なMOdelのための MEMO という,シンプルで効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2022-05-26T08:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。