論文の概要: Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrieval
- arxiv url: http://arxiv.org/abs/2610.02070v2
- Date: Fri, 02 Oct 2026 15:55:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.005323
- Title: Causal Memory Policy: Making Memory Utility Identifiable by Intervening on Retrieval
- Title(参考訳): 因果記憶ポリシー:検索に介入することで記憶の有用性を識別する
- Abstract要約: メモリが取得されない場合、ストアレベルの介入は同じ結果をもたらし、そのユーティリティは未確認のままである。
本稿では,検索自体に介入することで識別を復元する因果的枠組みである因果記憶ポリシー(CMP)を紹介する。
CMPは、バランスの取れた割り当て設計の下で、自己正規化逆確率重み付けによりメモリユーティリティを推定する。
- 参考スコア(独自算出の注目度): 29.12751904333385
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory-augmented large language models must decide which memories to retain, and recent systems do so by estimating each memory's effect on task performance. However, these estimates rely entirely on retrieved memories. When a memory is never retrieved, store-level interventions produce identical outcomes, leaving its utility unidentified. This is a retrieval-level positivity violation, invisible to diagnostics that examine only memory operations. We introduce Causal Memory Policy (CMP), a causal framework that restores identification by intervening on retrieval itself, reserving a fixed number of context slots for memories sampled with known propensities. CMP estimates memory utility by self-normalized inverse propensity weighting under a balanced assignment design. We prove the causal factorization of memory utility through retrieval, the unbiasedness and exact variance of the estimator, and the optimal decision rule under irreversible operations. Empirically, identification fails for 54% of required memories on LongMemEval and 67% on LoCoMo, and the failure persists in a deployed memory system. CMP improves discrimination between required and non-required memories from 0.54 to 0.66 AUC. Finally, we show that identified memory utility alone is insufficient for retention decisions: per-query utility reaches 0.78 AUC on the query for which it is estimated, yet no aggregation available to a retention policy predicts a memory's value on unseen queries. Code is available at: https://anonymous.4open.science/r/cmp-release-D0C3/.
- Abstract(参考訳): メモリ拡張された大規模言語モデルは、どのメモリを保持すべきかを判断し、最近のシステムは、各メモリがタスクのパフォーマンスに与える影響を見積もる。
しかし、これらの推定は回収された記憶に完全に依存している。
メモリが取得されない場合、ストアレベルの介入は同じ結果をもたらし、そのユーティリティは未確認のままである。
これは検索レベルの陽性違反であり、メモリ操作のみを調べる診断には見えない。
因果記憶ポリシー(CMP)は、検索自体に介入することで識別を復元し、既知の確率でサンプリングされた記憶のための一定の数のコンテキストスロットを保持する因果記憶ポリシー(CMP)を提案する。
CMPは、バランスの取れた割り当て設計の下で、自己正規化逆確率重み付けによりメモリユーティリティを推定する。
本研究では,検索によるメモリユーティリティの因果分解,推定器の非バイアス性および正確な分散,および不可逆操作による最適決定規則の証明を行う。
実証的には、LongMemEvalで必要なメモリの54%、LoCoMoで67%、障害はデプロイされたメモリシステムで持続する。
CMPは必須メモリと非要求メモリの区別を0.54から0.66AUCに改善する。
最後に,メモリの有効性だけでは保持の判断には不十分であることを示す。クエリごとのユーティリティは推定したクエリで0.78AUCに達するが,保持ポリシーで利用可能なアグリゲーションは,未知のクエリでメモリの価値を予測することはできない。
コードは、https://anonymous.4open.science/r/cmp-release-D0C3/で入手できる。
関連論文リスト
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemSyco-Bench: Benchmarking Sycophancy in Agent Memory [32.49512092540906]
MemSyco-Benchは、エージェントシステムにおけるメモリ誘起性を評価するためのベンチマークである。
MemSyco-Benchは、いつメモリが決定に影響を及ぼすか、どのように有効なメモリを使用するかを測定する。
論文 参考訳(メタデータ) (2026-07-01T15:30:33Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - When Should Memory Stay Silent: Measuring Memory-Use Boundaries in Memory-Augmented Conversational Agents [13.354128891280316]
長期記憶により、言語モデルエージェントはパーソナライズされたインタラクションをサポートすることができる。
利用可能な記憶がいつ応答に統合されるかは、まだ不明である。
検索システムは露光を減らすが、感度の高いメモリがジェネレータに到達すると、統合を排除しない。
論文 参考訳(メタデータ) (2026-06-04T11:54:51Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents [0.33842793760651557]
制御された介入の下で,候補記憶がモデル応答に与える影響を推定する因果記憶選択手法を提案する。
以上の結果から,CMIは,信頼性の高い長期記憶には関連性のみではなく,因果的有用性に基づくコンテキスト選択が必要であることが示唆された。
論文 参考訳(メタデータ) (2026-05-17T20:21:55Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents [0.0]
コーディングエージェントは、以前の経験、トレースの修復、リポジトリローカルな運用知識を再利用するために、ますます外部メモリに依存している。
本稿では、純トップk検索問題ではなく、選択的かつリスクに敏感な制御問題として、イシューメモリの使用を再検討する。
リスクに敏感なコンテキスト帯域メモリコントローラであるRSCB-MCを導入し,メモリ使用の有無を判断し,トップレゾリューションを注入し,複数の候補を要約し,高精度または高速リコール検索,停止,あるいはフィードバックを求める。
論文 参考訳(メタデータ) (2026-04-30T00:32:53Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Beyond Heuristics: A Decision-Theoretic Framework for Agent Memory Management [49.71055327567513]
メモリ管理は、不確実性の下でのシーケンシャルな意思決定問題と見なされるべきである。
私たちの貢献は、新しいアルゴリズムではなく、アプローチの限界を明確にする原則的なリフレーミングです。
論文 参考訳(メタデータ) (2025-12-25T08:23:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。