論文の概要: Deployment-Time Memorization in Foundation-Model Agents
- arxiv url: http://arxiv.org/abs/2606.10062v1
- Date: Mon, 08 Jun 2026 18:38:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.133433
- Title: Deployment-Time Memorization in Foundation-Model Agents
- Title(参考訳): ファンデーションモデルエージェントの展開時間記憶
- Authors: Lei, Chen, Guilin Zhang, Kai Zhao, Dalmo Cirne, Andy Olsen, Xu Chu, Zeke Miller, Alet Blanken, Amine Anoun, Jerry Ting,
- Abstract要約: 個人化リコール(PR)と適応抽出レート(AER)によるプライバシユーティリティフロンティアとしてのエージェントメモリの検討
キーファクト要約は、ほとんどすべてのパーソナライズリコールを維持しながら、Gemma 3 12Bで76%、GPT-4o-miniで64%のカナリア抽出を減少させる。
LongMemEvalでは、キーファクトの要約はGemma 3 12Bで76%、GPT-4o-miniで64%のカナリア抽出を減らし、ほぼすべてのパーソナライズリコールを保存する。
- 参考スコア(独自算出の注目度): 18.40535884093806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Foundation-model agents are increasingly long-lived systems that remember users across interactions, making memorization an explicit deployment-time function rather than solely a property of model weights. Existing work addresses parametric memorization or audits fixed memory configurations, but does not characterize how memory-design choices jointly shape personalization utility, extraction risk, and deletion fidelity. We study this surface as deployment-time memorization, formulating agent memory as a privacy-utility frontier measured by Personalization Recall (PR) and Adversarial Extraction Rate (AER), and sweeping three memory-design knobs: summarization aggressiveness, retrieval breadth (k), and deletion mode. We further introduce the Forgetting Residue Score (FRS) to quantify whether deleted information remains recoverable from derived memory tiers. On LongMemEval, key-fact summarization reduces canary extraction by 76% on Gemma 3 12B and 64% on GPT-4o-mini while preserving nearly all personalization recall; critically, once content is compressed away, increasing k no longer restores leakage. The same compression, however, induces a deletion-fidelity failure: raw-only deletion leaves derived summary copies recoverable in approximately 20% of instances, and only full-pipeline purge or tombstone redaction drives worst-tier residue to zero. Together, these results establish that persistent agent memory must be evaluated as a first-class memorization mechanism -- assessed by what it helps agents recall, what it makes extractable, and what it can truly erase.
- Abstract(参考訳): ファンデーションモデルエージェントは、ユーザ間のインタラクションを記憶する、ますます長寿命なシステムである。
既存のワークアドレスは、固定メモリ構成のパラメトリック記憶や監査を行うが、メモリ設計の選択がパーソナライズユーティリティ、抽出リスク、削除フィデリティを共同で形成する方法を特徴付けていない。
我々は,この表面を展開時記憶,Personalization Recall(PR)とAdversarial extract Rate(AER)によって測定されたプライバシユーティリティフロンティアとしてのエージェントメモリの定式化,および3つのメモリ設計ノブ(要約攻撃性,検索幅(k)、削除モード)を網羅した。
さらに、削除された情報が導出メモリ層から復元可能であるかどうかを定量化するために、Forgetting Residue Score (FRS)を導入する。
LongMemEvalでは、キーファクトの要約はGemma 3 12Bで76%、GPT-4o-miniで64%のカナリア抽出を減らし、ほとんどすべてのパーソナライズリコールを保存する。
しかし、同じ圧縮は、削除フィデリティの失敗を引き起こす: 生のみの削除が引き起こされた要約コピーは、約20%のインスタンスで復元可能であり、完全なパイプリンパージまたは墓石の再作用のみが、最悪の階層の残基をゼロに駆動する。
これらの結果は、永続的なエージェントメモリが第一級記憶機構として評価されなければならないことを証明している -- エージェントのリコールを助けるもの、抽出可能なもの、真に消去できるものによって評価される。
関連論文リスト
- When Should Memory Stay Silent: Measuring Memory-Use Boundaries in Memory-Augmented Conversational Agents [13.354128891280316]
長期記憶により、言語モデルエージェントはパーソナライズされたインタラクションをサポートすることができる。
利用可能な記憶がいつ応答に統合されるかは、まだ不明である。
検索システムは露光を減らすが、感度の高いメモリがジェネレータに到達すると、統合を排除しない。
論文 参考訳(メタデータ) (2026-06-04T11:54:51Z) - Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents [51.30250860677378]
本稿では,連想記憶グラフとアクティブな再構成機構を組み合わせたフレームワークであるMRAgentを提案する。
Cue-Tag-Contentグラフ上で実行することで,メモリアクセスに直接推論を統合する。
LoCoMoベンチマークとLongMemEvalベンチマークの実験は、強いベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-06-04T11:29:46Z) - Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents [18.83666486835137]
デプロイでは、単一のエージェントが長い水平線上で多くの独立したタスクを処理し、初期のタスクの間に蓄積されたメモリは、後続の無関係なタスクの振る舞いに影響を与える可能性がある。
本稿では,リードオンリーのメモリスナップショットに対して,プレフィックス長の異なる固定プローブセットを評価するトリガプローブプロトコルを提案する。
このプロトコルは、レコード、メモ、フォーム、Eメール対応、および8つのメモリアーキテクチャにまたがる3つのデプロイメントシナリオに適用する。
論文 参考訳(メタデータ) (2026-05-18T04:06:34Z) - RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents [16.625864201773343]
RecMemは、受信するインタラクションをサブ意識のメモリ層に格納し、軽量な埋め込みモデルを使用してエンコードする。
実験により、RecMemは3つのSOTAメモリシステムのメモリ構築トークンコストを最大87%削減し、精度を上回ります。
論文 参考訳(メタデータ) (2026-05-15T15:17:36Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Adversarially Diversified Rehearsal Memory (ADRM): Mitigating Memory Overfitting Challenge in Continual Learning [0.0]
継続的な学習は、それまでの知識を忘れずに、静止しないデータ分布を学習することに焦点を当てる。
リハーサルベースのアプローチは、破滅的な忘れに対処するために一般的に使用される。
本稿では、メモリ過度に適合する課題に対処するために、Adversarially Diversified Rehearsal Memoryを導入する。
論文 参考訳(メタデータ) (2024-05-20T06:56:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。