論文の概要: When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary
- arxiv url: http://arxiv.org/abs/2608.01679v2
- Date: Tue, 04 Aug 2026 08:28:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.428181
- Title: When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary
- Title(参考訳): メモリがオーソリティになるとき: メモリ統合境界におけるベンチマークオーソリティの崩壊
- Abstract要約: LLMエージェントは不均一な相互作用履歴を再利用可能な事実、嗜好、観察、規則に集約することでタスクに適応する。
我々は、権限の崩壊を特定し、統合は、その認可された使用を規制するソース制約を消去しながら、クレームを保護します。
メモリ駆動型適応は、学習したものだけでなく、再利用される可能性のある権威も保持しなければならないことを示す。
- 参考スコア(独自算出の注目度): 12.82709779460352
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Persistent memory allows (self-evolving) LLM agents to adapt across tasks by consolidating heterogeneous interaction histories into reusable facts, preferences, observations, and rules. Yet consolidation also imposes an implicit authorization boundary: it determines whether stored information may later be consumed as a user fact, an attested observation, or a standing instruction. We identify authority collapse, in which consolidation preserves a claim while erasing the source constraints governing its authorized use, causing the stored memory to imply greater authority than its source permits. We introduce AuthMem-Bench, a controlled paired benchmark that holds the focal claim and downstream task fixed while varying only source authority. It evaluates write-time collapse, downstream authorization errors, and automatic authority preservation. Across seven consolidators based on widely used agent-memory systems and seven LLM backbones, we observe authority collapse in 48 of 49 evaluated configurations. In a controlled action-grounded evaluation, collapsed memories without authority metadata yield a mean unauthorized-action rate of 50.3%. In an end-to-end evaluation, automatically predicted and persisted authority labels reduce the observed unauthorized-action rate from 16.9% to 0.0%, while benign task success remains essentially unchanged. These findings show that memory-driven adaptation must preserve not only what was learned, but also the authority under which it may be reused.
- Abstract(参考訳): 永続記憶は、不均一な相互作用履歴を再利用可能な事実、嗜好、観察、規則に統合することにより、(自己進化的な)LLMエージェントがタスク間で適応することを可能にする。
しかし、統合はまた暗黙の承認境界を課す: 保存された情報が後にユーザ事実、証明されていない観察、あるいは待機命令として消費されるかどうかを判断する。
コンソリデーションがクレームを保護しつつ、その権限使用を規制するソース制約を消去し、記憶されたメモリがそのソースの許可よりも大きな権限を暗示する権限の崩壊を識別する。
制御されたペア化ベンチマークであるAuthMem-Benchを導入し、ソース権限のみを変更しながら、フォーカスクレームとダウンストリームタスクを固定する。
書き込み時間の崩壊、下流の認可エラー、および自動権限保持を評価する。
広く使用されているエージェントメモリシステムと7つのLCMバックボーンに基づく7つのコンソリエータにおいて,49個の評価構成のうち48個の権限の崩壊を観測した。
制御された行動接地評価では、権威メタデータのない崩壊した記憶は、平均的な無許可行動率50.3%となる。
エンド・ツー・エンドの評価では、自動予測および継続された権限ラベルにより、観測された不正行為率が16.9%から0.0%に低下する一方、良質なタスク成功は基本的に変化しない。
これらの結果から,メモリ駆動型適応は学習内容だけでなく,再利用可能な権威も保持しなければならないことが示唆された。
関連論文リスト
- Agent Memory Is a Surface for Endogenous Authorization Laundering [0.764671395172401]
長期にわたるLLMエージェントは、相互作用間の状態を運ぶために永続メモリに依存している。
記憶が進化する認可状態を示すと、エージェント自身の記録は、基礎となる歴史が許されていない権限を与えることができる。
我々は、この障害を内在的な認可洗浄と呼び、急激な許可がメモリに書き込まれ、無許可の行動につながる。
論文 参考訳(メタデータ) (2026-09-01T20:12:08Z) - Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit [48.811961095386]
Hindsight Memory-PRMはこの監査パスを2回利用します。
オフラインで操作条件付きメモリユーティリティの批判をトレーニングする。
オンラインでは、検索、引用、および1つの制御された削除と再回答が、介入校正されたエントリーレベルのプレゼンスクレジットを確定する。
論文 参考訳(メタデータ) (2026-08-30T06:53:13Z) - MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents [14.82470944373943]
本稿では,関数対応メモリ調停フレームワークであるMemArbiterを提案する。
MemArbiterは、インタラクション履歴をアトミックアイテムに分解し、5つの機能的メモリバンクに編成する。
MemArbiterは、500と750の予算で82.8%、92.5%の成功率を達成した。
論文 参考訳(メタデータ) (2026-08-03T12:10:52Z) - Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory [2.98985980237058]
Provenance-Preserving Memory Fire Wall (PPMF) は、プラットフォームの保守された前兆を保存し、アクション関連メモリの権威にアクションリスクを合わせることでツールコールを認可する軽量メモリである。
プラットフォームに保持された証明、確認、リスクラベルはそのままであり、評価されていないハイリスクアクションはPPMFゲートを通過しない。
論文 参考訳(メタデータ) (2026-07-31T08:46:27Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Episodic-to-Semantic Consolidation Without Identity Drift [7.392721604463545]
長期にわたる適応的知的エージェントは、知識の統合と情報の整合性の間に構造的な緊張に直面している。
規制された自律神経デプロイメントでは、エージェントが暗号的に認証されたアイデンティティに結びつくコミットメントと監査契約の下で動作するため、これは責任である。
コンソリデーションはプランナーの突然変異やアイデンティティマニフェストの変異ではなく,決定論的関数 f: Mep -> Msem over episodic memory として扱うことを提案する。
論文 参考訳(メタデータ) (2026-07-02T10:18:45Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents [61.50171793000712]
GateMemはマルチプリンシパル共有メモリエージェントのベンチマークである。
医療、事務、教育、家庭の領域にまたがる。
強力なユーティリティ、堅牢なアクセス制御、信頼性のある忘れを同時に実現する方法は存在しない。
論文 参考訳(メタデータ) (2026-06-17T09:06:15Z) - Belief Memory: Agent Memory Under Partial Observability [56.41506249481312]
本稿では,メモリパラダイムを観測毎に1つの結論にシフトし,その確率で複数の結論を導出するBeliefMemを提案する。
BeliefMemは決定論的パラダイムが破棄されるという不確実性を保ち、エージェントが高い信頼を持って行動することを可能にする。
LoCoMoとALFWorldベンチマークの実証的な評価は、限られたデータであっても、BeliefMemが最高の平均パフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2026-05-07T02:03:13Z) - Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly [0.0]
LLMエージェントは生のインタラクション履歴に作用せず、トランケーション、要約、並べ替え、書き換えによって組み立てられた境界決定状態に作用する。
本研究では, 局所的なLlama 3.1 8B, Qwen 2.5 7B, Mistral 7B上の障害モードについて, 正確な制約の尊重と, 組立状態の可視性の直接監査を用いて検討した。
論文 参考訳(メタデータ) (2026-05-02T18:07:42Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - Governed Memory: A Production Architecture for Multi-Agent Workflows [0.0]
エンタープライズAIは数十の自律エージェントノードをデプロイし、それぞれが共有メモリ管理なしで同じエンティティに作用する。
このメモリガバナンスのギャップから生じる5つの構造的課題を特定します。
我々は、4つのメカニズムを通じてこのギャップに対処する共有メモリとガバナンス層であるGoverned Memoryを紹介します。
論文 参考訳(メタデータ) (2026-03-18T14:49:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。