論文の概要: MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
- arxiv url: http://arxiv.org/abs/2608.20202v1
- Date: Thu, 20 Aug 2026 16:00:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.630481
- Title: MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
- Title(参考訳): MemTrapBench: LLMメモリ使用時の認知的トラップのベンチマーク
- Authors: Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang,
- Abstract要約: 既存のメモリベンチマークは、情報が正しく抽出され、保存され、検索されるかどうかを主に評価する。
記憶によって引き起こされる認知的トラップは、忠実に記録され、意味的に関連する記憶でさえ、モデル推論を歪ませることができる。
本稿では,LLMにメモリトラップを回避するためのシンプルな推論時間手法であるAdaptiveMemを提案する。
- 参考スコア(独自算出の注目度): 30.64715962774191
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Memory has become a key component of large language models, enabling them to retain information and learn from long-term interactions. However, existing memory benchmarks mainly evaluate whether information is correctly extracted, stored, and retrieved, while largely overlooking how retrieved memories reshape model reasoning and affect performance on the current task. We identify memory-induced cognitive traps: even faithfully recorded and semantically relevant memories can distort model reasoning or beliefs and degrade current task performance. To systematically evaluate these failure modes, we introduce MemTrapBench, which covers two forms of cognitive traps: Reasoning Fixation and Belief Distortion. Experiments across two model families and five representative memory frameworks show that MemTrapBench is challenging: all evaluated memory strategies underperform the no-memory setting, with even the strongest methods suffering drops of more than 10%. To mitigate these cognitive traps, we propose AdaptiveMem, a simple yet effective inference-time method that instructs LLMs to avoid memory traps. AdaptiveMem mitigates cognitive traps on MemTrapBench while preserving or improving performance on standard memory benchmarks across diverse memory frameworks.
- Abstract(参考訳): メモリは大きな言語モデルの主要なコンポーネントとなり、情報を保持し、長期的な相互作用から学ぶことができるようになった。
しかし、既存のメモリベンチマークは、情報が正しく抽出され、保存され、検索されるかどうかを主に評価する一方で、検索されたメモリがモデル推論をどのように作り直し、現在のタスクのパフォーマンスに影響を及ぼすかを見極めている。
忠実に記録され、意味的に関連づけられた記憶でさえ、モデル推論や信念を歪め、現在のタスクパフォーマンスを低下させることができる。
これらの障害モードを体系的に評価するために,2種類の認知的トラップであるReasoning FixationとBreief Distortionを紹介するMemTrapBenchを紹介した。
2つのモデルファミリと5つの代表的なメモリフレームワークにわたる実験によると、MemTrapBenchは難しい。
これらの認知的トラップを緩和するために、メモリトラップを避けるためのLPMを指示するシンプルで効果的な推論時間法であるAdaptiveMemを提案する。
AdaptiveMemはMemTrapBenchの認知的トラップを緩和し、さまざまなメモリフレームワークにわたる標準メモリベンチマークのパフォーマンスを保存または改善する。
関連論文リスト
- Mechanistic Attention Guidance for Agent Memory Refinement [32.57216046158823]
検索ヘッドアテンションは,セグメントレベルのメモリ使用量を明らかにするためのメカニスティック信号を提供する。
本稿では,注意による利用パターンを用いてセグメントレベルのメモリ更新を誘導するフレームワークであるAttention-Guided Memory Refinement (AGMR)を提案する。
論文 参考訳(メタデータ) (2026-07-20T07:17:50Z) - MemSyco-Bench: Benchmarking Sycophancy in Agent Memory [32.49512092540906]
MemSyco-Benchは、エージェントシステムにおけるメモリ誘起性を評価するためのベンチマークである。
MemSyco-Benchは、いつメモリが決定に影響を及ぼすか、どのように有効なメモリを使用するかを測定する。
論文 参考訳(メタデータ) (2026-07-01T15:30:33Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory [7.707732051915869]
エージェントメモリシステムの診断では、メモリはクリーンな入力の推論を改善するが、それらが存在するときのスプリアスパターンへの依存を増幅する。
本稿では,CAMELを提案する。CAMELは,書き込み時間と検索時間の両方で,多様なメモリアーキテクチャ間で動作可能な,プラグアンドプレイキャリブレーション方式である。
全体として、CAMELはより信頼性の高いエージェントメモリデプロイメントに対して、原則的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2026-05-10T05:04:13Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization [57.17751568928966]
自己進化型メタメモリでメモリシステムを拡張するフレームワークであるMetaMemを提案する。
メタメモリ最適化の間、MetaMemは異なるタスク間で伝達可能な知識利用経験を反復的に蒸留する。
大規模な実験ではMetaMemの有効性が示され、これは強いベースラインを3.6%以上上回っている。
論文 参考訳(メタデータ) (2026-01-27T04:46:23Z) - Evaluating Long-Term Memory for Long-Context Question Answering [100.1267054069757]
質問応答タスクにアノテートした合成長文対話のベンチマークであるLoCoMoを用いて,メモリ拡張手法の体系的評価を行う。
以上の結果から,メモリ拡張アプローチによりトークン使用率が90%以上削減され,競争精度が向上した。
論文 参考訳(メタデータ) (2025-10-27T18:03:50Z) - Stable Hadamard Memory: Revitalizing Memory-Augmented Agents for Reinforcement Learning [64.93848182403116]
現在のディープラーニングメモリモデルは、部分的に観察可能で長期にわたる強化学習環境で苦労している。
本稿では,強化学習エージェントのための新しい記憶モデルであるStable Hadamard Memoryを紹介する。
我々の手法は、部分的に観測可能なベンチマークに挑戦する上で、最先端のメモリベースの手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2024-10-14T03:50:17Z) - MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation [15.64077949677469]
メモリ拡張対話システム(MADS)の有効性を評価するための新しいメモリ拡張対話ベンチマーク(MADail-Bench)を提案する。
このベンチマークは2つのタスクを別々に評価する: メモリ検索とメモリ認識は、パッシブとプロアクティブの両方のメモリリコールデータを組み込んだものである。
このベンチマークにおける最先端の埋め込みモデルと大規模言語モデルの結果は、さらなる進歩の可能性を示している。
論文 参考訳(メタデータ) (2024-09-23T17:38:41Z) - A Model or 603 Exemplars: Towards Memory-Efficient Class-Incremental
Learning [56.450090618578]
CIL(Class-Incremental Learning)は、この要件を満たすために、限られたメモリサイズでモデルをトレーニングすることを目的としている。
モデルサイズを総予算にカウントし,メモリサイズに整合する手法を比較すると,保存モデルは常に機能しないことを示す。
本稿では,メモリ効率のよい拡張可能なMOdelのための MEMO という,シンプルで効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2022-05-26T08:24:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。