論文の概要: MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
- arxiv url: http://arxiv.org/abs/2607.01071v2
- Date: Thu, 02 Jul 2026 15:40:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.514047
- Title: MemSyco-Bench: Benchmarking Sycophancy in Agent Memory
- Title(参考訳): MemSyco-Bench:エージェントメモリの同期ベンチマーク
- Authors: Zhishang Xiang, Zerui Chen, Yunbo Tang, Zhimin Wei, Ruqin Ning, Yujie Lin, Qinggang Zhang, Jinsong Su,
- Abstract要約: MemSyco-Benchは、エージェントシステムにおけるメモリ誘起性を評価するためのベンチマークである。
MemSyco-Benchは、いつメモリが決定に影響を及ぼすか、どのように有効なメモリを使用するかを測定する。
- 参考スコア(独自算出の注目度): 32.49512092540906
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Memory has emerged as a cornerstone of modern LLM-based agents, supporting their evolution from single-turn assistants to long-term collaborators. However, memory is not always beneficial: retrieved memories often induce a critical issue of sycophancy, causing agents to over-align with the user at the cost of factual accuracy or objective reasoning. Despite this emerging risk, existing memory benchmarks primarily evaluate whether memories are correctly stored, retrieved, or updated, while overlooking how retrieved memories influence downstream reasoning and decision-making. To bridge this gap, we propose MemSyco-Bench, a comprehensive benchmark for evaluating memory-induced sycophancy in agent systems. MemSyco-Bench measures when memory should influence a decision and how valid memory should be used. Specifically, it covers five tasks that assess whether agents can reject memory as factual evidence, respect its applicable scope, resolve conflicts between memory and objective evidence, track memory updates, and use valid memory for personalization. All related resources are collected for the community at https://github.com/XMUDeepLIT/MemSyco-Bench.
- Abstract(参考訳): メモリは現代のLSMベースのエージェントの基盤として現れ、シングルターンアシスタントから長期協力者への進化を支えている。
しかし、記憶は必ずしも有益ではない:回収された記憶は、しばしば梅毒の重大な問題を誘発し、エージェントが現実の正確さや客観的な推論を犠牲にしてユーザーと過度に調整する。
この新たなリスクにもかかわらず、既存のメモリベンチマークは、検索したメモリが下流の推論や意思決定にどのように影響するかを見極めながら、メモリが正しく保存されるか、回収されるか、または更新されるかを主に評価する。
このギャップを埋めるため,エージェントシステムにおけるメモリ誘起性評価のための総合ベンチマークであるMemSyco-Benchを提案する。
MemSyco-Benchは、いつメモリが決定に影響を及ぼすか、どのように有効なメモリを使用するかを測定する。
具体的には、エージェントがメモリを事実的証拠として拒否できるかどうかを評価する5つのタスクをカバーし、その適用範囲を尊重し、メモリと客観的証拠の衝突を解決し、メモリ更新を追跡し、パーソナライズに有効なメモリを使用する。
関連リソースはすべてコミュニティのためにhttps://github.com/XMUDeepLIT/MemSyco-Benchで収集される。
関連論文リスト
- MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - Beyond Similarity: Trustworthy Memory Search for Personal AI Agents [25.265839311088516]
個人AIエージェントにおける信頼境界としてのメモリ探索について検討する。
MemGateは、信頼性の高いメモリ検索のための軽量でデプロイ可能なメモリプラグインである。
論文 参考訳(メタデータ) (2026-06-04T11:54:29Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective [21.66000179149483]
EvoMemBenchは、メモリスコープとメモリ内容の2つの軸に沿って編成された統一ベンチマークである。
本稿では,15個の代表記憶法と強い長文ベースラインを標準プロトコルで比較する。
結果は、現在のメモリシステムは、まだ一般的な解決策には程遠いことを示している。
論文 参考訳(メタデータ) (2026-05-18T13:54:38Z) - Causal Intervention-Based Memory Selection for Long-Horizon LLM Agents [0.33842793760651557]
制御された介入の下で,候補記憶がモデル応答に与える影響を推定する因果記憶選択手法を提案する。
以上の結果から,CMIは,信頼性の高い長期記憶には関連性のみではなく,因果的有用性に基づくコンテキスト選択が必要であることが示唆された。
論文 参考訳(メタデータ) (2026-05-17T20:21:55Z) - From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents [38.52713500119118]
Memoraは、数週間から数ヶ月のユーザ会話にまたがる長期メモリベンチマークです。
ベンチマークでは、記憶、推論、レコメンデーションの3つのメモリグラウンドタスクを評価している。
FAMA(Forgetting-Aware Memory Accuracy)は、古いメモリや無効メモリへの依存を罰するメトリクスである。
論文 参考訳(メタデータ) (2026-04-21T21:31:01Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design [77.30163153176954]
RMBenchは、メモリの複雑さの複数のレベルにまたがる9つの操作タスクからなるシミュレーションベンチマークである。
Mem-0は、制御アブレーション研究をサポートするために設計された明示的なメモリコンポーネントを備えたモジュラー操作ポリシーである。
既存のポリシにおけるメモリ関連の制限を特定し、アーキテクチャ設計の選択がメモリパフォーマンスに与える影響に関する実証的な洞察を提供する。
論文 参考訳(メタデータ) (2026-03-01T18:59:59Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization [57.17751568928966]
自己進化型メタメモリでメモリシステムを拡張するフレームワークであるMetaMemを提案する。
メタメモリ最適化の間、MetaMemは異なるタスク間で伝達可能な知識利用経験を反復的に蒸留する。
大規模な実験ではMetaMemの有効性が示され、これは強いベースラインを3.6%以上上回っている。
論文 参考訳(メタデータ) (2026-01-27T04:46:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。