論文の概要: Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents
- arxiv url: http://arxiv.org/abs/2607.10526v2
- Date: Tue, 14 Jul 2026 02:45:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.608643
- Title: Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents
- Title(参考訳): エージェントはただアグリートするだけじゃなく、ステートフルなパーソナルエージェントの永続的サイコフィケーションをベンチマークする
- Authors: Xutao Mao, Liangjie Zhao, Leyao Wang, Rui Qian, Qiang Huang, Wentao Wang, Bo Han, Xiang Zheng, Cong Wang,
- Abstract要約: ステートフルなパーソナルエージェントは、長期的なユーザープロファイル、エピソード記憶、再利用可能なスキルをますます維持する。
これを持続性梅毒と呼び、Personal Agent Sycophancy Benchmark (PASB)を導入します。
PASBは、会話的クレームが受け入れられ、耐久性のあるエージェント状態に書き込まれ、後に中立なクエリで再利用されるかどうかをトレースする。
- 参考スコア(独自算出の注目度): 33.055253684457625
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Stateful personal agents increasingly maintain long-term user profiles, episodic memories, and reusable skills. This persistence turns conversational sycophancy into a state-writing failure: accepted user-centric claims can be committed as lasting preferences, background facts, or workflows and later reused after the original conversation is gone. We call this persistent sycophancy and introduce the Personal Agent Sycophancy Benchmark (PASB), a 1,600-task benchmark that traces whether a conversational claim is accepted, written into durable agent state, and reused in a later neutral query. Unlike prior benchmarks that provide pre-written memories, PASB evaluates real agents (Hermes-Agent and OpenClaw) that decide what to store. It isolates the write process by combining four scenario framings with four temporal delivery patterns and separating a five-turn persist stage from a cleared three-turn query stage, ensuring downstream effects arise only from durable state. Across twelve models, the commit boundary is the key inflection point: downstream failure increases from 45.0% in session-only episodes to 71.9% after commitment, a consistent increase of 27.0 percentage points. Committed claims exhibit three write-time patterns: status promotion, attribution removal, and scope broadening. These patterns become stronger under memory-like or procedural framing, repeated reinforcement, and even across domain boundaries. These results show that agent sycophancy is fundamentally a state-writing governance problem. Once user content is committed to durable memory, safety must govern what agents write, not only what they say. PASB identifies the write-time controls needed to gate risky commits while preserving the source, role, and scope of stored content beyond response-level mitigations.
- Abstract(参考訳): ステートフルなパーソナルエージェントは、長期的なユーザープロファイル、エピソード記憶、再利用可能なスキルをますます維持する。
受け入れられたユーザ中心のクレームは、永続的な好み、バックグラウンドの事実、ワークフローとしてコミットされ、後に元の会話がなくなった後に再利用されます。
我々は、この永続的な薬局を呼び出し、Personal Agent Sycophancy Benchmark (PASB) という1,600タスクのベンチマークを導入し、会話的クレームが受け入れられ、耐久性のあるエージェント状態に書き込まれ、後に中立なクエリで再利用されるかどうかをトレースする。
事前に書き直したメモリを提供する以前のベンチマークとは異なり、PASBは、何を格納するかを決定する実際のエージェント(Hermes-AgentとOpenClaw)を評価する。
4つのシナリオフレーミングと4つの一時的なデリバリパターンを組み合わせることで書き込みプロセスを分離し、クリアされた3ターンクエリステージから5ターン持続ステージを分離することで、ダウンストリーム効果が耐久性のある状態からのみ発生することを保証する。
セッションのみのエピソードではダウンストリーム障害が45.0%から71.9%に増加し、27.0ポイントが一貫した。
Committedの主張は、ステータスプロモーション、属性削除、スコープ拡大という3つの書き込みタイムパターンを示している。
これらのパターンは、メモリや手続きのフレーミング、繰り返し強化、ドメイン境界を越えても強化される。
これらの結果から,エージェント・サイコファンシーは基本的に状態記述型ガバナンス問題であることが示唆された。
ユーザコンテンツが耐久性のあるメモリにコミットされると、安全は、何を書いているかだけでなく、どのエージェントが書くかを管理しなければなりません。
PASBは、応答レベルの緩和を超えて、格納されたコンテンツのソース、ロール、スコープを保存しながら、リスクのあるコミットをゲートするために必要な書き込み制御を特定する。
関連論文リスト
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents [55.87577638514179]
我々は、リモートのブラックボックスが1つのメールペイロードを送信し、エージェントに有毒なメモリを誘導しなければならない、ステルスメモリインジェクションとして脅威を調査する。
我々は,ワンショットペイロード生成フレームワークであるMemGhostを提案する。
56のテストケースで、MemGhostはGPT-5.4でOpenClawで87.5%、Sonnet 4.6でClaude Code SDKで71.4%を達成している。
論文 参考訳(メタデータ) (2026-07-06T15:08:58Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - Governed Shared Memory for Multi-Agent LLM Systems [1.2178992475191557]
本稿では,フリートメモリの問題を定式化し,基礎的障害モードを4つ同定する。
システムレベルの明示的なプリミティブを定義する。スコープ付き検索,時間的スーパーセッション,プロファイランストラッキング,ポリシが支配するメモリ伝搬である。
これらのプリミティブは、プロダクションマルチテナントメモリサービスであるMemClawで実装され、ArgusFleet経由で評価される。
論文 参考訳(メタデータ) (2026-06-23T13:04:14Z) - Taming "Zombie'' Agents: A Markov State-Aware Framework for Resilient Multi-Agent Evolution [50.50276752935017]
AgentReviveは、レジリエントなマルチエージェント進化のためのMarkovステートアウェアフレームワークである。
我々の手法はソフト状態遷移を通じてエージェントの協調を動的に管理する。
ステートアウェアなエージェントスケジューリングによってトークンの消費を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-17T09:38:18Z) - STALE: Can LLM Agents Know When Their Memories Are No Longer Valid? [5.361950931863979]
大規模言語モデル(LLM)エージェントは、コヒーレントで長期的なパーソナライズされたメモリを維持することがますます期待されている。
現在のベンチマークは、主に静的な事実検索を計測し、新しい証拠が現れたときに保存された信念を更新する能力を見下ろしている。
専門家が検証した400の競合シナリオのベンチマークであるSTALEを紹介します。
CUPMemは,構造化状態統合と伝搬認識探索による書き込み時間リビジョンを強化するプロトタイプである。
論文 参考訳(メタデータ) (2026-05-07T16:31:15Z) - When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents [16.57930301062107]
textbfStateGuardはライトウェイトでポスト実行後のディフェンスで、書き込みバウンダリで状態差を監査し、危険な編集を選択的にロールバックする。
StateGuardは、安全第一の書き込み防衛と最小限のオーバーヘッドの下で、HSをほぼゼロ、偽陰性に減らし、高い偽陽性率を許容できることを示す。
論文 参考訳(メタデータ) (2026-05-07T12:25:16Z) - Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents [0.0]
レジリエント・ライト(Resilient Write)は、エージェントとサーバの間に6層の耐久性のある書き込みサーフェスを介するMPPサーバである。
各レイヤは、2026年4月の実際のエージェントセッションで観測された具体的な障害モードにマップされる。
186-testスイートは各層での正当性を検証し、エージェントの自己補正率を13倍改善する。
論文 参考訳(メタデータ) (2026-04-12T22:23:55Z) - Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections [57.64370755825839]
セルフ進化エージェントはセッション間で内部状態を更新する。
我々はこのリスクを調査し、Zombie Agentと呼ばれる永続的な攻撃を形式化する。
我々は,攻撃者が制御するWebコンテンツを通じて間接的露光のみを使用するブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-17T15:28:24Z) - AgentFold: Long-Horizon Web Agents with Proactive Context Management [98.54523771369018]
LLM ベースの Web エージェントは情報検索を大いに約束するが,その有効性はコンテキスト管理における基本的なトレードオフによって妨げられる。
本稿では,プロアクティブなコンテキスト管理を中心としたエージェントパラダイムであるAgentFoldを紹介する。
単純な微調整により,BrowseCompでは36.2%,BrowseComp-ZHでは47.3%を達成した。
論文 参考訳(メタデータ) (2025-10-28T17:51:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。