論文の概要: Beyond the Shadows of Plato's Cave: Evaluating False Memory in Autonomous Agents via Counterfactual Reasoning
- arxiv url: http://arxiv.org/abs/2609.39473v1
- Date: Wed, 30 Sep 2026 10:35:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.586646
- Title: Beyond the Shadows of Plato's Cave: Evaluating False Memory in Autonomous Agents via Counterfactual Reasoning
- Title(参考訳): プラトンの洞窟の影を超えて--反現実的推論による自律エージェントの虚偽記憶の評価
- Abstract要約: 我々は,素早い相関関係,環境変化,知識衝突から生じるテクスタイス・メモリを定式化する。
本稿では,反実的推論に基づくエージェント信念の進化を通じて,虚偽記憶を評価する学習自由フレームワークFAMEを提案する。
- 参考スコア(独自算出の注目度): 90.354889777866
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous agents increasingly rely on memory to generalize beyond their training environments. However, agents are bounded by what they have seen and believed, and leveraging such memories in unseen environments can introduce biases into their internal beliefs. We formalize this phenomenon as \textit{false memory}, which can arise from spurious correlations, environment shifts, and knowledge conflicts. Despite its importance, false memory is difficult to evaluate because it stems from agent internal beliefs and is easily confounded with ordinary generalization failures. Therefore, we propose FAME, a training-free framework that evaluates false memory through the evolution of agent beliefs under counterfactual reasoning. Specifically, counterfactual scenarios reveal how beliefs change as the latent concept of memory shifts under hypothetical interventions; thus, measuring the resulting concept drift provides a signal for distinguishing faithful versus false memory. Such concepts can be estimated from agent hidden states before answer generation, avoiding the need for reward design or answer sampling. Empirical experiments reveal that simply monitoring answers often fails to detect false memory, while FAME achieves AUROCs of 76.2% - 96.7% across false-memory settings, and outperforms the best baseline by 3.4% - 23.3% across realistic benchmarks, spanning math reasoning (GSM-Symbolic), code generation (GitChameleon), and complex reasoning (BigBench-Hard). We further release corresponding counterfactual templates and facilitate future research on false memory.
- Abstract(参考訳): 自律的なエージェントは、トレーニング環境を超えて一般化するためにメモリに依存している。
しかし、エージェントは、彼らが見たものや信じたものに縛られ、目に見えない環境でそのような記憶を活用することは、彼らの内的信念に偏見をもたらす可能性がある。
我々は、この現象を「textit{false memory}」として定式化し、この現象は、素早い相関関係、環境変化、知識の衝突から生じうる。
その重要性にもかかわらず、偽記憶はエージェント内部の信念から派生しており、通常の一般化失敗と容易に融合しているため評価が難しい。
そこで本研究では,反実的推論に基づくエージェント信念の進化を通じて,虚偽記憶を評価する学習自由フレームワークFAMEを提案する。
特に、反現実的なシナリオは、仮説的介入の下での潜在的な記憶のシフトとして信念がどのように変化するかを明らかにし、結果として生じる概念のドリフトを測定することは、忠実な記憶と偽の記憶を区別するための信号を提供する。
このような概念は、応答生成の前に隠蔽状態から推定することができ、報酬設計や回答サンプリングの必要性を避けることができる。
FAMEは偽メモリ設定で76.2%から96.7%のAUROCを達成し、現実的なベンチマークで3.4%から23.3%、数学推論(GSM-Symbolic)、コード生成(GitChameleon)、複雑な推論(BigBench-Hard)で最高のベースラインを上回っている。
さらに,対応テンプレートを公開し,偽メモリの今後の研究を促進する。
関連論文リスト
- Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem [12.078734827417685]
メモリが何であるか、いつ最適かに関する統一的な公式な説明はない。
中心的な考え方は、記憶は基礎であり、知識はその範囲であり、答え可能性はカバレッジの問題である。
最適なメモリは、期待されるカバレッジのキャパシティ制限された最大値である。
論文 参考訳(メタデータ) (2026-08-12T04:54:26Z) - Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory [1.0152838128195467]
Memory Contagion -- エージェントメモリによる評価者のバイアスの時間的伝播。
エージェントがバイアス評価者によって訓練されたり指導されたりすると、その経験がバイアスとなることを示す。
以上の結果から,現在のエージェントメモリ設計における重大な脆弱性が明らかとなった。
論文 参考訳(メタデータ) (2026-06-22T11:43:37Z) - Belief Memory: Agent Memory Under Partial Observability [56.41506249481312]
本稿では,メモリパラダイムを観測毎に1つの結論にシフトし,その確率で複数の結論を導出するBeliefMemを提案する。
BeliefMemは決定論的パラダイムが破棄されるという不確実性を保ち、エージェントが高い信頼を持って行動することを可能にする。
LoCoMoとALFWorldベンチマークの実証的な評価は、限られたデータであっても、BeliefMemが最高の平均パフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2026-05-07T02:03:13Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - REMem: Reasoning with Episodic Memory in Language Agent [32.63834745610879]
エピソードメモリを用いた構築と推論のためのフレームワークであるREMemについて述べる。
我々はREMemがMem0やHippoRAG 2のような時空間記憶システムよりも大幅に優れていることを示す。
REMemはまた、答えられない質問に対してより堅牢な拒絶行動を示す。
論文 参考訳(メタデータ) (2026-02-13T23:54:55Z) - MemGen: Weaving Generative Latent Memory for Self-Evolving Agents [57.1835920227202]
本稿では,エージェントに人間的な認知機能を持たせる動的生成記憶フレームワークであるMemGenを提案する。
MemGenは、エージェントが推論を通して潜在記憶をリコールし、増大させ、記憶と認知の密接なサイクルを生み出すことを可能にする。
論文 参考訳(メタデータ) (2025-09-29T12:33:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。