論文の概要: When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs
- arxiv url: http://arxiv.org/abs/2608.30198v1
- Date: Mon, 31 Aug 2026 03:26:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.210562
- Title: When Errors Become Memories: Causal Pathway Tracing in Multi-Turn Memory-Augmented LLMs
- Title(参考訳): 記憶の誤り:多軸記憶増強LDMにおける因果経路の追跡
- Abstract要約: 長期記憶により、大きな言語モデルでは、対話間で情報の保存と再利用が可能である。
既存の作業は、主にメモリシステムが情報を正しく保存し、取得するかどうかを評価する。
メモリ拡張LDMにおけるクロスターン誤り伝播のための構造因果モデルを提案する。
- 参考スコア(独自算出の注目度): 6.373565144653919
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-term memory enables large language models (LLMs) to preserve and reuse information across interactions, but it can also turn localized errors into persistent risks. Existing work mainly evaluates whether memory systems store and retrieve information correctly, leaving limited understanding of how errors propagate across responses, memory states, and future interactions. We propose a structural causal model (SCM)-based framework for cross-turn error propagation in memory-augmented LLMs. We model user questions, model responses, and memory states as a dynamic causal process, and identify two entry pathways: internal memory updating and external question feedback. By intervening on these pathways, we construct four counterfactual trajectories and quantify their downstream effects and interaction. Error influence is evaluated at four levels: memory retention, natural responses, targeted diagnostic probing, and probability-level error preference. Experiments show that error influence generally decays with interaction distance, while the memory-update pathway contributes more persistent effects than question feedback; latent errors may remain even after disappearing from natural responses. Propagation patterns also vary across memory categories and memory mechanisms. Pathway-guided restoration further validates this decomposition: Question Repair reduces residual error by 27.5%, Memory Repair by 70.2%, and Joint Repair by 98.3%, nearly eliminating residual propagation.
- Abstract(参考訳): 長期記憶により、大きな言語モデル(LLM)は、インタラクション間の情報の保存と再利用を可能にするが、局所的なエラーを永続的なリスクに変換することもできる。
既存の作業は主に、メモリシステムが情報を正しく保存し、取得するかどうかを評価し、エラーが応答、メモリ状態、将来の相互作用間でどのように伝播するかを限定的に理解している。
メモリ拡張LDMにおけるクロスターン誤り伝播のための構造因果モデル(SCM)に基づくフレームワークを提案する。
ユーザ質問,モデル応答,メモリ状態を動的因果プロセスとしてモデル化し,内部メモリ更新と外部質問フィードバックという2つのエントリパスを同定する。
これらの経路を介入することにより、4つの反事実軌道を構築し、下流効果と相互作用を定量化する。
エラーの影響は、メモリ保持、自然応答、ターゲット診断探索、確率レベルのエラー嗜好の4つのレベルで評価される。
実験では、エラーの影響は一般的に相互作用距離で減衰するが、メモリ更新経路は質問のフィードバックよりも永続的な効果をもたらす。
伝播パターンは、メモリカテゴリやメモリメカニズムによっても異なる。
質問修復は残差を27.5%減らし、記憶修復を70.2%減らし、共同修復を98.3%減らし、残差の伝播をほぼなくした。
関連論文リスト
- From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents [19.125716338799545]
textbfdependency-guided rollback repairは、出所からの型付きメモリ対アクショングラフを構築し、明示的な下流依存性をトレースし、応答関連処理のみを選択的に再生する。
本手法は,3つのツール使用領域と4つのメモリ障害タイプにまたがる150ケースのベンチマークで評価する。
論文 参考訳(メタデータ) (2026-08-11T05:19:55Z) - Controlled Memory Interference in Continual LLM Agents [19.630594179909156]
長期記憶により、AIエージェントはセッション間の連続性を維持し、振る舞いをパーソナライズし、蓄積された経験を通じて進化することができる。
既存のシステムは、主にメモリ構築と関連性に基づく検索を強調しているが、いくつかの記憶は、状態、時間的妥当性、権限において異なるが、同時に関連している。
我々は,異なるメモリ関係下でのエージェントメモリの進化を研究するための,制御された診断・データ生成フレームワークである制御型メモリ干渉(CMI)を紹介する。
論文 参考訳(メタデータ) (2026-08-07T09:46:19Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - MemFail: Stress-Testing Failure Modes of LLM Memory Systems [69.80981631587501]
大規模言語モデル(LLM)エージェントは、長期にわたる相互作用において一貫性を保つために、外部メモリシステムに依存している。
既存のベンチマークでは、集計された質問回答の精度を報告し、メモリシステムをブラックボックスとして扱う。
本稿では,現代のLCMメモリシステムの障害モードを分離する診断ベンチマークであるMemFailを紹介する。
論文 参考訳(メタデータ) (2026-05-26T08:03:55Z) - The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory [7.707732051915869]
エージェントメモリシステムの診断では、メモリはクリーンな入力の推論を改善するが、それらが存在するときのスプリアスパターンへの依存を増幅する。
本稿では,CAMELを提案する。CAMELは,書き込み時間と検索時間の両方で,多様なメモリアーキテクチャ間で動作可能な,プラグアンドプレイキャリブレーション方式である。
全体として、CAMELはより信頼性の高いエージェントメモリデプロイメントに対して、原則的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2026-05-10T05:04:13Z) - MemEvoBench: Benchmarking Memory MisEvolution in LLM Agents [78.95081012334116]
永続メモリを持つ大規模言語モデル(LLM)は、相互作用の継続性とパーソナライゼーションを高めるが、新たな安全性リスクをもたらす。
汚染または偏りのある記憶蓄積は、異常な作用を引き起こす可能性がある。
MemeEvoBenchは、LLMエージェントのメモリ安全性を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-04-17T07:29:52Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。