論文の概要: Causal Episodic Memory for Feedback-Driven Agent Repair
- arxiv url: http://arxiv.org/abs/2608.05906v1
- Date: Thu, 06 Aug 2026 11:34:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.894338
- Title: Causal Episodic Memory for Feedback-Driven Agent Repair
- Title(参考訳): フィードバック駆動型エージェント修復のための因果てんかん記憶
- Abstract要約: オラクル認証のオンライン双極性メモリを保守するトレーニングフリーエージェントであるMERITを紹介する。
負のメモリが適度に寄与することを示し、型条件付けと語彙ランク付けの値はデータセットに依存し、スキーマローカルエクスペリエンスが最も一貫した利点を提供する。
- 参考スコア(独自算出の注目度): 2.641347237473854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents that repair failures often discard successful corrections, forcing later episodes to rediscover similar solutions. We study whether finalized repair outcomes can improve subsequent Text-to-SQL episodes without parameter updates. We introduce MERIT, a training-free agent that maintains an online dual-polarity memory of oracle-verified corrections and observed unsuccessful directions. Under oracle-assisted benchmark feedback, only memories from earlier finalized episodes are eligible for retrieval. A deterministic classifier assigns a coarse failure type, which conditions a hybrid lexical-dense retriever before the frozen model generates each revision. Using Qwen2.5-7B-Instruct with identical initial predictions and repair budgets, MERIT improves execution accuracy over stateless iterative repair from \(66.34\%\) to \(69.79\%\) on Spider and from \(47.35\%\) to \(48.44\%\) on BIRD. Paired analyses provide clear evidence for the Spider gain but weaker evidence on BIRD. MERIT is not reliably separated from untyped dynamic retrieval on either benchmark, while Reflexion-style memory reaches \(51.24\%\) on BIRD at substantially higher inference cost. Ablations show that negative memory contributes modestly, the value of type conditioning and lexical--dense ranking is dataset dependent, and schema-local experience provides the most consistent benefit. These results clarify when causal cross-query memory improves repair and when broader memory representations remain preferable.
- Abstract(参考訳): 故障を修復するLLMエージェントは、しばしば成功した修正を破棄し、後続のエピソードでは同様の解決策を再発見せざるを得なくなった。
最終的な修復結果が,パラメータ更新を伴わずに,後続のText-to-SQLエピソードを改善することができるかどうかを検討する。
オラクル検証補正のオンライン双極性メモリを保守し、失敗した方向を観察するトレーニングフリーエージェントであるMERITを紹介する。
オラクルによるベンチマークフィードバックの下では、初期の最終エピソードの記憶だけが検索に利用できる。
決定論的分類器は、凍結モデルが各リビジョンを生成する前にハイブリッド語彙検索器を条件とする粗い故障型を割り当てる。
Qwen2.5-7B-インストラクタと同一の初期予測と修復予算を用いて、MERITは、状態のない反復的な修復の精度を、スパイダー上の \(66.34\%\) から \(69.79\%\) と、BIRD上の \(47.35\%\) から \(48.44\%\) に改善した。
ペアリング分析は、スパイダーゲインの明確な証拠を提供するが、BIRDに関するより弱い証拠を提供する。
MERITはどちらのベンチマーク上でも非型付けされた動的検索とは確実に分離されないが、ReflexionスタイルのメモリはBIRD上ではかなり高い推論コストで \(51.24\%\) に達する。
Ablationsによると、負のメモリは適度に寄与し、型条件付けと語彙ランク付けの値はデータセットに依存し、スキーマローカルエクスペリエンスは最も一貫した利点を提供する。
これらの結果は、因果クロスクエリーメモリが修復を改善し、より広いメモリ表現が好まれるかどうかを明らかにする。
関連論文リスト
- Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability [2.8890052855500143]
長文読解(LC-RAW)における記憶量と記憶量の比較を行った。
ランダム化された応答符号を持つ48の合成ヒストリー、正確なスコアリング、100億以下のパラメータを持つ2つのオープンウェイトモデルを使用する。
論文 参考訳(メタデータ) (2026-09-04T16:44:17Z) - Continual Graph Memory for Adaptive Recommendation under Intent Drift [7.140905344515738]
本稿では,意図的ドリフト下での適応的レコメンデーションについて検討し,各レコメンデーション結果からのフィードバックによって,ランク付けに使用される関係証拠が有用か,欠落か,誤解を招くかを明らかにする。
本稿では,適応型レコメンデーションのための連続グラフメモリフレームワークであるCGM-Recを提案する。
論文 参考訳(メタデータ) (2026-09-04T02:32:20Z) - The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory [29.20695058395373]
我々は、以前取得した妥当性スコアを再利用可能な検索エクスペリエンスとして扱う、経験適応型リグレードフレームワークであるEARMを紹介する。
EARMは、スパースクエリ-メモリ関連スコアをオンラインマトリックスに格納し、因果行列の補完を通じて共有構造を学習し、新たに観測されたスコアの小さなセットと推定スコアを組み合わせて、残りの候補を再ランクする。
長期会話記憶の実験では、観察と推定の混合がセマンティック検索よりも解の精度を最大6.62%向上させることが示された。
論文 参考訳(メタデータ) (2026-08-24T03:42:03Z) - From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents [19.125716338799545]
textbfdependency-guided rollback repairは、出所からの型付きメモリ対アクショングラフを構築し、明示的な下流依存性をトレースし、応答関連処理のみを選択的に再生する。
本手法は,3つのツール使用領域と4つのメモリ障害タイプにまたがる150ケースのベンチマークで評価する。
論文 参考訳(メタデータ) (2026-08-11T05:19:55Z) - Contrastive Reflection for Iterative Prompt Optimization [0.6533652962118279]
エージェントIRの反復的プロンプト最適化フレームワークであるContrastive Reflectionを提案する。
フレームワークをツリーベースのスライスセレクタでインスタンス化するが、コントリビューションはツリー自体よりもコントラストループである。
論文 参考訳(メタデータ) (2026-06-29T19:16:07Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery [6.0574120466674986]
LLMに基づく方程式探索は、データからシンボル法則を回復するための有望な経路を提供する。
本研究では,データ・アウェア・ジェネレーション,混合適合評価,批評家・実行者修復,多様性保存セマンティックメモリの調整により信頼性を向上させる自己表現型エージェント・フレームワークSTRIDEを提案する。
論文 参考訳(メタデータ) (2026-05-18T03:14:32Z) - MemReranker: Reasoning-Aware Reranking for Agent Memory Retrieval [37.54115468116941]
本報告では,Qwen3-Reranker を用いた多段 LLM 知識蒸留によるリグレードモデルファミリ MemReranker (0.6B/4B) について紹介する。
メモリ検索ベンチマークでは、MemReranker-0.6BはBGE-Rerankerを大きく上回り、オープンソースの4B/8BモデルとGPT-4o-miniをキーメトリクスでマッチングする。
MemReranker-4B はさらに 0.737 MAP を達成し、Gemini-3-Flash と同等のメトリクスを持つ一方で、推論遅延を10-20%の大型モデルで維持している。
論文 参考訳(メタデータ) (2026-05-07T12:33:57Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Mask-to-Correct$^+$: Leveraging Retriever Diversity for Masking-guided Faithful Fact Correction [2.6365690297272617]
ソーシャルメディア上での誤報の急速な拡散は、堅牢で自動化された事実訂正フレームワークの必要性を浮き彫りにする。
本稿では,多様性を意識したマスキングを利用して誤ったクレームを識別するRAG(Retrieval Augmented Generation)ベースのフレームワークを提案する。
さらにM$$C$+$というアンサンブルベースのフレームワークを導入し、複数のランクの修正を組み合わせることで、検索バイアスを低減し、ロバスト性を向上させる。
論文 参考訳(メタデータ) (2026-04-21T14:13:07Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Gumbel Reranking: Differentiable End-to-End Reranker Optimization [61.16471123356738]
RAGシステムは関連する文書を識別するためにリランカーに依存している。
注釈付きクエリ-ドキュメントペアが不足しているため、これらのモデルの微調整は依然として難しい。
我々は,トレーニングと推論のギャップを最小限に抑えることを目的とした,リランカーのためのエンドツーエンドのトレーニングフレームワークであるGumbel Re rankを提案する。
論文 参考訳(メタデータ) (2025-02-16T13:23:39Z) - ReFIT: Relevance Feedback from a Reranker during Inference [109.33278799999582]
Retrieve-and-Rerankは、ニューラル情報検索の一般的なフレームワークである。
本稿では,リランカを利用してリコールを改善する手法を提案する。
論文 参考訳(メタデータ) (2023-05-19T15:30:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。