論文の概要: Eywa: Provenance-Grounded Long-Term Memory for AI Agents
- arxiv url: http://arxiv.org/abs/2605.30771v1
- Date: Fri, 29 May 2026 02:56:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.353616
- Title: Eywa: Provenance-Grounded Long-Term Memory for AI Agents
- Title(参考訳): Eywa:AIエージェントの長期記憶
- Authors: Resham Joshi,
- Abstract要約: 既存のメモリシステムは、情報源の証拠、抽出された事実、検索されたコンテキスト、そして応答ポリシーを1つの不透明なプロンプトパスに分解する。
私たちはEywaを紹介します。Eywaは、信念以前の証拠を中心に構築された、証明済みのメモリアーキテクチャです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents that persist across sessions need memory they can retrieve, audit, update, and erase. Existing memory systems often collapse source evidence, extracted facts, retrieved context, and answer policy into one opaque prompt path, making failures difficult to diagnose: a wrong answer may come from missing evidence, unsupported extraction, stale state, retrieval loss, or answer-model behavior. We present Eywa, a provenance-grounded memory architecture built around evidence before belief. Eywa stores immutable source evidence before deriving canonical facts, validates extracted memories against typed signals and source support, and retrieves bounded memory context through a deterministic multi-route read path with zero LLM calls inside retrieval. Retrieved context is returned separately from answer instructions, allowing the same memory substrate to be evaluated across frontier, budget, and local answer models. Under a frozen, artifact-recorded retrieval configuration, Eywa reaches 90.19% judge accuracy on the LoCoMo C1-C4 split with Claude Sonnet 4.6 write and QA roles. On LongMemEval-S, it reaches 88.2% retrieval-sufficiency accuracy. On BEAM, a 700-question technical-memory stress benchmark, it reaches 81.45% mean nugget score and 85.29% pass@score >= 0.5. Full per-question artifacts, including questions, gold answers, model answers, retrieved context, and labels, are published at https://eywa.to/research.
- Abstract(参考訳): セッション全体にわたって持続するAIエージェントには、検索、監査、更新、消去が可能なメモリが必要である。
既存のメモリシステムは、情報源の証拠、抽出された事実、抽出された文脈、そして応答ポリシーを1つの不透明な急進的な経路に分解し、失敗を診断しにくくする。
私たちはEywaを紹介します。Eywaは、信念以前の証拠を中心に構築された、証明済みのメモリアーキテクチャです。
Eywaは、標準的事実を導き出す前に不変なソースエビデンスを格納し、抽出したメモリを型付き信号とソースサポートに対して検証し、検索中のLLMコールがゼロである決定論的マルチルート読み込みパスを通じて境界付きメモリコンテキストを検索する。
検索されたコンテキストは応答命令から別々に返され、同じメモリ基板をフロンティア、予算、ローカルの応答モデルで評価することができる。
凍結されたアーティファクト記録された検索構成の下で、EywaはLoCoMo C1-C4で90.19%の判定精度を獲得し、Claude Sonnet 4.6の書き込みとQAロールを分割した。
LongMemEval-Sでは88.2%の精度で検索できる。
700の技術的メモリストレスベンチマークであるBEAMでは、平均ナゲットスコアが81.45%、パス@score >=0.5.9%に達した。
質問ごとの完全な成果物(質問、金の回答、モデル回答、検索されたコンテキスト、ラベルなど)はhttps://eywa.to/research.comで公開されている。
関連論文リスト
- DeferMem: Query-Time Evidence Distillation via Reinforcement Learning for Long-Term Memory QA [3.56156695760535]
大規模言語モデル(LLM)エージェントは、依然として長期記憶疑問応答に苦慮している。
本稿では,この問題をハイリコール候補検索とクエリ条件のエビデンス蒸留に分離する長期記憶フレームワークであるDederMemを紹介する。
LoCoMoとLongMemEval-Sでは、DeferMemはQAの精度とメモリシステムの効率性において強力なベースラインを超えている。
論文 参考訳(メタデータ) (2026-05-21T12:36:46Z) - Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory [88.81430082035617]
LLMエージェントは、蓄積された対話履歴を忠実に保存し、効率的に検索し、深く推論できるメモリシステムを必要とする。
本稿では,ソース識別子に固定された生の対話セグメントを含む3つの共存表現の粒度を格納するTriMemを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:05:06Z) - MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs [47.66730296440261]
我々は,新たなメモリが生成されるたびに記憶が取得されたことを記録した証明DAGを通じて,クレジットを後方に伝播するMemQを紹介した。
6つのベンチマークで、MemQは、一般化評価とランタイム学習の6つすべてで最高成功率を達成した。
さらに、$と$がEC-MDP構造とどのように相互作用するかを研究し、パラメータ選択と将来の研究の原則的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-05-08T18:30:24Z) - From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction [39.146761527401424]
永続的なAIメモリは、しばしば検索問題に還元される。
本稿では、信頼性の高い外部AIメモリはスキーマ基底のハーネスでなければならないと論じる。
本稿では、メモリの取り込みをオブジェクト検出、フィールド検出、フィールド値抽出に分解する反復型スキーマ対応書き込みパスを提案する。
論文 参考訳(メタデータ) (2026-04-30T14:14:02Z) - EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory [19.027571478872]
IRIS(Iterative Retrieval via Insufficiency Signals)とLaceMem(Layered Architecture for Conversational Evidence Memory)を組み合わせたEviMemを提案する。
LoCoMoでは、EviMemは、時間(73.3%から81.6%)とマルチホップ(65.9%から85.2%)の質問を4.5倍のレイテンシでMIRIXよりも精度を向上させる。
論文 参考訳(メタデータ) (2026-04-30T10:37:04Z) - Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents [0.0]
コーディングエージェントは、以前の経験、トレースの修復、リポジトリローカルな運用知識を再利用するために、ますます外部メモリに依存している。
本稿では、純トップk検索問題ではなく、選択的かつリスクに敏感な制御問題として、イシューメモリの使用を再検討する。
リスクに敏感なコンテキスト帯域メモリコントローラであるRSCB-MCを導入し,メモリ使用の有無を判断し,トップレゾリューションを注入し,複数の候補を要約し,高精度または高速リコール検索,停止,あるいはフィードバックを求める。
論文 参考訳(メタデータ) (2026-04-30T00:32:53Z) - MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search [59.98962867649009]
本稿では,メモリ成長とリトラシングに基づくエージェント検索フレームワークであるMemSearch-o1を提案する。
MemSearch-o1はクエリからメモリシードトークンからきめ細かいメモリフラグメントを成長させ、コントリビューション関数を通じてメモリを再トレースし、深く洗練し、最終的にグローバルに接続されたメモリパスを再編成する。
論文 参考訳(メタデータ) (2026-04-19T05:35:06Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs [62.116710797795314]
大規模言語モデル(LLM)は、パーソナライゼーションとタスクパフォーマンスを向上させるために、過去のインタラクションから永続的なメモリを使用することが多い。
タスクコンテキストに基づいて,LLMがメモリからの情報フローを適切に制御するかどうかを評価するベンチマークであるCIMemoriesを提案する。
論文 参考訳(メタデータ) (2025-11-18T21:51:23Z) - Open-domain Question Answering via Chain of Reasoning over Heterogeneous
Knowledge [82.5582220249183]
異種知識ソース間のシングル/マルチホップ質問に応答する新しいオープンドメイン質問応答(ODQA)フレームワークを提案する。
分離された証拠を収集するためにレトリバーにのみ依存する従来の方法とは異なり、我々の仲介者は検索された集合に対する推論の連鎖を実行する。
本システムは,2つのODQAデータセットであるOTT-QAとNQに対して,Wikipediaの表や節に対する競合性能を実現する。
論文 参考訳(メタデータ) (2022-10-22T03:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。