論文の概要: DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users
- arxiv url: http://arxiv.org/abs/2610.03020v1
- Date: Fri, 02 Oct 2026 08:57:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 09:54:32.246684
- Title: DyadMem: A Long-Term Memory Benchmark of How Agents Work with Users
- Title(参考訳): DyadMem: エージェントがユーザとどのように機能するかの長期記憶ベンチマーク
- Abstract要約: 既存のベンチマークは、主にユーザファクトや好み、ユーザ間で再利用可能なエクスペリエンスを監督する。
DyadMemはユーザサイドとURAMメモリを同一のマルチセッション軌跡に沿って共同で注釈付けする。
これには3,065エピソード、50961セッション、61,210QAインスタンスが含まれる。
- 参考スコア(独自算出の注目度): 7.981122452537278
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-term agents must remember not only what is true about a user, but also how a particular agent should work with that user as their shared history evolves. Existing benchmarks primarily supervise user facts and preferences or experience reusable across users, leaving this relationship-specific agent memory implicit. Additionally, most prior works measure the model solely with final-answer QA over long interaction histories, making the assessment still incomplete and unreliable. To this end, we introduce DyadMem with the proposed new definition User-conditioned Relational Agent Memory (URAM). DyadMem jointly annotates user-side memory and URAM along the same multi-session trajectories, resulting in 6 memory categories. To summarize, it includes 3,065 episodes, 50,961 sessions, and 61,210 QA instances, with extensive session-level Capture and Update gold annotations, query-level Recall support, and two QA settings: Gold-Memory and Full-Pipeline. Across 16 open-weight and 4 proprietary models, Gold-Memory QA is consistently strong, yet Full-Pipeline QA drops sharply. Such a gap explicitly supports our fine-grained evaluation design. Additionally, several quantitative results further reveal low Capture recall, incomplete Recall, and unsafe-deletion issues arising from even the frontier LLMs. We further conduct a rigorous experiment to validate the effectiveness of our URAM and observe the positive effects for all 20 models. In summary, DyadMem is a dual-domain, full-pipeline memory benchmark with extensive annotation efforts for advancing the domain's development.
- Abstract(参考訳): 長期的なエージェントは、ユーザについて何が真実であるかだけでなく、共有された履歴が進化するにつれて、特定のエージェントがそのユーザとどのように機能するかを記憶しなければならない。
既存のベンチマークは、主にユーザファクトや好み、ユーザ間で再利用可能なエクスペリエンスを監督し、この関係性固有のエージェントメモリを暗黙的に残します。
さらに、ほとんどの先行研究は、長い相互作用履歴に関する最終回答QAのみを用いてモデルを測定するため、評価はいまだ不完全で信頼できない。
そこで我々は,ユーザ条件付きリレーショナルエージェントメモリ(URAM)を新たに定義したDyadMemを紹介する。
DyadMemはユーザ側メモリとURAMを同一のマルチセッショントラジェクトリで注釈付けし、6つのメモリカテゴリを生成する。
要約すると、3,065エピソード、50,961セッション、61,210QAインスタンス、広範なセッションレベルのキャプチャとアップデートゴールドアノテーション、クエリレベルのリコールサポート、ゴールドメモリとフルパイプラインの2つのQA設定が含まれている。
16のオープンウェイトと4つのプロプライエタリなモデルで、Gold-Memory QAは一貫して強力だが、Full-Pipeline QAは急落している。
このようなギャップは、きめ細かい評価設計を明示的にサポートします。
さらに、いくつかの定量的結果により、フロンティアLCMでさえも、キャプチャリコールの低さ、不完全なリコール、安全でない削除の問題が明らかになった。
さらに、URAMの有効性を検証するための厳密な実験を行い、全20モデルに対する肯定的な効果を観察する。
要約すると、DyadMemはドメインの開発を進めるための広範囲なアノテーションを伴うデュアルドメインのフルパイプメモリベンチマークである。
関連論文リスト
- FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents [9.305912044747368]
FinPerMAは、凍結した縦方向の投資家軌跡に対してパーソナライズされたメモリを評価する、イベントグラウンドのベンチマークである。
完全コンテキスト構成は、全体的な精度が約0.47以上、複数選択の質問では約39%を超えない。
属性分析により、要約ベースのメモリは、パーソナライズに必要な選好信号を失いながら、事実の詳細を保存していることが示された。
論文 参考訳(メタデータ) (2026-08-04T18:00:04Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues [80.29362825271768]
LongMemEval-V2は、メモリシステムが、カスタマイズされた環境で知識のある同僚になるために必要な経験を得るのに役立つかどうかを評価するためのベンチマークである。
LME-V2には、Webエージェントの5つのコアメモリ能力をカバーする451の質問が含まれている。
AgentRunbook-Rは生の状態観察,イベント,戦略ノートのための知識プールを備えた,効率的なRAGベースのメモリであり,AgentRunbook-Cはトラジェクトリをファイルとして格納し,コードエージェントを起動して,拡張サンドボックスに証拠を収集する。
論文 参考訳(メタデータ) (2026-05-12T17:59:34Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions [22.190297901876278]
メモリエージェントに不可欠な4つのコア能力、すなわち、正確な検索、テスト時間学習、長距離理解、選択的忘れの4つを特定した。
既存のベンチマークは、限られたコンテキスト長に依存するか、書籍ベースのQAのような静的で長いコンテキスト設定用に調整されている。
メモリエージェント用に特別に設計された新しいベンチマークであるMemoryAgentBenchを紹介する。
論文 参考訳(メタデータ) (2025-07-07T17:59:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。