論文の概要: When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational Agents
- arxiv url: http://arxiv.org/abs/2609.03467v1
- Date: Thu, 03 Sep 2026 07:24:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.968562
- Title: When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational Agents
- Title(参考訳): ユーザが質問しないとき:会話エージェントにおけるコンテキスト駆動型メモリ検索のベンチマーク
- Abstract要約: LOCOMO-CONVは、Lo-CoMoから派生したメモリベンチマークで、ダイアログ、暗黙、偽造、合成の4つのスタイルを持つ。
5つの反感的メモリシステムにおいて,検索リコールとエンドツーエンドの応答等性の評価を行った。
- 参考スコア(独自算出の注目度): 21.60115070942764
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) are increas- ingly deployed as long-horizon conversational agents, motivating growing interest in mem- ory systems. However, existing benchmarks primarily evaluate memory through QA-style probing rather than in-situ conversational usage. We introduce LOCOMO-CONV, a conversa- tional memory benchmark derived from Lo- CoMo with four query styles: dialog, implicit, counterfactual, and composed. Across five rep- resentative memory systems, we evaluate both retrieval recall and end-to-end response qual- ity. Our experiments show that conversational framing exposes substantial retrieval gaps over- looked by QA benchmarks, especially on im- plicit and composed queries, which multi-facet query rewriting narrows for raw-turn mem- ory but not abstractive memory. We further find that strong retrieval does not fully trans- late into response quality, and that implicit queries exhibit silent grounding, where mem- ory improves contextual grounding without ex- plicitly surfacing the gold fact. These results point to reasoning-based memory elaboration as a promising direction, and we release aux- iliary supportive_memory annotations captur- ing conversationally useful context beyond the original gold evidence.
- Abstract(参考訳): 大規模言語モデル(LLM)は、長距離会話エージェントとして包括的に展開され、mem- oryシステムへの関心の高まりを動機付けている。
しかし、既存のベンチマークでは、会話中の使用ではなく、QAスタイルの探索によるメモリ評価が主である。
LOCOMO-CONVは,対話型,暗黙型,偽造型,合成型の4種類のクエリスタイルを持つ,Lo-CoMoから派生したコンバータ・オプショナルメモリベンチマークである。
5つの反感的メモリシステムにおいて,検索リコールとエンドツーエンドの応答等性の評価を行った。
実験の結果,対話型フレーミングはQAベンチマーク,特にIm-plicitとCommand queryにおいて,生のターンメモリでは難解であるが,抽象メモリでは難解であることがわかった。
さらに、強い検索が応答品質に完全に遅れることはなく、暗黙のクエリはサイレントグラウンドングを示し、mem- oryはゴールド事実を疑うことなく文脈グラウンドニングを改善する。
これらの結果は、推論に基づくメモリエラボレーションが有望な方向であることを示唆し、元のゴールドエビデンスを超えた会話上有用なコンテキストをAux- iliary Supportive_Memoryアノテーションcaptur-ingでリリースする。
関連論文リスト
- CueMem: Cue-Guided Context Reconstruction for Long-Term Conversational Memory [38.76918926805768]
CueMemは、抽出されたメモリレコードを検索キューとして扱うキュー誘導フレームワークである。
ソースターンからクエリ関連対話コンテキストを再構築する。
LoCoMoとLongMemEvalの実験によると、CueMemは長期的なメモリベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-09-11T02:27:22Z) - Where to Look and What to Use: Retrieve-Localize-Generate for Long-Term Conversational Memory Question Answering [42.31517185994942]
RAGは、外部知識にアクセスすることによって、大きな言語モデルで質問に答えることを可能にする。
既存の方法は、時間的に離れたセッションに散在する断片化されたエビデンスと、中途半端な効果を誘発する検索セッション内のノイズのある内容の2つの主要な課題に悩まされている。
本稿では,長期会話メモリQAのための検索・ローカライズ・ジェネレーション統合フレームワークであるMemLocを提案する。
論文 参考訳(メタデータ) (2026-09-07T06:32:12Z) - CMT-RAG: Complementary Memory Traces for Multi-turn Multi-hop RAG [17.889279174355227]
本稿では,マルチターンマルチホップRAGのベンチマークである MuMu-QA と,この設定を補完するメモリフレームワークである CMT-RAG を紹介する。
MuMu-QAとコーパスレベルのRAGベンチマークは、CMT-RAGが回答精度においてRAGの5つのカテゴリを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-29T04:50:41Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - D-Mem: A Dual-Process Memory System for LLM Agents [3.5426740232689604]
本稿では,デュアルプロセスメモリシステムD-Memを紹介する。
ルーチンクエリに対する軽量なベクトル検索を維持しながら、フルリベレーションモジュールを高忠実度フォールバックとして確立している。
GPT-4o-miniとQwen3-235B-Instructを用いたLoCoMoとRealTalkのベンチマーク実験により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-19T08:55:22Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework for LLM Agents [19.76627324918285]
我々は,cue-trigger セマンティック・ディコネクションの下で認知記憶を評価するためのベンチマークである textbfLoCoMo-Plus を紹介する。
従来の文字列マッチングの指標と明示的なタスクタイププロンプトが,このようなシナリオと一致していないことを示す。
多様なバックボーンモデル、検索ベースの方法、メモリシステムによる実験は、認知記憶が依然として困難であることを証明している。
論文 参考訳(メタデータ) (2026-02-11T10:22:35Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Evaluating Long-Term Memory for Long-Context Question Answering [100.1267054069757]
質問応答タスクにアノテートした合成長文対話のベンチマークであるLoCoMoを用いて,メモリ拡張手法の体系的評価を行う。
以上の結果から,メモリ拡張アプローチによりトークン使用率が90%以上削減され,競争精度が向上した。
論文 参考訳(メタデータ) (2025-10-27T18:03:50Z) - From Single to Multi-Granularity: Toward Long-Term Memory Association and Selection of Conversational Agents [79.87304940020256]
大言語モデル(LLM)は会話エージェントで広く採用されている。
MemGASは、多粒度アソシエーション、適応選択、検索を構築することにより、メモリ統合を強化するフレームワークである。
4つの長期メモリベンチマークの実験により、MemGASは質問応答と検索タスクの両方において最先端の手法より優れていることが示された。
論文 参考訳(メタデータ) (2025-05-26T06:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。