論文の概要: Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
- arxiv url: http://arxiv.org/abs/2606.01223v1
- Date: Sun, 31 May 2026 13:16:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.394463
- Title: Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue
- Title(参考訳): ドットの接続: 長軸対話におけるリフレクティブメモリのベンチマーク
- Authors: Jingjie Lin, Bingbing Wang, Zihan Wang, Zhengda Jin, Weiming Qiao, Jing Li, Ruifeng Xu,
- Abstract要約: RefMem-Benchは長軸対話における反射メモリのベンチマークである。
REMINDのカップルは、質問条件付きエビデンス検索、サリエンス認識基盤、抽象レベルの監督を行う。
- 参考スコア(独自算出の注目度): 28.424707470781428
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite substantial progress in long-context modeling, existing benchmarks remain confined to factual memory for explicit recall, failing to measure the reflective memory required to synthesize fragmented, multimodal cues into high-level interpretations. To address this gap, we introduce RefMem-Bench, a benchmark for reflective memory in long-horizon dialogue. RefMem-Bench contains 26K annotated QA instances with eight reflective-memory dimensions and three task formats, requiring models to move beyond surface-level retrieval and infer latent meanings from evidence distributed across interaction histories. To enhance reflective memory capability, we propose REflective Memory INDuction (REMIND), a hierarchical framework that treats reflective memory as progressive meaning construction. REMIND couples question-conditioned evidence retrieval, salience-aware grounding, and abstraction-level supervision, and uses Progressive Reflective Alignment to distill high-level reflective reasoning into the factual inference pathway. Experiments show RefMem-Bench poses a substantial challenge to current models, while REMIND consistently improves both answer accuracy and memory recall through progressive evidence perception, grounding, and abstraction.
- Abstract(参考訳): 長いコンテキストモデリングの大幅な進歩にもかかわらず、既存のベンチマークは明示的なリコールのためにファクトメモリに限られており、断片化されたマルチモーダルキューを高レベルな解釈に合成するのに必要な反射メモリの測定に失敗している。
このギャップに対処するため、長軸対話におけるリフレクティブメモリのベンチマークであるRefMem-Benchを導入する。
RefMem-Benchは、8つの反射メモリ次元と3つのタスクフォーマットを持つ26Kの注釈付きQAインスタンスを含んでいる。
リフレクティブメモリ能力を高めるために,リフレクティブメモリをプログレッシブな意味構成として扱う階層型フレームワークであるReflective Memory INDuction (REMIND)を提案する。
REMINDは、疑問条件付きエビデンス検索、サリエンス認識基盤、抽象レベルの監督と、プログレッシブ・リフレクティブ・アライメント(Progressive Reflective Alignment)を用いて、事実推論経路に高レベルのリフレクティブ推論を蒸留する。
実験では、RefMem-Benchが現在のモデルに重大な課題を呈し、REMINDはプログレッシブエビデンス認識、接地、抽象化を通じて、解答精度とメモリリコールの両方を一貫して改善している。
関連論文リスト
- MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - Improving MLLMs in Embodied Exploration and Question Answering with Human-Inspired Memory Modeling [7.901667874113712]
本研究では,エピソードとセマンティックメモリをアンハングする非パラメトリックメモリフレームワークを提案する。
検索優先の推論支援パラダイムは,意味的類似性を通じてエピソード体験を想起し,視覚的推論によって検証する。
論文 参考訳(メタデータ) (2026-02-17T11:41:28Z) - REMem: Reasoning with Episodic Memory in Language Agent [32.63834745610879]
エピソードメモリを用いた構築と推論のためのフレームワークであるREMemについて述べる。
我々はREMemがMem0やHippoRAG 2のような時空間記憶システムよりも大幅に優れていることを示す。
REMemはまた、答えられない質問に対してより堅牢な拒絶行動を示す。
論文 参考訳(メタデータ) (2026-02-13T23:54:55Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Evaluating Long-Term Memory for Long-Context Question Answering [100.1267054069757]
質問応答タスクにアノテートした合成長文対話のベンチマークであるLoCoMoを用いて,メモリ拡張手法の体系的評価を行う。
以上の結果から,メモリ拡張アプローチによりトークン使用率が90%以上削減され,競争精度が向上した。
論文 参考訳(メタデータ) (2025-10-27T18:03:50Z) - In Prospect and Retrospect: Reflective Memory Management for Long-term Personalized Dialogue Agents [70.12342024019044]
大規模言語モデル(LLM)は、オープンエンド対話において大きな進歩を遂げているが、関連する情報の保持と取得ができないため、その有効性は制限されている。
本稿では,長期対話エージェントのための新しいメカニズムであるリフレクティブメモリ管理(RMM)を提案する。
RMMは、LongMemEvalデータセットのメモリ管理なしでベースラインよりも10%以上精度が向上している。
論文 参考訳(メタデータ) (2025-03-11T04:15:52Z) - MADial-Bench: Towards Real-world Evaluation of Memory-Augmented Dialogue Generation [15.64077949677469]
メモリ拡張対話システム(MADS)の有効性を評価するための新しいメモリ拡張対話ベンチマーク(MADail-Bench)を提案する。
このベンチマークは2つのタスクを別々に評価する: メモリ検索とメモリ認識は、パッシブとプロアクティブの両方のメモリリコールデータを組み込んだものである。
このベンチマークにおける最先端の埋め込みモデルと大規模言語モデルの結果は、さらなる進歩の可能性を示している。
論文 参考訳(メタデータ) (2024-09-23T17:38:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。