論文の概要: Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context
- arxiv url: http://arxiv.org/abs/2608.25655v1
- Date: Wed, 26 Aug 2026 11:37:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.787257
- Title: Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context
- Title(参考訳): 右エピソードの再構築 : 長期記憶を超えた会話記憶の評価
- Authors: Zhexi Feng, Ruiyi Zhang, Yongbo Yang, Pengtao Xie,
- Abstract要約: 本稿では、エピソード整合性障害をターゲットとしたフラットな未分割スレッドに対する制約付きタスクQAベンチマークを提案する。
データセットには、10のドメインにわたる3000の監査済みの質問が含まれ、決定論的4方向の多重選択グレーディングを使用しており、決定論的ランタイムビルダーを含んでいる。
また,TSIM(Temporal-Semantic Interleaved Memory Reconstruction)を提案する。これはターンストリームをコヒーレントなエピソードに分割し,階層的なマルチビューメモリスタックを通じてインデックス化する。
- 参考スコア(独自算出の注目度): 26.90440158198578
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversations with chat assistants increasingly span many topics in a single long-running thread, challenging memory systems. Existing long-context and memory benchmarks often expose session or topic boundaries, or probe direct personal-memory questions. These settings understate a harder assistant-memory regime: a flat mixed-topic thread where the system must infer which earlier episode makes a later task decision valid. We introduce SCALE-QA, a constraint-grounded task QA benchmark for flat unsegmented threads targeting episode integrity failure. The dataset contains 3,000 audited questions across 10 domains, uses deterministic four-way multiple-choice grading, and includes a deterministic runtime builder; experiments use all 3,000 questions through 128k and a stratified 400-question diagnostic at 1M. SCALE-QA questions are ordinary task-oriented requests whose correct answer depends on causally related evidence introduced earlier in the conversation. We also propose Temporal-Semantic Interleaved Memory Reconstruction (TSIM), which segments the turn stream into coherent episodes and indexes them through a hierarchical multi-view memory stack with deterministic episode-level summary and cluster-routing views. Experiments show that SCALE-QA challenges strong RAG baselines and long-context LLMs alike; across three open-source and proprietary LLM backends, TSIM achieves the highest accuracy in every backend setting, gaining 5.6-17.6 accuracy points over the strongest corresponding baseline.
- Abstract(参考訳): チャットアシスタントとの会話は、長いスレッドで多くのトピックにまたがるようになり、メモリシステムに挑戦する。
既存の長期コンテキストとメモリのベンチマークはセッションやトピックの境界を公開したり、直接の個人記憶に関する質問を探索することが多い。
フラットな混合トピックスレッドでは、システムがどの初期エピソードが後続のタスク決定を有効にするかを推測しなければならない。
エピソード整合性障害をターゲットとしたフラットな非セグメントスレッドのための制約付きタスクQAベンチマークであるSCALE-QAを紹介する。
このデータセットには、10のドメインにわたる3000の監査済みの質問が含まれ、決定論的4方向の多重選択グレードを使用しており、決定論的ランタイムビルダーを含んでいる。
SCALE-QA質問は、会話の初期に導入された因果関係の証拠に依存する、通常のタスク指向の要求である。
また,TSIM(Temporal-Semantic Interleaved Memory Restruction)を提案する。これはターンストリームをコヒーレントなエピソードに分割し,階層的なマルチビューメモリスタックを通じてインデックス化する。
実験の結果、SCALE-QAは強力なRAGベースラインと長いコンテキストのLLMに挑戦し、3つのオープンソースおよびプロプライエタリなLLMバックエンドにおいて、TSIMはバックエンド設定毎に最高精度を達成し、最強のベースラインに対して5.6-17.6の精度ポイントを獲得している。
関連論文リスト
- CMT-RAG: Complementary Memory Traces for Multi-turn Multi-hop RAG [17.889279174355227]
本稿では,マルチターンマルチホップRAGのベンチマークである MuMu-QA と,この設定を補完するメモリフレームワークである CMT-RAG を紹介する。
MuMu-QAとコーパスレベルのRAGベンチマークは、CMT-RAGが回答精度においてRAGの5つのカテゴリを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-29T04:50:41Z) - MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - EverMemBench: Benchmarking Long-Term Interactive Memory in Large Language Models [16.865998112859604]
EverMemBenchは、100万以上のトークンにまたがる多人数のマルチグループ会話を特徴とするベンチマークである。
EverMemBenchは、1000以上のQAペアを通じて3次元にわたるメモリシステムを評価する。
論文 参考訳(メタデータ) (2026-02-01T16:13:08Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs [28.807582003957005]
本稿では,長期記憶を必要とするタスクに対する大規模言語モデル(LLM)の能力を評価するためのフレームワークを提案する。
次に、100の会話と2000の検証済みの質問からなる新しいベンチマークであるBEAMを構築します。
モデル性能を向上させるために,LLMに3つの相補的メモリシステムを備えたLIGHT-aフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-31T07:29:52Z) - MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks [67.31276358668424]
AV-HaystacksQAという新しいタスクを導入し、クエリに応答して、異なるビデオにまたがる有能なセグメントを識別し、それらをリンクして最も有意義な回答を生成する。
AVHaystacksは、マルチビデオ検索および時間的グラウンドタスクにおけるLMMの能力を評価するために設計された3100の注釈付きQAペアからなるオーディオビジュアルベンチマークである。
提案するAVHaystackのQAタスクにおけるBLEU@4およびGPT評価スコアの基準値よりも89%と65%の相対的な改善を実現し、モデルに依存しないマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-08T06:34:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。