論文の概要: Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks
- arxiv url: http://arxiv.org/abs/2605.24060v1
- Date: Fri, 22 May 2026 02:53:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 15:02:06.976991
- Title: Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks
- Title(参考訳): 同じランク付けと異なる勝者: ScoringはどのようにしてLLMメモリベンチマークを形作るか
- Authors: Sugam Panthi, Rabab Abdelfattah,
- Abstract要約: 会話記憶システムは対話履歴を事実、要約、タイムライン、および他のソースリンクされた子孫に変換する。
どのストアドフォームが検索クレジットを受け取るべきか?
このスコアリング対象の選択は、しばしば暗黙的に残され、ベンチマークの結論を実質的に変更できることを示す。
- 参考スコア(独自算出の注目度): 2.9089118242427627
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational-memory systems increasingly transform dialogue history into facts, summaries, timelines, and other source-linked descendants, so a single source turn can coexist with several derived memories in the same retrieval index. This raises an underspecified evaluation question: which stored form should receive retrieval credit? We show that this scoring-target choice is often left implicit and can materially change benchmark conclusions. We present TIAP, a fixed-output audit that rescores saved ranked outputs under three targets -- Raw, Source, and Canonical -- without rerunning retrieval. On LoCoMo and LongMemEval-S, switching only the credited target changes nDCG on 83.4--94.0 percent of shared queries, flips target orderings on Mem0 and MemoryOS transfer runs, and reverses parser-density recommendations. A 1,902-case semantic audit further shows that relaxed source-linked credit is fully justified only 29.2 percent of the time, despite high rubric reliability in a validation subset. These results reveal target noninvariance: conclusions about memory architectures can silently flip with a single benchmark-design choice. Conversational-memory papers should therefore define and report the scoring target explicitly.
- Abstract(参考訳): 会話記憶システムは、対話履歴を事実、要約、タイムライン、その他のソースリンクされた子孫に変換する傾向にあるため、単一のソースターンは、同じ検索インデックス内の複数の派生メモリと共存することができる。
どのストアドフォームが検索クレジットを受け取るべきか?
このスコアリング対象の選択は、しばしば暗黙的に残され、ベンチマークの結論を実質的に変更できることを示す。
我々は、検索を再実行することなく、3つの目標(Raw、Source、Canonicalの3つの目標)にランク付けされた出力を再スコアする固定出力監査であるTIAPを提示する。
LoCoMoとLongMemEval-Sでは、共有クエリの83.4--94.0パーセントで認証対象変更nDCGのみを切り替え、Mem0とMemoryOS転送のターゲット順序を反転させ、パーサ密度の推奨を反転させる。
1,902ケースのセマンティック監査では、検証サブセットの信頼性が高いにもかかわらず、ソースリンクされた信用が完全に29.2%しか正当化されていないことが示されている。
メモリアーキテクチャに関する結論は、単一のベンチマーク設計選択でサイレントに反転することができる。
したがって、会話記憶紙は、スコアリング対象を明示的に定義し、報告すべきである。
関連論文リスト
- MemMark: State-Evolution Attribution Watermarking for Agent Long-Term Memory Systems [13.133650395551507]
メモリベースのエージェントは、リークされたスナップショットや移行されたスナップショットを生き残るための証明を必要とする。
MemMarkは、オーナー制御シグナルを潜在メモリ書き込み決定に埋め込む。
MemMarkは、生き残ったトレース、信頼できるメタデータ、ユーティリティ劣化のない長期的なエージェントメモリで実現可能である。
論文 参考訳(メタデータ) (2026-05-24T11:04:35Z) - What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema [0.0]
筆者らは、よく知られた12のLSMエージェントベンチマーク論文を読み、各論文が実際にどのように評価されたか、寸法によって記録した。
私たちは、小さな監査スキーマを設計しました(5つのフィールド:ベンチマークアイデンティティ、ハーネス仕様、推論設定、コストレポート、障害の分解)。
我々はエージェントランの開示を正当性ではなくスコア付けし、開示が信頼できる結果を意味するという主張をしない。
論文 参考訳(メタデータ) (2026-05-20T17:02:36Z) - Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory [88.81430082035617]
LLMエージェントは、蓄積された対話履歴を忠実に保存し、効率的に検索し、深く推論できるメモリシステムを必要とする。
本稿では,ソース識別子に固定された生の対話セグメントを含む3つの共存表現の粒度を格納するTriMemを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:05:06Z) - Goal-Oriented Reasoning for RAG-based Memory in Conversational Agentic LLM Systems [20.461904943047468]
Goal-Memは、RAGベースのエージェントメモリのためのゴール指向の推論フレームワークである。
Goal-Memはマルチホップ推論と暗黙推論を必要とするタスクのパフォーマンスを一貫して改善する。
論文 参考訳(メタデータ) (2026-05-12T14:51:02Z) - Belief Memory: Agent Memory Under Partial Observability [56.41506249481312]
本稿では,メモリパラダイムを観測毎に1つの結論にシフトし,その確率で複数の結論を導出するBeliefMemを提案する。
BeliefMemは決定論的パラダイムが破棄されるという不確実性を保ち、エージェントが高い信頼を持って行動することを可能にする。
LoCoMoとALFWorldベンチマークの実証的な評価は、限られたデータであっても、BeliefMemが最高の平均パフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2026-05-07T02:03:13Z) - Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval [59.295767860331004]
RF-Memは、親しみやすい不確実性誘導デュアルパスメモリレトリバーである。
それは、人間のようなデュアルプロセス認識をレトリバーに埋め込む。
一定の予算とレイテンシの制約の下で、ワンショット検索とフルコンテキスト推論を一貫して上回る。
論文 参考訳(メタデータ) (2026-03-10T06:31:44Z) - MemGuide: Intent-Driven Memory Selection for Goal-Oriented Multi-Session LLM Agents [46.21840714172862]
インテント駆動型メモリ選択のための2段階フレームワークであるMemGuideを紹介する。
MemGuideは、現在の対話コンテキストとメモリバンク内の格納されたインテント記述とを一致させる。
Missing-Aligned Guided Filteringでは、チェーンオブソートスロット推論器を使用して未充填スロットを列挙し、微調整のLLaMA-8Bフィルタを使用して検索したユニットを再ランクする。
論文 参考訳(メタデータ) (2025-05-26T17:10:43Z) - Unlocking the Power of SAM 2 for Few-Shot Segmentation [54.562050590453225]
Few-Shot (FSS) は、少数のクラスでクラスに依存しないセグメンテーションを学習し、任意のクラスをセグメンテーションすることを目的としている。
近年、SAM 2は、クラスに依存しないマッチング能力を持つビデオセグメンテーションをサポートしてSAMを拡張している。
擬似クエリメモリを符号化するPseudo Prompt Generatorを設計し、クエリ機能と互換性のある方法でマッチングする。
さらに、メモリにより多くのクエリFG機能を融合させる反復メモリリファインメントを設計し、メモリの予期せぬクエリBG機能を抑制するためのサポートキャリブレーションメモリアテンションを考案する。
論文 参考訳(メタデータ) (2025-05-20T09:02:53Z) - vCache: Verified Semantic Prompt Caching [95.16654660556975]
本稿では,ユーザ定義エラー率保証を備えた最初の検証済みセマンティックキャッシュであるvCacheを提案する。
オンライン学習アルゴリズムを使用して、キャッシュされたプロンプト毎に最適な閾値を推定し、追加のトレーニングなしで信頼性の高いキャッシュ応答を可能にする。
我々の実験によると、vCacheは特定のエラー境界を一貫して満たし、最先端の静的な閾値と微調整された埋め込みベースラインより優れています。
論文 参考訳(メタデータ) (2025-02-06T04:16:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。