論文の概要: Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration
- arxiv url: http://arxiv.org/abs/2607.16848v1
- Date: Sat, 18 Jul 2026 15:09:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.271376
- Title: Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration
- Title(参考訳): メモリ以上のリーダーボード - 予算付きコンテキスト復元としての科学的記憶の評価
- Authors: Maksim Sheverev, David Finkelstein, Sergey Nikolenko,
- Abstract要約: 我々は2つのフルテキスト科学メモリベンチマーク、Public AI Memory(PAIM)とPublic Transformers(PTr)を紹介する。
提案するセオリアを含む8つのメモリ/検索システムと,非検索ベースラインを評価した。
その結果,メモリリーダボードは完全なプロトコルなしでは解釈できないことがわかった。
- 参考スコア(独自算出の注目度): 0.05097809301149341
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-term memory is becoming a core component of LLM agents, but most memory benchmarks evaluate conversations or compact summaries, while research agents need to restore evidence from full scientific papers. We introduce two full-text scientific-memory benchmarks, Public AI Memory (PAIM; 81 papers, 66 questions) and Public Transformers (PTr; 252 papers, 98 questions). We evaluate eight memory/retrieval systems, including our own proposed Theoria, plus a no-retrieval baseline. Our results show that memory leaderboards are not interpretable without the full protocol: ingestion granularity, raw-text preservation, retrieval budget, retrieval modality, rubric audit, and judge choice all affect the outcome. For example, on PAIM Graphiti wins convincingly but uses 2.6M characters of retrieved context per query, and after controlling for retrieval budget the lead disappears. On PTr, for the systems where BM25 retrieval can be added cleanly, the sparse-dense hybrid is the single most significant intervention: hybrid variants of Simple RAG, Mem0, and Theoria tie for the lead within 0.03 points. Multi-judge and human side-by-side calibration show that LLM-as-a-judge rankings are consistent across frontier judges and agree with human evaluation, with an effective resolution of roughly one point on a ten-point scale. We argue that scientific memory should be evaluated as budgeted, modality-aware context restoration rather than as an unconstrained architecture leaderboard, and we release the datasets, harness, raw outputs, judgments, and scripts to reproduce our results and serve as tools for such evaluation. Our code is available at http://gitlab.com/quantellence/research/scientific-recall-bench , and the datasets are available at http://huggingface.co/datasets/quantellence/srb-data .
- Abstract(参考訳): 長期記憶はLLMエージェントのコアコンポーネントになりつつあるが、ほとんどのメモリベンチマークは会話や要約を評価し、研究エージェントは完全な科学論文から証拠を復元する必要がある。
我々は,2つのフルテキスト科学メモリベンチマーク,Public AI Memory(PAIM;81論文,66質問)とPublic Transformer(PTr;252論文,98質問)を紹介する。
提案するセオリアを含む8つのメモリ/検索システムと,非検索ベースラインを評価した。
以上の結果から, メモリリーダボードは, 摂取粒度, 原文保存, 検索予算, 検索モダリティ, ルーリック監査, 判断選択など, 完全なプロトコルなしでは解釈できないことが明らかとなった。
例えば、PAIM Graphitiでは説得力があるが、クエリ毎に検索されたコンテキストの260万文字を使用し、検索予算を制御した後、リードは消滅する。
PTrでは、BM25の検索をきれいに追加できるシステムにおいて、スパース・デンス・ハイブリッドは唯一の重要な介入である:Simple RAG、Mem0、Theoriaのハイブリッド変種は0.03ポイント以内である。
マルチジャッジとヒューマン・バイ・バイ・サイドキャリブレーションは,LLM-as-a-judgeランキングがフロンティアの審査員間で一貫しており,人間の評価と一致していることを示している。
科学記憶は、制約のないアーキテクチャのリーダーボードとしてではなく、予算的な、モダリティに配慮したコンテキスト復元として評価されるべきであり、我々はデータセット、ハーネス、生の出力、判断、スクリプトを公開し、その結果を再現し、そのような評価のためのツールとして機能する。
私たちのコードはhttp://gitlab.com/quantellence/research/scientific-recall-benchで、データセットはhttp://huggingface.co/datasets/quantellence/srb-dataで利用可能です。
関連論文リスト
- MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents [1.8047694351309203]
物理環境で動作するエンボディエージェントのためのハイブリッドグラフベースメモリシステムeMEMを提案する。
eMEMはこのギャップをマルチインデックスアーキテクチャ(構造化ストレージ用ITE、近傍セマンティックサーチ用hlib、空間クエリ用Rツリー)で埋める。
また,eMEM-Bench v1は,メモリ評価のためのProcTHOR-10Kシーン上で構築したベンチマークである。
論文 参考訳(メタデータ) (2026-06-02T09:22:12Z) - Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory [50.857546269660276]
本稿では,大規模言語モデル(LLM)メモリを逐次進化させる診断評価フレームワークであるSeqMem-Evalを紹介する。
最終的なパフォーマンスのみに焦点を当てるのではなく、SeqMem-Evalは、シーケンシャル推論において、メモリ状態がどのように進化し、一般化し、エクスペリエンスを集約し、有用な情報を保持するかを評価する。
論文 参考訳(メタデータ) (2026-05-14T20:15:22Z) - From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction [39.146761527401424]
永続的なAIメモリは、しばしば検索問題に還元される。
本稿では、信頼性の高い外部AIメモリはスキーマ基底のハーネスでなければならないと論じる。
本稿では、メモリの取り込みをオブジェクト検出、フィールド検出、フィールド値抽出に分解する反復型スキーマ対応書き込みパスを提案する。
論文 参考訳(メタデータ) (2026-04-30T14:14:02Z) - When to Forget: A Memory Governance Primitive [0.0]
Memory Worthはメモリ当たりの2カウンタ信号で、メモリが成功と失敗を共起する頻度を追跡する。
MW は条件付き成功確率 p+(m) = Pr[y_t = +1 | m in M_t] にほぼ確実に収束することを示す。
これは今でもメモリ管理にとって有用な操作信号であり、制御された合成環境で実証的に検証する。
論文 参考訳(メタデータ) (2026-04-13T19:54:14Z) - ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models [60.14219417402433]
LLMエージェントの既存のメモリベンチマークは、事実の明示的なリコールを評価するが、意識的な検索なしに、経験が自動的な振る舞いになる暗黙の記憶を見落としている。
IndicitMemBenchは、非宣言的メモリの標準的な認知科学のアカウントから引き出された3つの構造を通して暗黙的メモリを評価する最初の体系的なベンチマークである。
当社の300イテムスイートでは,初動採点を備えたLearning/Priming-Interfere-Testプロトコルを統一しています。
論文 参考訳(メタデータ) (2026-04-09T10:26:32Z) - Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory [6.493102878734374]
我々は、書き込み戦略、検索方法、メモリ利用行動における性能差がどのように現れるかを分析する。
LoCoMoでは、検索方法が主流である。
フェール分析は、パフォーマンスの低下が、利用ではなく、検索段階で最も多く現れることを示している。
論文 参考訳(メタデータ) (2026-03-02T23:47:23Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions [55.19217798774033]
メモリは、大規模言語モデル(LLM)ベースのエージェントを支える、AIシステムの基本コンポーネントである。
本稿ではまず,メモリ表現をパラメトリックおよびコンテキスト形式に分類する。
次に、コンソリデーション、更新、インデックス付け、フォッティング、検索、圧縮の6つの基本的なメモリ操作を紹介します。
論文 参考訳(メタデータ) (2025-05-01T17:31:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。