論文の概要: RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts
- arxiv url: http://arxiv.org/abs/2607.16716v1
- Date: Sat, 18 Jul 2026 09:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.233305
- Title: RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts
- Title(参考訳): RECON: 長期にわたるコンポジション推論のためのベンチマークエージェントメモリ
- Authors: Mihir Shriniwas Arya,
- Abstract要約: RECONは、長い文脈における構成的推論を評価するためのベンチマークである。
3つのドメイン(刑事、医療、財務)に24のケースファイルがあり、それぞれ50万から100万のトークンがある。
マルチホップエビデンスチェーンの再構築、カスケード無効の伝播、ソースコンフリクトの解決、反ファクト推論、時間的制約を満たすこと、時間的事実検索である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models and LLM-based agents are widely used as personal chat assistants, enterprise copilots, and autonomous workflow agents. In all these applications, memory (the ability to retain, access, and reason over information accumulated over long contexts and multiple interactions) plays a crucial role in determining the reliability of any agent. We introduce RECON (Reasoning over Extended Contexts with Obfuscated Narratives), a benchmark for evaluating compositional reasoning over long contexts. RECON spans 24 case files across three domains (criminal, medical, and financial), each ranging from 50k to 100k tokens, and tests agents on six memory intensive tasks: reconstructing multi-hop evidence chains, propagating cascading invalidations, resolving source conflicts, counterfactual reasoning, satisfying temporal constraints, and temporal fact retrieval. Recent memory benchmarks evaluate whether agents can retrieve scattered facts or detect if a fact has changed whereas RECON evaluates what happens after the change, whether agents can trace which downstream conclusions are affected, which survive through independent support, and how alternative timelines would have unfolded. Our evaluation reveals substantial limitations across current architectures: even the strongest non-Oracle system reaches only 22.4% Accuracy, with retrieval and reasoning each surfacing as challenges.
- Abstract(参考訳): 大規模言語モデルとLLMベースのエージェントは、パーソナルチャットアシスタント、エンタープライズコピロ、自律ワークフローエージェントとして広く使用されている。
これらすべてのアプリケーションにおいて、メモリ(長期のコンテキストと複数のインタラクションに蓄積された情報の保持、アクセス、理性)は、エージェントの信頼性を決定する上で重要な役割を担います。
本稿では,長期にわたる構成的推論を評価するベンチマークであるRECON(Reasoning over Extended Contexts with Obfuscated Narratives)を紹介する。
RECONは3つのドメイン(刑事、医療、財務)に24のケースファイルがあり、それぞれ50kから100kのトークンがあり、マルチホップエビデンスチェーンの再構築、カスケード無効化の伝播、ソースコンフリクトの解決、反事実的推論、時間的制約の満足、時間的事実検索という6つのメモリ集約的なタスクでエージェントをテストする。
最近のメモリベンチマークでは、エージェントが散在した事実を検索できるか、あるいは事実が変わったかを検出することができるかが評価されている。
最強の非Oracleシステムでさえ22.4%の精度に達し、検索と推論が課題として直面する。
関連論文リスト
- MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents [14.695250837875454]
本稿では,ActMemと呼ばれる新しい動作可能なメモリフレームワークを提案する。
ActMemは非構造化対話履歴を構造化因果グラフと意味グラフに変換する。
エージェントは暗黙の制約を推論し、過去の状態と現在の意図の間の潜在的な衝突を解決することができる。
論文 参考訳(メタデータ) (2026-02-04T00:54:53Z) - AgentLongBench: A Controllable Long Benchmark For Long-Contexts Agents via Environment Rollouts [78.33143446024485]
我々は、横方向思考パズルに基づく環境ロールアウトによるエージェントの評価を行うtextbfAgentLongBenchを紹介した。
このフレームワークは、知識集約的で知識のないシナリオにまたがる厳密な相互作用の軌跡を生成する。
論文 参考訳(メタデータ) (2026-01-28T16:05:44Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning [22.89546852658161]
時間的知識グラフは時間的推論の信頼できる情報源を提供する。
既存の TKG ベースの LLM 推論手法は、4つの大きな課題に苦慮している。
メモリ拡張時間知識グラフフレームワークであるMemoTimeを提案する。
論文 参考訳(メタデータ) (2025-10-15T14:43:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。