論文の概要: Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
- arxiv url: http://arxiv.org/abs/2607.24368v1
- Date: Mon, 27 Jul 2026 12:42:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.41981
- Title: Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
- Title(参考訳): Keep it InMind:エージェントメモリにおけるインシシト・アソシエーション・ブラインドスポットのベンチマーク
- Authors: Ruizhe Li, Mingxuan Du, Benfeng Xu, Zhendong Mao,
- Abstract要約: 長期記憶システムは、ユーザが外部ストアで言ったことを格納し、関連するクエリが到着したときにそれを検索する。
このインターフェースは、非常に自然な仮定に基づいており、滅多に述べられません:必要なメモリは、それを必要とするクエリに似ているでしょう。
この障害モードを暗黙の連想盲点と呼び、10つの生命ドメインにまたがるベンチマークであるInMindを紹介します。
- 参考スコア(独自算出の注目度): 32.094723684433895
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-term memory systems store what a user says in an external store and retrieve it when a related query arrives. This interface rests on an assumption so natural that it is rarely stated: a memory that is needed will resemble the query that needs it. World knowledge breaks the assumption. A tree-nut allergy should change the answer to a macaron request through their almond-flour ingredient, yet the two texts share no cue a retriever can see. We call this failure mode the implicit-association blind spot and introduce InMind, a 125-task, expert-verified benchmark spanning ten life domains, with 113 tasks grounded in citable public sources. Its paired controls separate three explanations that existing evaluations conflate: the fact was never stored, the model lacks the bridging knowledge, or the fact was stored and never surfaced. The verdict is clean. With the decisive memory placed in context, the backbone answers 84.0 percent of indirect queries; when the same memory must be retrieved, six vector, graph, and agentic memory systems reach at most 14.4 percent, even though they recall the same facts on demand at up to 100 percent. An embedding with eight times the dimensionality raises answer-blind target recall for every system yet leaves the gap essentially intact. A minimal diagnostic probe that keeps memory visible before the query arrives recovers most of the gap, locating the failure in the query-conditioned interface itself and pointing to routing, deciding which facts must stay visible, as the open problem InMind is built to score.
- Abstract(参考訳): 長期記憶システムは、ユーザが外部ストアで言ったことを格納し、関連するクエリが到着したときにそれを検索する。
このインターフェースは、非常に自然な仮定に基づいており、滅多に述べられません:必要なメモリは、それを必要とするクエリに似ているでしょう。
世界的知識が仮定を破る。
木の実アレルギーは、アーモンド・フロアの成分を通してマカロンの要求に対する答えを変更するべきであるが、この2つのテキストは、レトリバーが見ることができるキューを共有しない。
この障害モードを暗黙の連想盲点と呼び、125タスクで10のライフドメインにまたがる専門家認証ベンチマークであるInMindを紹介します。
そのペア化されたコントロールは、既存の評価が強調する3つの説明を分離している。事実は保存されず、モデルはブリッジングの知識を欠いている。
評決は清潔です。
決定的なメモリがコンテキストに置かれると、バックボーンは84.0パーセントの間接クエリを答え、同じメモリを検索しなければならないとすると、6つのベクトル、グラフ、エージェントメモリシステムが最大14.4%に達する。
次元の8倍の埋め込みによって、すべてのシステムに対する応答盲点のターゲットリコールが引き起こされるが、ギャップは基本的に無傷のままである。
クエリが到着する前にメモリの可視性を維持する最小限の診断プローブがギャップの大部分を回復し、クエリ条件付きインターフェース自体の障害を特定し、ルーティングを指示し、オープンな問題であるInMindが得点するために構築されているように、どの事実が可視でなければならないかを判断する。
関連論文リスト
- MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery [58.64329475683699]
我々は、長期記憶は監査可能な相互作用後のアーティファクトとして評価されるべきであると主張している。
我々は、メモリを備えたエージェントがシミュレーションユーザを支援するベンチマークであるMEMPROBEで、このビューをインスタンス化する。
私たちは、成功したアシストと回復可能なメモリが、異なる機能として振る舞うことに気付きました。
論文 参考訳(メタデータ) (2026-06-23T13:52:46Z) - Eywa: Provenance-Grounded Long-Term Memory for AI Agents [0.0]
既存のメモリシステムは、情報源の証拠、抽出された事実、検索されたコンテキスト、そして応答ポリシーを1つの不透明なプロンプトパスに分解する。
私たちはEywaを紹介します。Eywaは、信念以前の証拠を中心に構築された、証明済みのメモリアーキテクチャです。
論文 参考訳(メタデータ) (2026-05-29T02:56:35Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory [80.97855900579512]
既存の評価では、エージェントが後続の推論に必要な視覚的証拠を保存するかどうかを検査することはめったにない。
メモリ性能を2次元から評価するフレームワークであるMemEyeを紹介する。
本フレームワークでは,8つのライフシナリオタスクにまたがる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-14T17:37:52Z) - From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction [39.146761527401424]
永続的なAIメモリは、しばしば検索問題に還元される。
本稿では、信頼性の高い外部AIメモリはスキーマ基底のハーネスでなければならないと論じる。
本稿では、メモリの取り込みをオブジェクト検出、フィールド検出、フィールド値抽出に分解する反復型スキーマ対応書き込みパスを提案する。
論文 参考訳(メタデータ) (2026-04-30T14:14:02Z) - MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search [59.98962867649009]
本稿では,メモリ成長とリトラシングに基づくエージェント検索フレームワークであるMemSearch-o1を提案する。
MemSearch-o1はクエリからメモリシードトークンからきめ細かいメモリフラグメントを成長させ、コントリビューション関数を通じてメモリを再トレースし、深く洗練し、最終的にグローバルに接続されたメモリパスを再編成する。
論文 参考訳(メタデータ) (2026-04-19T05:35:06Z) - Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo [0.0]
我々は、脳にインスパイアされた構造化されたペルソナメモリシステムであるSynthius-Memを、根本的に異なるアプローチで紹介する。
LoCoMoのベンチマークでは、Synthius-Memは94.37%の精度を達成し、全システムを超える。
Synthius-Memはトークン使用量をフルコンテキストのリプレイに比べて5倍削減し、精度の向上を実現している。
論文 参考訳(メタデータ) (2026-04-13T14:47:48Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects [11.300084544174894]
エージェントメモリを推論のための構造化第1級基板として扱うメモリアーキテクチャであるHindsightを提案する。
情報の追加、アクセス、更新の方法を管理する3つのコア操作 – 保持、リコール、リフレクション – をサポートしている。
オープンソースの20Bモデルは、全文ベースラインで全体の精度を39%から83.6%に引き上げる。
論文 参考訳(メタデータ) (2025-12-14T19:47:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。