論文の概要: Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents
- arxiv url: http://arxiv.org/abs/2607.05690v1
- Date: Mon, 06 Jul 2026 23:16:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.349552
- Title: Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents
- Title(参考訳): ループにおけるメモリ:言語エージェントのための拡張作業メモリとしてのプロセス内検索
- Abstract要約: 言語エージェントはループ(観察、理性、行動)を実行しますが、それらが引き起こすメモリはその外にあります。
メモリがループ内を移動し、すべてのステップで読み書きされる仕組みを研究します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language agents run a loop - observe, reason, act - but the memory they reason over sits outside it: a store queried at most once per turn. We study the regime where memory moves inside the loop, read and written on every step. The obstacle has always been latency: networked stores answer in tens to hundreds of milliseconds, and in-loop retrieval can inflate end-to-end latency by up to 83x when retrieval is expensive. Prior work manages that cost rather than questioning it: serving-layer scheduling hides it, "memory-first" designs ration retrieval to once per turn. We argue latency is a property of where the store lives, not the in-loop pattern: an in-process store answers in ~100us, three orders of magnitude below the network regime, and at that speed the per-step tax collapses. By the extended-mind thesis's parity principle, a store fast enough to be constantly and directly available becomes extended working memory, not a tool the agent merely consults. The premise is causal: holding a fixed per-turn memory-latency budget and varying only the store's answer speed, redundant actions rise monotonically with latency - 0.0 of 12 at in-process speed, 7.2 of 12 at a 110ms cloud round trip (gpt-5-nano, gpt-5-mini; exact permutation p=0.0079). We demonstrate the regime end-to-end: across four GPT-5-class models under a bounded window, recall improves from 0/5 to 3.6-4.8/5 with in-loop memory, store ops at p50 80-165us - though an instructed restate-every-reply baseline also solves it perfectly, at a token cost that grows with the working set. The store never lost a fact in any run (244 of 244 writes kept); every miss traces to the agent's read policy, not the store. Our measurements also relocate the bottleneck: the dominant per-step cost is embedding (~200-400ms over the network); pairing the in-process store with a small local embedder returns the complete operation to a measured ~40us.
- Abstract(参考訳): 言語エージェントはループ(観察、理性、行動)を実行しますが、それらが引き起こすメモリはその外にあります。
メモリがループ内を移動し、すべてのステップで読み書きされる仕組みを研究します。
ネットワークストアは数ミリ秒から数百ミリ秒で応答し、ループ内検索は検索が高価である場合には、エンドツーエンドのレイテンシを最大83倍まで向上させることができる。
サービス層スケジューリングはそれを隠蔽し、"メモリファースト"設計では、1ターンに1回までレーション検索を行う。
レイテンシは、ループ内のパターンではなく、ストアの持つ特性である、と私たちは主張する: プロセス内ストアは、およそ100usで応答し、ネットワーク体制の3桁下において、その速度でステップ毎の税が崩壊する。
拡張ミンドの論文のパリティの原則により、エージェントが単に参照するツールではなく、常に利用でき、直接利用できるような高速なストアが拡張ワーキングメモリになる。
固定されたターン毎のメモリレイテンシ予算を持ち、店の応答速度だけを変える、冗長なアクションは、プロセス内速度で0.0の12、110ミリ秒のクラウドラウンドトリップで7.2の12(gpt-5-nano, gpt-5-mini; 正確な置換p=0.0079)で単調に上昇する。
条件付きウィンドウの下で4つのGPT-5クラスモデルにまたがって、リコールは0/5から3.6-4.8/5に改善され、ループ内メモリで、opsはp50 80-165usに保存される。
店は一度も事実を失わなかった(244件のうち244件が保管されている)。
プロセス内ストアと小さなローカルな埋め込み器をペアにすることで,全動作を約40usに戻す。
関連論文リスト
- PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents [85.82624962221026]
本稿では、読みを推論から切り離すPARSERを紹介する。
単一のチャンクにバインドされた軽量サブエージェントのバンクは、ドキュメント全体を並列に読み取る。
7Kから896Kまでのコンテキストを持つマルチホップQAでは、4Bバックボーンを持つPARSERが最強のシーケンシャルメモリベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-06T16:19:01Z) - A Graph-Native Bitemporal Memory Store for Conversational AI Agents [0.0]
HNSWベクトルインデックスとフルバイテンポラルデータモデルで拡張したエージェントローカルなNeo4jプロパティグラフについて述べる。
各メモリは、2つの閉時間間隔を持つバージョニングされたコンテンツノードにリンクされた不変のアイデンティティノードとして格納される。
このシステムは,長期記憶を強調するために設計された6つの質問タイプにまたがる500クエストベンチマークであるLongMemEvalで評価する。
論文 参考訳(メタデータ) (2026-07-29T06:40:52Z) - Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Selective Memory Retention for Long-Horizon LLM Agents [0.0]
TraceRetainを使用して、機能を解釈してエントリをスコアし、キャパシティの低いものを削除します。
境界保持は、飽和クリーンベンチマークのメモリとステップ効率をタスクコストなしで購入し、ストリームがノイズを含むときだけキャッシュと区別する。
論文 参考訳(メタデータ) (2026-06-28T03:46:46Z) - AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents [79.03892269184145]
我々は、記憶に値するものはロール依存であり、 textbfAdaMem (Adaptive Memory)を提案する。
AdaMemは、メモリ容量をtextbf9%削減しながら、均一なMem0ベースライン上で textbf+9.0% まで精度を向上する。
論文 参考訳(メタデータ) (2026-06-19T06:35:52Z) - AURA: Action-Gated Memory for Robot Policies at Constant VRAM [0.0]
AURA-Memは、一定サイズのリカレントメモリと学習ゲートを備えた凍結された視覚言語アクションバックボーンをラップする。
AURA-Mem は 5.19-6.13 倍の書き込みと 9.19 倍の書き込みを使用して、O(1) のベースラインを精度良く一致させる。
論文 参考訳(メタデータ) (2026-06-01T18:38:21Z) - memorywire: A Vendor-Neutral Wire Format for Agent Memory Operations [0.0]
長期的なストレージに入る前に、人間がレビューを書くことができるフレームワークであるMemorywireを紹介します。
5つのバックエンドコンポーネントによるオープンソースリファレンス実装について説明する。
16-scenario cross-adapter conformance suiteは、80細胞中68細胞を無故障で通過する。
論文 参考訳(メタデータ) (2026-05-31T10:18:56Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemGym: a Long-Horizon Memory Environment for LLM Agents [69.79226770543049]
本稿では,エージェントメモリのベンチマークであるMemGymを紹介する。
MemGymは、メモリパフォーマンスを推論、検索、ツール使用能力から切り離すメモリアイソレーションスコアを報告している。
MEMGYM-CODEQAとMEMGYM-DRの合成パイプラインは、長さ制御可能であり、各ステージでアブレーションを検証可能であり、下流のシナリオと密に整合している。
論文 参考訳(メタデータ) (2026-05-20T07:25:33Z) - MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents [20.000127976303606]
我々は、下流の応答バックボーンからメモリの入力を分離する書き込み側メモリルータであるMemを紹介する。
Memは、12Mパラメータのみをトレーニングしながら、軽量な分類ヘッドを使用してターンを格納すべきかどうかを予測する。
論文 参考訳(メタデータ) (2026-05-01T02:33:50Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning [50.486479460454866]
より安定かつ効率的な長文推論のための2つのテキスト制御ゲートを組み込んだGRU-Memを提案する。
GRU-Memは一般的に、最大400%の推論速度加速でバニラMemAgentを上回っている。
論文 参考訳(メタデータ) (2026-02-11T06:14:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。