論文の概要: Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents
- arxiv url: http://arxiv.org/abs/2607.20972v1
- Date: Thu, 23 Jul 2026 06:50:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.301973
- Title: Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents
- Title(参考訳): デリバリー、ストレージではなく:コーディングエージェントのハーネス特性としてのキューアンコールワーキングメモリ
- Abstract要約: コーディングエージェントは1つの種類のメモリで出荷される。
人間の専門知識は、決して書き下されることのない第2階層で実行されます。
この2番目の層は、長時間稼働するエージェントのためのロードバランシング層である、と私たちは主張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents ship with one kind of memory: documents. Instruction files, plan artifacts, and auto-written memory directories are deliberately authored and deliberately retrieved: the agent must choose to write them and choose to read them back. Human expertise runs on a second tier that never gets written down: situationally-bound operational facts (gotchas, locations, local conventions) encoded as a side effect of the work and retrieved involuntarily when the situation cues them. We argue this second tier is the load-bearing one for long-running agents and must be a harness property, not an agent choice. We contribute: (1) a two-tier design theory grounded in the cognitive literature on memory offloading, incidental encoding, and event-based prospective memory, each mapped to an architectural requirement; (2) a cue-anchored memory model where memories carry first-class trigger conditions over a composable vocabulary (path, symbol, semantic, event, temporal), evaluated deterministically by the harness, a composition no surveyed academic or shipped system provides; (3) a controlled evaluation on a real coding task showing that voluntary memory use is near zero even with a pre-seeded store (0 memory operations in 114 turns), that deterministic injection delivered in every seeded run with zero false alarms, and that 39% of intra-session re-reads re-buy content paid for before a compaction boundary; (4) a repeated-compaction decay probe: ten facts held only in conversation vanish at the first summary and stay absent from 106 of 108 compactions, and the deprived agent greps the harness's own session files to rebuild them, while the same facts injected from a harness-owned store arrive intact through all 138 compact-resumes as the final summary carries none. Delivery, not storage, is the product: the reliable memory channel for agents is the one the agent never has to think about.
- Abstract(参考訳): コーディングエージェントは1つの種類のメモリで出荷される。
命令ファイル、計画アーティファクト、自動書き起こされたメモリディレクトリは意図的に作成され、意図的に検索される。
状況に縛られた運用上の事実(ゴッチャ、場所、地域の慣習)は、作業の副作用としてエンコードされ、状況が引き起こされたときに自発的に回収されます。
この2番目の層は、長時間稼働するエージェントのための負荷を持つ層であり、エージェントの選択ではなく、ハーネスプロパティでなければならない、と我々は主張する。
1) メモリオフロード、インシデントエンコーディング、イベントベースの予測メモリに関する認知文学に基づく2層設計理論をアーキテクチャ要件にマッピングし、(2) メモリが構成可能なボキャブラリ(パス、シンボル、セマンティック、イベント、時間)上で第一級トリガ条件を伝達するキューアンコールメモリモデル、そのハーネスによって決定的に評価される構成、非サーベイド学術または出荷システムによる構成、(3) 任意のメモリ使用がプレシードストア(0メモリ操作114回で0回)でもほぼゼロに近いこと、そして、すべてのシードランで配信される決定論的インジェクションの39%が偽のアラームで完結する前に納されること、(4) 最初の106件のインセプティビティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンの108件から108件のコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンプティコンに留まったこと。
エージェントの信頼性の高いメモリチャネルは、エージェントが考える必要のないものなのです。
関連論文リスト
- VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - MELD: A Protocol for Merging Knowledge Across Distributed Agentic Memories [2.2541665241198534]
MELDは、エージェントメモリのフェデレーションのための自己管理コヒーレンス機構である。
それぞれの脳は5アウトカムの手順で全てのクレームを受信する。
HotpotQAorでは、分散マージが中央集中ストアにリコールされる。
論文 参考訳(メタデータ) (2026-08-17T10:09:06Z) - Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem [12.078734827417685]
メモリが何であるか、いつ最適かに関する統一的な公式な説明はない。
中心的な考え方は、記憶は基礎であり、知識はその範囲であり、答え可能性はカバレッジの問題である。
最適なメモリは、期待されるカバレッジのキャパシティ制限された最大値である。
論文 参考訳(メタデータ) (2026-08-12T04:54:26Z) - Harnessing agent memory to build lifelong AI partners for materials scientists [9.774511876116415]
我々は、物質科学のための生涯にわたるAIパートナーは、特定のエージェントの実装よりも永続的なメモリを中心に設計できると主張している。
科学的な経験を検査可能な事実と実行可能なスキルとして保存する自己進化型メモリフレームワークを導入し、観察、障害境界、プロトコル、バリデーションチェックをモデル間で検索し、修正し、移行できるようにする。
これらの結果から, エージェントメモリは, 単一のモデルやエージェントスタックを超越した, ポータブルで自己改善された材料検索体験の記録として, 耐久性のある科学的資産として機能することを示す。
論文 参考訳(メタデータ) (2026-07-25T09:11:52Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory [9.041305193333434]
メモリは、長年にわたるAIエージェントの中核的なコンポーネントになりつつある。これにより、エージェントは、Webブラウザやソフトウェアツール、その他のインタラクティブな環境を操作する際に、過去の経験を再利用することができる。
既存の作業は、主にメモリを供給問題として扱い、どのエクスペリエンスを書くか、どのように保存するか、どのエントリを次のタスクに取得するかを尋ねる。
しかし、モデルが取得したメモリをどのように消費するかについては、まだ明確な説明がありません。
論文 参考訳(メタデータ) (2026-07-12T07:05:31Z) - When Not to Write Memory: Governing False Promotion from Correlated Agent Traces [10.675009214407185]
長寿命の言語エージェントは、自身の実行トレースから再利用可能なメモリを書くことが増えています。
重要な安全上の問題は、どのエージェントを覚えるべきかということだが、いつメモリの記述を一切拒否すべきなのか。
我々は、この障害モードをメモリの書き込みパスガバナンス問題として研究する。
論文 参考訳(メタデータ) (2026-06-30T21:27:41Z) - SaliMory: Orchestrating Cognitive Memory for Conversational Agents [22.813290545851743]
SALIMORYは、認知的に構造化されたメモリスパンニングされたユーザファクト、好み、ワーキングメモリを管理するために単一の言語モデルをトレーニングするフレームワークである。
メモリ分散障害を3分の1削減し、エンドツーエンドの精度で最先端を10%以上上回り、良質なパーソナライゼーション率を2倍以上に向上させる。
論文 参考訳(メタデータ) (2026-06-02T18:31:50Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - Contextual Agentic Memory is a Memo, Not True Memory [3.939241105154204]
我々は、ルックアップをメモリとして扱うことは、エージェント能力、長期学習、セキュリティの証明可能な結果を伴うカテゴリエラーであると主張する。
生体知能は, 高速海馬貯蔵と低速大脳皮質体重統合を併用することによりこの問題を解決した。
論文 参考訳(メタデータ) (2026-04-30T10:54:56Z) - MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks [55.145729491377374]
メモリを持つエージェントの既存の評価は、通常、単独で記憶と行動を評価する。
マルチセッションメモリ-エージェント環境ループにおけるエージェントメモリのベンチマークのための統合評価ジムであるMemoryArenaを紹介する。
MemoryArenaは、Webナビゲーション、優先制約付き計画、プログレッシブ情報検索、シーケンシャルなフォーマルな推論を含む評価をサポートする。
論文 参考訳(メタデータ) (2026-02-18T09:49:14Z) - Memory in the Age of AI Agents [217.9368190980982]
この研究は、現在のエージェントメモリ研究の最新の展望を提供することを目的としている。
我々は,エージェントメモリ,すなわちトークンレベル,パラメトリック,潜時メモリの3つの支配的実現を同定する。
実用的な開発を支援するため、メモリベンチマークとオープンソースフレームワークの包括的な概要をコンパイルする。
論文 参考訳(メタデータ) (2025-12-15T17:22:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。