論文の概要: What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents
- arxiv url: http://arxiv.org/abs/2607.08032v1
- Date: Thu, 09 Jul 2026 01:15:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.385958
- Title: What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents
- Title(参考訳): 忘れるべきことは何か: LLM とエージェントにおけるメモリ圧縮のゆがみ
- Authors: Ashwin Gerard Colaco, Nada Lahjouji,
- Abstract要約: 4つの研究コミュニティがそれぞれ,大規模言語メモリのコンパクト化を学んでいることを示す。
我々は、これらが1つの問題の例であると主張する。
このレンズを1つのコンパクト化目標と層に依存しない下界で正確にし、スタック全体からメソッドを一様に分類する7軸分類法を構築するために使用する。
- 参考スコア(独自算出の注目度): 1.0742675209112622
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models, and the agents built on them, spend an ever-growing share of their compute and memory on remembering: caching attention keys and values, carrying long prompts, maintaining recurrent state, and storing what happened in previous turns and sessions. Because none of this memory is free, four largely separate research communities have each learned to compact it. They evict or quantize the KV cache, prune or distill prompts, bound architectural state, and consolidate agent memory. We argue that these are instances of one problem: a rate--distortion decision about what context-derived information to retain versus discard, at what fidelity, under a resource budget, so as to preserve downstream task utility. We make this lens precise with a single compaction objective and a layer-agnostic lower bound, use it to build a seven-axis taxonomy that classifies methods from across the stack uniformly, and use it to transfer mechanisms between layers that have never been connected, from serving-stack KV management to agent long-term memory. Two patterns hold across the survey. At every layer the signal that decides what to keep is attention magnitude or recency, and it fails in the same way everywhere, by discarding, before the query is known and with no way to undo it, information the query later needs. And while compression is measured carefully on single-turn long context, the repeated compaction that agents actually perform is almost never measured, and no benchmark holds one budget axis across all the layers at once. We turn both observations into a benchmark proposal, a small reference experiment, and a set of compaction-aware design principles, and we map the open problems.
- Abstract(参考訳): 大規模言語モデルとそれら上に構築されたエージェントは、注目キーと値のキャッシュ、長いプロンプトの転送、リカレント状態の維持、前のターンやセッションで起きたことの保存など、記憶にコンピューティングとメモリのシェアを継続的に使用します。
この記憶はどれも無料なので、4つの研究コミュニティがそれぞれ、それをコンパクトにすることを学びました。
それらはKVキャッシュ、プルーーンまたは蒸留プロンプト、アーキテクチャ状態のバウンド、エージェントメモリの統合を排除または定量化する。
我々は、これらが1つの問題の事例であると主張する: ダウンストリームタスクユーティリティを保存するために、どのコンテキスト由来の情報を保持するか、捨てるか、どの忠実度で保持するか、どのリソース予算で保持するか、という率-歪みの決定。
我々は、このレンズを単一のコンパクト化目標と層非依存の下位境界で正確にし、スタック全体からメソッドを均一に分類する7軸分類を構築するために使用し、それを用いて、接続されていない層間でメカニズムを転送する。
調査には2つのパターンがある。
あらゆる層において、何を保持するかを決めるシグナルは注意の規模または正確さであり、クエリが知られる前に破棄し、後でクエリが必要とする情報を解き放つことによって、どこでも同じように失敗する。
圧縮は1ターンの長いコンテキストで注意深く測定されるが、エージェントが実際に実行する繰り返し圧縮はほとんど測定されず、すべてのレイヤに一度に1つの予算軸を保持するベンチマークは存在しない。
両観測結果をベンチマークの提案、小さな参照実験、コンパクト化対応設計原則のセットに変換し、オープンな問題をマップする。
関連論文リスト
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction [65.710271475739]
我々は,各トークンの将来のユーティリティを統一メモリ予算の下で学習する,グローバルな保持に基づくKV消去手法を提案する。
提案手法は,フルキャッシュ推論に適合したり,超えたりしながら,KVメモリを大幅に削減することを示す。
これらの結果から,世界規模で校正されたKV消去は圧縮技術であるだけでなく,長文推論を改善するメカニズムでもあることが示唆された。
論文 参考訳(メタデータ) (2026-05-10T16:47:50Z) - The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory [7.707732051915869]
エージェントメモリシステムの診断では、メモリはクリーンな入力の推論を改善するが、それらが存在するときのスプリアスパターンへの依存を増幅する。
本稿では,CAMELを提案する。CAMELは,書き込み時間と検索時間の両方で,多様なメモリアーキテクチャ間で動作可能な,プラグアンドプレイキャリブレーション方式である。
全体として、CAMELはより信頼性の高いエージェントメモリデプロイメントに対して、原則的で軽量なソリューションを提供する。
論文 参考訳(メタデータ) (2026-05-10T05:04:13Z) - Contextual Agentic Memory is a Memo, Not True Memory [3.939241105154204]
我々は、ルックアップをメモリとして扱うことは、エージェント能力、長期学習、セキュリティの証明可能な結果を伴うカテゴリエラーであると主張する。
生体知能は, 高速海馬貯蔵と低速大脳皮質体重統合を併用することによりこの問題を解決した。
論文 参考訳(メタデータ) (2026-04-30T10:54:56Z) - Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers [0.42061757959666934]
大きな言語モデル(LLM)エージェントは、単一のコンテキストウィンドウが小さすぎて何が起きているのかをキャプチャできないような環境で、ますます運用される。
メモリはステートレステキストジェネレータを真に適応的なエージェントに変える。
この調査は、メモリがどのように設計され、実装され、現代のLCMベースのエージェントで評価されるかという構造化された説明を提供する。
論文 参考訳(メタデータ) (2026-03-08T15:08:01Z) - Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation [22.803751188961865]
検索は類似性マッチングを超えて移動し、代わりに潜在コンポーネントを操作するべきだと我々は主張する。
我々は、無傷ユニットの階層を構築し、検索可能な高レベルノード組織を維持するxMemoryを提案する。
論文 参考訳(メタデータ) (2026-02-02T12:04:58Z) - AMA: Adaptive Memory via Multi-Agent Collaboration [54.490349689939166]
複数の粒度にまたがるメモリ管理に協調エージェントを活用する新しいフレームワークであるAMA(Adaptive Memory via Multi-Agent Collaboration)を提案する。
AMAは、ステート・オブ・ザ・アートのベースラインを著しく上回り、トークンの消費をフルコンテキストの手法と比べて約80%削減する。
論文 参考訳(メタデータ) (2026-01-28T08:09:49Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。