論文の概要: ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2604.10352v1
- Date: Sat, 11 Apr 2026 21:38:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.97368
- Title: ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents
- Title(参考訳): ClawVM: ステートフルツールを使用したLLMエージェントのためのハーネス管理仮想メモリ
- Abstract要約: textscClawVMは仮想メモリ層で、最小フィデリティ不変量を持つ型付きページとして状態を管理する。
textscClawVMは、最小忠実度セットがトークン予算に適合するたびに、ポリシー管理可能なすべての障害を取り除く。
- 参考スコア(独自算出の注目度): 0.7377939119373589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Stateful tool-using LLM agents treat the context window as working memory, yet today's agent harnesses manage residency and durability as best-effort, causing recurring failures: lost state after compaction, bypassed flushes on reset, and destructive writeback. We present \textsc{ClawVM}, a virtual memory layer that manages state as typed pages with minimum-fidelity invariants, multi-resolution representations under a token budget, and validated writeback at every lifecycle boundary. Because the harness already assembles prompts, mediates tools, and observes lifecycle events, it is the natural enforcement point; placing the contract there makes residency and durability deterministic and auditable. Across synthetic workloads, 12 real-session traces, and adversarial stress tests, \textsc{ClawVM} eliminates all policy-controllable faults whenever the minimum-fidelity set fits within the token budget, confirmed by an offline oracle, and adds median <50 microseconds of policy-engine overhead per turn.
- Abstract(参考訳): ステートフルツールを使用するLLMエージェントは、コンテキストウィンドウをワーキングメモリとして扱うが、今日のエージェントは、常駐性と耐久性をベストプラクティスとして管理し、継続する障害を引き起こす。
我々は,仮想メモリ層である \textsc{ClawVM} を紹介した。これは,最小忠実度不変量を持つ型付きページとして状態を管理する仮想メモリ層であり,トークン予算下でのマルチレゾリューション表現であり,すべてのライフサイクル境界における書き込みの検証を行う。
ハーネスは、すでにプロンプトを組み立て、ツールを仲介し、ライフサイクルイベントを観察するので、それは自然な実行ポイントです。
合成ワークロード、12のリアルセッショントレース、および逆ストレステストを含む、 \textsc{ClawVM}は、トークン予算内に最小のフィデリティセットが適合するたびに、すべてのポリシ制御可能な障害を排除し、オフラインのオラクルによって確認され、1ターンあたりのポリシーエンジニアリングオーバーヘッドの中央値<50マイクロ秒を追加します。
関連論文リスト
- MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - Scaling Self-Evolving Agents via Parametric Memory [69.96398842169002]
既存のメモリ拡張LDMエージェントは、過去の経験をプロンプト空間にのみ保存する。
自己進化型パラメトリックメモリフレームワークである textttTMEM を導入する。
textttTMEMは、様々なモデルスケールで要約ベースのベースラインと検索ベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-03T07:18:31Z) - STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments [63.39393178045112]
モバイルエージェントは即座に反応制御を行うが、メモリを必要とする現実的なロングホライゾンタスクでは頻繁に失敗する。
制御可能な仮想環境を通じて,モバイルエージェントの明示的なメモリをトレーニングするフレームワークSTAMPを提案する。
結果のStampGUIエージェントは、メモリワールドベンチマークに新たなハイウォーターマークを設定し、例外的なメモリ精度とタスクレジリエンスを実証します。
論文 参考訳(メタデータ) (2026-05-28T04:00:13Z) - Mitigating Provenance-Role Collapse in Long-Term Agents via Typed Memory Representation [33.47493976010677]
本稿では,ソースモニタリングを構造制約として運用する型付きメモリ中間表現であるMemIRを提案する。
MemIRは、長期記憶を基底原子に書き、生の証拠、検索の手がかり、真理を含む主張を分離する。
LoCoMoとBEAM-100Kの実験は、MemIRが既存のメモリベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2026-05-25T13:56:31Z) - Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture [0.0]
本稿では、RLコーディングエージェントのためのローカルファーストのモデルコンテキストプロトコル(MCP)ネイティブな開発者メモリアーキテクチャであるRL Developer Memoryについて述べる。
メモリ選択をログ化されたコンテキスト決定プロセスとして扱う。
システムは、RLアルゴリズムのバグ、ハードネガ、レビューゲートされたRL/コントロールケース、低リスク障害を含む決定論的200ケースのベンチマークで評価される。
論文 参考訳(メタデータ) (2026-05-02T18:37:36Z) - Beyond Compaction: Structured Context Eviction for Long-Horizon Agents [0.0]
本研究では,長期LLMエージェントに効果的に非有界な作業地平線を与えるコンテキスト管理方式であるContext Window Lifecycle (CWL)を提案する。
セッションが履歴を蓄積するにつれて、CWLは、完了した意味論的に認識された定義を通じて、コンテキストを予算内に保持する。
本稿では, アノテーションプロトコル, エピソードグラフ, 消去ポリシー, トークンカウントループについて記述し, 長期エージェントベンチマークによるCWLの評価を行う。
論文 参考訳(メタデータ) (2026-05-01T18:39:02Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks [96.60530830276281]
RuleSafeは、スケーラブルなLLM支援シミュレーションフレームワーク上に構築された、新しいオペレーティングベンチマークである。
VQ-Memoryはベクトル量子化変分オートエンコーダを用いたコンパクトで構造化された時間表現である。
論文 参考訳(メタデータ) (2026-03-10T11:13:54Z) - Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers [0.42061757959666934]
大きな言語モデル(LLM)エージェントは、単一のコンテキストウィンドウが小さすぎて何が起きているのかをキャプチャできないような環境で、ますます運用される。
メモリはステートレステキストジェネレータを真に適応的なエージェントに変える。
この調査は、メモリがどのように設計され、実装され、現代のLCMベースのエージェントで評価されるかという構造化された説明を提供する。
論文 参考訳(メタデータ) (2026-03-08T15:08:01Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Contextual Memory Virtualisation: DAG-Based State Management and Structurally Lossless Trimming for LLM Agents [0.0]
我々は,蓄積したLLM理解をバージョン管理状態として扱うシステムであるコンテキスト記憶仮想化(CMV)を提案する。
CMVはセッション履歴を、正式に定義されたスナップショット、ブランチ、トリムプリミティブを備えたDAG(Directed Acyclic Graph)としてモデル化する。
シングルユーザによるケーススタディ評価では、トリミングが迅速なキャッシュの下で経済的に有効であることが示されている。
論文 参考訳(メタデータ) (2026-02-25T20:52:52Z) - From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning [81.97788535387286]
本稿では,エージェントによる検証・編集機構を統一された単一パス推論プロセスに内部化するフレームワークを提案する。
最小限のデータで、SRI-Coderは、ChatモデルがBaseモデルの完了性能を上回ることができる。
FIMスタイルのチューニングとは異なり、SRIは一般的なコーディング能力を保持し、標準のFIMに匹敵する推論遅延を維持する。
論文 参考訳(メタデータ) (2026-01-19T20:33:53Z) - Gated Differentiable Working Memory for Long-Context Language Modeling [80.27483324685434]
本稿では,Gdwm(Gated Differentiable Working Memory)を提案する。
ZeroSCROLLS と LongBench v2 の実験では、Gdwm は均一なベースラインよりも 4$times$ の勾配ステップで同等または優れたパフォーマンスを達成している。
論文 参考訳(メタデータ) (2026-01-19T10:00:33Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z) - Quantifying Memory Use in Reinforcement Learning with Temporal Range [51.98491034847041]
時間的範囲(Temporal Range)は、時間的影響プロファイルとして、時間的ウィンドウから入力シーケンスへの複数のベクトル出力の1次感度を扱うモデルに依存しない計量である。
また、タスクレベルメモリのプロキシ読み出しとして、タスク上で訓練されたコンパクトなLong Expressive Memory(LEM)ポリシーについて、テンポラルレンジを報告する。
論文 参考訳(メタデータ) (2025-12-05T22:58:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。