論文の概要: KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU
- arxiv url: http://arxiv.org/abs/2609.04852v1
- Date: Fri, 04 Sep 2026 08:09:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.968766
- Title: KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU
- Title(参考訳): KVMem: 数百万のエージェントワークスペースをコンシューマGPU上で仮想化する
- Abstract要約: LLMエージェントは、蓄積された履歴がGPU KVキャパシティとモデルのネイティブコンテキストウインドウの両方を超えるような永続的なワークスペースで動作する。
KVMemは、オーバーフローしたワークスペース履歴をGPUメモリ、ホストメモリ、仮想化にまたがるページドKVステートとして保存するKV-VMである。
LongMemEval、MemoryAgentBench、AgentLongBenchを含む100万のトークンにまたがる長いコンテキストエージェントベンチマークの大規模な評価は、KVMemがコンパクト化ベースのアプローチよりも高いタスクユーティリティと推論効率を達成することを示している。
- 参考スコア(独自算出の注目度): 10.833717716887316
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern LLM agents operate in persistent workspaces whose accumulated history can exceed both GPU KV capacity and the model's native context window. Existing systems typically compact older context into summaries or retrieve it later as text, either losing fine-grained execution evidence or repeatedly prefilling content that the model has already processed. We present KVMem, a KV-context virtualization system that preserves overflowed workspace history as paged KV state across GPU memory, host memory, and NVMe. KVMem uses lightweight, model-native attention-space indexes to select relevant historical blocks and materializes a query-dependent execution view bounded by the model's native context window. Extensive evaluations on long-context agent benchmarks spanning histories up to one million tokens, including LongMemEval, MemoryAgentBench, and AgentLongBench, show that KVMem generally achieves higher task utility and greater inference efficiency than compaction-based approaches, the de facto standard for handling context overflow. In the DeepSWE long-context test with Qwen3.8-27B, KVMem improves task success from 43.8% with compaction-only context management to 48.4%. In our local-deployment evaluation, KVMem runs Qwen3.6/3.8-27B NVFP4 with MTP on an off-the-shelf laptop equipped with a 24\,GB RTX 5090 Laptop GPU, virtualizing agent workspaces of up to 1M tokens-four times the model's native 256K-token context window. In a single-session setting, KVMem generates $\sim$50 tokens/s, providing interactive responsiveness for local agent execution. More broadly, by decoupling addressable workspace size from the LLM's native context window, KVMem provides a practical path toward long-running agents whose workspaces can grow beyond that window.
- Abstract(参考訳): 現代のLLMエージェントは、蓄積された履歴がGPU KVキャパシティとモデルのネイティブコンテキストウインドウの両方を超えるような永続的なワークスペースで動作する。
既存のシステムは、通常、古いコンテキストを要約にコンパクトにするか、後でテキストとして取り出す。
オーバーフローしたワークスペース履歴を,GPUメモリ,ホストメモリ,NVMe間でページ化されたKV状態として保存するKVコンテキスト仮想化システムであるKVMemを提案する。
KVMemは、軽量でモデルネイティブなアテンションスペースインデックスを使用して、関連する履歴ブロックを選択し、モデルのネイティブコンテキストウィンドウにバウンドされたクエリ依存の実行ビューを実体化する。
LongMemEval、MemoryAgentBench、AgentLongBenchなど、100万のトークンにまたがる長いコンテキストエージェントベンチマークの広範な評価によると、KVMemは一般的に、コンテキストオーバーフローを処理するデファクト標準である圧縮ベースのアプローチよりも高いタスクユーティリティと推論効率を達成する。
Qwen3.8-27BによるDeepSWE長文テストでは、KVMemはタスク成功率を43.8%から48.4%に改善した。
ローカルデプロイ評価では、KVMemはQwen3.6/3.8-27B NVFP4を実行し、24GBのRTX 5090 Laptop GPUを備えた市販ラップトップ上でMPPで実行します。
シングルセッション設定では、KVMemは$\sim$50トークン/sを生成し、ローカルエージェントの実行に対してインタラクティブな応答性を提供する。
より広範に、LLMのネイティブコンテキストウィンドウからアドレス可能なワークスペースサイズを分離することにより、KVMemは、ワークスペースがそのウィンドウを超えて成長可能な長時間実行エージェントへの実践的なパスを提供する。
関連論文リスト
- Context as an Environment: Programmatic Context Management for Long-Horizon Agents [47.21335299084925]
それぞれのエージェントセッションを実行可能なセッション環境として扱うコンテキストマネージャであるScrollを提示する。
カーネルはモデルコールにまたがって型付けされ、ツール出力、検索された履歴、派生した状態が変数にバインドされる。
論文 参考訳(メタデータ) (2026-08-21T23:39:19Z) - TClone: Low-Latency Forking of Live GUI Environments for Computer-Use Agents [4.492246229561089]
コンピュータ利用エージェントのためのフォーク可能なパーソナルシステムであるTCloneを提案する。
TCloneは、ライブGUIワークスペースをスナップショット化し、独立したブランチにフォークし、ロールバックし、選択的にコミットまたはマージすることを可能にする。
エンドツーエンドのエージェントループ測定において、TCloneは、KVMとCRIUの合計タスクレイテンシを1.9倍、1.5倍削減します。
論文 参考訳(メタデータ) (2026-05-17T08:24:01Z) - LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues [80.29362825271768]
LongMemEval-V2は、メモリシステムが、カスタマイズされた環境で知識のある同僚になるために必要な経験を得るのに役立つかどうかを評価するためのベンチマークである。
LME-V2には、Webエージェントの5つのコアメモリ能力をカバーする451の質問が含まれている。
AgentRunbook-Rは生の状態観察,イベント,戦略ノートのための知識プールを備えた,効率的なRAGベースのメモリであり,AgentRunbook-Cはトラジェクトリをファイルとして格納し,コードエージェントを起動して,拡張サンドボックスに証拠を収集する。
論文 参考訳(メタデータ) (2026-05-12T17:59:34Z) - Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - Auto-scaling Continuous Memory for GUI Agent [35.84598737971337]
従来のGUIエージェントは過去のトラジェクトリをテキストトークンに圧縮する。
本稿では,各GUI軌跡を連続埋め込みの固定長列に符号化する連続メモリを提案する。
メモリサイズと検索深度が増加するにつれて、長いプロンプトで劣化するテキストメモリとは異なり、パフォーマンスは単調に向上する。
論文 参考訳(メタデータ) (2025-10-10T06:16:45Z) - ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities [53.97515452727115]
ChatQA 2は、128Kコンテキストウィンドウを備えたLlama 3.0ベースのモデルである。
Llama3-70Bベースのコンテキストウィンドウを8Kから128Kまで拡張するためのトレーニングレシピを提案する。
RAGを用いた長文LLMの性能は,多数のチャンクを検索した場合に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-19T17:35:47Z) - LongEmbed: Extending Embedding Models for Long Context Retrieval [87.60404151086715]
本稿では、埋め込みモデルのコンテキストウィンドウ拡張について検討し、追加のトレーニングを必要とせず、制限を32kまで押し上げる。
まず、新たに構築したLongEmbedベンチマークにおいて、コンテキスト検索のための現在の埋め込みモデルの性能について検討する。
実験では、PlaceRoのようなトレーニング不要のコンテキストウィンドウ拡張戦略が、既存の埋め込みモデルのコンテキストウィンドウを複数の折り畳みで効果的に拡張できることが示されている。
論文 参考訳(メタデータ) (2024-04-18T11:29:23Z) - TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document [60.01330653769726]
テキスト中心タスクに適した大規模マルチモーダルモデル(LMM)であるTextMonkeyを提案する。
ゼロ初期化によるシフトウィンドウアテンションの導入により、高い入力解像度でクロスウィンドウ接続を実現する。
テキストスポッティングとグラウンド化を包含する能力を拡張し、位置情報を応答に組み込むことで、解釈可能性を高める。
論文 参考訳(メタデータ) (2024-03-07T13:16:24Z) - Parallel Context Windows for Large Language Models [52.965170346907904]
本稿では,PCW(Parallel Context Windows)について述べる。
本研究の主な成果は,7億5000万から1億7800億のパラメータのモデルを用いて,テキスト内学習におけるPCWアプローチを検証した。
長いコンテキストウインドウが有益であるかもしれない他の設定では、マルチホップ質問と検索強化質問が複数の検索された文書で答えられる。
論文 参考訳(メタデータ) (2022-12-21T11:38:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。