論文の概要: TokenPilot: Cache-Efficient Context Management for LLM Agents
- arxiv url: http://arxiv.org/abs/2606.17016v1
- Date: Mon, 15 Jun 2026 17:46:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 18:36:05.122491
- Title: TokenPilot: Cache-Efficient Context Management for LLM Agents
- Title(参考訳): TokenPilot: LLMエージェントのキャッシュ効率の良いコンテキスト管理
- Authors: Buqiang Xu, Zirui Xue, Dianmou Chen, Chenyang Fu, Chiyu Wu, Caiying Huang, Chen Jiang, Jizhan Fang, Xinle Deng, Yijun Chen, Yunzhi Yao, Xuehai Wang, Jin Shang, Gong Yu, Ningyu Zhang,
- Abstract要約: TokenPilotは、二重粒度コンテキスト管理フレームワークである。
グローバルでは、Ingestion-Aware Compactionがフレームワークハーネスとして機能し、プロンプトプレフィックスを安定化し、Ingestion Gateにおけるオープンワールド環境ノイズを排除する。
PinchBenchとClaw-Evalを分離モードと連続モードの両方で実験した結果、TokenPilotは、従来のシステムと比較して、コストを61%と56%削減し、連続モードでは61%と87%削減した。
- 参考スコア(独自算出の注目度): 19.621473196153694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLM agents are deployed in long-horizon sessions, context accumulation drives up inference costs. Existing approaches utilize text pruning or dynamic memory eviction to minimize token footprints; however, their unconstrained sequence mutations alter layouts, introducing prefix mismatches and cache invalidation. This reveals a critical trade-off between text sparsity and prompt cache continuity. To address this, we present TokenPilot, a dual-granularity context management framework. Globally, Ingestion-Aware Compaction acts as a framework harness to stabilize prompt prefixes and eliminate open-world environmental noise at the ingestion gate. Locally, Lifecycle-Aware Eviction monitors the ongoing residual utility of context segments, enforcing a conservative batch-turn schedule to offload content segments only when task relevance expires. Experiments on PinchBench and Claw-Eval under both isolated and continuous modes demonstrate that TokenPilot reduces costs by 61% and 56% in isolated mode, and 61% and 87% in continuous mode, while maintaining competitive performance compared to prior systems. TokenPilot has been integrated into LightMem2 at https://github.com/zjunlp/LightMem2.
- Abstract(参考訳): LLMエージェントが長期セッションにデプロイされるため、コンテキストの蓄積は推論コストを上昇させる。
既存のアプローチでは、トークンのフットプリントを最小限に抑えるためにテキストプルーニングや動的メモリ消去が使用されているが、制約のないシーケンスの変異によってレイアウトが変更され、プレフィックスミスマッチやキャッシュ無効化が導入されている。
これにより、テキストのスパーシリティとキャッシュの継続性の急激なトレードオフが明らかになる。
これを解決するために、二重粒度コンテキスト管理フレームワークであるTokenPilotを紹介します。
グローバルでは、Ingestion-Aware Compactionがフレームワークハーネスとして機能し、プロンプトプレフィックスを安定化し、Ingestion Gateにおけるオープンワールド環境ノイズを取り除く。
ローカルでは、Lifecycle-Aware Evictionがコンテキストセグメントの継続的な有効性を監視し、タスクの関連性が切れた場合にのみコンテンツセグメントをオフロードするように保守的なバッチターンスケジュールを強制する。
PinchBenchとClaw-Evalを分離モードと連続モードの両方で実験した結果、TokenPilotは、従来のシステムと比較して、コストを61%と56%削減し、連続モードでは61%と87%削減した。
TokenPilotは、https://github.com/zjunlp/LightMem2でLightMem2に統合された。
関連論文リスト
- Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting [18.71433885255431]
適応的ビデオトークン化(Adaptive Video tokenisation)は、シーケンスの基盤となる視覚的複雑さに基づいて、トークンの予算を動的に割り当てる。
凍結連続ビデオトークンの潜伏空間は,直接利用可能な時間的冗長性を本質的に符号化していることを示す。
パラメータフリー適応トークン割り当て機構を導入し,時間-L1差分に対する固定しきい値を適用した。
論文 参考訳(メタデータ) (2026-06-04T13:31:12Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - StreamingTOM: Streaming Token Compression for Efficient Video Understanding [6.9203477336374775]
既存のアプローチはLLM後のkv-cacheのみを規制し、コストのかかるLLM前のプリフィルは変わらない。
StreamingTOMは,LLM前とLLM後の両方のボトルネックに,予測可能なレイテンシで対処する,トレーニングフリーでプラグイン&プレイの2段階フレームワークです。
実験では, 従来のSOTAと比較して, 15.7 時間で kv-cache 圧縮, 12 時間で低ピークメモリ, 2 時間で速い TTFT 圧縮を実現している。
論文 参考訳(メタデータ) (2025-10-21T03:39:41Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [72.27673320976933]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおけるブレークスルーを可能にする。
現在のキャッシュ技術は、フルレイヤ状態を保存することでデコーディングを加速するが、メモリ使用量を大幅に増加させる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - Training-Free Exponential Context Extension via Cascading KV Cache [49.608367376911694]
カスケードサブキャッシュバッファを利用して,最も関連性の高いトークンを選択的に保持する機構を導入する。
本手法は,1Mトークンのフラッシュアテンションと比較して,プリフィルステージ遅延を6.8倍削減する。
論文 参考訳(メタデータ) (2024-06-24T03:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。