論文の概要: mzCache: On-Device LLM Memory Management under Multitasking
- arxiv url: http://arxiv.org/abs/2609.01338v1
- Date: Tue, 01 Sep 2026 14:49:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.775032
- Title: mzCache: On-Device LLM Memory Management under Multitasking
- Title(参考訳): mzCache:マルチタスクによるオンデバイスLCMメモリ管理
- Authors: Hongseung Yu, Minsung Kim, Jongseok Park, Kyunghan Lee,
- Abstract要約: 我々は,専用メモリ管理を備えたデバイス上でのモバイル大言語モデル(LLM)推論システムであるmzCacheを提案する。
予測不能なメモリ圧力の下で、mzCacheはLSMメモリとモバイルSOCの統一メモリを弾性的に消去する。
mzCacheはストレージがバックアップする部分的なオフロードに比べて2.1-5.5$のタイム・ツー・ファースト・トークンの削減を実現している。
- 参考スコア(独自算出の注目度): 6.974241731162878
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-device mobile Large Language Model (LLM) inference is gaining significant attention. However, mobile devices operate in highly dynamic multitasking environments where users frequently switch between applications. This creates memory pressure, forcing LLM memory (model weights and KV cache) to be evicted by the operating system. When a new inference request arrives, the inference system must restore the evicted memory through slow storage reads or recompute the entire KV cache, severely degrading responsiveness. To address this, we present mzCache, an on-device LLM inference system with specialized memory management for multitasking environments. Under unpredictable memory pressure, mzCache elastically evicts LLM memory and leverages the unified memory of mobile SoCs to enable zero-wait inference on the GPU with concurrent CPU-side restoration. mzCache realizes this through restoration-oriented memory management: LLM memory is partitioned into fine-grained shared buffers to enable partial eviction and restoration with concurrent cross-processor access, while hybrid swap and backward-out eviction policies ensure low-latency restoration from any eviction state. Implemented on llama.cpp and deployed as an Android application, mzCache achieves 2.1-5.5$\times$ reduction in Time-to-First-Token compared to storage-backed partial offload and demonstrates its effectiveness in real multitasking scenarios.
- Abstract(参考訳): デバイス上でのモバイルLarge Language Model (LLM)推論は注目されている。
しかし、モバイルデバイスは、ユーザが頻繁にアプリケーション間を切り替える、非常にダイナミックなマルチタスク環境で動作します。
これによりメモリの圧力が発生し、LLMメモリ(モデルウェイトとKVキャッシュ)をオペレーティングシステムから取り除かざるを得なくなる。
新たな推論要求が到着すると、推論システムは、遅いストレージ読み込みまたはKVキャッシュ全体を再コンパイルすることで、メモリの停止を回復し、応答性を著しく低下させなければならない。
そこで本研究では,マルチタスク環境のためのメモリ管理機能を備えたオンデバイスLCM推論システムであるmzCacheを提案する。
予測不能なメモリプレッシャの下で、mzCacheはLLMメモリを弾性的に消去し、モバイルSoCの統一メモリを活用して、並列CPUサイドの復元を伴うGPU上のゼロウェイト推論を可能にする。
LLMメモリは細粒度の共有バッファに分割され、部分的な消去と並列なクロスプロセッサアクセスによる復元が可能であり、一方、ハイブリッドスワップおよび後方方向の消去ポリシーにより、任意の消去状態から低レイテンシの復元が保証される。
llama.cppに実装され、AndroidアプリケーションとしてデプロイされたmzCacheは、ストレージがバックアップする部分的なオフロードと比較して2.1-5.5$\times$のTime-to-First-Tokenの削減を実現し、実際のマルチタスクシナリオにおいてその効果を示す。
関連論文リスト
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - RecMem: Recurrence-based Memory Consolidation for Efficient and Effective Long-Running LLM Agents [16.625864201773343]
RecMemは、受信するインタラクションをサブ意識のメモリ層に格納し、軽量な埋め込みモデルを使用してエンコードする。
実験により、RecMemは3つのSOTAメモリシステムのメモリ構築トークンコストを最大87%削減し、精度を上回ります。
論文 参考訳(メタデータ) (2026-05-15T15:17:36Z) - MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution [52.29303869050117]
メモリ拡張LDMエージェントは、長期の相互作用をサポートするために外部メモリバンクを保持する。
MemMAはプラグアンドプレイのマルチエージェントフレームワークで、前方と後方の両方の経路に沿ってメモリサイクルを調整する。
論文 参考訳(メタデータ) (2026-03-19T10:15:59Z) - MemLoRA: Distilling Expert Adapters for On-Device Memory Systems [71.32550994522738]
メモリ拡張大言語モデル(LLM)は対話中に顕著な一貫性を示す。
MemLoRAは、小さなVision-Language Modelを統合する新しいメモリシステムである。
VLM統合MemLoRA-Vはキャプションベースのアプローチで大幅に改善されている。
論文 参考訳(メタデータ) (2025-12-04T12:56:30Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [72.27673320976933]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおけるブレークスルーを可能にする。
現在のキャッシュ技術は、フルレイヤ状態を保存することでデコーディングを加速するが、メモリ使用量を大幅に増加させる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention [8.20523619534105]
PagedAttention は LLM サービスシステムにおける動的メモリ割り当ての一般的なアプローチである。
仮想メモリにおけるKVキャッシュの整合性を保ちながら、物理メモリのフラグメンテーションを軽減するアプローチとして、vAttentionを提案する。
全体として、vAttentionはPagedAttentionに代わるシンプルでポータブルでパフォーマンスの高いものだ。
論文 参考訳(メタデータ) (2024-05-07T16:00:32Z) - Efficient Memory Management for Large Language Model Serving with
PagedAttention [44.70922552274376]
大規模言語モデル(LLM)の高スループットサービスには,一度に十分な数の要求が要求される。
既存のシステムでは、各要求のキー値キャッシュ(KVキャッシュ)メモリが巨大で、成長し、動的に縮小するため、苦労している。
本稿では,オペレーティングシステムにおける従来の仮想メモリとページング技術にヒントを得たアテンションアルゴリズムであるPagedAttentionを提案する。
論文 参考訳(メタデータ) (2023-09-12T12:50:04Z) - Recurrent Dynamic Embedding for Video Object Segmentation [54.52527157232795]
一定サイズのメモリバンクを構築するためにRDE(Recurrent Dynamic Embedding)を提案する。
本稿では, SAM を長時間の動画でより堅牢にするため, トレーニング段階での無バイアス誘導損失を提案する。
また、メモリバンクの異なる品質のマスクの埋め込みをネットワークが修復できるように、新たな自己補正戦略を設計する。
論文 参考訳(メタデータ) (2022-05-08T02:24:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。