論文の概要: NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
- arxiv url: http://arxiv.org/abs/2608.22643v1
- Date: Sun, 23 Aug 2026 22:58:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.819082
- Title: NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
- Title(参考訳): NeuroPrefetcher:Delta Prefetchingによるストレージ対応スパースLDM推論
- Authors: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo,
- Abstract要約: 量子化、より小さなモデル、オフロードといった既存のアプローチは、効果的なメモリ制限を上昇させるが、それでもいくつかの予算に収まるようにモデルを圧縮または分割できると仮定する。
実行中、モデルが常駐メモリよりも大きく、かつストレージがクリティカルパスの重み付けのアクティブな源となるような、厳密なモデル実行型メモリ設定を目標としています。
本稿では,この特性を予測的プレフェッチにより活用するストレージベース推論システムであるNeuroPrefetcherを提案する。
- 参考スコア(独自算出の注目度): 2.369705021757544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying large language models on edge devices is increasingly limited by a widening gap between model size and available memory. Existing approaches such as quantization, smaller models, and offloading can raise the effective memory limit, but they still assume that the model can be compressed or partitioned to fit within some budget. We target the harder model-exceeds-memory setting, in which the model remains larger than resident memory throughout execution and storage becomes an active source of weights on the critical path. We observe that MLP activity during autoregressive decoding has strong temporal locality: approximately 82-85% of active neurons persist from one token to the next. This means that most sparse weights needed for the current token are already resident, and only the newly needed rows must be fetched from storage. We present NeuroPrefetcher, a storage-backed LLM inference system that exploits this property through predictive delta prefetching. After layer 0, a single GPU-resident predictor, occupying 2.86% of base model parameters, predicts sparse activity for all downstream MLP layers in one forward pass. The runtime compares these predictions against resident GPU buffers and issues application-scheduled NVMe reads only for incoming delta rows, replacing reactive operating-system demand paging with explicit, model-aware weight movement. On real unified-memory edge hardware, NeuroPrefetcher achieves 7.9-12.0x speedup over llama.cpp across constrained memory budgets.
- Abstract(参考訳): エッジデバイスに大規模な言語モデルをデプロイするのは、モデルサイズと利用可能なメモリとのギャップが広がることで、ますます制限される。
量子化、より小さなモデル、オフロードといった既存のアプローチは、効果的なメモリ制限を上昇させるが、それでもいくつかの予算に収まるようにモデルを圧縮または分割できると仮定する。
実行中、モデルが常駐メモリよりも大きく、かつストレージがクリティカルパスの重み付けのアクティブな源となるような、より厳しいモデル実行メモリ設定を目標としています。
自己回帰復号時のMLP活性は時間的局所性が強く,活動ニューロンの約82-85%がトークンから次のトークンに持続している。
これは、現在のトークンに必要なスパースウェイトのほとんどは既に存在しており、新たに必要になった行だけがストレージから取得されなければならないことを意味する。
我々は,この特性を予測デルタプレフェッチにより活用する記憶型LLM推論システムであるNeuroPrefetcherを提案する。
層0の後、ベースモデルのパラメータの2.86%を占める1つのGPU抵抗予測器は、1つのフォワードパスで下流のすべてのMLP層のスパースアクティビティを予測する。
ランタイムは、これらの予測を、常駐のGPUバッファと比較し、アプリケーションスケジューリングされたNVMe読み取りは、入ってくるデルタ行のみに対応し、リアクティブなオペレーティングシステム要求のページングを明示的でモデル対応の重み移動に置き換える。
実際の統一メモリエッジハードウェアでは、NeuroPrefetcherは制限されたメモリ予算でllama.cppよりも7.9-12.0xのスピードアップを達成した。
関連論文リスト
- CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration [2.6196419303092466]
大規模言語モデル(LLM)における自動回帰デコーディングは本質的にメモリバウンドである。
メモリ制限デバイス上でのケースド検証と修正を行う,自己記述型デコーディングフレームワークであるCATSを提案する。
CATSは、生成品質を劣化させることなく最大5.08倍のウォールクロックスピードアップを達成でき、エッジメモリの制約下では最大1.45倍のSOTA法より優れている。
論文 参考訳(メタデータ) (2026-05-11T19:50:08Z) - From Projection to Prediction: Beyond Logits for Scalable Language Models [0.28647133890966986]
大規模言語モデル(LLM)のトレーニングは通常、出力層で2段階のパイプラインを伴います。
隠れ状態とターゲットトークンの損失を直接計算することにより、当社のアプローチは明示的なロジットの実体化をバイパスする。
論文 参考訳(メタデータ) (2025-11-18T02:23:47Z) - On-Device Fine-Tuning via Backprop-Free Zeroth-Order Optimization [27.237134457089194]
メモリ効率のゼロオーダー最適化(MeZO)はこのボトルネックを軽減する。
本稿ではまず,BPおよびMeZOトレーニングで適用可能な相対モデルサイズを理論的に推定する。
次に,メモリ上の制約下で,MeZOが精度上の優位性を示すことを示す。
論文 参考訳(メタデータ) (2025-11-14T14:46:29Z) - Memory Layers at Scale [67.00854080570979]
この研究はメモリ層を概念実証以上のものにし、現代の規模でその有用性を証明している。
ダウンストリームタスクでは、改善されたメモリ層で強化された言語モデルは、予算の2倍以上の高密度モデルよりも優れており、計算とパラメータの両方にマッチする場合の熟練モデルの混合も優れている。
最大128Bのメモリパラメータを持つスケーリング法則を1兆トークンまで事前訓練し,最大8Bパラメータを持つベースモデルと比較した,完全な並列化可能なメモリレイヤの実装を提供する。
論文 参考訳(メタデータ) (2024-12-12T23:56:57Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z) - Efficient NLP Inference at the Edge via Elastic Pipelining [0.42970700836450487]
WRXは2つの新しい手法によってレイテンシ/メモリの緊張を緩和する。
We build WRX and evaluation that on a range of NLP tasks, under a practical range of target latencies, on both CPU and GPU。
論文 参考訳(メタデータ) (2022-07-11T17:15:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。