論文の概要: Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference
- arxiv url: http://arxiv.org/abs/2607.05475v1
- Date: Mon, 06 Jul 2026 09:42:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.274949
- Title: Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference
- Title(参考訳): LLMのためのNPUの準備はできているか? モバイルLLM推論における隠れた効率ボツネックの分離
- Abstract要約: モバイルデバイス上の大規模言語モデル(LLM)は、プライバシを高め、レイテンシを低減するが、ハードウェアの非効率によってボトルネックとなる。
移動式LLM推論の総合的, 横断的な測定を行った。
我々は、バックエンド固有のエネルギー属性を初めて提供する、きめ細かいプロファイリングツールであるPowerBenchを開発した。
- 参考スコア(独自算出の注目度): 8.952888082316456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying Large Language Models (LLMs) on mobile devices enhances privacy and reduces latency, but is severely bottlenecked by hardware inefficiency. We present the first comprehensive, cross-layer measurement study of mobile LLM inference, uniquely spanning five mainstream frameworks (e.g., llama.cpp, GENIE) and three hardware backends (CPU, GPU, NPU). To enable this analysis, we develop PowerBench, a fine-grained profiling tool that provides the first backend-specific energy attribution, moving beyond traditional device-level measurements. Our study yields three critical insights: (1) Framework-induced performance gaps are substantially amplified on NPUs, reaching up to 10x using custom operators due to divergent offloading and quantization strategies. (2) We identify a distinct phase split where NPUs excel at compute-bound prefilling, while CPUs outperform all other backends in memory-bound decoding. This is driven by the NPU's preference for large, fixed-shape workloads, which conflicts with the small-kernel, dynamic nature of decoding. (3) Backend-specific profiling uncovers substantial scheduling headroom missed by prior work. Suboptimal thread configurations, uncoordinated NPU sleep latencies, and CPU polling intervals result in up to 40% energy waste. Leveraging these findings, we present an energy-oriented best-practice configuration for mobile LLM inference. We estimate that this configuration could reduce energy consumption by up to 54.8% on the NPU backend across three datasets.
- Abstract(参考訳): モバイルデバイスにLLM(Large Language Models)をデプロイすると、プライバシが向上し、レイテンシが低下するが、ハードウェアの非効率性によって著しくボトルネックとなる。
本稿では,モバイルLEM推論の総合的,クロスレイヤな研究として,5つの主流フレームワーク(例えば,llama.cpp,GENIE)と3つのハードウェアバックエンド(CPU,GPU,NPU)に一意にまたがる。
この分析を可能にするために、我々は、バックエンド固有のエネルギー属性を初めて提供する微細なプロファイリングツールであるPowerBenchを開発した。
1)フレームワークによるパフォーマンスギャップはNPUで大幅に増幅され、分散オフロードと量子化戦略により、カスタム演算子を使用して最大10倍まで到達する。
2) NPUは計算バウンドのプリフィルで優れ, CPUはメモリバウンドのデコーディングで他のすべてのバックエンドよりも優れていた。
これは、NPUが大規模で固定型のワークロードを好むことによるものであり、デコーディングの小さなカーネル、動的な性質と矛盾する。
(3) バックエンド固有のプロファイリングにより、事前の作業で見落とされた相当なスケジューリングヘッドルームが明らかになった。
最適スレッド構成、非コーディネートNPU睡眠レイテンシ、CPUポーリング間隔は最大40%のエネルギー浪費をもたらす。
これらの知見を生かして,移動LLM推論のためのエネルギー指向のベストプラクティス構成を提案する。
この構成により、3つのデータセットにわたるNPUバックエンドのエネルギー消費量を最大54.8%削減できると見積もっている。
関連論文リスト
- Efficient On-Device Diffusion LLM Inference with Mobile NPU [8.218014049394391]
lladaは、スマートフォン上でdLLMを加速するための最初のNPU対応推論フレームワークである。
エンドツーエンドのフレームワークとしてlladaを実装し、さまざまなハードウェアプラットフォームとdLLMワークロードで評価しています。
論文 参考訳(メタデータ) (2026-06-11T12:44:57Z) - When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference [8.014238682359938]
モバイルデバイス上の大規模言語モデル(LLM)は、ますます不均一な実行に依存している。
演算子およびパイプラインレベルでNPUの有効性を系統的に評価した先行研究はない。
CPU-NPUヘテロジニアスシステム上での移動LEM推論のステージ認識とマルチレベルベンチマークについて述べる。
論文 参考訳(メタデータ) (2026-05-22T10:39:35Z) - Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs [5.431496585727341]
本稿では,Apple Silicon上でのMoE実行を高速化するランタイム推論エンジンであるNPUMoEを提案する。
NPUMoEはベースラインを一貫して上回り、レイテンシを1.32x-5.55xに、エネルギー効率を1.81x-7.37xに、CPUサイクルを1.78x-5.54xに減らした。
論文 参考訳(メタデータ) (2026-04-20T19:52:56Z) - HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network [50.33808558714122]
エッジでの大規模言語モデル(LLM)推論は、ユーザのプライバシを保護すると同時に、サービスの応答性を促進する。
損失エッジネットワークにおける分散LLM推論を向上する新しいフレームワークであるHALOを提案する。
Raspberry Piクラスタによる実験の結果、HALOは信頼性の低いネットワーク条件下でLLaMAシリーズLLMの3.41倍のエンドツーエンドのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-16T07:37:23Z) - Scaling LLM Test-Time Compute with Mobile NPU on Smartphones [18.50846535848905]
本稿では,移動型ニューラルプロセッシングユニット (NPU) が計算資源を過小評価していることを示す。
そこで本研究では,モバイルNPUに並列テスト時間スケーリング手法を適用し,小型LLMの性能を向上させることを提案する。
混合精度GEMMは19.0、ソフトマックスは2.2である。
論文 参考訳(メタデータ) (2025-09-27T14:17:46Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z) - Fast On-device LLM Inference with NPUs [10.80559106452755]
我々は、オンデバイスニューラルプロセッシングユニット(NPU)オフロードを利用した最初のLCM推論システムであるllm.npuについて述べる。
llm.npuは3つのレベルでプロンプトとモデルを再構築することで、NPUのオフロード効率を向上させる。
初めて、llm.npuは10億規模のモデルで1000トークン/秒以上のプリフィルを達成した。
論文 参考訳(メタデータ) (2024-07-08T12:20:45Z) - Enabling High-Sparsity Foundational Llama Models with Efficient Pretraining and Deployment [56.44025052765861]
大規模言語モデル(LLM)は自然言語処理(NLP)に革命をもたらしたが、そのサイズは計算のボトルネックを生み出している。
そこで本研究では,高性能LLMの高精度かつ疎結合な基本バージョンを作成するための新しいアプローチを提案する。
スパース量子化LLaMAの最大8.6倍のCPU上での総高速化を示す。
論文 参考訳(メタデータ) (2024-05-06T16:03:32Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z) - AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration [54.692405042065815]
LLM低ビット量のみの量子化のためのハードウェアフレンドリーなアプローチであるActivation-Aware Weight Quantization (AWQ)を提案する。
AWQ は 1% の正重みしか保護せず,命令調整型 LM とマルチモーダル LM の量子化性能に優れる。
また,4ビットオンデバイスLLM/VLMに適した,効率的なフレキシブルな推論フレームワークであるTinyChatを実装した。
論文 参考訳(メタデータ) (2023-06-01T17:59:10Z) - Fluid Batching: Exit-Aware Preemptive Serving of Early-Exit Neural
Networks on Edge NPUs [74.83613252825754]
スマートエコシステム(smart ecosystems)"は、スタンドアロンではなく、センセーションが同時に行われるように形成されています。
これはデバイス上の推論パラダイムを、エッジにニューラル処理ユニット(NPU)をデプロイする方向にシフトしている。
そこで本研究では,実行時のプリエンプションが到着・終了プロセスによってもたらされる動的性を考慮に入れた,新しい早期終了スケジューリングを提案する。
論文 参考訳(メタデータ) (2022-09-27T15:04:01Z) - Multi-Exit Semantic Segmentation Networks [78.44441236864057]
本稿では,最先端セグメンテーションモデルをMESSネットワークに変換するフレームワークを提案する。
パラメトリド早期出口を用いた特別訓練されたCNNは、より簡単なサンプルの推測時に、その深さに沿って保存する。
接続されたセグメンテーションヘッドの数、配置、アーキテクチャとエグジットポリシーを併用して、デバイス機能とアプリケーション固有の要件に適応する。
論文 参考訳(メタデータ) (2021-06-07T11:37:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。