論文の概要: LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference
- arxiv url: http://arxiv.org/abs/2609.03079v1
- Date: Wed, 02 Sep 2026 18:49:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.83859
- Title: LeanStream: A Speculate-and-Refine Streaming Framework for Efficient on-Device LLM Inference
- Title(参考訳): LeanStream: デバイス上での効率的なLLM推論のための推測と修正のためのストリーミングフレームワーク
- Abstract要約: 本稿では,効率的なオンデバイスLEM推論のためのストリーミング推測・再定義フレームワークであるLeanStreamを紹介する。
モバイルプラットフォームと組み込みプラットフォームの両方でLeanStreamを実装しています。
- 参考スコア(独自算出の注目度): 18.34596081334684
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-device LLM inference is attractive for privacy and responsiveness, but remains challenging on mobile and embedded devices because model weights far exceed available DRAM. Prior systems exploit activation sparsity and offload weights to SSD or flash storage, but face a fundamental systems trade-off: accurate sparse execution decisions require the latest context, whereas efficient computation-I/O overlap requires early prediction. As a result, existing designs either serialize execution or incur redundant weight fetches, extra computation, and large cache overheads. We present LeanStream, a streaming speculate-and-refine framework for efficient on-device LLM inference. LeanStream progressively refines computation, loading, and cache-retention priorities using partial GPU results, enabling fine-grained overlap between GPU execution and storage I/O. We implement LeanStream on both mobile and embedded platforms. Compared with prior on-device LLM inference systems, LeanStream reduces memory usage by 4.8$\times$ to 7.5$\times$ at the best throughput achieved by prior work, while further improving token generation throughput by 1.6$\times$ to 2.1$\times$.
- Abstract(参考訳): オンデバイスLSM推論は、プライバシと応答性には魅力的なものだが、モデルウェイトが利用可能なDRAMを超えているため、モバイルや組み込みデバイスでは依然として困難である。
従来のシステムはアクティベーションの幅とSSDやフラッシュストレージへのオフロード重みを利用するが、基本的なシステムトレードオフに直面している。
その結果、既存の設計は実行をシリアライズするか、冗長な重み付け、余分な計算、大きなキャッシュオーバーヘッドを発生させる。
本稿では,効率的なオンデバイスLEM推論のためのストリーミング推測・再定義フレームワークであるLeanStreamを紹介する。
LeanStreamは、部分的なGPU結果を使用して計算、ロード、キャッシュ保持の優先順位を徐々に洗練し、GPU実行とストレージI/Oの微妙な重複を可能にする。
モバイルプラットフォームと組み込みプラットフォームの両方でLeanStreamを実装しています。
従来のオンデバイスLCM推論システムと比較して、LeanStreamはメモリ使用量を4.8$\times$から7.5$\times$に削減し、トークン生成スループットを1.6$\times$から2.1$\times$に改善した。
関連論文リスト
- Lever: Speculative LLM Inference on Smartphones [11.768438191539374]
対話型モバイルアプリケーションには、大規模言語モデル(LLM)がますます必要である。
本稿では,スマートフォン上でのフラッシュバック型LLM推論のためのエンドツーエンドシステムであるLeverを紹介する。
論文 参考訳(メタデータ) (2026-05-16T03:43:10Z) - Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing [9.984481065465028]
エッジデバイス上の大規模言語モデル(LLM)は、レイテンシの低減、リアルタイム処理の改善、プライバシの向上に不可欠である。
エッジデバイスにLLMを実装することは、特にキーバリューキャッシュの管理において、課題となる。
エッジデバイスにおけるLLMのプライマリストレージとしてeDRAMを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:12:08Z) - dInfer: An Efficient Inference Framework for Diffusion Language Models [54.80918957287927]
拡散に基づく大規模言語モデル (dLLM) は自己回帰(AR) LLM に代わる有望な代替品として登場した。
本稿では、dLLM推論のための効率的かつ効率的なフレームワークであるdInferについて述べる。
論文 参考訳(メタデータ) (2025-10-09T16:19:42Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [72.27673320976933]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおけるブレークスルーを可能にする。
現在のキャッシュ技術は、フルレイヤ状態を保存することでデコーディングを加速するが、メモリ使用量を大幅に増加させる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking [12.664307714758843]
本稿では,最小限の微調整で精度を保ちながら予測自由な動的スペーシフィケーション手法を提案する。
本稿では、キャッシュの状態とアクティベーションの規模を考慮し、キャッシュヒット率をさらに向上させる新しいキャッシュ対応マスキング戦略について述べる。
DIPは46%のメモリ削減と40%のスループット向上を実現している。
論文 参考訳(メタデータ) (2024-12-02T11:07:51Z) - Efficient LLM inference solution on Intel GPU [19.154403468201924]
トランスフォーマーベースの大規模言語モデル(LLM)は多くの分野で広く使われている。
低レイテンシかつ高スループットで効率的なLLM推論ソリューションを提案する。
標準的なHuggingFaceの実装と比較して、提案されたソリューションは最大で7倍のトークンレイテンシと27倍のスループットを実現している。
論文 参考訳(メタデータ) (2023-12-19T05:40:43Z) - AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration [54.692405042065815]
LLM低ビット量のみの量子化のためのハードウェアフレンドリーなアプローチであるActivation-Aware Weight Quantization (AWQ)を提案する。
AWQ は 1% の正重みしか保護せず,命令調整型 LM とマルチモーダル LM の量子化性能に優れる。
また,4ビットオンデバイスLLM/VLMに適した,効率的なフレキシブルな推論フレームワークであるTinyChatを実装した。
論文 参考訳(メタデータ) (2023-06-01T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。