論文の概要: Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices
- arxiv url: http://arxiv.org/abs/2607.10183v2
- Date: Tue, 14 Jul 2026 15:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.544276
- Title: Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices
- Title(参考訳): ハイブリッドCPU-GPU LLM推論のためのコンシューマデバイス上での自動テンソルスケジューリング
- Abstract要約: ATSInferは、テンソル粒度でオフロードを実行するコンシューマデバイス向けのハイブリッドCPU-GPU推論システムである。
ATSInferを実装し、高密度モデルとMoEモデルの両方を用いて、代表的なコンシューマプラットフォーム上で評価する。
既存のシステムと比較して、ATSInferはプリフィルのスループットを最大1.94$times$で改善し、スループットを最大3.29$times$でデコードする。
- 参考スコア(独自算出の注目度): 23.066831820262394
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Running large language models on consumer devices such as laptops and desktops is challenging because model weights often exceed GPU memory capacity, making offloading inference necessary to extend effective model capacity with CPU memory. Existing offloading systems, however, typically rely on coarse layer-level or expert-level scheduling, which overlooks substantial heterogeneity among tensors within the same layer and adapts poorly to changing hardware load conditions on such devices. This paper presents ATSInfer, a hybrid CPU-GPU inference system for consumer devices that performs offloading at tensor granularity. ATSInfer combines static tensor placement with load-aware dynamic transfer, and introduces asynchronous CPU-GPU coordination to efficiently schedule hardware storage, data movement, and computation across heterogeneous backends. We implement ATSInfer and evaluate it on representative consumer platforms using both dense and MoE models. Compared with existing systems, ATSInfer improves prefill throughput by up to 1.94$\times$ and decode throughput by up to 3.29$\times$, while also increasing GPU utilization and making more effective use of PCIe bandwidth. These results show that ATSInfer can substantially improve the user experience of local LLM deployment on personal consumer devices.
- Abstract(参考訳): ラップトップやデスクトップなどのコンシューマデバイスで大規模な言語モデルを実行することは難しい。なぜなら、モデルウェイトがGPUメモリ容量を超えることが多く、CPUメモリで効果的なモデルキャパシティを拡張するために、オフロード推論が必要とされるからだ。
しかし、既存のオフロードシステムは、通常、粗い層レベルまたは専門家レベルのスケジューリングに依存しており、同じ層内のテンソル間のかなりの不均一性を見落とし、そのようなデバイスのハードウェア負荷条件の変更に不適応である。
本稿では、テンソル粒度でオフロードを行うコンシューマデバイス向けハイブリッドCPU-GPU推論システムであるATSInferについて述べる。
ATSInferは静的テンソル配置とロードアウェアな動的転送を統合し、非同期CPU-GPU調整を導入し、ハードウェアストレージ、データ移動、計算を異種バックエンド間で効率的にスケジュールする。
ATSInferを実装し、高密度モデルとMoEモデルの両方を用いて、代表的なコンシューマプラットフォーム上で評価する。
既存のシステムと比較すると、ATSInferはプリフィルスループットを最大1.94$\times$で改善し、デコードスループットを最大3.29$\times$で改善している。
これらの結果から,ATSInferはパーソナル・コンシューマー・デバイス上でのローカルLCMデプロイメントのユーザエクスペリエンスを大幅に改善できることがわかった。
関連論文リスト
- LLM Inference in a Flash! [66.43896490006965]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクで印象的な機能を示している。
我々は、高価な浮動小数点演算をなくすために、エンドツーエンドの整数のみの量子化手法を提案する。
論文 参考訳(メタデータ) (2026-09-14T18:04:30Z) - Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - UniLab: A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms [68.40808444348735]
シミュレーション支配型ロボット制御では、どのプロセッサが物理を実行するかではなく、シミュレーションスループット、ポリシー学習、実行時同期が効率的なエンドツーエンドループを形成するかどうかが重要な問題である。
データ移動、バッファリング、同期のための統一ランタイムを通じて、GPUポリシー更新からCPU並列シミュレーションを分離する、異種CPU常駐/GPU学習アーキテクチャであるUniLabを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:53:50Z) - Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - Scalable GPU-Based Integrity Verification for Large Machine Learning Models [4.301162531343759]
我々は、CPUとGPUプラットフォーム間の整合性保護を標準化することで、分散機械学習を強化するセキュリティフレームワークを提案する。
提案手法は,GPUアクセラレータ上での大規模なMLモデル実行と直接的に整合性検証を行う。
私たちは、基盤となるCPUやGPUインフラストラクチャに関係なく、エンタープライズチームがデプロイできるハードウェアに依存しない基盤を提供します。
論文 参考訳(メタデータ) (2025-10-27T23:45:21Z) - Characterizing the Efficiency of Distributed Training: A Power, Performance, and Thermal Perspective [6.51239603014107]
大規模言語モデル(LLM)は、単一ノード分析の限界を超えて、トレーニングワークロードを推し進めている。
様々な実世界のワークロードとハードウェアプラットフォームにわたるLLMトレーニングの包括的特徴について述べる。
論文 参考訳(メタデータ) (2025-09-12T16:05:07Z) - Forecasting LLM Inference Performance via Hardware-Agnostic Analytical Modeling [0.02091806248191979]
本稿では,演算子のモジュラー解析モデルからなる軽量でモジュラーな解析フレームワークLIFEを紹介する。
LIFEは、量子化、KVキャッシュ圧縮、LoRAアダプタ、チャンクされたプリフィル、異なる注意、演算子融合など、ソフトウェアとモデル最適化の影響を特徴づけている。
我々は,AMD CPU,NPU,iGPU,NVIDIA V100 GPUにおけるLIFEの予測をLlama2-7B変種を用いて検証した。
論文 参考訳(メタデータ) (2025-07-29T03:08:31Z) - MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism [26.923312725688735]
Mixture-of-Experts (MoE)は、大規模言語モデル(LLM)をスケールし、性能を向上し、計算の複雑さを減らし、大きな可能性を誇示している。
大規模MOEモデルを提供するための効率よく費用効率の良いシステムであるMegaScale-Inferを提案する。
論文 参考訳(メタデータ) (2025-04-03T04:20:44Z) - MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs [55.95879347182669]
MoEアーキテクチャは、推論コストの比例的な増加なしにモデルキャパシティを向上できることで有名である。
MoE-LightningはCPU-GPU-I/OパイプラインスケジュールであるCGOPipeを導入し、ページ重み付けにより高いリソース利用を実現する。
MoE-Lightningは、単一のT4 GPU(16GB)上でMixtral 8x7Bの最先端オフロード可能なLLM推論システムよりも最大10.3倍高いスループットを実現することができる
論文 参考訳(メタデータ) (2024-11-18T01:06:12Z) - FusionAI: Decentralized Training and Deploying LLMs with Massive
Consumer-Level GPUs [57.12856172329322]
我々は、巨大な未使用のコンシューマレベルのGPUをアンロックする分散システムを構想する。
このシステムは、CPUとGPUメモリの制限、ネットワーク帯域幅の低さ、ピアとデバイスの多様性など、重要な課題に直面している。
論文 参考訳(メタデータ) (2023-09-03T13:27:56Z) - FlexGen: High-Throughput Generative Inference of Large Language Models
with a Single GPU [89.2451963569343]
FlexGenは、単一のコモディティGPU上で大きな言語モデル(LLM)推論を実行するための世代エンジンである。
1つの16GB GPU上でOPT-175Bを実行する場合、FlexGenは最先端のオフロードシステムに比べてスループットが大幅に向上する。
HELMベンチマークでは、FlexGenは7つの代表サブシナリオに16GBのGPUで30Bモデルを21時間でベンチマークすることができる。
論文 参考訳(メタデータ) (2023-03-13T05:19:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。