論文の概要: Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference
- arxiv url: http://arxiv.org/abs/2608.08730v2
- Date: Tue, 11 Aug 2026 13:35:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.66546
- Title: Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference
- Title(参考訳): LLM推論のためのWebGPUディスパッチオーバーヘッドの測定と削減
- Authors: Jędrzej Maczan,
- Abstract要約: シーケンシャル・ディスパッチ測定手法を導入し, 単一動作単体計測がディスパッチ当たりのコストを過大に見積もっていることを示す。
カーネルの品質ではなく、ディスパッチのオーバーヘッドがバッチサイズ1のボトルネックであることを示し、ディスパッチ数を原因として分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models are deployed to multiple types of environments, from internet browsers to edge devices, and WebGPU serves as a modern cross-platform standard. The engines for browser-based LLM inference have proliferated, yet the overhead of WebGPU per-operation dispatch remains poorly characterized. In this work, we introduce a sequential-dispatch measurement method and show that naive single-operation measurements overestimate per-dispatch cost by conflating dispatch with synchronization. Using our method, we measure the per-dispatch cost and show that it is independent of data type used. We show that the dispatch overhead, not kernel quality, is the bottleneck at batch size 1, and isolate the dispatch count as the cause. Therefore, we conclude that at batch size 1, the effective approach to LLM inference optimization in WebGPU is reducing dispatch count. Our findings point to dispatch amortization, in the inference engines and in the WebGPU specification, as a path to practical browser-based inference.
- Abstract(参考訳): 大規模言語モデルは、インターネットブラウザからエッジデバイスまで、さまざまな種類の環境にデプロイされ、WebGPUは、モダンなクロスプラットフォーム標準として機能する。
ブラウザベースのLLM推論エンジンは急増しているが、WebGPU/運用ディスパッチのオーバーヘッドは依然として不十分である。
本研究では、逐次ディスパッチ計測手法を導入し、同期でディスパッチを膨らませることにより、ディスパッチ毎のコストを過大に見積もることを示す。
提案手法を用いて,ディスパッチあたりのコストを測定し,使用したデータ型に依存しないことを示す。
カーネルの品質ではなく、ディスパッチのオーバーヘッドがバッチサイズ1のボトルネックであることを示し、ディスパッチ数を原因として分離する。
したがって、バッチサイズ1では、WebGPUにおけるLLM推論最適化の効果的なアプローチはディスパッチ数を削減していると結論付けている。
この結果から,WebGPU仕様や推論エンジンにおいて,現実的なブラウザベース推論への道筋として,アモーティゼーションのディスパッチが示唆された。
関連論文リスト
- Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - Performance of Small Language Model Pretraining on FABRIC: An Empirical Study [2.2070336216767763]
本研究では,学習者が無償で試用できる実験台上での小型LLMの事前学習技術の性能について検討する。
我々は,GPT-2ミディアムモデルと大規模モデルを使用し,オープンソースパッケージであるAlpaとRayを用いて事前訓練を行った。
我々は,GPUが地理的に分散された場合,演算子内並列性と演算子間並列性を一括最適化したAlpaの実行計画が,常に最善を尽くしたことを観察した。
論文 参考訳(メタデータ) (2026-02-02T17:58:47Z) - Optimizing Resource Allocation for Geographically-Distributed Inference by Large Language Models [8.341777627286621]
大規模な言語モデルは、多くのAIタスクにおいて異常なパフォーマンスを示してきたが、ハイエンドGPUを必要とするため、トレーニング後にも使用するには高価である。
近年,PETALSと呼ばれる分散システムが開発され,複数のサーバにモデルブロックを分割し,ローエンドGPUをインターネット上に分散することで,LCMのデプロイ障壁を低くすることに成功した。
本稿では,分散LLM推論における資源配分問題に関する最初の体系的研究を行い,ブロック配置と要求ルーティングの2つの重要な決定に焦点をあてる。
論文 参考訳(メタデータ) (2025-12-26T06:13:59Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - Intra-DP: A High Performance Collaborative Inference System for Mobile Edge Computing [67.98609858326951]
Intra-DPはモバイルデバイス上でのディープニューラルネットワーク(DNN)に最適化された高性能な協調推論システムである。
推論毎のレイテンシを最大50%削減し、最先端のベースラインと比較してエネルギー消費量を最大75%削減する。
評価の結果,DP内の遅延は,最先端のベースラインと比較して最大50%,エネルギー消費は最大75%減少することがわかった。
論文 参考訳(メタデータ) (2025-07-08T09:50:57Z) - Aligning Language Models with Demonstrated Feedback [58.834937450242975]
Demonstration ITerated Task Optimization (DITTO)は、言語モデルの出力とユーザの実証された振る舞いを直接調整する。
我々は,DITTOがニュース記事やメール,ブログ記事などのドメイン間できめ細かいスタイルやタスクアライメントを学習する能力を評価する。
論文 参考訳(メタデータ) (2024-06-02T23:13:56Z) - Distributed Inference and Fine-tuning of Large Language Models Over The
Internet [91.00270820533272]
大規模言語モデル(LLM)は、多くのNLPタスクで有用であり、サイズが向上する。
これらのモデルはハイエンドのハードウェアを必要とするため、ほとんどの研究者にはアクセスできない。
本研究では,システムスループットの最大化のためにデバイスを自動的に割り当てるフォールトトレラント推論アルゴリズムとロードバランシングプロトコルを開発する。
論文 参考訳(メタデータ) (2023-12-13T18:52:49Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z) - RTFormer: Efficient Design for Real-Time Semantic Segmentation with
Transformer [63.25665813125223]
本稿では,リアルタイムセマンティックセグメンテーションのための効率的なデュアルレゾリューション変換器RTFormerを提案する。
CNNベースのモデルよりもパフォーマンスと効率のトレードオフが優れている。
主要なベンチマーク実験では,提案したRTFormerの有効性を示す。
論文 参考訳(メタデータ) (2022-10-13T16:03:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。