論文の概要: KernelSight-LM: A Kernel-Level LLM Inference Simulator
- arxiv url: http://arxiv.org/abs/2606.28565v2
- Date: Thu, 02 Jul 2026 09:24:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 15:16:32.237818
- Title: KernelSight-LM: A Kernel-Level LLM Inference Simulator
- Title(参考訳): KernelSight-LM:カーネルレベルLLM推論シミュレータ
- Authors: Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt,
- Abstract要約: 本稿では,トークンレベルの実行をモデル化し,カーネルレベルの遅延分解を生成する,詳細な推論シミュレータであるKernelSight-LMを提案する。
それぞれのサービスステップを学習された効率項、通信モデル、ホストオーバーヘッドモデルでカーネルモデルに分解する。
カーネルレベルのボトルネックはハードウェア/ソフトウェアの共同設計とキャパシティプランニングをサポートする。
- 参考スコア(独自算出の注目度): 27.54401355597591
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: As large language models (LLMs) move into production serving, practitioners must rapidly evaluate inference performance across diverse hardware, models, and serving parameters to meet cost and latency targets. However, the end-to-end behavior of LLMs couples serving-layer policies with low-level GPU kernel execution and rapidly evolving architectures, forcing slow, deployment-specific benchmarking that is hard to generalize. We present KernelSight-LM, a fine-grained inference simulator that models token-level execution and produces kernel-level latency breakdowns. It decomposes each serving step into a roofline kernel model with a learned efficiency term, a communication model, and a host-overhead model, composed through a discrete-event scheduler that also captures mechanisms like prefix caching and continuous batching. KernelSight-LM offers two prediction tiers that trade target-GPU data for accuracy. The cross-generation tier uses no target-GPU measurements, only hardware specifications and kernel microbenchmarks from previously profiled GPUs, and predicts per-kernel latency on an unseen GPU generation to 12.1% error, a 1.8x improvement over the roofline baseline (22.0%). A second target-measured tier adds one model-agnostic kernel-microbenchmark sweep on the target GPU, sharpening per-kernel error to 3.8%, a 7.3x improvement over a comparable baseline (27.7%). Both tiers require far less target-GPU data than the prior systems they extend. In our simulator, these predictions yield end-to-end median (p50) errors across six model families of 15.4%, 12.8%, and 3.0% (TTFT, TPOT, throughput) in the cross-generation tier and 14.3%, 6.2%, and 2.7% in the target-measured tier, matching dedicated profiling tools while collecting far less on-device data. Beyond prediction, its kernel-level bottleneck breakdowns support hardware/software co-design and capacity planning.
- Abstract(参考訳): 大規模言語モデル(LLM)が本番環境に移行するにつれて、実践者は様々なハードウェア、モデル、そしてコストとレイテンシの目標を満たすためのパラメータを提供するための推論性能を迅速に評価する必要がある。
しかし、LLMのエンドツーエンドの動作は、低レベルのGPUカーネルの実行と急速に進化するアーキテクチャを備えたサービス層ポリシーを結合し、遅くてデプロイ固有のベンチマークを一般化するのが困難である。
本稿では,トークンレベルの実行をモデル化し,カーネルレベルの遅延分解を生成する,詳細な推論シミュレータであるKernelSight-LMを提案する。
これは、各サービスステップを学習された効率項、通信モデル、ホストオーバーヘッドモデルでルーフラインカーネルモデルに分解し、プレフィックスキャッシュや連続バッチなどのメカニズムをキャプチャする離散イベントスケジューラによって構成される。
KernelSight-LMは、ターゲットGPUデータを正確に交換する2つの予測層を提供する。
クロスジェネレーション層では、ターゲットGPU測定は使用せず、以前にプロファイルされたGPUのハードウェア仕様とカーネルマイクロベンチマークのみを使用し、未確認のGPU生成時のカーネル毎のレイテンシを12.1%エラーと予測し、ルーフラインベースラインの1.8倍の改善(22.0%)を達成している。
第2のターゲット測定層は、ターゲットGPUに1つのモデルに依存しないカーネル-マイクロベンチマークスイープを追加し、カーネル毎のエラーを3.8%に、同等のベースライン(27.7%)よりも7.3倍改善した。
どちらのティアも、拡張する以前のシステムよりも、ターゲットGPUデータが少なくなります。
シミュレーションでは,6種類のモデル群で15.4%,12.8%,3.0%(TTFT,TPOT,スループット),14.3%,6.2%,2.7%の中間値(p50)誤差が得られた。
予測以外にも、カーネルレベルのボトルネックはハードウェア/ソフトウェアの共同設計とキャパシティプランニングをサポートする。
関連論文リスト
- LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization [37.645358922637065]
KernelProはクローズドループのマルチエージェントシステムで、カーネルコードを自動生成、プロファイル、反復的に最適化する。
KernelProでは、レベル1/2/3の2.42x/4.69x/5.30xの平均スピードアップを実現し、あらゆる難易度で最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-06-24T23:28:09Z) - GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization [73.92934811090163]
カーネル評価のための選択的なGPUサロゲートとしてLLMがどのように機能するかを検討する。
限られたGPU測定予算下での高速カーネルの復旧に,その予測が正確で校正され,実用的に有用であるかどうかを計測する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
論文 参考訳(メタデータ) (2026-05-29T15:56:08Z) - Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU [38.81440160993858]
ディープラーニングアルゴリズムを新しいハードウェアアクセラレータに移植するには、開発者はコードベースのすべてのTritonカーネルに同じ低レベル最適化を適用する必要がある。
我々は、このプロセスをIntel GPU向けに自動化するマルチステージLCM駆動パイプラインであるXe-Forgeを紹介する。
キュレートされた知識ベースは、LLMトレーニングデータにはないIntel GPU制約を符号化し、モデルをアーキテクチャ上有効なバウンダリ内に保持する。
論文 参考訳(メタデータ) (2026-04-16T20:21:01Z) - Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization [48.656549870801285]
Kernel-Smithは高性能GPUカーネルと演算子生成のためのフレームワークである。
エージェント側では、Kernel-Smithは実行可能な候補の集団を維持し、反復的にそれらを改善している。
トレーニング側では、長距離進化軌道をステップ中心の監視と強化学習信号に変換する。
論文 参考訳(メタデータ) (2026-03-30T12:12:49Z) - DPVO-QAT++: Heterogeneous QAT and CUDA Kernel Fusion for High-Performance Deep Patch Visual Odometry [0.8122270502556375]
本稿では,DPVO-QAT++ (DPVO-QAT++: Heterogeneous QAT and Kernel Fusion for High-Performance Deep Patch Visual Odometry)を提案する。
論文 参考訳(メタデータ) (2025-11-16T15:38:25Z) - Omniwise: Predicting GPU Kernels Performance with LLMs [0.06666419797034795]
Omniwiseは、GPUカーネルのパフォーマンス予測に大規模言語モデル(LLM)を適用する、エンド・ツー・エンドの自己教師型微調整パイプラインである。
メモリ帯域幅、キャッシュヒット率、GFLOP、演算強度などの重要なパフォーマンス指標を、コード実行やプロファイリングツールを必要とせずに、カーネルコードから直接予測することができる。
提案手法は,AMD MI250およびMI300Xアーキテクチャ上で実行されるGPUカーネル上での相対誤差の10%以内の予測を90%以上達成する。
論文 参考訳(メタデータ) (2025-06-25T23:36:44Z) - DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures
using Lookup Tables [49.965024476651706]
DeepGEMMはSIMDハードウェア上で超高精度畳み込みニューラルネットワークを実行するためのルックアップテーブルベースのアプローチである。
実装は、x86プラットフォーム上で、対応する8ビット整数カーネルを最大1.74倍の性能で上回る。
論文 参考訳(メタデータ) (2023-04-18T15:13:10Z) - Accelerating Training and Inference of Graph Neural Networks with Fast
Sampling and Pipelining [58.10436813430554]
グラフニューラルネットワーク(GNN)のミニバッチトレーニングには、多くの計算とデータ移動が必要である。
我々は,分散マルチGPU環境において,近傍サンプリングを用いたミニバッチトレーニングを行うことを支持する。
本稿では,これらのボトルネックを緩和する一連の改良点について述べる。
また,サンプリングによる推論を支援する実験分析を行い,試験精度が実質的に損なわれていないことを示す。
論文 参考訳(メタデータ) (2021-10-16T02:41:35Z) - A Simple Model for Portable and Fast Prediction of Execution Time and
Power Consumption of GPU Kernels [2.9853894456071077]
このモデルは、Parboil、Rodinia、Polybench-GPU、SHOCなどのベンチマークから189個の計算カーネルを使用してランダムなフォレストに基づいて構築されている。
クロスバリデーションを用いたモデル性能の評価では、中央値平均パーセンテージエラー(MAPE)は8.86-52.00%と1.84-2.94%で、それぞれ5つのGPUで電力予測を行う。
論文 参考訳(メタデータ) (2020-01-20T13:40:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。