論文の概要: Correct but Slow: An Empirical Study of the GPU Kernel Evaluation Gap in Modern Domain-Specific Languages
- arxiv url: http://arxiv.org/abs/2607.04454v3
- Date: Mon, 13 Jul 2026 19:43:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.263233
- Title: Correct but Slow: An Empirical Study of the GPU Kernel Evaluation Gap in Modern Domain-Specific Languages
- Title(参考訳): 正しいが遅い: 現代ドメイン特化言語におけるGPUカーネル評価ギャップの実証的研究
- Abstract要約: 機能的に有効なカーネルは、置き換えを意図した最適化されたライブラリオペレータのスループットよりもはるかに低い可能性がある。
NVIDIA A100 と GH200 GPU 上の 5 つの演算子カテゴリから,22 の Triton と TileLang のカーネルを用いて,この精度と性能のギャップについて検討した。
- 参考スコア(独自算出の注目度): 9.908756853186018
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern GPU domain-specific languages (DSLs), such as Triton and TileLang, are increasingly used to implement specialized deep-learning kernels and as target languages for automated kernel-generation systems. Existing DSL-kernel evaluations establish correctness through reference-based numerical validation -- necessary, but silent on replacement quality: a functionally valid kernel may still fall far below the throughput of the optimized library operator it is intended to replace. We study this correctness-performance gap using 22 Triton and TileLang kernels from five operator categories on NVIDIA A100 and GH200 GPUs, asking whether correctness-based evaluation identifies kernels unsuitable as library replacements, why such failures occur, and how they can be detected without exhaustive benchmark coverage. The study yields three results. \emph{First}, correctness-based evaluation can admit severe slowdowns: an idiomatic TileLang LayerNorm kernel passes KernelBench's correctness check while running more than 300$\times$ slower than the PyTorch baseline. \emph{Second}, the causes differ by kernel family. TileLang normalization and reduction slowdowns are mainly repairable authoring defects, such as sequential reductions and unnecessary dtype conversions, whereas convolution and large general matrix multiplication (GEMM) retain residual gaps after optimization due to code-generation and autotuning-coverage limits; vendor-library algorithm selection contributes only marginally. \emph{Third}, two lightweight checks -- library-relative efficiency and roofline utilization -- are complementary screening criteria: together they flag every functionally valid but inefficient kernel in our suite and separate repairable authoring defects from structural residuals.
- Abstract(参考訳): TritonやTileLangのような最新のGPUドメイン固有言語(DSL)は、専門的なディープラーニングカーネルの実装や、自動カーネル生成システムのターゲット言語として、ますます使われている。
既存のDSLカーネル評価は、参照ベースの数値検証によって正確性を確立する -- 必要だが、置換品質について沈黙している: 機能的に有効なカーネルは、置き換えを意図した最適化ライブラリオペレータのスループットよりもはるかに低い可能性がある。
NVIDIA A100 と GH200 GPU の 5 つの演算系カテゴリの Triton と TileLang のカーネルを用いて,この精度と性能のギャップを調べた。
その研究は3つの結果をもたらす。
慣用的なTileLang LayerNormカーネルはKernelBenchの正当性チェックをパスし、300$\times$はPyTorchベースラインよりも遅い。
原因はカーネルファミリによって異なります。
TileLangの正規化と減速は、シーケンシャルリダクションや不要なdtype変換といった、主に修正可能な欠陥のオーサリングである一方、畳み込みと大規模一般行列乗算(GEMM)は、コード生成と自動修正-カバレッジ制限による最適化後の残差を保ち、ベンダー-ライブラリアルゴリズムの選択は、わずかにしか寄与しない。
2つの軽量チェック -- ライブラリ相対効率と屋上線利用 -- は補完的なスクリーニング基準である。
関連論文リスト
- KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch? [13.026983194416168]
大きな言語モデル(LLM)は、KernelBenchのようなベンチマークでPyTorchを上回っているように見えるカスタムカーネルを生成することができる。
We demonstrate that frontier models often involved in reward hacking to artificially inflate performance。
論文 参考訳(メタデータ) (2026-06-26T03:22:50Z) - GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization [73.92934811090163]
カーネル評価のための選択的なGPUサロゲートとしてLLMがどのように機能するかを検討する。
限られたGPU測定予算下での高速カーネルの復旧に,その予測が正確で校正され,実用的に有用であるかどうかを計測する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
論文 参考訳(メタデータ) (2026-05-29T15:56:08Z) - Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts [29.878782850560132]
Kernel Foundryは、自動GPUカーネル最適化のための診断駆動の進化的フレームワークである。
KernelBenchの実験では、強いベースラインよりも精度と性能が一貫して向上していることが示されている。
論文 参考訳(メタデータ) (2026-05-08T03:41:54Z) - AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU [38.81440160993858]
ディープラーニングアルゴリズムを新しいハードウェアアクセラレータに移植するには、開発者はコードベースのすべてのTritonカーネルに同じ低レベル最適化を適用する必要がある。
我々は、このプロセスをIntel GPU向けに自動化するマルチステージLCM駆動パイプラインであるXe-Forgeを紹介する。
キュレートされた知識ベースは、LLMトレーニングデータにはないIntel GPU制約を符号化し、モデルをアーキテクチャ上有効なバウンダリ内に保持する。
論文 参考訳(メタデータ) (2026-04-16T20:21:01Z) - ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants [12.49256588033198]
LLMベースのコーディングエージェントは、機能的に正しいGPUカーネルを生成することができるが、その性能は、重要な計算に関する手動最適化ライブラリよりもはるかに低いままである。
データフロー不変量を通じてこの問題に対処するエージェントフレームワークであるArgusを紹介します。
我々は、GEMM、フラッシュアテンション、MoEカーネルにわたるAMD MI300X GPU上でArgusを評価する。
論文 参考訳(メタデータ) (2026-04-16T15:49:31Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - CrashFixer: A crash resolution agent for the Linux kernel [58.152358195983155]
この作業は、システムレベルのLinuxカーネルバグのベンチマークと、Linuxカーネルで実験を実行するプラットフォームを共有するkGymの上に構築されている。
CrashFixerはLinuxカーネルのバグに適応する最初のLCMベースのソフトウェア修復エージェントである。
論文 参考訳(メタデータ) (2025-04-29T04:18:51Z) - KernelBench: Can LLMs Write Efficient GPU Kernels? [36.4117525096377]
KernelBenchは、高速で正確なカーネルを記述する言語モデルの能力を評価するためのオープンソースのフレームワークである。
本稿では,関数的に正しい生成カーネルの割合を計測する,新しい評価基準であるfast_pを紹介する。
実験の結果,フロンティア推論モデルが最も優れているが,全体としては不足していることがわかった。
論文 参考訳(メタデータ) (2025-02-14T19:30:53Z) - KGym: A Platform and Dataset to Benchmark Large Language Models on Linux Kernel Crash Resolution [59.20933707301566]
大規模言語モデル(LLM)は、ますます現実的なソフトウェア工学(SE)タスクにおいて一貫して改善されている。
現実世界のソフトウェアスタックでは、Linuxカーネルのような基本的なシステムソフトウェアの開発にSEの取り組みが費やされています。
このような大規模システムレベルのソフトウェアを開発する際にMLモデルが有用かどうかを評価するため、kGymとkBenchを紹介する。
論文 参考訳(メタデータ) (2024-07-02T21:44:22Z) - Lifelong Bandit Optimization: No Prior and No Regret [70.94238868711952]
我々は,過去の経験から学習することで環境に適応するアルゴリズムであるLIBOを開発した。
カーネルが未知だが、すべてのタスク間で共有されるカーネル構造を仮定する。
我々のアルゴリズムは、任意のカーネル化または線形バンディットアルゴリズムと組み合わせて、最適な性能を保証できる。
論文 参考訳(メタデータ) (2022-10-27T14:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。