論文の概要: How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?
- arxiv url: http://arxiv.org/abs/2609.21058v1
- Date: Thu, 17 Sep 2026 20:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.769528
- Title: How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?
- Title(参考訳): LLMが生成したGPUカーネルは、実際のワークロードのどれ程に到達できるのか?
- Abstract要約: 言語モデルは、PyTorchを上回るGPUカーネルを記述できるようになった。
フロンティアモデルは、91.1%の問題に対して正しいカーネルを生成し、3つの畳み込みを含む56の内22で独立に検証されたスピードアップを行う。
最高値は30.4%に達し、3つの検証されたスピードアップを達成し、ゼロの畳み込みを解決する。
- 参考スコア(独自算出の注目度): 1.7396274240172123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models can now write GPU kernels that outperform PyTorch. We evaluate five model configurations on KernelBench level 1 and find that a frontier model produces correct kernels for 91.1% of problems and independently verified speedups on 22 of 56, including three convolutions, with a median of 1.235x. Open-weights models are far behind: the best reaches 30.4% correct with three verified speedups and solves zero convolutions. We then ask a question the literature does not: what fraction of a real model's wall clock do such kernels govern? Profiling seven workloads across three domains, we find the addressable fraction ranges from 8.9% to 58.2%. On transformers, 80-86% of runtime is spent in cuBLAS GEMM and FlashAttention, bounding realistic end-to-end improvement at roughly 1%, and the fraction shrinks with model scale. On recommenders it is 58.2%, concentrated in a single embedding kernel. We introduce DLRM-Bench, 12 recommender kernel problems in KernelBench format, and measure a 41.7% win rate at a 1.552x median there, projecting 8.63% end-to-end. Separately, we show that KernelBench's correctness check (torch.allclose with an absolute tolerance) is satisfied by a tensor of zeros on 4 of 60 level-1 problems. Two kernels in our own results exploited this before we detected them, including one scored at 283x that wrote 0.3% of its output buffer. We propose scale-invariant replacements and release all 879 evaluations.
- Abstract(参考訳): 言語モデルは、PyTorchを上回るGPUカーネルを記述できるようになった。
KernelBenchレベル1上の5つのモデル構成を評価し、フロンティアモデルが91.1%の問題に対して正しいカーネルを生成し、3つの畳み込みを含む56のうち、独立に検証されたスピードアップが1.235xであることを確認した。
最高値は30.4%に達し、3つの検証されたスピードアップを達成し、ゼロの畳み込みを解決する。
実際のモデルのウォールクロックのどの部分でそのようなカーネルが支配されているのか?
3つのドメインにわたる7つのワークロードをプロファイリングすると、アドレス可能な分数範囲は8.9%から58.2%になる。
トランスフォーマーでは、ランタイムの80~86%がcuBLAS GEMMとFlashAttentionに費やされ、現実的なエンドツーエンドの改善はおよそ1%に抑えられ、その割合はモデルスケールで縮小する。
レコメンデーションでは58.2%であり、単一の埋め込みカーネルに集中している。
KernelBenchフォーマットの12の推奨カーネル問題であるDLRM-Benchを導入し、1.552倍の中央値で41.7%の勝利率を示し、8.63%のエンドツーエンドを予測した。
分離して、KernelBench の正当性チェック (torch.allclose with an absolute tolerance) は、60レベル-1 問題のうち 4 個のゼロのテンソルで満たされることを示す。
うち1つは283xで、出力バッファの0.3%を書き込みました。
スケール不変の代替案を提案し、879の評価を全てリリースする。
関連論文リスト
- KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch? [13.026983194416168]
大きな言語モデル(LLM)は、KernelBenchのようなベンチマークでPyTorchを上回っているように見えるカスタムカーネルを生成することができる。
We demonstrate that frontier models often involved in reward hacking to artificially inflate performance。
論文 参考訳(メタデータ) (2026-06-26T03:22:50Z) - Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels [0.0]
テンソル-カーネルの正当性テストは、手書きの絶対値と相対値の許容値を持つ固定形全クローズスタイルチェックを経由する。
我々は、カーネル自体が正しい実装で観察される絶対許容度を問う。
答えは、現在の手書きのガソリンよりずっときつい。
論文 参考訳(メタデータ) (2026-06-23T20:50:36Z) - KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels [41.03500441875287]
LLMベースのTritonカーネル生成は大きな関心を集めているが、基本的な実験的な疑問は未解決のままである。
本稿では,その正しさとハードウェア効率のカテゴリ認識による評価を通じて,この問題に対処するためのベンチマークであるKernelBenchXを提案する。
論文 参考訳(メタデータ) (2026-05-06T14:18:36Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search [0.0]
Auto Kernelは、任意のPyTorchモデルのGPUカーネル最適化に自律エージェントループを適用するフレームワークである。
システムには、9000行以上のPythonと、2つのバックエンドにまたがる18のスターターカーネル実装、6層最適化プレイブック、KernelBenchベンチマークスイートとの統合が含まれている。
NVIDIA H100では、テストされたプレイブックの大部分で、私たちのTritonカーネルがPyTorchとTorch.compile(max-autotune)の両方を上回っています。
論文 参考訳(メタデータ) (2026-03-22T17:15:28Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Explore as a Storm, Exploit as a Raindrop: On the Benefit of Fine-Tuning Kernel Schedulers with Coordinate Descent [48.791943145735]
カーネルの品質を向上しながら,Ansorの検索時間を短縮する可能性を示す。
このアプローチを、Ansorが生成した最初の300のカーネルに適用する。
この結果は20の有名なディープラーニングモデルで再現されている。
論文 参考訳(メタデータ) (2024-06-28T16:34:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。