論文の概要: Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- arxiv url: http://arxiv.org/abs/2607.14541v1
- Date: Thu, 16 Jul 2026 03:49:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.978535
- Title: Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- Title(参考訳): LLM生成GPUカーネルは生産可能か?トレース駆動ベンチマークと最適化エージェント
- Abstract要約: 既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
- 参考スコア(独自算出の注目度): 10.241408048987038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing GPU kernel generation benchmarks draw problems from synthetic or curated sources that diverge from deployed workloads. We present Atrex-Bench, a benchmark whose 30 operators and 440 shapes are sampled directly from full-cluster production inference traces of compute-limited, memory-rich GPUs. Each problem carries an importance weight derived from its share of observed GPU time, weighted by application card-hours and computed separately for the serving phases in which it runs, together with a per-problem roofline ceiling, so the aggregate score emphasizes the kernels that consume the most serving time. Evaluating six frontier coding agents on Atrex-Bench shows that even the best vanilla model reaches only ${\sim}10\%$ of the hardware roofline on production operators; and correctness alone overstates capability, since much of the apparent pass rate comes from PyTorch fallbacks rather than kernels the model wrote. To close this gap, we co-release Atrex-Kernel-Agent (AKA), a profile-driven kernel-optimization agent that combines iterative measure-revise search, optimization dropout for escaping stalled search contexts, and a layered GPU-optimization knowledge base (298 reference-kernel files and 244 optimization-knowledge documents, plus external upstream reference projects for API/ISA lookup). In a controlled case study, the agent converts zero-FlyDSL fallbacks into real kernels that match or exceed hand-tuned production baselines.
- Abstract(参考訳): 既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
それぞれの問題は、観測されたGPU時間のシェアから導かれる重要な重みを持ち、アプリケーションカード時間によって重み付けされ、実行中のサービスフェーズごとに別々に計算される。
Atrex-Bench上での6つのフロンティアコーディングエージェントの評価によると、最高のバニラモデルでさえ、プロダクションオペレーターのハードウェアルーフラインのわずか${\sim}10\%にしか達していない。
このギャップを埋めるために、プロファイル駆動のカーネル最適化エージェントであるAtrex-Kernel-Agent(aka)を共同リリースし、反復的測度修正検索、停止した検索コンテキストをエスケープするための最適化ドロップアウト、GPU最適化知識ベース(298の参照カーネルファイルと244の最適化カーネルドキュメント、API/ISAルックアップのための外部のアップストリーム参照プロジェクト)を組み合わせた。
制御されたケーススタディでは、エージェントはゼロFlyDSLフォールバックを手作業による生産ベースラインに適合または超える実カーネルに変換する。
関連論文リスト
- Harness Engineering for LLM-Driven GPU Kernel Generation [1.375573703671189]
大規模言語モデル(LLM)はGPUカーネル生成を支援するが、その実用性は生成したコードが確実に制約され、検証され、プロファイルされ、選択されるかどうかに依存する。
本稿では,MLSys 2026 FlashInfer AI Kernel Generation ContestにおけるLLM駆動型GPUカーネル最適化のためのハーネス中心システムを提案する。
論文 参考訳(メタデータ) (2026-07-20T14:14:14Z) - GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization [73.92934811090163]
カーネル評価のための選択的なGPUサロゲートとしてLLMがどのように機能するかを検討する。
限られたGPU測定予算下での高速カーネルの復旧に,その予測が正確で校正され,実用的に有用であるかどうかを計測する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
論文 参考訳(メタデータ) (2026-05-29T15:56:08Z) - FastKernels: Benchmarking GPU Kernel Generation in Production [15.284289018908781]
LLMベースのGPUカーネル生成エージェントは急速に進歩している。
しかし、彼らの進歩は最適化されたベンチマークによって制限されています。
Fast Kernelsはプロダクショングレードの推論フレームワークで、強化されたシステムと同等に動作する。
論文 参考訳(メタデータ) (2026-05-22T04:19:04Z) - A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM [47.09947710347623]
PrismLLMは大規模なクラスタにアクセスする必要から大規模な実行を分離する。
大規模LLMトレーニングワークロードの実験は、PrismLLMがパフォーマンスとメモリの挙動を正確に再現していることを示している。
論文 参考訳(メタデータ) (2026-05-15T04:58:20Z) - ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants [12.49256588033198]
LLMベースのコーディングエージェントは、機能的に正しいGPUカーネルを生成することができるが、その性能は、重要な計算に関する手動最適化ライブラリよりもはるかに低いままである。
データフロー不変量を通じてこの問題に対処するエージェントフレームワークであるArgusを紹介します。
我々は、GEMM、フラッシュアテンション、MoEカーネルにわたるAMD MI300X GPU上でArgusを評価する。
論文 参考訳(メタデータ) (2026-04-16T15:49:31Z) - SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits [33.140868197031985]
SOL-ExecBenchは、124生産モデルと新興AIモデルから抽出された235の最適化問題のベンチマークである。
SOLARによって計算された解析的導出光速度(SOL)境界に対して性能を測定する。
我々は、リリース定義スコアベースラインと、候補カーネルを閉じたハードウェアSOLとの間のギャップを定量化するSOLスコアを報告する。
論文 参考訳(メタデータ) (2026-03-19T17:30:02Z) - CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation [51.72529978689561]
Agentは、カーネルの専門知識を3つのコンポーネントで開発する大規模なエージェント強化学習システムである。
AgentはKernelBench上で、トーチコンパイルよりも100%、100%、92%高速なレートを提供する。
論文 参考訳(メタデータ) (2026-02-27T18:58:05Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity [2.7389338551082605]
性能ボトルネックを予測するため,LLM(Large Language Models)のベンチマークを開発した。
FLOPBenchは577カーネルの単精度と倍精度のFLOP数を予測する。
われわれはFLOPBenchをLLMツールの開発に焦点をあてたテストベッドとして位置づけた。
論文 参考訳(メタデータ) (2025-12-04T01:03:20Z) - NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding [54.88765757043535]
この研究は、統計的なn-gram言語モデルのデータ構造を再考し、GPU最適化推論の高速かつ並列な操作を可能にする。
我々のアプローチは NGPU-LM と呼ばれ、7% 未満の計算オーバーヘッドを持つ全ての主要な ASR モデルに対して、カスタマイズ可能なgreedy decoding を導入している。
提案手法は,ビーム探索による顕著な遅延を回避しつつ,greedy と beam search の精度ギャップの50%以上を排除できる。
論文 参考訳(メタデータ) (2025-05-28T20:43:10Z) - KernelBench: Can LLMs Write Efficient GPU Kernels? [36.4117525096377]
KernelBenchは、高速で正確なカーネルを記述する言語モデルの能力を評価するためのオープンソースのフレームワークである。
本稿では,関数的に正しい生成カーネルの割合を計測する,新しい評価基準であるfast_pを紹介する。
実験の結果,フロンティア推論モデルが最も優れているが,全体としては不足していることがわかった。
論文 参考訳(メタデータ) (2025-02-14T19:30:53Z) - Providing Meaningful Data Summarizations Using Examplar-based Clustering
in Industry 4.0 [67.80123919697971]
我々は,従来のCPUアルゴリズムと比較して,一精度で最大72倍,半精度で最大452倍の高速化を実現していることを示す。
提案アルゴリズムは射出成形プロセスから得られた実世界のデータに適用し, 得られたサマリーが, コスト削減と不良部品製造の削減のために, この特定のプロセスのステアリングにどのように役立つかについて議論する。
論文 参考訳(メタデータ) (2021-05-25T15:55:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。