論文の概要: GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization
- arxiv url: http://arxiv.org/abs/2605.31464v1
- Date: Fri, 29 May 2026 15:56:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.717765
- Title: GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization
- Title(参考訳): GPU Forecasters:カーネルランタイム最適化のための選択的なサロゲートとしての言語モデル
- Authors: Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal,
- Abstract要約: カーネル評価のための選択的なGPUサロゲートとしてLLMがどのように機能するかを検討する。
限られたGPU測定予算下での高速カーネルの復旧に,その予測が正確で校正され,実用的に有用であるかどうかを計測する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
- 参考スコア(独自算出の注目度): 73.92934811090163
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GPU kernels are the workhorse of modern deep learning, and optimizing them (via evolutionary search or coding agents) usually requires repeated measurement on target hardware. While these measurements provide the ground-truth signal necessary for kernel search, they are costly, because each evaluation of a kernel requires compilation and repeated execution on a GPU. As improvements in LLM inference reduce the cost of writing novel kernels and LLM-driven searches scale to large search budgets, on-device evaluation becomes a bottleneck. To address this, we study how LLMs can serve as selective GPU surrogates for kernel evaluation, by forecasting the performance of proposed kernels. A useful surrogate should be accurate, and it should be selective, by knowing when it could be wrong, and deferring to the GPU. To evaluate surrogates, we measure whether their forecasts are accurate, calibrated, and practically useful for recovering fast kernels under limited GPU-measurement budgets. Next, we study whether reinforcement learning can improve forecast accuracy and confidence calibration. Our experiments demonstrate that LLMs can accurately forecast relative kernel performance, that their utility can be improved through reinforcement learning. Used inside a kernel search, the surrogate lets the search consider several times as many candidates under the same GPU evaluation budget, and that leads to finding faster kernels than an equal-budget baseline. These results suggest that LLMs can play a broader role in kernel optimization, by acting as virtual models of a GPU rather than solely as kernel generators for search.
- Abstract(参考訳): GPUカーネルは現代のディープラーニングの成果であり、(進化的検索やコーディングエージェントを通じて)それらを最適化するには、通常、ターゲットハードウェア上で繰り返し測定する必要がある。
これらの測定は、カーネル探索に必要な地上信号を提供するが、カーネルのそれぞれの評価はGPU上でのコンパイルと繰り返し実行を必要とするため、コストがかかる。
LLM推論の改良により、新しいカーネルの作成コストが削減され、LLM駆動の検索が大規模な検索予算にスケールするにつれて、デバイス上での評価がボトルネックとなる。
そこで本研究では,提案するカーネルの性能を予測し,LLMがカーネル評価のための選択的なGPUサロゲートとして機能する方法について検討する。
有用なサロゲートは正確でなければならないし、いつそれが間違っているのかを知り、GPUに延期することで選択すべきである。
サーロゲートの評価には,GPU測定予算の制限下での高速カーネルの復旧に,予測が正確で校正され,実用的に有用であるかどうかを計測する。
次に,強化学習が予測精度と信頼性校正を向上できるかどうかを検討する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
カーネルサーチ内で使用されるサロゲートは、同じGPU評価予算の下で、検索を数倍の候補とみなすことができ、それによって、同じ予算のベースラインよりも高速なカーネルを見つけることができる。
これらの結果から,LLMは検索用のカーネルジェネレータとしてではなく,GPUの仮想モデルとして機能することで,カーネル最適化においてより大きな役割を果たす可能性が示唆された。
関連論文リスト
- Prior Knowledge or Search? A Study of LLM Agents in Hardware-Aware Code Optimization [20.018878620048344]
純粋なブラックボックス最適化では、LLMは欲張りとして機能する。
ゼロショットカーネル生成では、明示的な入力サイズ情報を提供するが、測定可能な効果はない。
カーネルサイズが一般的でない場合、使用する言語に関係なく、パフォーマンスは大幅に低下する。
論文 参考訳(メタデータ) (2026-05-19T12:48:48Z) - GPU-Accelerated Algorithms for Graph Vector Search: Taxonomy, Empirical Study, and Research Directions [54.570944939061555]
本稿では,GPU加速グラフに基づくベクトル探索アルゴリズムについて包括的に研究する。
我々は、GPU最適化戦略の詳細な分類を確立し、アルゴリズムタスクとハードウェア実行ユニット間のマッピングを明確にする。
我々の発見は、スケーラブルで堅牢なGPUベースの近接検索システムを設計するための明確なガイドラインを提供する。
論文 参考訳(メタデータ) (2026-02-10T16:18:04Z) - Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity [2.7389338551082605]
性能ボトルネックを予測するため,LLM(Large Language Models)のベンチマークを開発した。
FLOPBenchは577カーネルの単精度と倍精度のFLOP数を予測する。
われわれはFLOPBenchをLLMツールの開発に焦点をあてたテストベッドとして位置づけた。
論文 参考訳(メタデータ) (2025-12-04T01:03:20Z) - NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding [54.88765757043535]
この研究は、統計的なn-gram言語モデルのデータ構造を再考し、GPU最適化推論の高速かつ並列な操作を可能にする。
我々のアプローチは NGPU-LM と呼ばれ、7% 未満の計算オーバーヘッドを持つ全ての主要な ASR モデルに対して、カスタマイズ可能なgreedy decoding を導入している。
提案手法は,ビーム探索による顕著な遅延を回避しつつ,greedy と beam search の精度ギャップの50%以上を排除できる。
論文 参考訳(メタデータ) (2025-05-28T20:43:10Z) - Can Large Language Models Predict Parallel Code Performance? [1.5221392705893568]
本稿では,Large Language Models (LLM) がハードウェアに依存しないGPU性能予測に代替的なアプローチを提供するかどうかを考察する。
LLMはRooflineモデルについて強く理解しており、明示的なプロファイリングデータを備えた場合、100%の分類精度を達成する。
以上の結果から,より優れたデータセットと迅速な戦略により,LLMはHPCルーフライン解析および性能ポータビリティのための実用的なツールとなる可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-06T21:41:20Z) - Explore as a Storm, Exploit as a Raindrop: On the Benefit of Fine-Tuning Kernel Schedulers with Coordinate Descent [48.791943145735]
カーネルの品質を向上しながら,Ansorの検索時間を短縮する可能性を示す。
このアプローチを、Ansorが生成した最初の300のカーネルに適用する。
この結果は20の有名なディープラーニングモデルで再現されている。
論文 参考訳(メタデータ) (2024-06-28T16:34:22Z) - Optimal Kernel Tuning Parameter Prediction using Deep Sequence Models [0.44998333629984877]
本稿では,深部列列列モデルを用いて,計算カーネルを管理する最適チューニングパラメータを予測する手法を提案する。
提案アルゴリズムは、AMD機械学習プリミティブライブラリであるMIOpenにおいて、様々な畳み込みカーネル上で90%以上の精度を達成することができる。
論文 参考訳(メタデータ) (2024-04-15T22:25:54Z) - SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation [0.0]
大型言語モデル(LLM)はその出現以来、重要なワークロードとなっている。
また、数十億のパラメータを持ち、大量のデータで訓練されているため、計算コストも高い。
近年、LLMのトレーニングと推論のための専用カーネルが開発されているため、ハードウェアリソースは可能な限り十分に活用されている。
論文 参考訳(メタデータ) (2024-03-25T15:26:50Z) - Kernel methods through the roof: handling billions of points efficiently [94.31450736250918]
カーネル法は、非パラメトリック学習に対するエレガントで原則化されたアプローチを提供するが、今のところ大規模な問題ではほとんど利用できない。
最近の進歩は、最適化、数値線形代数、ランダム射影など、多くのアルゴリズム的アイデアの利点を示している。
ここでは、これらの取り組みをさらに進めて、GPUハードウェアを最大限に活用する解決器を開発し、テストする。
論文 参考訳(メタデータ) (2020-06-18T08:16:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。