論文の概要: KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation
- arxiv url: http://arxiv.org/abs/2607.27231v1
- Date: Wed, 22 Jul 2026 12:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.259005
- Title: KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation
- Title(参考訳): KernelGenBench: LLMベースのカーネル生成のためのマルチソースおよびマルチチップベンチマーク
- Authors: Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin,
- Abstract要約: 大規模言語モデル(LLM)は、効率的なアクセラレーターカーネルの需要を著しく増加させているが、カーネル開発は高度に専門的で労働集約的な課題である。
我々は,多種多様な演算子および異種ハードウェアプラットフォームにわたるLLMおよびエージェント生成Tritonカーネル評価のための統一ベンチマークであるKernelGenBenchを提案する。
- 参考スコア(独自算出の注目度): 13.879112914967058
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have significantly increased the demand for efficient accelerator kernels, but kernel development remains a highly specialized and labor-intensive task. The recent rise of LLMs and agentic frameworks offers a promising pathway toward automatic kernel generation. However, despite rapid progress, there is still no comprehensive benchmark to rigorously evaluate LLM-generated kernels across diverse operator sources or heterogeneous hardware platforms. We present KernelGenBench, a unified benchmark for systematically evaluating LLM- and agent-generated Triton kernels across diverse operator sources and heterogeneous hardware platforms. It comprises two complementary sub-benchmarks: KernelGenBench-MS (Multi-Source), evaluating 210 operators from three sources beyond standard PyTorch-centric tasks, and KernelGenBench-MC (Multi-Chip), measuring performance portability across six heterogeneous hardware platforms using a 110-operator subset. Our large-scale evaluation, consuming over 15 billion tokens, shows: (1) agent-based methods consistently outperform pure LLM sampling methods, while cuBLAS operators are the most challenging across all methods; (2) generation performance varies significantly across hardware platforms, with even recent kernel-specialized agents experiencing severe cross-platform degradation (e.g., AutoKernel drops from 87% on NVIDIA to 25% on Platform E); (3) autonomous kernel generation remains highly cost-intensive, with specialized agent methods averaging 5.11 million tokens per successful operator (AKO4all reaches 5.19 million), orders of magnitude higher than simple LLM sampling approaches.
- Abstract(参考訳): 大規模言語モデル(LLM)は、効率的なアクセラレーターカーネルの需要を著しく増加させているが、カーネル開発は高度に専門的で労働集約的な課題である。
最近のLLMとエージェントフレームワークの台頭は、自動カーネル生成への有望な経路を提供する。
しかし、急速な進歩にもかかわらず、多種多様な演算子や異種ハードウェアプラットフォームにわたるLLM生成カーネルを厳格に評価するための包括的なベンチマークは、まだ存在しない。
我々は,多種多様な演算子および異種ハードウェアプラットフォームにわたるLLMおよびエージェント生成Tritonカーネルを体系的に評価するための統一ベンチマークであるKernelGenBenchを提案する。
KernelGenBench-MS (Multi-Source), KernelGenBench-MC (Multi-Chip), KernelGenBench-MC (Multi-Chip), KernelGenBench-MS (Multi-Chip), KernelGenBench-MS (KernelGenBench-MS) は,110-operatorサブセットを使用した6つの異種ハードウェアプラットフォーム間のパフォーマンスポータビリティの測定を行う。
大規模評価では,(1)エージェントベースの手法は純粋なLCMサンプリング手法を一貫して上回るが,(2) cuBLAS演算子が最も難しいのはハードウェアプラットフォームで,(2) 最近のカーネル特殊化エージェントでも厳しいクロスプラットフォーム劣化(例:AutoKernelはNVIDIAで87%からEプラットフォームで25%に低下する)を経験している。
関連論文リスト
- NKI-Agent: Domain-Specific Fine-Tuning and Agentic Tool Use for Neuron Kernel Generation [18.169388901224416]
NKIカーネル生成のためのドメイン固有の微調整とエージェントループを組み合わせた最初のシステムであるNKI-Agentを提案する。
Opus 4.8は、エージェントツールなしでシングルショットモードで6%スコアし、SFTでトレーニングされたQwen3-Coder-30B-A3Bは、Sonnet 4 RLの1/100分の1で25.0%パスレートを達成した。
論文 参考訳(メタデータ) (2026-07-05T16:37:41Z) - K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model [57.440609834690385]
既存のアプローチでは、進化ループ内の高速コードジェネレータとして、LLM(Large Language Models)を扱います。
我々は,共進化的世界モデルによる検索を提案し,この手法に基づいてK-Searchを構築する。
GQA, MLA, MoE カーネルを含む多種多様な複雑なカーネル上で K-Search を評価する。
論文 参考訳(メタデータ) (2026-02-22T11:06:22Z) - KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware [25.808580418841718]
新しいAIアクセラレータは、しばしば開発者が手動で低レベルのカーネルを作る必要がある。
これにより、新興ハードウェアプラットフォームが市場に到達するのを効果的に防ぐことができる。
KernelCraftは、エージェントがカスタマイズされたアクセラレーターのために低レベルのカーネルを生成し最適化する能力を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-02-10T14:52:02Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - STARK: Strategic Team of Agents for Refining Kernels [23.717055490630596]
我々は,GPUカーネル最適化のためのエージェントフレームワークを導入し,マルチエージェント協調による設計空間を探索する。
このフレームワークはエキスパートエンジニアのワークフローを模倣し、LCMがハードウェアトレードオフを推論し、プロファイリングフィードバックを取り入れ、カーネルを反復的に洗練することを可能にする。
我々は,LLMに基づくカーネル最適化のベンチマークであるKernelBenchに対するアプローチを評価し,ベースラインエージェントよりも大幅に改善したことを示す。
論文 参考訳(メタデータ) (2025-10-19T20:41:46Z) - MultiKernelBench: A Multi-Platform Benchmark for Kernel Generation [17.461533973039064]
MultiKernelBenchは、大規模言語モデル(LLM)を用いたディープラーニングカーネル生成のためのベンチマークである。
14の明確に定義されたカーネルカテゴリにまたがる285のタスクにまたがっており、3つの主要なハードウェアプラットフォームをサポートしている。
課題の難易度, トレーニング露出の少ないプラットフォームへの一般化の低さ, ターゲット型プロンプト戦略の有効性について検討した。
論文 参考訳(メタデータ) (2025-07-20T00:58:33Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - PolyScientist: Automatic Loop Transformations Combined with Microkernels
for Optimization of Deep Learning Primitives [55.79741270235602]
深層学習カーネル開発のためのハイブリッドソリューションを開発する。
我々は、高度な多面体技術を用いて、パフォーマンスのために外部ループを自動的に調整する。
論文 参考訳(メタデータ) (2020-02-06T08:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。