論文の概要: EGG: An Expert-Guided Agent Framework for Kernel Generation
- arxiv url: http://arxiv.org/abs/2606.26758v1
- Date: Thu, 25 Jun 2026 08:44:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.219004
- Title: EGG: An Expert-Guided Agent Framework for Kernel Generation
- Title(参考訳): EGG:カーネル生成のためのエキスパートガイドエージェントフレームワーク
- Authors: Yaochen Han, Ke Fan, Hongxu Jiang, Wanqi Xu, Weiyu Xie, Runhua Zhang, Chenhui Zhu, Yixiang Zhang,
- Abstract要約: LLMの判断を導くために,専門家最適化の原則を取り入れた,カーネル生成のためのエキスパートガイドエージェントフレームワークEGGを提案する。
EGGはPyTorchよりも平均2.13倍のスピードアップを実現し、既存のエージェントベースおよびRLベースのアプローチより優れている。
- 参考スコア(独自算出の注目度): 6.7681055398028995
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-performance GPU kernels are critical for reducing the exponentially growing computational costs of large language models (LLMs), but their development heavily relies on manual tuning by domain experts. While recent advances in LLM-based approaches show promise for automating kernel generation, they still struggle to achieve both correctness and high performance. This limitation primarily arises from the lack of domain-specific optimization guidance, hindering effective exploration of the optimization space. We propose EGG, an Expert-Guided Agent Framework for Kernel Generation, which incorporates expert optimization principles to guide LLMs' decisions. Inspired by expert workflows, we decompose kernel generation into two hierarchical stages: 1) algorithmic structure design, which establishes a high-quality computational structure foundation; 2) hardware-specific tuning, which performs targeted adjustments through parallel mapping, tensor tiling, and memory optimization. This staged decomposition defines explicit optimization objectives, structuring the design space to achieve progressive refinement. To this end, a stage-aware multi-agent collaboration mechanism is designed for inter and intra-stage context management, ensuring stable optimization trajectories. Experiments on KernelBench and real-world workloads show that EGG achieves a 2.13x average speedup over PyTorch, outperforming existing agent-based and RL-based approaches.
- Abstract(参考訳): 高性能GPUカーネルは、大規模言語モデル(LLM)の指数関数的に増加する計算コストを削減するために重要であるが、その開発はドメインエキスパートによる手動チューニングに大きく依存している。
LLMベースのアプローチの最近の進歩はカーネル生成の自動化を約束しているが、正確性と高性能の両方を達成するのに苦戦している。
この制限は、主にドメイン固有の最適化ガイダンスの欠如から生じ、最適化空間の効率的な探索を妨げる。
LLMの判断を導くために,専門家最適化の原則を取り入れた,カーネル生成のためのエキスパートガイドエージェントフレームワークEGGを提案する。
専門家のワークフローにヒントを得て、カーネル生成を2つの階層的なステージに分解する。
1) 高品質な計算構造基盤を確立するアルゴリズム構造設計
2) 並列マッピング,テンソルタイリング,メモリ最適化による目標調整を行うハードウェア固有チューニング。
この段階的な分解は、明確な最適化目標を定義し、段階的な洗練を達成するために設計空間を構造化する。
この目的のために、段階認識型マルチエージェント協調機構は、段階間および段階間コンテキスト管理のために設計され、安定した最適化軌道が確保される。
KernelBenchと実世界のワークロードの実験によると、EGGはPyTorchよりも平均2.13倍のスピードアップを実現しており、既存のエージェントベースおよびRLベースのアプローチよりも優れている。
関連論文リスト
- AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation [59.964989458924585]
AdaExploreは、パフォーマンスクリティカルなカーネルコード生成のための蓄積された実行フィードバックによる自己改善を可能にするエージェントフレームワークである。
適応段階では、エージェントはタスクを合成し、繰り返し発生する障害を有効ルールの再利用可能なメモリに変換する。
探索段階では、候補核を木として整理し、小さな局所精製とより大きな構造再生を交互に行う。
論文 参考訳(メタデータ) (2026-04-17T18:25:03Z) - Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations [98.44542103979735]
勾配勾配降下法(SGD)とアダム(Adam)による1次勾配勾配降下法は、現代の訓練パイプラインの基礎となる。
大規模モデルトレーニング、厳格なプライバシ要件、分散学習パラダイムは、プライバシ保護とメモリ効率に関する従来のアプローチにおける重要な制限を明らかにする。
深層学習最適化アルゴリズムの進化軌道を振り返って分析し、様々なモデルアーキテクチャやトレーニングシナリオの主流を包括的に評価する。
我々は、重要な新興トレンドと基本設計のトレードオフを抽出し、将来の研究の有望な方向性を示唆する。
論文 参考訳(メタデータ) (2026-04-14T17:01:36Z) - CuTeGen: An LLM-Based Agentic Framework for Generation and Optimization of High-Performance GPU Kernels using CuTe [7.881930340027473]
CuTeGenはGPUカーネルの自動生成と最適化のためのフレームワークである。
カーネル開発を構造化された生成-テスト-定義ワークフローとして扱う。
本稿では, CuTeGen が機能的に正しいカーネルを生成し, 最適化されたライブラリ実装と比較して, 競合性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-01T23:55:23Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Towards Automated Kernel Generation in the Era of LLMs [17.69471168609145]
カーネルエンジニアリングは時間がかかり、スケールできないプロセスです。
大規模言語モデル(LLM)やエージェントシステムの最近の進歩は、カーネル生成と最適化を自動化する新しい可能性を開いた。
フィールドは断片化され続けており、LLM駆動のカーネル生成の体系的な視点が欠如している。
論文 参考訳(メタデータ) (2026-01-22T07:53:52Z) - STARK: Strategic Team of Agents for Refining Kernels [23.717055490630596]
我々は,GPUカーネル最適化のためのエージェントフレームワークを導入し,マルチエージェント協調による設計空間を探索する。
このフレームワークはエキスパートエンジニアのワークフローを模倣し、LCMがハードウェアトレードオフを推論し、プロファイリングフィードバックを取り入れ、カーネルを反復的に洗練することを可能にする。
我々は,LLMに基づくカーネル最適化のベンチマークであるKernelBenchに対するアプローチを評価し,ベースラインエージェントよりも大幅に改善したことを示す。
論文 参考訳(メタデータ) (2025-10-19T20:41:46Z) - Evolution of Kernels: Automated RISC-V Kernel Optimization with Large Language Models [26.985412258634256]
大規模言語モデル(LLM)は、自動化されたカーネル最適化の約束を示し、包括的な技術ドキュメントと成熟した不足を伴うドメインの成功を示している。
本稿では,LLMベースの進化的プログラム検索フレームワークであるEvolution of Kernels(EoK)について紹介する。
EoKは中央値1.27倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2025-09-14T08:11:06Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - PolyScientist: Automatic Loop Transformations Combined with Microkernels
for Optimization of Deep Learning Primitives [55.79741270235602]
深層学習カーネル開発のためのハイブリッドソリューションを開発する。
我々は、高度な多面体技術を用いて、パフォーマンスのために外部ループを自動的に調整する。
論文 参考訳(メタデータ) (2020-02-06T08:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。