論文の概要: MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation
- arxiv url: http://arxiv.org/abs/2607.20501v1
- Date: Sat, 20 Jun 2026 23:14:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.20448
- Title: MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation
- Title(参考訳): MKEvolve: カーネルコード生成のためのモジュール型マルチエージェントフレームワーク
- Abstract要約: MKEvolveは、複雑なPyTorchモジュールと各サブモジュール用のLLM生成カーネルのモジュール分解を反復的に共進化させるフレームワークである。
その結果、MKEvolveはLSMトークンの使用量を最大35%削減しつつ、エンドツーエンドの直接合成ベースラインの正確性と高速化を両立させることがわかった。
- 参考スコア(独自算出の注目度): 18.355003000296648
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite rapid progress in LLM-based code generation, writing correct and performant kernels for hardware accelerators remains a key bottleneck in scaling modern ML workloads. We present MKEvolve (Modular Kernel Evolve), a framework that iteratively co-evolves a modular decomposition of complex PyTorch modules and the LLM-generated kernel for each submodule, refining the decomposition by splitting and fusing across iterations while independently improving each subkernel via LLM-driven beam search. The resulting kernels are programmatic compositions of independently verified subkernels, making them configurable (subkernel implementations are swappable), interpretable (errors and speedups are traceable to specific subkernels), and readily adaptable to related model architectures. Experiments with Triton on KernelBench L2 and L3, spanning multi-operator sequences and full model architectures, show that MKEvolve improves both correctness and speedup over end-to-end direct synthesis baselines while reducing LLM token usage by up to 35%.
- Abstract(参考訳): LLMベースのコード生成は急速に進歩しているが、ハードウェアアクセラレーターのための正しいパフォーマンスのカーネルを書くことは、現代のMLワークロードをスケールする上で重要なボトルネックである。
MKEvolve(Modular Kernel Evolve)は、複雑なPyTorchモジュールと各サブモジュールに対するLLM生成カーネルのモジュール分解を反復的に共進化させるフレームワークである。
結果として得られたカーネルは独立に検証されたサブカーネルのプログラム構成であり、設定可能(サブカーネルの実装はスワップ可能)、解釈可能(エラーとスピードアップは特定のサブカーネルにトレース可能)、関連するモデルアーキテクチャに容易に適応できる。
マルチオペレータシーケンスとフルモデルアーキテクチャにまたがるTriton on KernelBench L2とL3の実験により、MKEvolveは、エンドツーエンドの直接合成ベースラインよりも正確性と高速化の両方を向上し、LLMトークンの使用量を最大35%削減した。
関連論文リスト
- KernelFoundry: Hardware-aware evolutionary GPU kernel optimization [9.20884368317651]
KernelFoundryは、GPUカーネルデザインスペースを効率的に探求する進化的フレームワークである。
KernelBench、堅牢なkbench、カスタムタスクでこのフレームワークを評価します。
提案手法は,SYCL における KernelBench の平均速度を2.3倍に向上する。
論文 参考訳(メタデータ) (2026-03-12T20:40:04Z) - Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis [68.7701048879757]
EvoKernelは、カーネル合成のライフサイクルを自動化する自己進化型エージェントフレームワークである。
ステージ固有のQ値を学び、現在の目標への貢献に基づいて経験を優先する。
モデルの正しさを11.0%から83.0%に改善し、初期ドラフトよりも3.60倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:06Z) - K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model [57.440609834690385]
既存のアプローチでは、進化ループ内の高速コードジェネレータとして、LLM(Large Language Models)を扱います。
我々は,共進化的世界モデルによる検索を提案し,この手法に基づいてK-Searchを構築する。
GQA, MLA, MoE カーネルを含む多種多様な複雑なカーネル上で K-Search を評価する。
論文 参考訳(メタデータ) (2026-02-22T11:06:22Z) - KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware [25.808580418841718]
新しいAIアクセラレータは、しばしば開発者が手動で低レベルのカーネルを作る必要がある。
これにより、新興ハードウェアプラットフォームが市場に到達するのを効果的に防ぐことができる。
KernelCraftは、エージェントがカスタマイズされたアクセラレーターのために低レベルのカーネルを生成し最適化する能力を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-02-10T14:52:02Z) - AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis [13.239454996851771]
現代のAIモデルは高性能な計算カーネルを必要とする。
Akgカーネルエージェント(AI駆動のカーネルジェネレータ)は複数のドメイン固有言語をサポートするように設計されている。
システムのモジュール設計により、バックエンドDSLとハードウェアターゲットの迅速な統合が可能になる。
システムはPyTorch Eagerベースライン上で平均1.46ドルのスピードアップを達成する。
論文 参考訳(メタデータ) (2025-12-29T12:42:05Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition [95.54406667705999]
Pangu Embeddedは、Ascend Neural Processing Units (NPU) 上で開発された効率的なLarge Language Model (LLM) 推論器である。
既存の推論最適化 LLM でよく見られる計算コストと推論遅延の問題に対処する。
単一の統一モデルアーキテクチャ内で、迅速な応答と最先端の推論品質を提供する。
論文 参考訳(メタデータ) (2025-05-28T14:03:02Z) - PAPI: Exploiting Dynamic Parallelism in Large Language Model Decoding with a Processing-In-Memory-Enabled Computing System [13.678531084541666]
PAPI は PIM 対応のヘテロジニアスアーキテクチャで,計算バウンドカーネルやメモリバウンドカーネルを適切なハードウェアユニットに動的にスケジューリングする。
PAPIは最先端の異種加速器と最先端のPIM専用加速器で1.8$times$と11.1$times$を達成している。
論文 参考訳(メタデータ) (2025-02-21T13:52:31Z) - Liger Kernel: Efficient Triton Kernels for LLM Training [6.373771349397682]
大規模言語モデル(LLM)を大規模に効果的に訓練することは、ますます増大する計算要求によって引き起こされる、恐ろしい挑戦となる。
LLMトレーニング用に開発されたTritonカーネルのオープンソースセットであるLiger- Kernelを紹介する。
カーネル操作の融合や入力チャンキングといったカーネル最適化技術により、カーネルはトレーニングのスループットが平均20%向上し、GPUメモリ使用量が60%削減された。
論文 参考訳(メタデータ) (2024-10-14T18:17:01Z) - CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules [51.82044734879657]
我々は,自己修正の連鎖を通じてモジュール化されたコード生成を誘発する,新しい推論フレームワークであるCodeChainを提案する。
CodeChainは、生成したソリューションのモジュール性と正確性の両方を大幅に向上させ、APPSで35%、CodeContestsで76%の相対パス@1の改善を実現しています。
論文 参考訳(メタデータ) (2023-10-13T10:17:48Z) - PolyScientist: Automatic Loop Transformations Combined with Microkernels
for Optimization of Deep Learning Primitives [55.79741270235602]
深層学習カーネル開発のためのハイブリッドソリューションを開発する。
我々は、高度な多面体技術を用いて、パフォーマンスのために外部ループを自動的に調整する。
論文 参考訳(メタデータ) (2020-02-06T08:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。