論文の概要: MaxKernel: Agentic Kernel Generation for TPUs
- arxiv url: http://arxiv.org/abs/2609.04523v1
- Date: Thu, 03 Sep 2026 22:22:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.84186
- Title: MaxKernel: Agentic Kernel Generation for TPUs
- Title(参考訳): MaxKernel: TPUのためのエージェントカーネル生成
- Abstract要約: MaxKernelはTPUカーネル開発のために3つの異なるパラダイムを実装したマルチエージェントシステムである。
これら3つのパラダイムは、計画、実装、自己老化、テスト、ハードウェアプロファイリングを扱うために、特別なサブエージェントの共有プールを利用する。
我々は、Max Kernelが高度に最適化された実装を一貫して生成し、熟練した手書きのベースラインと一致することを示した。
- 参考スコア(独自算出の注目度): 0.1719024873384565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Designing and authoring high-performance custom kernels for accelerators is a complex task that requires deep hardware-level expertise. Large Language Models (LLM) can be leveraged together with real-time compiler feedback to build agentic systems for kernel generation. In this work, we present MaxKernel, a multi-agent system that implements three distinct paradigms for TPU kernel development: (1) a Human-in-the-Loop (HITL) agent for collaborative, step-by-step design; (2) an Autonomous (Auto) agent that executes a fully automated, metric/trace-driven optimization loop; and (3) a Graph-Based Autonomous Search that scales the Auto agent for global exploration of the design space. All three paradigms leverage a shared pool of specialized sub-agents to handle planning, implementation, self-debugging, testing, and hardware profiling. We evaluate MaxKernel on JaxBench, a comprehensive suite of 50 diverse kernel tasks for TPUs, alongside complex, real-world workloads from state-of-the-art open-source models. We demonstrate that MaxKernel consistently generates highly optimized implementations, matching expert hand-tuned baselines and delivering significant performance across the benchmark. Our agent is open-sourced and available https://github.com/AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel.
- Abstract(参考訳): アクセラレータのための高性能なカスタムカーネルの設計とオーサリングは、ハードウェアレベルの深い専門知識を必要とする複雑なタスクである。
大規模言語モデル(LLM)は、リアルタイムコンパイラフィードバックと併用してカーネル生成のためのエージェントシステムを構築することができる。
本稿では,TPUカーネル開発のための3つの異なるパラダイムを実装したマルチエージェントシステムであるMaxKernelを紹介する。(1)協調的かつステップバイステップの設計を行うHuman-in-the-Loop(HITL)エージェント,(2)完全に自動化されたメトリック/トレース駆動最適化ループを実行するAutonomous(Auto)エージェント,(3)デザイン空間のグローバルな探索のためにAutoエージェントをスケールするGraph-Based Autonomous Searchである。
これら3つのパラダイムは、計画、実装、自己デバッグ、テスト、ハードウェアプロファイリングを扱うために、特別なサブエージェントの共有プールを利用する。
私たちは、最先端のオープンソースモデルによる複雑な実世界のワークロードとともに、TPUのための50の多様なカーネルタスクからなる包括的なスイートである、JaxBench上でMaxKernelを評価します。
我々は、MaxKernelが高度に最適化された実装を一貫して生成し、専門家が手動で調整したベースラインに適合し、ベンチマーク全体で大きなパフォーマンスを提供することを示した。
我々のエージェントはオープンソースであり、https://github.com/AI-Hypercomputer/accelerator-agents/tree/main/MaxKernel.comで利用可能です。
関連論文リスト
- KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators [5.703659894138959]
生産推定は、不均一な加速器の混合をますます狙う。
それぞれのパイプラインは、増大するハードウェアバックエンドとプログラミングモデルにまたがって、ハイパフォーマンスカーネルを必要としている。
我々は、2つのLLMベースのエージェントによって駆動される反復リファインメントループを中心に構築されたクロスプラットフォームフレームワークであるKForgeを紹介する。
論文 参考訳(メタデータ) (2026-06-01T23:48:55Z) - AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents [30.03012293068346]
AgentArenaは、GPUカーネル最適化上のAIコーディングエージェントを測定するためのオープンソースのベンチマークである。
ほとんどのタスクカテゴリにおいて、ほぼ完全なコンパイルと高い正当性率が得られます。
その結果,HIP-to-HIPとTriton-to-Tritonの最適化は未確認入力形式に大きく移行した。
論文 参考訳(メタデータ) (2026-05-16T05:25:11Z) - KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware [25.808580418841718]
新しいAIアクセラレータは、しばしば開発者が手動で低レベルのカーネルを作る必要がある。
これにより、新興ハードウェアプラットフォームが市場に到達するのを効果的に防ぐことができる。
KernelCraftは、エージェントがカスタマイズされたアクセラレーターのために低レベルのカーネルを生成し最適化する能力を評価する最初のベンチマークである。
論文 参考訳(メタデータ) (2026-02-10T14:52:02Z) - AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis [13.239454996851771]
現代のAIモデルは高性能な計算カーネルを必要とする。
Akgカーネルエージェント(AI駆動のカーネルジェネレータ)は複数のドメイン固有言語をサポートするように設計されている。
システムのモジュール設計により、バックエンドDSLとハードウェアターゲットの迅速な統合が可能になる。
システムはPyTorch Eagerベースライン上で平均1.46ドルのスピードアップを達成する。
論文 参考訳(メタデータ) (2025-12-29T12:42:05Z) - cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution [15.701861287574296]
cuPilotは戦略協調型マルチエージェントフレームワークで、カーネル進化の中間的な意味表現として戦略を導入する。
GEMMタスクでは、cuPilotは高度な最適化を示し、重要なハードウェアユニットの高利用を実現する。
論文 参考訳(メタデータ) (2025-12-18T12:34:00Z) - xLLM Technical Report [57.13120905321185]
我々は,知的かつ効率的なLarge Language Model (LLM)推論フレームワークであるxLLMを紹介する。
xLLMは、新しい分離されたサービスエンジンアーキテクチャを構築する。
xLLM-Engineは、システムとアルゴリズムの設計を最適化し、コンピュータリソースを完全に飽和させる。
論文 参考訳(メタデータ) (2025-10-16T13:53:47Z) - MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning [65.200259961515]
マルチモーダル軌道を自動的に合成する視覚中心型エージェントチューニングフレームワークを開発した。
また、自動生成された11Kの選好ペアであるPref-Xについても紹介する。
Agent-X、GTA、GAIAの3つのベンチマークで、MATRIXはオープンソースとクローズドソースの両方のVLMを一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-09T17:59:54Z) - xLAM: A Family of Large Action Models to Empower AI Agent Systems [111.5719694445345]
AIエージェントタスク用に設計された大規模なアクションモデルであるxLAMをリリースする。
xLAMは、複数のエージェント能力ベンチマークで例外的なパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-09-05T03:22:22Z) - CRAB: Cross-environment Agent Benchmark for Multimodal Language Model Agents [49.68117560675367]
Crabは、クロス環境タスクをサポートするように設計された最初のベンチマークフレームワークである。
私たちのフレームワークは複数のデバイスをサポートし、Pythonインターフェースで簡単に任意の環境に拡張できます。
実験の結果、GPT-4oの1剤が38.01%の最高完成率を達成することが示された。
論文 参考訳(メタデータ) (2024-07-01T17:55:04Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - PolyScientist: Automatic Loop Transformations Combined with Microkernels
for Optimization of Deep Learning Primitives [55.79741270235602]
深層学習カーネル開発のためのハイブリッドソリューションを開発する。
我々は、高度な多面体技術を用いて、パフォーマンスのために外部ループを自動的に調整する。
論文 参考訳(メタデータ) (2020-02-06T08:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。