論文の概要: KernelArc: A Multi-Agent Framework for GPU Kernel Optimization
- arxiv url: http://arxiv.org/abs/2608.17071v2
- Date: Thu, 20 Aug 2026 21:29:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:31.730475
- Title: KernelArc: A Multi-Agent Framework for GPU Kernel Optimization
- Title(参考訳): KernelArc:GPUカーネル最適化のためのマルチエージェントフレームワーク
- Abstract要約: 戦略特化エージェントは並列に動作し、結論のみの共有メモリ、決定論的ベンチマークガード、読み取り専用クロスエージェント状態を通じてコーディネートする。
NVIDIA H100 と B200 GPU 上の KernelArc をカテゴリ表現型 SOL-ExecBench ワークロードを用いて評価する。
- 参考スコア(独自算出の注目度): 5.95300038655579
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present KernelArc, a multi-agent framework for autonomous GPU kernel optimization across heterogeneous workloads. Strategy-specialized agents run in parallel and coordinate through conclusions-only shared memory, a deterministic benchmark guard, and read-only cross-agent state with plateau-triggered drafting. We evaluate KernelArc on NVIDIA H100 and B200 GPUs using category-representative SOL-ExecBench workloads. The resulting implementations span custom BF16 GEMM, static cuBLASLt Expert-API configuration tables, fused mixture-of-experts backward, shape-gated decoder-layer fusion, native NVFP4 grouped-query attention, and paged prefill attention. In the public SOL-ExecBench leaderboard snapshot recorded on August~20, 2026, KernelArc ranked first on every representative L1, L2, Quantization, and FlashInfer task evaluated. The trajectories support the paper's central motivation: shared multi-agent search can broaden exploration and reach stronger incumbents within a fixed candidate budget, while the value of individual coordination features depends on the kernel and optimization stage.
- Abstract(参考訳): 異種ワークロード間でのGPUカーネルの自動最適化のためのマルチエージェントフレームワークであるKernelArcを紹介する。
戦略特化エージェントは並列に動作し、結論のみの共有メモリ、決定論的ベンチマークガード、プラトートリガードドラフトによる読み取り専用クロスエージェント状態を通じてコーディネートする。
NVIDIA H100 と B200 GPU 上の KernelArc をカテゴリ表現型 SOL-ExecBench ワークロードを用いて評価する。
実装は、カスタムなBF16 GEMM、静的cuBLASLt Expert-API構成テーブル、融合したミックスオブエキスパート、フォームゲートデコーダ層融合、ネイティブなNVFP4グループドクエリアテンション、ページドプリフィルアテンションにまたがる。
2026年8月20日に記録されたSOL-ExecBenchのリーダボードのスナップショットでは、KernelArcがすべての代表L1、L2、量子化、FlashInferタスクでトップにランクインした。
共有マルチエージェント探索は、探索を拡大し、固定された候補予算内でより強力な既存メンバーに到達することができる一方で、個々の調整機能の価値は、カーネルと最適化段階に依存する。
関連論文リスト
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent [10.241408048987038]
既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
論文 参考訳(メタデータ) (2026-07-16T03:49:50Z) - KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators [5.703659894138959]
生産推定は、不均一な加速器の混合をますます狙う。
それぞれのパイプラインは、増大するハードウェアバックエンドとプログラミングモデルにまたがって、ハイパフォーマンスカーネルを必要としている。
我々は、2つのLLMベースのエージェントによって駆動される反復リファインメントループを中心に構築されたクロスプラットフォームフレームワークであるKForgeを紹介する。
論文 参考訳(メタデータ) (2026-06-01T23:48:55Z) - optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limits [33.140868197031985]
SOL-ExecBenchは、124生産モデルと新興AIモデルから抽出された235の最適化問題のベンチマークである。
SOLARによって計算された解析的導出光速度(SOL)境界に対して性能を測定する。
我々は、リリース定義スコアベースラインと、候補カーネルを閉じたハードウェアSOLとの間のギャップを定量化するSOLスコアを報告する。
論文 参考訳(メタデータ) (2026-03-19T17:30:02Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Optimizing PyTorch Inference with LLM-Based Multi-Agent Systems [1.2289544895833646]
マルチエージェントPyTorch最適化システムを比較するためのフレームワークを提案する。
エラー修正エージェントと組み合わせた場合,エクスプロイトヘビー戦略が最善であることを示す。
最も優れた実装は、H100 GPU上で平均2.88倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-11-21T05:37:38Z) - PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization [12.24680414520151]
PRAGMAはプロファイル誘導型AIカーネル生成フレームワークである。
実行フィードバックとハードウェアの詳細なプロファイリングを推論ループに統合する。
我々は、GPUとCPUバックエンドをカバーするKernelBench上でPRAGMAを評価する。
論文 参考訳(メタデータ) (2025-11-09T12:01:43Z) - Explore as a Storm, Exploit as a Raindrop: On the Benefit of Fine-Tuning Kernel Schedulers with Coordinate Descent [48.791943145735]
カーネルの品質を向上しながら,Ansorの検索時間を短縮する可能性を示す。
このアプローチを、Ansorが生成した最初の300のカーネルに適用する。
この結果は20の有名なディープラーニングモデルで再現されている。
論文 参考訳(メタデータ) (2024-06-28T16:34:22Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - Kernel Identification Through Transformers [54.3795894579111]
カーネル選択はガウス過程(GP)モデルの性能決定において中心的な役割を果たす。
この研究は、高次元GP回帰モデルのためのカスタムカーネル関数を構築するという課題に対処する。
KITT: Kernel Identification through Transformersを提案する。
論文 参考訳(メタデータ) (2021-06-15T14:32:38Z) - Efficient Video Semantic Segmentation with Labels Propagation and
Refinement [138.55845680523908]
本稿では,ハイブリッドGPU/CPUを用いた高精細ビデオのリアルタイムセマンティックセマンティックセマンティック化の問題に取り組む。
i) CPU上では、非常に高速な光フロー法であり、ビデオの時間的側面を利用して、あるフレームから次のフレームへ意味情報を伝達するために使用される。
高解像度フレーム(2048 x 1024)を持つ一般的なCityscapesデータセットでは、単一のGPUとCPU上で80から1000Hzの動作ポイントが提案されている。
論文 参考訳(メタデータ) (2019-12-26T11:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。