論文の概要: Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization
- arxiv url: http://arxiv.org/abs/2607.23089v1
- Date: Sat, 25 Jul 2026 07:49:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.991571
- Title: Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization
- Title(参考訳): LLMに基づくトリトンカーネル最適化のためのコンパイラ周辺階層診断
- Authors: Dongjie Chen, Ping Zhao, Bohua Zhan, Yulong Wang, Shushu Chen, Liangjun Feng, Hao Zhou, Min Shen, Linmu Wang, Weijia Sheng, Xiangyu Wei, Weijie Ding, Jianhui Huang, Yaoqing Gao,
- Abstract要約: 本稿では,コンパイラを基盤としたTritonカーネルの階層最適化フレームワークを提案する。
このシステムは幾何平均速度を4.35$times$とし、初期最適化されたトリトンカーネルから平均速度を2.73$times$とする。
完全な分布は、ほぼベースラインのエントリから大きな勝利まで、現在のシステムのスコープと制限を透過的に報告する動機となっている。
- 参考スコア(独自算出の注目度): 10.855607995195099
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in large language models (LLMs) have enabled automated kernel generation and optimization, but most existing approaches rely on surface signals such as compilation feedback and profiling metrics. These signals reveal that a kernel is slow, but not why the backend compiler fails to realize a profitable optimization, especially on emerging accelerators such as NPUs. We therefore formulate kernel optimization as a progressive cross-layer diagnosis problem that links runtime symptoms to IR structure and compiler behavior before rewriting source. Based on this insight, we present our system, a compiler-grounded and hierarchical optimization framework for Triton kernels. the system escalates from lightweight pattern triage and profiling diagnosis to IR attribution and compiler-grounded analysis only when deeper evidence is needed, then proposes evidence-backed source-level rewrites. We implement the system on Triton for Ascend NPUs and evaluate it on 37 successfully converted entries from a standardized NPUKernelBench-derived Ascend 950 benchmark. Across these entries, the system attains a geometric-mean speedup of 4.35$\times$ and a median speedup of 2.73$\times$ from the initial to optimized Triton kernel; 22/37 exceed 2$\times$ and 13/37 exceed 5$\times$. The complete distribution ranges from near-baseline entries to large wins, motivating transparent reporting of the current system's scope and limitations.
- Abstract(参考訳): 大規模言語モデル(LLM)の最近の進歩により、カーネルの自動生成と最適化が可能になったが、既存のアプローチのほとんどは、コンパイルフィードバックやプロファイリングメトリクスのような表面信号に依存している。
これらのシグナルはカーネルが遅いことを示しているが、特にNPUのような新興アクセラレーターにおいて、バックエンドコンパイラが利益の出る最適化を実現できなかった理由ではない。
そこで我々は,カーネル最適化を,実行時症状とIR構造とコンパイラ動作をリンクした進行的クロスレイヤー診断問題として定式化する。
本稿では,コンパイラを基盤としたTritonカーネルの階層最適化フレームワークであるシステムについて述べる。
システムは、軽量なパターントリアージやプロファイリング診断からIR属性やコンパイラ基底解析まで、より深い証拠が必要な場合にのみエスカレートし、エビデンスベースのソースレベルの書き換えを提案する。
我々は,Triton for Ascend NPUsの実装を行い,標準化されたNPUKernelBench由来のAscend 950ベンチマークから37個のエントリを変換して評価した。
これらのエントリ全体で、システムの平均速度は4.35$\times$、中央速度は2.73$\times$、22/37は2$\times$、13/37は5$\times$である。
完全な分布は、ほぼベースラインのエントリから大きな勝利まで、現在のシステムのスコープと制限を透過的に報告する動機となっている。
関連論文リスト
- Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization [37.645358922637065]
KernelProはクローズドループのマルチエージェントシステムで、カーネルコードを自動生成、プロファイル、反復的に最適化する。
KernelProでは、レベル1/2/3の2.42x/4.69x/5.30xの平均スピードアップを実現し、あらゆる難易度で最先端のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2026-06-24T23:28:09Z) - optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - Diff3R: Feed-forward 3D Gaussian Splatting with Uncertainty-aware Differentiable Optimization [76.38917994186733]
Diff3Rはフィードフォワード予測とテストタイム最適化をブリッジする新しいフレームワークである。
フィードフォワード3DGSアーキテクチャにシームレスに統合でき、ポーズギヴン法とポーズフリー法の両方に対応できることを示す。
論文 参考訳(メタデータ) (2026-04-01T15:40:20Z) - Improving Efficiency of GPU Kernel Optimization Agents using a Domain-Specific Language and Speed-of-Light Guidance [2.6106833542109693]
エージェントが操作する抽象化レベルについて、2つの重要な観察を行う。
CUTLASSが支援するGPUカーネル用のコンパイラを備えたDSLであるCUTLASSでこれらの原則を実装します。
我々は、SOLガイダンスを使用して、ヘッドルームを推定し、最適化試験をガイドし、SOLに近い問題を優先順位付けし、ベンチマークをゲームするカーネルにフラグを付ける。
論文 参考訳(メタデータ) (2026-03-30T21:16:39Z) - Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization [48.656549870801285]
Kernel-Smithは高性能GPUカーネルと演算子生成のためのフレームワークである。
エージェント側では、Kernel-Smithは実行可能な候補の集団を維持し、反復的にそれらを改善している。
トレーニング側では、長距離進化軌道をステップ中心の監視と強化学習信号に変換する。
論文 参考訳(メタデータ) (2026-03-30T12:12:49Z) - Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis [68.7701048879757]
EvoKernelは、カーネル合成のライフサイクルを自動化する自己進化型エージェントフレームワークである。
ステージ固有のQ値を学び、現在の目標への貢献に基づいて経験を優先する。
モデルの正しさを11.0%から83.0%に改善し、初期ドラフトよりも3.60倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:06Z) - A Two-Stage GPU Kernel Tuner Combining Semantic Refactoring and Search-Based Optimization [9.49293344824955]
本稿では,エージェント駆動反復ループ上にテンプレートベースの書き換え層を導入する。
提案手法は,実運用負荷に対する自動性能最適化を実現するために拡張することができる。
論文 参考訳(メタデータ) (2026-01-19T03:40:12Z) - AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization [12.269456144158783]
本稿では,自己改善型大規模言語モデル(LLM)エージェントシステムであるAccelOptを紹介する。
NKIBenchは、AWS Trainiumアクセラレータカーネルの新しいベンチマークスイートで、現実世界のワークロードから抽出される複雑さがさまざまです。
評価の結果,AccelOptの能力は時間とともに向上し,ピークスループットの平均値はTranium 1で49%から61%,NKIBenchカーネルで45%から59%へと向上した。
論文 参考訳(メタデータ) (2025-11-19T22:49:37Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - INR-Arch: A Dataflow Architecture and Compiler for Arbitrary-Order
Gradient Computations in Implicit Neural Representation Processing [66.00729477511219]
計算グラフとして表される関数を考えると、従来のアーキテクチャはn階勾配を効率的に計算する上で困難に直面している。
InR-Archは,n階勾配の計算グラフをハードウェア最適化データフローアーキテクチャに変換するフレームワークである。
1.8-4.8x と 1.5-3.6x の高速化を CPU と GPU のベースラインと比較した結果を示す。
論文 参考訳(メタデータ) (2023-08-11T04:24:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。