論文の概要: CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels
- arxiv url: http://arxiv.org/abs/2605.05023v1
- Date: Wed, 06 May 2026 15:19:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.900413
- Title: CuBridge: An LLM-Based Framework for Understanding and Reconstructing High-Performance Attention Kernels
- Title(参考訳): CuBridge: 高性能アテンションカーネルの理解と再構築のためのLLMベースのフレームワーク
- Abstract要約: CuBridgeは、構造化リフト-トランスファー-ローワーワークフローを通じて専門家が書いた注目カーネルに適応するフレームワークである。
CuBridgeは一貫して正しいカーネルを生成し、一般的なフレームワーク、コンパイラベースのアプローチ、および以前のLCMベースのメソッドよりも大幅に優れている。
- 参考スコア(独自算出の注目度): 36.66718851543183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Efficient CUDA implementations of attention mechanisms are critical to modern deep learning systems, yet supporting diverse and evolving attention variants remains challenging. Existing frameworks and compilers trade performance for flexibility, while expert-written kernels achieve high efficiency but are difficult to adapt. Recent work explores large language models (LLMs) for GPU kernel generation, but prior studies report unstable correctness and significant performance gaps for complex operators such as attention. We present CuBridge, an LLM-based framework that adapts expert-written attention kernels through a structured lift-transfer-lower workflow. CuBridge starts from expert-written CUDA attention kernels and lifts them into an executable intermediate representation that makes execution orchestration explicit while abstracting low-level CUDA syntax. Given a user-provided PyTorch specification, CuBridge generates and verifies a target IR program, then reconstructs optimized CUDA code via reference-guided lowering. Across diverse attention variants and GPU platforms, CuBridge consistently produces correct kernels and substantially outperforms general frameworks, compiler-based approaches, and prior LLM-based methods.
- Abstract(参考訳): 注意機構の効率的なCUDA実装は、現代のディープラーニングシステムにとって重要であるが、多様で進化している注意変動をサポートすることは依然として困難である。
既存のフレームワークとコンパイラは柔軟性のためにパフォーマンスを交換するが、専門家が書いたカーネルは高い効率を達成するが、適応は難しい。
近年,GPUカーネル生成のための大規模言語モデル (LLM) について検討している。
提案するCuBridgeは,構造化リフト-トランスファー-ローワーワークフローを通じて,専門家による注目カーネルを適応させるLLMベースのフレームワークである。
CuBridgeはエキスパートによって書かれたCUDAアテンションカーネルから始まり、低レベルのCUDA構文を抽象化しながら実行オーケストレーションを明示する実行可能な中間表現へと持ち上げる。
ユーザが提供するPyTorch仕様を前提として、CuBridgeはターゲットIRプログラムを生成し検証し、参照誘導ローディングを通じて最適化されたCUDAコードを再構築する。
さまざまな注目の亜種とGPUプラットフォームにまたがって、CuBridgeは一貫して正しいカーネルを生成し、一般的なフレームワーク、コンパイラベースのアプローチ、および以前のLCMベースのメソッドよりも大幅に優れています。
関連論文リスト
- CUDA-Harness: Harnessing Agentic CUDA Kernel Generation and Optimization from Natural Language [12.536212788514815]
Text2CUDAは、自然言語(Text2CUDA)から直接カーネルを生成する。
LLM(Large Language Models)は、LLMベースのカーネル生成を探求する一連の研究を促進する。
本稿では,自然言語からエージェント型カーネルレベルの最適化を実現するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-30T13:51:43Z) - CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs [45.52512820646709]
我々は、エンドツーエンドの人間-専門家SOTAシステムに対して生成されたベンチマークであるHerculesを紹介する。
自動化プログラミングは完全な解決には程遠いものであり、より強力なハードウェア推論、より良いツール使用、トレーニング目標が必要です。
論文 参考訳(メタデータ) (2026-05-08T20:35:27Z) - CuTeGen: An LLM-Based Agentic Framework for Generation and Optimization of High-Performance GPU Kernels using CuTe [7.881930340027473]
CuTeGenはGPUカーネルの自動生成と最適化のためのフレームワークである。
カーネル開発を構造化された生成-テスト-定義ワークフローとして扱う。
本稿では, CuTeGen が機能的に正しいカーネルを生成し, 最適化されたライブラリ実装と比較して, 競合性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-01T23:55:23Z) - CUCo: An Agentic Framework for Compute and Communication Co-design [13.906670325427463]
CUCoはトレーニングフリーのエージェント駆動ワークフローで、共同でオーケストレーションと通信を行う高性能カーネルを自動的に生成する。
従来のコンポーネントを最適化することで、CUCoは既存のアプローチでは利用できない新しい最適化の機会を解放する。
論文 参考訳(メタデータ) (2026-03-02T20:35:50Z) - CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation [51.72529978689561]
Agentは、カーネルの専門知識を3つのコンポーネントで開発する大規模なエージェント強化学習システムである。
AgentはKernelBench上で、トーチコンパイルよりも100%、100%、92%高速なレートを提供する。
論文 参考訳(メタデータ) (2026-02-27T18:58:05Z) - KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning [3.4998382481249286]
我々は、テストハーネス、検証コンポーネント、再現可能な評価を伴って、オープンソースのエージェントフレームワークとしてKernelBlasterをリリースした。
提案手法は, KernelBench Levels 1, 2, 3 の平均速度をそれぞれ 1.43x, 2.50x, 1.50x とする。
論文 参考訳(メタデータ) (2026-02-15T19:48:43Z) - QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code [52.66657751895655]
大規模言語モデル(LLM)は、ニューラルコンパイルという魅力的な新しいパラダイムを提供する。
本稿では,IR-to-assemblyコンパイル用に設計された新しいベンチマークデータセットであるNeuComBackを紹介する。
LLMの内部的なプロンプト戦略を進化させる自己進化的プロンプト最適化法を提案する。
論文 参考訳(メタデータ) (2025-11-03T03:20:26Z) - Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization [25.135006275638172]
本稿では,カーネル性能の厳密な評価と,さまざまなシナリオにおける正当性評価のための新しいベンチマークである,ロバスト・クベンチを紹介する。
また、トーチコードをカーネルに変換し、ランタイム設定を反復的に改善する包括的なエージェントフレームワークを提案する。
提案手法は,フォワードパスやバックパスを含む,実用アプリケーションのためのトーチ実装よりも優れたカーネルを生成する。
論文 参考訳(メタデータ) (2025-09-16T11:08:30Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - Extending C++ for Heterogeneous Quantum-Classical Computing [56.782064931823015]
qcorはC++とコンパイラの実装の言語拡張で、異種量子古典プログラミング、コンパイル、単一ソースコンテキストでの実行を可能にする。
我々の研究は、量子言語で高レベルな量子カーネル(関数)を表現できる、第一種C++コンパイラを提供する。
論文 参考訳(メタデータ) (2020-10-08T12:49:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。