論文の概要: AttnFuse: A Composable DSL for Compiling Attentions to Fused GPU Kernels
- arxiv url: http://arxiv.org/abs/2609.13612v1
- Date: Fri, 11 Sep 2026 23:55:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.40847
- Title: AttnFuse: A Composable DSL for Compiling Attentions to Fused GPU Kernels
- Title(参考訳): AttnFuse: 融合GPUカーネルへの注意をコンパイルするための構成可能なDSL
- Abstract要約: PyTorchの最近のflex_attentionは、Pythonでカスタムの注意パターンを記述し、融合したカーネルにコンパイルすることを可能にする。
我々は、RoPEファーストクラスの操作のようなプリ・マルチプリケーション・トランスフォーメーションを実現する小さなDSLであるAttnFuseを紹介します。
AttnFuseは、RoPE+causalパターン上のflex_attentionよりも2.10$times$のスピードアップを達成する。
- 参考スコア(独自算出の注目度): 0.3580891736370874
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern AI systems are built on the Transformer architecture, whose core operation, attention, accounts for the majority of computation and memory cost. Researchers continually propose new attention variants to improve quality, efficiency, or context length, but each variant currently requires expert-written GPU code to run at usable speeds. PyTorch's recent flex\_attention lets researchers describe custom attention patterns in Python and compile them to fused kernels, but its design is limited to modifications applied after the central matrix multiplication, excluding Rotary Position Embedding (RoPE), the positional encoding used by every major LLM. We introduce AttnFuse, a small DSL for attention that makes pre-multiplication transformations like RoPE first-class operations. Researchers compose ten high-level building blocks to describe a variant, and AttnFuse's compiler emits a single fused GPU kernel for the entire computation. On an RTX 3090, AttnFuse achieves a 2.10$\times$ speedup over flex\_attention on the RoPE+causal pattern. On an H100, it runs a full Llama-3-8B training step within 5\% of PyTorch's hand-tuned backend. Our investigation reveals the Rotation Calculus: whether to fuse RoPE or apply it separately depends on the GPU's compute-to-bandwidth ratio, with a derived crossover that matches measurement. AttnFuse demonstrates that a small, attention-specific compiler can close the gap between flexible research code and production kernels.
- Abstract(参考訳): 現代のAIシステムはTransformerアーキテクチャ上に構築されており、そのコア操作、注意が計算とメモリコストの大部分を占めている。
研究者は、品質、効率、コンテキスト長を改善するために、新しい注目の亜種を継続的に提案しているが、現在、使用可能な速度で実行するには、専門家によるGPUコードが必要である。
PyTorchの最近のflex\_attentionは、Pythonのカスタムアテンションパターンを記述し、融合カーネルにコンパイルするが、その設計は、すべての主要なLLMで使われている位置符号化であるRotary Position Embedding (RoPE)を除いて、中央行列の乗算後に適用される修正に限られている。
我々は、RoPEファーストクラスの操作のようなプリ・マルチプリケーション・トランスフォーメーションを実現する小さなDSLであるAttnFuseを紹介します。
研究者は変種を記述するために10のハイレベルなビルディングブロックを構成し、AttnFuseのコンパイラは計算全体のために単一の融合GPUカーネルを出力する。
RTX 3090では、AttnFuseはRoPE+causalパターン上のflex\_attentionよりも2.10$\times$のスピードアップを達成した。
H100では、PyTorchのハンドチューニングバックエンドの5倍の範囲内で、完全なLlama-3-8Bトレーニングステップを実行する。
RoPEを融合するか、別々に適用するかは、GPUの計算-帯域比と、測定値に一致する導出クロスオーバーに依存する。
AttnFuseは、小さな注意を向けたコンパイラがフレキシブルな研究コードとプロダクションカーネルの間のギャップを埋めることを示した。
関連論文リスト
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent [10.241408048987038]
既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
論文 参考訳(メタデータ) (2026-07-16T03:49:50Z) - Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU [38.81440160993858]
ディープラーニングアルゴリズムを新しいハードウェアアクセラレータに移植するには、開発者はコードベースのすべてのTritonカーネルに同じ低レベル最適化を適用する必要がある。
我々は、このプロセスをIntel GPU向けに自動化するマルチステージLCM駆動パイプラインであるXe-Forgeを紹介する。
キュレートされた知識ベースは、LLMトレーニングデータにはないIntel GPU制約を符号化し、モデルをアーキテクチャ上有効なバウンダリ内に保持する。
論文 参考訳(メタデータ) (2026-04-16T20:21:01Z) - VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents [42.56489784841984]
実装の変更が生成され、エージェントが提案する差分として適用される。
アーキテクチャを説明し、システムの生成と検証に使用するワークフローを要約し、アーティファクトを評価する。
論文 参考訳(メタデータ) (2026-01-21T19:29:00Z) - Scalable GPU-Accelerated Euler Characteristic Curves: Optimization and Differentiable Learning for PyTorch [0.0]
我々は,Euler Characteristics Curve(ECC)向けに最適化されたGPUカーネルを提案し,合成グリッド上でのGPU実装よりも16-2000"Oの高速化を実現した。
エンドツーエンドの学習を可能にする差別化可能なPyTorch層を導入する。
論文 参考訳(メタデータ) (2025-10-23T06:59:07Z) - Tensor Decomposition Networks for Fast Machine Learning Interatomic Potential Computations [48.46721044282335]
テンソル分解ネットワーク(TDN)は、計算処理の劇的な高速化と競合する性能を実現する。
1億5500万のDFT計算スナップショットを含む分子緩和データセットPubChemQCRのTDNを評価した。
その結果,TDNは計算処理の劇的な高速化と競合する性能を示した。
論文 参考訳(メタデータ) (2025-07-01T18:46:27Z) - KernelBench: Can LLMs Write Efficient GPU Kernels? [36.4117525096377]
KernelBenchは、高速で正確なカーネルを記述する言語モデルの能力を評価するためのオープンソースのフレームワークである。
本稿では,関数的に正しい生成カーネルの割合を計測する,新しい評価基準であるfast_pを紹介する。
実験の結果,フロンティア推論モデルが最も優れているが,全体としては不足していることがわかった。
論文 参考訳(メタデータ) (2025-02-14T19:30:53Z) - Scaling Tractable Probabilistic Circuits: A Systems Perspective [53.76194929291088]
PyJuiceは、いくつかの点で先行技術を改善するPCの一般的な実装設計である。
大規模PCのトレーニングでは、既存のシステムよりも1~2桁高速である。
PyJuiceは2~5倍のメモリを消費するので、より大きなモデルをトレーニングすることができます。
論文 参考訳(メタデータ) (2024-06-02T14:57:00Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - SKI to go Faster: Accelerating Toeplitz Neural Networks via Asymmetric
Kernels [69.47358238222586]
Toeplitz Neural Networks (TNN) は、印象的な結果を持つ最近のシーケンスモデルである。
我々は, O(n) 計算複雑性と O(n) 相対位置エンコーダ (RPE) 多層パーセプトロン (MLP) と減衰バイアスコールの低減を目指す。
双方向モデルの場合、これはスパースと低ランクのToeplitz行列分解を動機付ける。
論文 参考訳(メタデータ) (2023-05-15T21:25:35Z) - Batch-efficient EigenDecomposition for Small and Medium Matrices [65.67315418971688]
EigenDecomposition (ED)は多くのコンピュータビジョンアルゴリズムとアプリケーションの中心にある。
本稿では,コンピュータビジョンの応用シナリオに特化したQRベースのED手法を提案する。
論文 参考訳(メタデータ) (2022-07-09T09:14:12Z) - Stable, Fast and Accurate: Kernelized Attention with Relative Positional
Encoding [63.539333383965726]
相対的位置符号化(RPE)を用いた変換器の注意計算を高速化する新しい手法を提案する。
相対的な位置符号化がToeplitz行列を形成するという観測に基づいて、Fast Fourier Transform (FFT) を用いて、RPEによるカーネル化された注意を効率的に計算できることを数学的に示す。
論文 参考訳(メタデータ) (2021-06-23T17:51:26Z) - FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation [81.76975488010213]
ディセンス光学フロー推定は、多くのロボットビジョンタスクで重要な役割を果たしています。
現在のネットワークはしばしば多くのパラメータを占有し、計算コストがかかる。
提案したFastFlowNetは、周知の粗大なやり方で、以下のイノベーションで機能する。
論文 参考訳(メタデータ) (2021-03-08T03:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。