論文の概要: STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU
- arxiv url: http://arxiv.org/abs/2607.09385v1
- Date: Fri, 10 Jul 2026 13:09:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.85089
- Title: STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU
- Title(参考訳): STEEL: AMDのXDNA NPUにおけるエネルギー効率のよい長周期推論のための疎結合型フューズドアテンション
- Abstract要約: 我々は、XDNAライクなニューラルプロセッシングエンジン(NPU)をターゲットにしたFlashAttentionの最初のオープンソース実装であるSTEELを提案する。
STEELは、それぞれCPUとGPUのベースラインに対して平均9.17xと1.75xのエネルギー消費を減らす。
XDNA 1では、STEELは、最先端技術よりも平均9.6倍のレイテンシ低減を実現し、XDNA 2上の層間アテンション実装と比較して平均22.8倍のスピードアップを実現している。
- 参考スコア(独自算出の注目度): 17.901016888350735
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: The growing adoption of large language model-based agents within operating system workflows has increased the importance of energy-efficient inference on laptop-class systems-on-chip (SoCs). While cloud offloading remains common, it introduces reliability and privacy concerns that are particularly problematic for agentic workloads. Recent laptop SoCs, therefore, incorporate neural processing engines (NPUs) optimized for energy efficiency; however, effectively mapping attention mechanisms onto NPUs remains challenging due to architectural diversity and explicit data-movement programming models. In this work, we present STEEL, the first open-source implementation of FlashAttention targeting XDNA-like NPUs. STEEL introduces a dataflow formulation of prefill attention, enabling efficient exploitation of spatial parallelism and on-chip memory. Furthermore, STEEL addresses the load imbalance induced by the causal mask by leveraging a sparsity-aware pipeline placement onto the NPU array, reducing synchronization overhead and improving utilization. We evaluate STEEL on the AMD Ryzen AI 9 HX 370 SoC and compare its performance against optimized CPU and GPU implementations. Experimental results show that STEEL reduces energy consumption by an average of 9.17x and 1.75x relative to CPU and GPU baselines, respectively. On XDNA 1, STEEL achieves an average 9.6x latency reduction over the prior state of the art, and delivers a 22.8x speedup on average compared to a layer-by-layer attention implementation on XDNA 2.
- Abstract(参考訳): オペレーティングシステムワークフローにおける大規模言語モデルベースエージェントの採用の増加により、ラップトップクラスのシステム・オン・チップ(SoC)におけるエネルギー効率の推論の重要性が高まっている。
クラウドのオフロードは依然として一般的だが、特にエージェントのワークロードに問題のある信頼性とプライバシの懸念が導入されている。
そのため、最近のラップトップSoCは、エネルギー効率に最適化されたニューラルプロセッシングエンジン(NPU)を組み込んでいるが、アーキテクチャの多様性と明示的なデータ移動プログラミングモデルのために、効果的に注意機構をNPUにマッピングすることは困難である。
本稿では,XDNA様のNPUをターゲットとしたFlashAttentionの最初のオープンソース実装であるSTEELを紹介する。
STEELはプリフィルアテンションのデータフロー定式化を導入し、空間並列性とオンチップメモリの効率的な利用を可能にした。
さらに、STEELは、NPUアレイ上にスペーサを意識したパイプライン配置を活用し、同期オーバーヘッドを低減し、利用率を向上させることで、因果マスクによって引き起こされる負荷不均衡に対処する。
我々は、AMD Ryzen AI 9 HX 370 SoC上でSTEELを評価し、その性能を最適化されたCPUとGPUの実装と比較した。
実験の結果,STEEL は CPU と GPU のベースラインに対して平均 9.17x と 1.75x のエネルギー消費を減少させることがわかった。
XDNA 1では、STEELは前の最先端よりも平均9.6倍のレイテンシ低減を実現し、XDNA 2の層間アテンション実装と比較して平均22.8倍のスピードアップを実現している。
関連論文リスト
- Diagonal-Tiled Mixed-Precision Attention for Efficient Low-Bit MXFP Inference [29.72164316945472]
トランスフォーマーベースの大規模言語モデル (LLM) は、様々な現実世界のタスクにおいて顕著な性能を示している。
しかし、注意の2次複雑さと高精度操作のメモリ帯域幅制限のため、推論コストは禁断的に高いままである。
マイクロスケーリング浮動小数点(MXFP)データフォーマットを用いた低ビット混合注意カーネルを提案する。
論文 参考訳(メタデータ) (2026-04-05T03:56:21Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - eIQ Neutron: Redefining Edge-AI Inference with Integrated NPU and Compiler Innovations [4.776283807742058]
eIQ中性子効率NPUは商用フラッグシップMPUに統合される。
我々のソリューションは、標準AIベンチマークにおけるTOPSとメモリリソースの同等で平均1.8倍(4倍ピーク)のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-09-17T19:45:51Z) - Efficient Edge LLMs Deployment via HessianAware Quantization and CPU GPU Collaborative [31.74122603714625]
Mixture of Experts (MoE)アーキテクチャは、スパースアクティベーションによってモデルのキャパシティを向上させる。
MoEは実践的な展開において2つの大きな困難に直面している。
メモリ制限下では、専門家モジュールの効率的なオフロードと協調的な推論は、レイテンシとスループットのバランスをとるのに苦労する。
本稿では,Hessian-Aware Quantization (HAQ)とCPU-GPU協調推論に基づく効率的なMoEエッジ配置方式を提案する。
論文 参考訳(メタデータ) (2025-08-10T12:59:57Z) - Pushing the Envelope of LLM Inference on AI-PC [45.081663877447816]
ウルトラロービットモデル(1/1.58/2-bit)は、同じモデルサイズを用いて、その完全精度のモデルのパープレキシティとエンドタスクのパフォーマンスとを一致させる。
最先端の推論ランタイム(例えばbitnet)の計算効率は未調査のままである。
まず1ビットと2ビットのマイクロカーネルを設計・実装し,計算効率の最大化を実現した。
我々は、現在のSOTAランタイムビットネットよりも優れた2ビットモデルを用いて、エンドツーエンドの推論結果を示す。
論文 参考訳(メタデータ) (2025-08-08T23:33:38Z) - Intra-DP: A High Performance Collaborative Inference System for Mobile Edge Computing [67.98609858326951]
Intra-DPはモバイルデバイス上でのディープニューラルネットワーク(DNN)に最適化された高性能な協調推論システムである。
推論毎のレイテンシを最大50%削減し、最先端のベースラインと比較してエネルギー消費量を最大75%削減する。
評価の結果,DP内の遅延は,最先端のベースラインと比較して最大50%,エネルギー消費は最大75%減少することがわかった。
論文 参考訳(メタデータ) (2025-07-08T09:50:57Z) - GraNNite: Enabling High-Performance Execution of Graph Neural Networks on Resource-Constrained Neural Processing Units [0.6063137165121326]
グラフニューラルネットワーク(GNN)は、グラフ構造化データから学習するために不可欠であり、ネットワーク分析、レコメンデーションシステム、音声分析の応用を可能にする。
GraNNiteは、COTS(Commercial-off-the-Shelf) SOTAアクセラレータ上でGNNの実行を最適化する最初のハードウェア対応フレームワークである。
論文 参考訳(メタデータ) (2025-02-10T17:03:02Z) - FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression [55.992528247880685]
分散トレーニングは、システム設計と効率に関する重要な課題に直面します。
大規模深層ニューラルネットワーク(DNN)のトレーニング用に設計・実装された分散トレーニングシステムFusionLLMを提案する。
本システムと手法は,収束性を確保しつつ,ベースライン法と比較して1.45~9.39倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2024-10-16T16:13:19Z) - Fluid Batching: Exit-Aware Preemptive Serving of Early-Exit Neural
Networks on Edge NPUs [74.83613252825754]
スマートエコシステム(smart ecosystems)"は、スタンドアロンではなく、センセーションが同時に行われるように形成されています。
これはデバイス上の推論パラダイムを、エッジにニューラル処理ユニット(NPU)をデプロイする方向にシフトしている。
そこで本研究では,実行時のプリエンプションが到着・終了プロセスによってもたらされる動的性を考慮に入れた,新しい早期終了スケジューリングを提案する。
論文 参考訳(メタデータ) (2022-09-27T15:04:01Z) - FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation [81.76975488010213]
ディセンス光学フロー推定は、多くのロボットビジョンタスクで重要な役割を果たしています。
現在のネットワークはしばしば多くのパラメータを占有し、計算コストがかかる。
提案したFastFlowNetは、周知の粗大なやり方で、以下のイノベーションで機能する。
論文 参考訳(メタデータ) (2021-03-08T03:09:37Z) - EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware
Multi-Task NLP Inference [82.1584439276834]
BERTのようなトランスフォーマーベースの言語モデルでは、自然言語処理(NLP)タスクの精度が大幅に向上する。
We present EdgeBERT, a in-deepth algorithm- hardware co-design for latency-aware energy optimization for multi-task NLP。
論文 参考訳(メタデータ) (2020-11-28T19:21:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。