論文の概要: AI-RAN on NPUs: Baseband Processing Without Baseband Chips
- arxiv url: http://arxiv.org/abs/2607.04224v1
- Date: Sun, 05 Jul 2026 10:36:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.870645
- Title: AI-RAN on NPUs: Baseband Processing Without Baseband Chips
- Title(参考訳): NPU上のAI-RAN:ベースバンドチップなしのベースバンド処理
- Authors: Shilong Zhang, Luping Xiang, Jienan Chen, Kun Yang,
- Abstract要約: AI-RANは、共有計算基板上で人工知能と無線アクセスネットワークワークロードを統合することを目的としている。
推論に最適化されたAIアクセラレータであるNeural Processing Units(NPU)が、無線ベースバンド処理もサポートするかどうかは不明だ。
ここでは、ベースバンドワークロードとNPUアーキテクチャの根本的なミスマッチを解決することで、最初の肯定的な回答を提供する。
- 参考スコア(独自算出の注目度): 17.288754905973466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-RAN aims to unify artificial intelligence and radio access network workloads on a shared compute substrate. While this paradigm has so far been demonstrated primarily on Graphics Processing Units (GPUs), it remains unclear whether Neural Processing Units (NPUs), which are AI accelerators optimized for inference, can also support wireless baseband processing. Here, we provide the first affirmative answer by resolving the fundamental mismatch between baseband workloads and NPU architecture. A computational isomorphism exists: matrix and vector engines NPUs dedicate to inference inherently cover physical-layer operations. Yet NPU architectures are natively shaped for dense-tensor AI inference, not baseband. This architectural mismatch surfaces as opposing optimization objectives: traditional baseband minimizes arithmetic operations, whereas NPU performance demands maximizing engine utilization. We close this gap by reconstructing communication algorithms onto AI compute primitives, prioritizing engine utilization over arithmetic count. We validate this with a complete OFDM transceiver on an Ascend 310B1 edge NPU, demonstrating end-to-end over-the-air transmission via USRP X300 at 3.0 GHz.
- Abstract(参考訳): AI-RANは、共有計算基板上で人工知能と無線アクセスネットワークワークロードを統合することを目的としている。
このパラダイムは、主にGPU(Graphics Processing Units)で実証されているが、推論に最適化されたAIアクセラレータであるNeural Processing Units(NPU)が無線ベースバンド処理もサポートするかどうかは不明だ。
ここでは、ベースバンドワークロードとNPUアーキテクチャの根本的なミスマッチを解決することで、最初の肯定的な回答を提供する。
行列とベクトルエンジン NPU は、本質的に物理層演算をカバーしている。
しかし、NPUアーキテクチャはベースバンドではなく、濃密なテンソルAI推論のためにネイティブに形状されている。
従来のベースバンドは算術演算を最小化するが、NPUの性能はエンジン使用率を最大化する。
通信アルゴリズムをAI計算プリミティブに再構成し、演算数よりもエンジン利用を優先することで、このギャップを埋める。
Ascend 310B1 edge NPU上の全OFDMトランシーバでこれを検証し,USRP X300を3.0GHzで無線通信することを示す。
関連論文リスト
- Harvesting AI Computation at the Edge via Generic Approximation [25.85205133921183]
汎用近似手法を用いて,未使用のAI計算資源を抽出するフレームワークを提案する。
メインのAIワークロードのパフォーマンスを損なうことなく、タスクをAIチップにオフロードするランタイムスケジューラを導入します。
論文 参考訳(メタデータ) (2026-06-28T17:27:52Z) - Ascend-RaBitQ: Heterogeneous NPU-CPU Acceleration of Billion-Scale Similarity Search with 1-bit Quantization [18.17338809219932]
In this present Ascend-RaBitQ, a first heterogeneous NPU- CPU optimized IVF-RaBitQ system for billion-scale vector search。
3段階のヘテロジニアスパイプラインは、1ビット量子化されたベクトル上でのAI Coreアクセラレーション粗いランク付け、オンデバイスAI CPU Top-k処理、フル精度ベクトル上でのホストCPUファインランク付けを含む。
Ascend-RaBitQは、CPUベースラインよりも3.0*から62.8*高速なインデックス構築、最速のCPU IVF-RaBitQ実装よりも4.6*スループットの改善、数学的に等価なCPUより100*以上を実現している。
論文 参考訳(メタデータ) (2026-05-15T14:37:18Z) - eIQ Neutron: Redefining Edge-AI Inference with Integrated NPU and Compiler Innovations [4.776283807742058]
eIQ中性子効率NPUは商用フラッグシップMPUに統合される。
我々のソリューションは、標準AIベンチマークにおけるTOPSとメモリリソースの同等で平均1.8倍(4倍ピーク)のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-09-17T19:45:51Z) - Intra-DP: A High Performance Collaborative Inference System for Mobile Edge Computing [67.98609858326951]
Intra-DPはモバイルデバイス上でのディープニューラルネットワーク(DNN)に最適化された高性能な協調推論システムである。
推論毎のレイテンシを最大50%削減し、最先端のベースラインと比較してエネルギー消費量を最大75%削減する。
評価の結果,DP内の遅延は,最先端のベースラインと比較して最大50%,エネルギー消費は最大75%減少することがわかった。
論文 参考訳(メタデータ) (2025-07-08T09:50:57Z) - Serving Large Language Models on Huawei CloudMatrix384 [28.88558053380112]
従来のAIクラスタは、計算強度、メモリ帯域幅、チップ間通信、レイテンシの制限に直面している。
本稿では,Huawei CloudMatrixを紹介する。Huawei CloudMatrixは,プロダクショングレードのCloudMatrix384スーパーノードで実現された次世代AIアーキテクチャである。
384 Ascend 910 NPUと192 Kunpeng CPUを超広帯域統一バス(UB)ネットワークを介して相互接続し、直接通信とリソースの動的プールを可能にする。
論文 参考訳(メタデータ) (2025-06-15T03:41:34Z) - Latency-aware Unified Dynamic Networks for Efficient Image Recognition [72.8951331472913]
LAUDNetは動的ネットワークの理論的および実用的な効率ギャップを橋渡しするフレームワークである。
3つの主要な動的パラダイム - 適応型計算、動的層スキップ、動的チャネルスキップ - を統合している。
これにより、V100,3090やTX2 GPUのようなプラットフォーム上で、ResNetのようなモデルの遅延を50%以上削減できる。
論文 参考訳(メタデータ) (2023-08-30T10:57:41Z) - Towards Better Out-of-Distribution Generalization of Neural Algorithmic
Reasoning Tasks [51.8723187709964]
ニューラルネットワーク推論タスクのOOD一般化について検討する。
目標は、ディープニューラルネットワークを使用して入出力ペアからアルゴリズムを学ぶことである。
論文 参考訳(メタデータ) (2022-11-01T18:33:20Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z) - Neural network relief: a pruning algorithm based on neural activity [47.57448823030151]
重要でない接続を非活性化する簡易な重要スコア計量を提案する。
MNIST上でのLeNetアーキテクチャの性能に匹敵する性能を実現する。
このアルゴリズムは、現在のハードウェアとソフトウェアの実装を考えるとき、FLOPを最小化するように設計されていない。
論文 参考訳(メタデータ) (2021-09-22T15:33:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。