論文の概要: DPU or GPU for Accelerating Neural Networks Inference -- Why not both? Split CNN Inference
- arxiv url: http://arxiv.org/abs/2605.00174v1
- Date: Thu, 30 Apr 2026 19:49:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 17:43:28.728669
- Title: DPU or GPU for Accelerating Neural Networks Inference -- Why not both? Split CNN Inference
- Title(参考訳): ニューラルネットワーク推論を高速化するDPUまたはGPU - なぜ両方ではないのか? CNN推論を分割する
- Authors: Ali Emre Oztas, Mahir Demir, James Garside, Mikel Luj'an,
- Abstract要約: DPUとGPU間でのCNN推論のパーティショニング(Split CNN推論)を提案する。
分割推論に必要なCNNの分割を自動化するために,GNNに基づく分割インデックス予測手法を提案する。
DPUのみの実行で最大2.48倍、GPUのみの実行で最大3.37倍のレイテンシ向上を実現している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video and image streaming on edge devices requires low latency. To address this, Neural Networks (NNs) are widely used, and prior work mainly focuses on accelerating them with single hardware units such as Graphics Processing Units (GPUs), Field Programmable Gate Arrays (FPGAs), and Deep Learning Processing Units (DPUs). However, further reductions in latency can be observed by combining these units. In this paper, partitioning CNN inference across DPU and GPU (Split CNN Inference) is proposed. The first partition runs on the AI engines (DPU) of a Versal VCK190, which consists of initial CNN layers processing the input images. The DPU processes the first partition near the source of the data. Pipelined asynchronously, a GPU runs the remaining layers. The GPU (NVIDIA RTX 2080) processes the second partition, albeit having reduced the data transfer between the data source (storage/camera) and the GPU. Furthermore, a Graph Neural Network (GNN)-based partition index prediction method is proposed to automate the partitioning of CNNs needed for the Split Inference. Well established models such as LeNet-5, ResNet18/50/101/152, VGG16, and MobileNetv2 are analyzed. Results demonstrate up to 2.48x latency improvement over DPU-only execution and up to 3.37x over GPU-only execution. The trained GNN model splits the layers between the appropriate devices with 96.27% accuracy.
- Abstract(参考訳): エッジデバイス上のビデオとイメージのストリーミングは、低レイテンシを必要とする。
これを解決するために、ニューラルネットワーク(NN)は広く使われており、以前の研究は主にグラフィクス処理ユニット(GPU)、フィールドプログラマブルゲートアレイ(FPGA)、ディープラーニング処理ユニット(DPU)のような単一のハードウェアユニットでそれらを高速化することに焦点を当てていた。
しかし、これらのユニットを組み合わせることで、さらなる遅延の低減が観察できる。
本稿では,DPUとGPU(Split CNN Inference)間でのCNN推論のパーティショニングを提案する。
最初のパーティションは、入力イメージを処理する最初のCNNレイヤで構成されるVersal VCK190のAIエンジン(DPU)上で動作する。
DPUは、データソース近くの最初のパーティションを処理する。
非同期でパイプラインされるGPUは、残りのレイヤを実行する。
GPU(NVIDIA RTX 2080)は第2パーティションを処理するが、データソース(ストレージ/カメラ)とGPU間のデータ転送を削減している。
さらに、分割推論に必要なCNNの分割を自動化するために、グラフニューラルネットワーク(GNN)に基づくパーティションインデックス予測手法を提案する。
LeNet-5、ResNet18/50/101/152、VGG16、MobileNetv2といった確立したモデルを分析した。
DPUのみの実行で最大2.48倍、GPUのみの実行で最大3.37倍のレイテンシ向上を実現している。
トレーニングされたGNNモデルは、96.27%の精度で適切なデバイス間で層を分割する。
関連論文リスト
- Distributed Convolutional Neural Network Training on Mobile and Edge Clusters [0.9421843976231371]
機械学習タスクをエッジに完全にローカライズするための最近の取り組みが登場した。
これにより、レイテンシの低減とプライバシの向上にメリットがあるが、リソース制約のあるデバイスで作業する必要がある。
本稿では,モバイルデバイスとエッジデバイスのみを対象とした分散CNNトレーニングのアプローチについて述べる。
論文 参考訳(メタデータ) (2024-09-11T02:44:28Z) - Quiver: Supporting GPUs for Low-Latency, High-Throughput GNN Serving
with Workload Awareness [4.8412870364335925]
Quiverは、低レイテンシと高スループットを備えた分散GPUベースのGNNサービスシステムである。
最新のGNN手法と比較して,Quiverは8倍のスループットで最大35倍のレイテンシを実現している。
論文 参考訳(メタデータ) (2023-05-18T10:34:23Z) - A Study on the Intersection of GPU Utilization and CNN Inference [8.084016058894779]
我々は、畳み込みニューラルネットワーク(CNN)の推論時GPU利用を改善する余地があることを示す。
我々は、CNNの推論時GPU利用を改善する余地があり、GPU利用に関する知識は、利用自体をターゲットとしないアプリケーションでさえも恩恵を受ける可能性があることを論じる。
論文 参考訳(メタデータ) (2022-12-15T16:11:40Z) - Dynamic Split Computing for Efficient Deep Edge Intelligence [78.4233915447056]
通信チャネルの状態に基づいて最適な分割位置を動的に選択する動的分割計算を導入する。
本研究では,データレートとサーバ負荷が時間とともに変化するエッジコンピューティング環境において,動的スプリットコンピューティングが高速な推論を実現することを示す。
論文 参考訳(メタデータ) (2022-05-23T12:35:18Z) - DistGNN: Scalable Distributed Training for Large-Scale Graph Neural
Networks [58.48833325238537]
大規模グラフの構造を学ぶためにGNN(Graph Neural Networks)のフルバッチトレーニングは、実現可能な数百の計算ノードにスケールする必要がある重要な問題です。
本稿では,CPUクラスタ上でのフルバッチトレーニングのためのDGL(Deep Graph Library)を最適化したGNNについて述べる。
4つの一般的なGNNベンチマークデータセットの結果は、1つのCPUソケットを使用して最大3.7倍のスピードアップ、128のCPUソケットを使用して最大97倍のスピードアップを示す。
論文 参考訳(メタデータ) (2021-04-14T08:46:35Z) - Performance Prediction for Convolutional Neural Networks in Edge Devices [0.8602553195689513]
データソースに近いエッジデバイス上の畳み込みニューラルネットワーク(CNN)ベースのアプリケーションは、レイテンシとプライバシの課題を満たすことができる。
我々は,2つのエッジGPUプラットフォーム上でのCNNの実行時間予測に広く使用されている機械学習ベースの手法の5つの (5) を提示し,比較する。
論文 参考訳(メタデータ) (2020-10-21T20:21:25Z) - RT3D: Achieving Real-Time Execution of 3D Convolutional Neural Networks
on Mobile Devices [57.877112704841366]
本稿では3次元CNNのためのモデル圧縮およびモバイルアクセラレーションフレームワークRT3Dを提案する。
3D CNNのリアルタイム実行は、市販のモバイル上で初めて実現された。
論文 参考訳(メタデータ) (2020-07-20T02:05:32Z) - TFApprox: Towards a Fast Emulation of DNN Approximate Hardware
Accelerators on GPU [0.4817429789586127]
近似演算回路を導入することにより、ディープニューラルネットワーク(DNN)のハードウェアアクセラレータのエネルギー効率を向上させることができる。
DNNアクセラレータのソフトウェアエミュレーションは通常、CPUまたはGPU上で実行される。
このエミュレーションは通常、ソフトウェアDNN実装のエミュレーションよりも2~3桁遅い。
論文 参考訳(メタデータ) (2020-02-21T08:22:56Z) - Efficient Video Semantic Segmentation with Labels Propagation and
Refinement [138.55845680523908]
本稿では,ハイブリッドGPU/CPUを用いた高精細ビデオのリアルタイムセマンティックセマンティックセマンティック化の問題に取り組む。
i) CPU上では、非常に高速な光フロー法であり、ビデオの時間的側面を利用して、あるフレームから次のフレームへ意味情報を伝達するために使用される。
高解像度フレーム(2048 x 1024)を持つ一般的なCityscapesデータセットでは、単一のGPUとCPU上で80から1000Hzの動作ポイントが提案されている。
論文 参考訳(メタデータ) (2019-12-26T11:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。