論文の概要: Rapid Deployment of DNNs for Edge Computing via Structured Pruning at Initialization
- arxiv url: http://arxiv.org/abs/2404.16877v1
- Date: Mon, 22 Apr 2024 10:57:54 GMT
- ステータス: 処理完了
- システム内更新日: 2024-04-29 15:13:44.229793
- Title: Rapid Deployment of DNNs for Edge Computing via Structured Pruning at Initialization
- Title(参考訳): 初期化時の構造化プルーニングによるエッジコンピューティング用DNNの迅速な展開
- Authors: Bailey J. Eccles, Leon Wong, Blesson Varghese,
- Abstract要約: エッジ機械学習(ML)は、デバイス上のデータのローカライズされた処理を可能にする。
ディープニューラルネットワーク(DNN)は、実際のコンピューティング、メモリ、エネルギー要件のため、デバイス上で簡単に動作できない。
エッジ配置に適したプルーニングモデルを生成するシステムであるReconveneを開発した。
- 参考スコア(独自算出の注目度): 2.6831773062745863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Edge machine learning (ML) enables localized processing of data on devices and is underpinned by deep neural networks (DNNs). However, DNNs cannot be easily run on devices due to their substantial computing, memory and energy requirements for delivering performance that is comparable to cloud-based ML. Therefore, model compression techniques, such as pruning, have been considered. Existing pruning methods are problematic for edge ML since they: (1) Create compressed models that have limited runtime performance benefits (using unstructured pruning) or compromise the final model accuracy (using structured pruning), and (2) Require substantial compute resources and time for identifying a suitable compressed DNN model (using neural architecture search). In this paper, we explore a new avenue, referred to as Pruning-at-Initialization (PaI), using structured pruning to mitigate the above problems. We develop Reconvene, a system for rapidly generating pruned models suited for edge deployments using structured PaI. Reconvene systematically identifies and prunes DNN convolution layers that are least sensitive to structured pruning. Reconvene rapidly creates pruned DNNs within seconds that are up to 16.21x smaller and 2x faster while maintaining the same accuracy as an unstructured PaI counterpart.
- Abstract(参考訳): エッジ機械学習(ML)は、デバイス上のデータのローカライズされた処理を可能にし、ディープニューラルネットワーク(DNN)によって支えられている。
しかし、DNNは、クラウドベースのMLに匹敵するパフォーマンスを提供するための、相当なコンピューティング、メモリ、エネルギ要件のために、デバイス上で容易に動作できない。
そのため、プルーニングなどのモデル圧縮技術が検討されている。
既存のプルーニング手法は, エッジMLにおいて問題となる: 1) 実行時の性能に限界がある圧縮モデルを作成する(非構造化プルーニングを用いる)か, 最終モデルの精度を損なう(構造化プルーニングを使用する)か,(2) 適切な圧縮DNNモデルを特定するために十分な計算資源と時間を必要とする(ニューラルアーキテクチャサーチを用いる)。
本稿では,Pruning-at-Initialization (PaI) と呼ばれる新しい道路について,上記の問題を緩和するために構造化プルーニングを用いて検討する。
Reconveneは、構造化されたPaIを用いてエッジ配置に適したプルーニングモデルを高速に生成するシステムである。
Reconveneは、構造化プルーニングに最も敏感なDNN畳み込み層を体系的に識別し、プルーンする。
Reconvene は16.21倍小さく2倍高速で、未構造化の PaI と同等の精度を維持しながら、数秒でプルーニングされた DNN を迅速に生成する。
関連論文リスト
- RL-Pruner: Structured Pruning Using Reinforcement Learning for CNN Compression and Acceleration [0.0]
RL-Prunerを提案する。このRL-Prunerは、強化学習を用いて最適プルーニング分布を学習する。
RL-Prunerは、モデル固有のプルーニング実装を必要とせずに、入力モデル内のフィルタ間の依存関係を自動的に抽出し、プルーニングを実行する。
論文 参考訳(メタデータ) (2024-11-10T13:35:10Z) - FSCNN: A Fast Sparse Convolution Neural Network Inference System [31.474696818171953]
畳み込みニューラルネットワーク(CNN)は目覚ましい成功を収めているが、通常は高い計算コストと多くの冗長な重みパラメータが伴う。
FLOPを小さくするためには、粗粒の粗さを導入して隠蔽構造全体を除去する構造刈りが一般的である。
圧縮されたCNNの微細な粒度を利用した効率的な畳み込みニューラルネットワーク推論システムを提案する。
論文 参考訳(メタデータ) (2022-12-17T06:44:58Z) - Automatic Mapping of the Best-Suited DNN Pruning Schemes for Real-Time
Mobile Acceleration [71.80326738527734]
本稿では,汎用的,きめ細かな構造化プルーニング手法とコンパイラの最適化を提案する。
提案手法は,より微細な構造化プルーニング手法とともに,最先端のDNN最適化フレームワークよりも優れていることを示す。
論文 参考訳(メタデータ) (2021-11-22T23:53:14Z) - GRIM: A General, Real-Time Deep Learning Inference Framework for Mobile
Devices based on Fine-Grained Structured Weight Sparsity [46.75304109970339]
本稿では、畳み込みニューラルネットワーク(CNN)とリカレントニューラルネットワーク(RNN)の両方に汎用的な新しいモバイル推論加速フレームワークGRIMを設計する。
ブロックベースカラムロープルーニング(BCR)による微細粒度構造解析手法を提案する。
我々のGRIMフレームワークは、この新たなきめ細かな構造化された空間に基づいて、(a)リアルタイムモバイル推論のためのコンパイラ最適化とコード生成という2つの部分で構成されています。
論文 参考訳(メタデータ) (2021-08-25T03:50:46Z) - Efficient Micro-Structured Weight Unification and Pruning for Neural
Network Compression [56.83861738731913]
ディープニューラルネットワーク(DNN)モデルは、特にリソース制限されたデバイスにおいて、実用的なアプリケーションに不可欠である。
既往の非構造的あるいは構造化された重量刈り法は、推論を真に加速することはほとんど不可能である。
ハードウェア互換のマイクロ構造レベルでの一般化された重み統一フレームワークを提案し,高い圧縮と加速度を実現する。
論文 参考訳(メタデータ) (2021-06-15T17:22:59Z) - Learning N:M Fine-grained Structured Sparse Neural Networks From Scratch [75.69506249886622]
ディープニューラルネットワーク(DNN)におけるスパーシティは、資源制約された環境でモデルを圧縮し、加速するために広く研究されている。
本稿では,N:M細粒構造スパースネットワークのスクラッチからトレーニングを初めて行う。
論文 参考訳(メタデータ) (2021-02-08T05:55:47Z) - A Privacy-Preserving-Oriented DNN Pruning and Mobile Acceleration
Framework [56.57225686288006]
モバイルエッジデバイスの限られたストレージとコンピューティング能力を満たすために、ディープニューラルネットワーク(DNN)の軽量プルーニングが提案されている。
従来のプルーニング手法は主に、ユーザデータのプライバシを考慮せずに、モデルのサイズを減らしたり、パフォーマンスを向上させることに重点を置いていた。
プライベートトレーニングデータセットを必要としないプライバシ保護指向のプルーニングおよびモバイルアクセラレーションフレームワークを提案する。
論文 参考訳(メタデータ) (2020-03-13T23:52:03Z) - BLK-REW: A Unified Block-based DNN Pruning Framework using Reweighted
Regularization Method [69.49386965992464]
本稿では, 汎用的かつ柔軟な構造化プルーニング次元と, 強力かつ効率的な再加重正規化手法を組み合わせたブロック型プルーニングフレームワークを提案する。
我々のフレームワークは普遍的であり、CNNとRNNの両方に適用できる。
リアルタイムモバイルアクセラレーションと精度の妥協のないCNNとRNNの共通カバレッジを実現するのはこれが初めてである。
論文 参考訳(メタデータ) (2020-01-23T03:30:56Z) - PatDNN: Achieving Real-Time DNN Execution on Mobile Devices with
Pattern-based Weight Pruning [57.20262984116752]
粗粒構造の内部に新しい次元、きめ細かなプルーニングパターンを導入し、これまで知られていなかった設計空間の点を明らかにした。
きめ細かいプルーニングパターンによって高い精度が実現されているため、コンパイラを使ってハードウェア効率を向上し、保証することがユニークな洞察である。
論文 参考訳(メタデータ) (2020-01-01T04:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。