Fugu-MT 論文翻訳(概要): Auto-ViT-Acc: An FPGA-Aware Automatic Acceleration Framework for Vision Transformer with Mixed-Scheme Quantization

論文の概要: Auto-ViT-Acc: An FPGA-Aware Automatic Acceleration Framework for Vision Transformer with Mixed-Scheme Quantization

arxiv url: http://arxiv.org/abs/2208.05163v1
Date: Wed, 10 Aug 2022 05:54:46 GMT
ステータス: 翻訳完了
システム内更新日: 2022-08-11 12:50:19.223675
Title: Auto-ViT-Acc: An FPGA-Aware Automatic Acceleration Framework for Vision Transformer with Mixed-Scheme Quantization
Title（参考訳）: Auto-ViT-Acc:混合化学量子化を用いたビジョントランスのためのFPGA対応自動加速フレームワーク
Authors: Zhengang Li, Mengshu Sun, Alec Lu, Haoyu Ma, Geng Yuan, Yanyue Xie, Hao Tang, Yanyu Li, Miriam Leeser, Zhangyang Wang, Xue Lin, Zhenman Fang
Abstract要約: コンピュータビジョンタスクにおいて、視覚変換器(ViT)は大幅に精度が向上している。本研究は,提案した混合スキーム量子化に基づくFPGA対応自動ViT加速フレームワークを提案する。
参考スコア（独自算出の注目度）: 78.18328503396057
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Vision transformers (ViTs) are emerging with significantly improved accuracy in computer vision tasks. However, their complex architecture and enormous computation/storage demand impose urgent needs for new hardware accelerator design methodology. This work proposes an FPGA-aware automatic ViT acceleration framework based on the proposed mixed-scheme quantization. To the best of our knowledge, this is the first FPGA-based ViT acceleration framework exploring model quantization. Compared with state-of-the-art ViT quantization work (algorithmic approach only without hardware acceleration), our quantization achieves 0.47% to 1.36% higher Top-1 accuracy under the same bit-width. Compared with the 32-bit floating-point baseline FPGA accelerator, our accelerator achieves around 5.6x improvement on the frame rate (i.e., 56.8 FPS vs. 10.0 FPS) with 0.71% accuracy drop on ImageNet dataset for DeiT-base.
Abstract（参考訳）: ビジョントランスフォーマー (vits) はコンピュータビジョンタスクの精度を大幅に向上させた。しかし、その複雑なアーキテクチャと膨大な計算/ストレージ要求は、新しいハードウェアアクセラレータ設計方法論に緊急の要求を課す。本研究は,提案した混合スキーム量子化に基づくFPGA対応自動ViT加速フレームワークを提案する。我々の知る限りでは、モデル量子化を探求するFPGAベースのVT加速フレームワークとしてはこれが初めてである。 vit量子化(algorithmic approach only without hardware acceleration)は0.47%から1.36%の精度を同じビット幅で達成している。 32ビット浮動小数点FPGAアクセラレータと比較して、このアクセラレータはフレームレート(56.8 FPS vs. 10.0 FPS)が約5.6倍改善され、DeiTベース用のImageNetデータセットでは0.71%精度が低下する。

関連論文リスト

FPQVAR: Floating Point Quantization for Visual Autoregressive Model with FPGA Hardware Co-design [5.4815337424005355]
視覚自己回帰(VAR)モデリングは、次世代の予測から次世代の予測へ、画像生成のパラダイムシフトを象徴している。メモリと計算コストを削減するため、VARのための効率的な後学習浮動小数点(FP)量子化フレームワークであるFPQvarを提案する。 AMD-Xilinx VCK190 FPGA上の我々のアクセラレータは、整数ベースのアクセラレータよりも3.1倍高い1.1イメージ/sのスループットを達成する。
論文参考訳（メタデータ） (2025-05-22T07:47:51Z)
Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers [56.37495946212932]
視覚変換器(ViT)は、畳み込みニューラルネットワーク(CNN)と比較して、コンピュータビジョンタスクにおいて優れた精度を示す。ハードウェア指向の量子化対応アーキテクチャ検索フレームワークであるQuasar-ViTを提案する。
論文参考訳（メタデータ） (2024-07-25T16:35:46Z)
An FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT [5.141764719319689]
本稿では,VTのハードウェア効率フロンティアを向上するために,FPGAベースのEfficientViTアクセラレータを提案する。具体的には、軽量な畳み込みや注意を含む様々な操作タイプを効率的にサポートする再構成可能なアーキテクチャを設計する。実験の結果,我々の加速器はスループット780.2 GOPS,エネルギー効率105.1 GOPS/Wを200MHzで達成した。
論文参考訳（メタデータ） (2024-03-29T15:20:33Z)
TurboViT: Generating Fast Vision Transformers via Generative Architecture Search [74.24393546346974]
近年、視覚変換器は様々な視覚認知タスクに対処する上で、前例のないレベルの性能を示している。近年,効率的な視覚変換器の設計に関する研究が盛んに行われている。本研究では,生成型アーキテクチャサーチによる高速ビジョントランスフォーマーアーキテクチャの設計について検討する。
論文参考訳（メタデータ） (2023-08-22T13:08:29Z)
Exploring Lightweight Hierarchical Vision Transformers for Efficient Visual Tracking [69.89887818921825]
HiTは、さまざまなデバイス上で高速に動作可能な、効率的なトラッキングモデルの新たなファミリーだ。 HiTはLaSOTベンチマークで64.6%のAUCを達成した。
論文参考訳（メタデータ） (2023-08-14T02:51:34Z)
Edge-MoE: Memory-Efficient Multi-Task Vision Transformer Architecture with Task-level Sparsity via Mixture-of-Experts [60.1586169973792]
M$3$ViTは、Mix-of-experts (MoE)を導入した最新のマルチタスクViTモデルである。 MoEは精度の向上と80%以上の削減計算を実現しているが、FPGAに効率的なデプロイを行う上での課題は残されている。 Edge-MoEと呼ばれる私たちの研究は、アーキテクチャの革新の集合を伴って、マルチタスクのViTのための最初のエンドツーエンドFPGAアクセラレータを導入するという課題を解決します。
論文参考訳（メタデータ） (2023-05-30T02:24:03Z)
HeatViT: Hardware-Efficient Adaptive Token Pruning for Vision Transformers [35.92244135055901]
HeatViTは、組み込みFPGA上の視覚変換器(ViT)のための画像適応型トークンプルーニングフレームワークである。 HeatViTは既存のViTプルーニング研究と比較して0.7%$sim$8.9%高い精度を達成できる。 HeatViTは28.4%以上のコスト削減を実現している。
論文参考訳（メタデータ） (2022-11-15T13:00:43Z)
ViTCoD: Vision Transformer Acceleration via Dedicated Algorithm and Accelerator Co-Design [42.46121663652989]
ビジョントランスフォーマー(ViT)は、様々なビジョンタスクにおいて最先端のパフォーマンスを実現している。しかし、ViTsの自己保持モジュールは依然として大きなボトルネックである。本稿では,ViTの高速化を目的とした,ViTCoDと呼ばれる専用アルゴリズムとアクセラレータ共設計フレームワークを提案する。
論文参考訳（メタデータ） (2022-10-18T04:07:23Z)
VAQF: Fully Automatic Software-hardware Co-design Framework for Low-bit Vision Transformer [121.85581713299918]
量子化ビジョントランス(ViT)のためのFPGAプラットフォーム上で推論アクセラレータを構築するフレームワークVAQFを提案する。モデル構造と所望のフレームレートから、VAQFはアクティベーションに必要な量子化精度を自動的に出力する。 FPGA上でのViTアクセラレーションに量子化が組み込まれたのはこれが初めてである。
論文参考訳（メタデータ） (2022-01-17T20:27:52Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。