論文の概要: Recent Developments in Transformer Inference Deployment on FPGA Platforms: A Survey
- arxiv url: http://arxiv.org/abs/2609.01212v1
- Date: Tue, 01 Sep 2026 13:18:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.679926
- Title: Recent Developments in Transformer Inference Deployment on FPGA Platforms: A Survey
- Title(参考訳): FPGAプラットフォームにおけるトランスフォーマー推論展開の最近の進歩:サーベイ
- Authors: Arjan Blankestijn, Uraz Odyurt, Amirreza Yousefzadeh,
- Abstract要約: FPGAプラットフォーム上でのTransformer推論の最近の進歩,トレンド,設計選択について検討する。
文献の体系的なレビューを行い、実装と最適化のために好まれるテクニックを抽出し、掘り下げる。
この研究と提案されたトピックの分類は、学術や産業の研究者のガイドとして機能する可能性がある。
- 参考スコア(独自算出の注目度): 0.2851702684899107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the rapid and continuous growth in the incorporation of machine learning models based on the Transformer architecture, capable deployment is in high demand. In this context, capable deployment refers to operational performance aspects, e.g., throughput and latency, as well as efficiency aspects, e.g., energy consumption. When it comes to the task of inference using such models, purpose-built hardware accelerators provide a lucrative alternative to common deployment choices, such as Central Processing Units (CPUs) and Graphics Processing Units (GPUs). The Field Programmable Gate Array (FPGA) platforms category is an example of such alternative accelerators, promising implementation flexibility, energy efficiency, improved latency and suitability for on-site deployment. We investigate the most recent advances, trends, and design choices for Transformer inference on FPGA platforms. We perform a systematic literature review, extracting and delving into preferred techniques for implementation and optimisation. This study and the provided taxonomy of topics could act as a guide for researchers from the academia and industry alike.
- Abstract(参考訳): Transformerアーキテクチャに基づいた機械学習モデルの導入の迅速かつ継続的な成長により、能動的なデプロイメントが要求される。
このコンテキストでは、能力のあるデプロイメントは、例えばスループットやレイテンシといった運用パフォーマンスの面や、効率性、例えばエネルギー消費といった面を指します。
このようなモデルを用いた推論のタスクでは、汎用ハードウェアアクセラレータは、CPU(Central Processing Unit)やGPU(Graphics Processing Unit)といった一般的なデプロイメント選択に代えて、有利な代替手段を提供する。
FPGA(Field Programmable Gate Array)プラットフォームカテゴリは、実装の柔軟性、エネルギ効率、レイテンシの改善、オンサイトデプロイメントへの適合性を約束する代替アクセラレータの例である。
FPGAプラットフォーム上でのTransformer推論の最近の進歩,トレンド,設計選択について検討する。
文献の体系的なレビューを行い、実装と最適化のために好まれるテクニックを抽出し、掘り下げる。
この研究と提案されたトピックの分類は、学術や産業の研究者のガイドとして機能する可能性がある。
関連論文リスト
- Architectural Design and Performance Analysis of FPGA based AI Accelerators: A Comprehensive Review [0.7874708385247353]
ディープラーニング(DL)は、急速に発展する先進技術である。
本稿では,DLのハードウェアレベルの最適化について述べる。
これは最先端のFPGAベースのニューラルネットワークアクセラレータの概要を提供する。
論文 参考訳(メタデータ) (2026-02-25T17:53:35Z) - FPGA or GPU? Analyzing comparative research for application-specific guidance [0.0]
本稿では,様々な研究論文から洞察を合成し,ドメイン固有アプリケーションに適したアクセラレーションを選択する際にユーザを指導する。
レビューされた研究を分類し、主要なパフォーマンス指標を分析することで、FPGAとGPUの長所、限界、理想的なユースケースを強調します。
この発見は、研究者や実践者がパフォーマンス、エネルギー効率、プログラム可能性のトレードオフをナビゲートするのに役立つ、実用的なレコメンデーションを提供する。
論文 参考訳(メタデータ) (2025-11-09T22:54:28Z) - TrackCore-F: Deploying Transformer-Based Subatomic Particle Tracking on FPGAs [0.2851702684899107]
我々はモノリシックなトランスフォーマー合成のためのツールを開発することを目指しており、特に推論をターゲットにしている。
当社の主なユースケースは、TrackFormersプロジェクトから派生した、追跡のための2つの機械学習モデル設計です。
論文 参考訳(メタデータ) (2025-09-30T14:44:43Z) - FPGA-based Acceleration for Convolutional Neural Networks: A Comprehensive Review [3.7810245817090906]
畳み込みニューラルネットワーク(CNN)は、ディープラーニングの基本であり、さまざまなドメインにわたるアプリケーションを駆動する。
本稿では、CNN用に特別に設計されたFPGAベースのハードウェアアクセラレータの包括的なレビューを提供する。
論文 参考訳(メタデータ) (2025-05-04T04:03:37Z) - A Survey on Inference Optimization Techniques for Mixture of Experts Models [50.40325411764262]
大規模Mixture of Experts(MoE)モデルは、条件計算によるモデル容量と計算効率の向上を提供する。
これらのモデル上で推論をデプロイし実行することは、計算資源、レイテンシ、エネルギー効率において大きな課題を示す。
本調査では,システムスタック全体にわたるMoEモデルの最適化手法について分析する。
論文 参考訳(メタデータ) (2024-12-18T14:11:15Z) - Inference Optimization of Foundation Models on AI Accelerators [68.24450520773688]
トランスフォーマーアーキテクチャを備えた大規模言語モデル(LLM)を含む強力な基礎モデルは、ジェネレーティブAIの新たな時代を支えている。
モデルパラメータの数が数十億に達すると、実際のシナリオにおける推論コストと高いレイテンシーが排除される。
このチュートリアルでは、AIアクセラレータを用いた補完推論最適化テクニックに関する包括的な議論を行っている。
論文 参考訳(メタデータ) (2024-07-12T09:24:34Z) - Enhancing Dropout-based Bayesian Neural Networks with Multi-Exit on FPGA [20.629635991749808]
本稿では,フィールドプログラマブルゲートアレイ(FPGA)ベースのアクセラレータを効率よく生成するアルゴリズムとハードウェアの共同設計フレームワークを提案する。
アルゴリズムレベルでは、計算とメモリのオーバーヘッドを低減した、新しいマルチエグジット・ドロップアウトベースのベイズNNを提案する。
ハードウェアレベルでは,提案する効率的なベイズNNのためのFPGAベースのアクセラレータを生成するための変換フレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-20T17:08:42Z) - Benchmarking and In-depth Performance Study of Large Language Models on
Habana Gaudi Processors [5.432613942292548]
トランスフォーマーモデルは、様々な機械学習タスクにおいて顕著な成功を収めてきたが、高い計算複雑性とリソース要求に悩まされている。
Habana GAUDIアーキテクチャのような専門的なAIハードウェアアクセラレータは、これらの問題に対処するための有望なソリューションを提供する。
本稿では,GAUDIプロセッサを用いてTransformerベースのモデルを高速化する未解決の可能性について検討し,そのプロセスにおける重要な課題に対処する。
論文 参考訳(メタデータ) (2023-09-29T04:49:35Z) - Full Stack Optimization of Transformer Inference: a Survey [58.55475772110702]
トランスフォーマーモデルは広範囲のアプリケーションにまたがって優れた精度を実現する。
最近のTransformerモデルの推測に必要な計算量と帯域幅は、かなり増加しています。
Transformerモデルをより効率的にすることに注力している。
論文 参考訳(メタデータ) (2023-02-27T18:18:13Z) - Learning Discrete Energy-based Models via Auxiliary-variable Local
Exploration [130.89746032163106]
離散構造データに対する条件付きおよび非条件付きEMMを学習するための新しいアルゴリズムであるALOEを提案する。
エネルギー関数とサンプリング器は、新しい変分型電力繰り返しにより効率よく訓練できることを示す。
本稿では、ソフトウェアテストのためのエネルギーモデルガイド付ファジィザについて、libfuzzerのようなよく設計されたファジィエンジンに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2020-11-10T19:31:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。