論文の概要: TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI
- arxiv url: http://arxiv.org/abs/2603.22867v1
- Date: Tue, 24 Mar 2026 07:12:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.431654
- Title: TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI
- Title(参考訳): TRINE:マルチモーダルAIのためのToken-Aware, Runtime-Adaptive FPGA推論エンジン
- Authors: Hyunwoo Oh, Hanning Chen, Sanggeon Yun, Yang Ni, Suyeon Jang, Behnam Khaleghi, Fei Wen, Mohsen Imani,
- Abstract要約: TRINEは再構成なしでエンドツーエンドのマルチモーダル推論を実行する。
トークンプルーニングだけで、ViT重パイプライン上では最大7.8倍になる。
int8量子化では、一般的なタスク間で精度が2.5%低下する。
- 参考スコア(独自算出の注目度): 16.724696664451653
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal stacks that mix ViTs, CNNs, GNNs, and transformer NLP strain embedded platforms because their compute/memory patterns diverge and hard real-time targets leave little slack. TRINE is a single-bitstream FPGA accelerator and compiler that executes end-to-end multimodal inference without reconfiguration. Layers are unified as DDMM/SDDMM/SpMM and mapped to a mode-switchable engine that toggles at runtime among weight/output-stationary systolic, 1xCS SIMD, and a routable adder tree (RADT) on a shared PE array. A width-matched, two-stage top-k unit enables in-stream token pruning, while dependency-aware layer offloading (DALO) overlaps independent kernels across reconfigurable processing units to sustain utilization. Evaluated on Alveo U50 and ZCU104, TRINE reduces latency by up to 22.57x vs. RTX 4090 and 6.86x vs. Jetson Orin Nano at 20-21 W; token pruning alone yields up to 7.8x on ViT-heavy pipelines, and DALO contributes up to 79% throughput improvement. With int8 quantization, accuracy drops remain <2.5% across representative tasks, delivering state-of-the-art latency and energy efficiency for unified vision, language, and graph workloads-in one bitstream.
- Abstract(参考訳): ViT、CNN、GNN、トランスフォーマーNLPの組み込みプラットフォームを混在させるマルチモーダルスタックは、計算/メモリパターンが多様化し、ハードなリアルタイムターゲットがほとんど遅れないため、組込みプラットフォームである。
TRINEはシングルビットストリームFPGAアクセラレータとコンパイラで、再構成なしでエンドツーエンドのマルチモーダル推論を実行する。
レイヤはDDMM/SDDMM/SpMMとして統一され、モードスイッチ可能なエンジンにマッピングされる。
幅マッチングされた2段階のトップkユニットは、ストリーム内のトークンのプルーニングを可能にし、依存性対応層オフロード(DALO)は、再構成可能な処理ユニット間で独立カーネルを重複させ、利用を継続する。
Alveo U50とZCU104で評価されたTRINEは、レイテンシを最大22.57倍、RTX 4090と6.86倍、20-21WでJetson Orin Nanoに短縮する。
int8量子化では、一般的なタスク間で精度が2.5%低下し、統合されたビジョン、言語、グラフのワークロードを1ビットストリームで処理するための最先端のレイテンシとエネルギー効率が提供される。
関連論文リスト
- BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - QUILL: An Algorithm-Architecture Co-Design for Cache-Local Deformable Attention [12.542462936966844]
QUILLはスケジュール対応のアクセラレータで、変形可能な注意をキャッシュフレンドリでシングルパスの作業に変換する。
融合したMSDeformAttnエンジンは、中間体をこぼすことなく1回のパスで、ソフトマックス、アグリゲーション、最終的なプロジェクション(W'm)を実行する。
論文 参考訳(メタデータ) (2025-11-17T18:34:04Z) - A Runtime-Adaptive Transformer Neural Network Accelerator on FPGAs [0.0]
ADAPTORは、FPGA上のトランスフォーマーエンコーダとデコーダの高密度行列計算のためのランタイム適応型アクセラレータである。
FPGAプラットフォームにリソースを分散するための効率的な行列タイリングが組み込まれている。
最新のFPGAベースのアクセラレータと比べて1.7~2.25$times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2024-11-27T08:53:19Z) - ProTEA: Programmable Transformer Encoder Acceleration on FPGA [0.0]
トランスフォーマーニューラルネットワーク(TNN)は、自然言語処理(NLP)、機械翻訳、コンピュータビジョン(CV)など、様々な用途で広く利用されている。
TNNの人気にもかかわらず、これら2つの重要なブロックをターゲットにしたハードウェアアクセラレータは限られている。
本稿では,最先端の変圧器エンコーダの高密度計算に適したプログラム実行アクセラレータである textitProTEA を紹介する。
論文 参考訳(メタデータ) (2024-09-21T01:44:13Z) - Quasar-ViT: Hardware-Oriented Quantization-Aware Architecture Search for Vision Transformers [56.37495946212932]
視覚変換器(ViT)は、畳み込みニューラルネットワーク(CNN)と比較して、コンピュータビジョンタスクにおいて優れた精度を示す。
ハードウェア指向の量子化対応アーキテクチャ検索フレームワークであるQuasar-ViTを提案する。
論文 参考訳(メタデータ) (2024-07-25T16:35:46Z) - Edge-MoE: Memory-Efficient Multi-Task Vision Transformer Architecture
with Task-level Sparsity via Mixture-of-Experts [60.1586169973792]
M$3$ViTは、Mix-of-experts (MoE)を導入した最新のマルチタスクViTモデルである。
MoEは精度の向上と80%以上の削減計算を実現しているが、FPGAに効率的なデプロイを行う上での課題は残されている。
Edge-MoEと呼ばれる私たちの研究は、アーキテクチャの革新の集合を伴って、マルチタスクのViTのための最初のエンドツーエンドFPGAアクセラレータを導入するという課題を解決します。
論文 参考訳(メタデータ) (2023-05-30T02:24:03Z) - LL-GNN: Low Latency Graph Neural Networks on FPGAs for High Energy
Physics [45.666822327616046]
本研究は,粒子検出器のための低グラフニューラルネットワーク(LL-GNN)設計のための新しい再構成可能なアーキテクチャを提案する。
LL-GNNの設計は、洗練されたアルゴリズムが実験データを効率的に処理できるようにすることで、次世代のトリガーシステムを進化させる。
論文 参考訳(メタデータ) (2022-09-28T12:55:35Z) - EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware
Multi-Task NLP Inference [82.1584439276834]
BERTのようなトランスフォーマーベースの言語モデルでは、自然言語処理(NLP)タスクの精度が大幅に向上する。
We present EdgeBERT, a in-deepth algorithm- hardware co-design for latency-aware energy optimization for multi-task NLP。
論文 参考訳(メタデータ) (2020-11-28T19:21:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。