論文の概要: CascadeLUT: Information-Ordered Streaming Inference for Bandwidth-Constrained FPGAs
- arxiv url: http://arxiv.org/abs/2608.00720v1
- Date: Sat, 01 Aug 2026 15:40:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.876934
- Title: CascadeLUT: Information-Ordered Streaming Inference for Bandwidth-Constrained FPGAs
- Title(参考訳): CascadeLUT:帯域制約FPGAのための情報順序付きストリーミング推論
- Abstract要約: 本稿では,帯域幅制約に基づいて構成された情報構造化推論フレームワークCascadeLUTを提案する。
ハードウェアデータフローと機能スケジューリングを共同設計することで、CascadeLUTは精度を維持しながらデータの移動を削減できる。
データセット全体では、レイテンシの4.0から12.5倍、スループットの3.0から5.0倍、エネルギー/サンプルの13.8倍に達する。
- 参考スコア(独自算出の注目度): 1.4312099612976772
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mapping neural networks to FPGAs enables low-latency, energy-efficient inference, particularly for lookup table (LUT)-based models that eliminate multipliers and map directly to reconfigurable fabric. While prior work achieves high compute efficiency, it typically assumes full-sample availability, causing pipeline stalls in bandwidth-limited streaming scenarios. Here, the bottleneck shifts from computation to data movement, as large input transfers limit throughput and energy efficiency. We present CascadeLUT, an information-structured inference framework organized around bandwidth constraints. Instead of buffering the full input, features are partitioned into ordered subsets and predictions are progressively refined as subsets arrive. The cascade statically controls which layers consume incoming features, enabling deterministic streaming inference without runtime branching. By co-designing feature scheduling with hardware dataflow, CascadeLUT reduces data movement while maintaining accuracy. Across datasets, it achieves 4.0 to 12.5 times lower latency, 3.0 to 5.0 times higher throughput and up to 13.8 times lower energy/sample than prior LUT baselines, using 1.2 to 4.4 times the LUTs of the smallest DWN baseline per task. We also demonstrate on-device input quantization integrated with LUT-based inference and present end-to-end FPGA results on real-world workloads, with 5 times reductions in quantization overhead.
- Abstract(参考訳): ニューラルネットワークをFPGAにマッピングすることで、特に乗算器を排除し、再構成可能なファブリックに直接マップするルックアップテーブル(LUT)ベースのモデルにおいて、低レイテンシでエネルギー効率の推論が可能になる。
以前の作業は高い計算効率を達成するが、通常はフルサンプルの可用性を前提としており、帯域幅制限のストリーミングシナリオではパイプラインが停止する。
ここでは、大きな入力がスループットとエネルギー効率を制限するため、ボトルネックは計算からデータ移動へとシフトする。
本稿では,帯域幅制約に基づいて構成された情報構造化推論フレームワークCascadeLUTを提案する。
完全な入力をバッファする代わりに、機能は順序付けられたサブセットに分割され、サブセットが到着するにつれて予測が徐々に洗練される。
カスケードは、どの層が入ってくる機能を消費するかを静的に制御し、実行時ブランチなしで決定論的ストリーミング推論を可能にする。
ハードウェアデータフローと機能スケジューリングを共同設計することで、CascadeLUTは精度を維持しながらデータの移動を削減できる。
データセット全体では、レイテンシの4.0から12.5倍、スループットの3.0から5.0倍、以前のUTTベースラインの13.8倍、タスク毎のDWNベースラインの1.2から4.4倍のLUTを使用する。
また、LUTベースの推論と統合されたデバイス上の入力量子化と、実世界のワークロード上でのエンドツーエンドFPGAの結果を、量子化オーバーヘッドの5倍の削減で示す。
関連論文リスト
- ELiTeFormer: An Efficient Transformer for FPGAs [3.884894816711594]
トランスフォーマーブロックは、大きな言語モデル(LLM)で広く使われているが、現在のデプロイメント課題である。
ELiTeFormerは,ハイブリッド線形アテンションと超低精度(3次)線形プロジェクションを一体化した最初のトランスフォーマーモデルである。
論文 参考訳(メタデータ) (2026-07-04T00:52:06Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - QUILL: An Algorithm-Architecture Co-Design for Cache-Local Deformable Attention [12.542462936966844]
QUILLはスケジュール対応のアクセラレータで、変形可能な注意をキャッシュフレンドリでシングルパスの作業に変換する。
融合したMSDeformAttnエンジンは、中間体をこぼすことなく1回のパスで、ソフトマックス、アグリゲーション、最終的なプロジェクション(W'm)を実行する。
論文 参考訳(メタデータ) (2025-11-17T18:34:04Z) - TeLLMe v2: An Efficient End-to-End Ternary LLM Prefill and Decode Accelerator with Table-Lookup Matmul on Edge FPGAs [9.646882213709814]
TeLLMeは、低消費電力のエッジFPGAのためのテーブルルックアップベースの3次LLMアクセラレータである。
1.58ビットの重みと8ビットのアクティベーションを使用するプリフィルと自動回帰デコードの両方をサポートする。
5Wの電力予算の下では、TeLLMeは最大25tokens/sデコードスループットを提供する。
論文 参考訳(メタデータ) (2025-10-03T05:37:51Z) - da4ml: Distributed Arithmetic for Real-time Neural Networks on FPGAs [5.979741271992278]
FPGA上での分散算術 (DA) を用いた定数行列ベクトル乗算 (CMVM) 演算の効率的な実装法を提案する。
このアルゴリズムは、最先端のアルゴリズムと同様のリソース削減を実現し、計算を著しく高速化する。
提案アルゴリズムは,リアルタイムかつ高量子化されたニューラルネットワークに対して,同時にレイテンシを低減しつつ,チップ上のリソースを最大3分の1削減できることを示す。
論文 参考訳(メタデータ) (2025-07-06T21:01:32Z) - Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference [54.53508601749513]
本稿では,マルチモーダル理解のためのタスク指向特徴圧縮(TOFC)手法を提案する。
圧縮効率を向上させるために、視覚特徴の特性に基づいて複数のエントロピーモデルを適応的に選択する。
その結果,TOFCはデータ転送オーバーヘッドを最大52%削減し,システム遅延を最大63%削減できることがわかった。
論文 参考訳(メタデータ) (2025-03-17T08:37:22Z) - Fast Matrix Multiplications for Lookup Table-Quantized LLMs [58.11584672945781]
FLUTEはLUT量子化LLM用のフレキシブルなルックアップテーブルエンジンである。
バッチサイズ32と量子化グループサイズ128では、FLUTEカーネルは既存のGEMMカーネルよりも2〜4倍高速である。
論文 参考訳(メタデータ) (2024-07-15T17:55:42Z) - NeuraLUT: Hiding Neural Network Density in Boolean Synthesizable Functions [2.7086888205833968]
Field-Programmable Gate Array (FPGA)アクセラレータは、レイテンシとリソースクリティカルなDeep Neural Network (DNN)推論タスクの処理に成功している。
本稿では、ニューロンの境界を緩和し、サブネットワーク全体を単一のLUTにマッピングすることを提案する。
提案手法は,既知の遅延クリティカルタスク,ジェットサブストラクチャタグ,古典的コンピュータビジョンタスク,MNISTを用いた桁分類で検証する。
論文 参考訳(メタデータ) (2024-02-29T16:10:21Z) - Federated Learning for Energy-limited Wireless Networks: A Partial Model
Aggregation Approach [79.59560136273917]
デバイス間の限られた通信資源、帯域幅とエネルギー、およびデータ不均一性は、連邦学習(FL)の主要なボトルネックである
まず、部分モデルアグリゲーション(PMA)を用いた新しいFLフレームワークを考案する。
提案されたPMA-FLは、2つの典型的な異種データセットにおいて2.72%と11.6%の精度を改善する。
論文 参考訳(メタデータ) (2022-04-20T19:09:52Z) - Network Calculus with Flow Prolongation -- A Feedforward FIFO Analysis
enabled by ML [73.11023209243326]
Flow Prolongation (FP) は遅延境界精度を大幅に改善することが示されている。
本稿では,機械学習を用いて拡張を予測することによって,FPをスケールするアプローチであるDeepFPを紹介する。
DeepFPは計算コストを無視して平均12.1%削減する。
論文 参考訳(メタデータ) (2022-02-07T08:46:47Z) - DS-Net++: Dynamic Weight Slicing for Efficient Inference in CNNs and
Transformers [105.74546828182834]
本稿では,様々な難易度を持つ入力に対して,ネットワークパラメータの一部を適応的にスライスする動的ウェイトスライシングという,ハードウェア効率のよい動的推論方式を示す。
我々は、CNNのフィルタ数とCNNと変換器の多重次元を入力依存的に調整することで、動的スライム可能なネットワーク(DS-Net)と動的スライス可能なネットワーク(DS-Net++)を提案する。
論文 参考訳(メタデータ) (2021-09-21T09:57:21Z) - NullaNet Tiny: Ultra-low-latency DNN Inference Through Fixed-function
Combinational Logic [4.119948826527649]
フィールドプログラマブルゲートアレイ(FPGA)ベースのアクセラレータは、グラフィックス処理ユニット/中央処理ユニットベースのプラットフォームを置き換える深刻な競争相手として注目を集めています。
本稿では,資源とエネルギー効率,超低遅延FPGAベースニューラルネットワークアクセラレータ構築のためのフレームワークであるNullaNet Tinyを提案する。
論文 参考訳(メタデータ) (2021-04-07T00:16:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。