論文の概要: DiffLUT-Net: Differentiable Training of FPGA LUT Networks with Learnable Connectivity
- arxiv url: http://arxiv.org/abs/2609.09254v1
- Date: Tue, 08 Sep 2026 15:00:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.746751
- Title: DiffLUT-Net: Differentiable Training of FPGA LUT Networks with Learnable Connectivity
- Title(参考訳): DiffLUT-Net:学習可能な接続性を持つFPGA LUTネットワークの微分可能トレーニング
- Abstract要約: FPGAネイティブネットワークであるDiffLUT-Netを,スクラッチからトレーニングした6入力のLUTで接続する。
訓練後、真理表と接続は離散化され、未使用のロジックはプルーニングされ、ネットワークはVerilogとして直接エクスポートされる。
- 参考スコア(独自算出の注目度): 7.054660214035757
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Field-programmable gate arrays (FPGAs) enable efficient neural-network inference, but most deployment flows either accelerate multiply-accumulate operations or convert pretrained quantized models into lookup tables (LUTs). We present DiffLUT-Net, an FPGA-native network connected by six-input LUTs that are trained from scratch. We jointly learn the 64 truth-table entries of a LUT and the source to each of its six input ports using a differentiable LUT function relaxation and hardware source selection. After training, the truth tables and connections are discretized, unused logic can be pruned, and the network is exported directly as synthesizable Verilog. Across five benchmarks, DiffLUT-Net achieves favorable accuracy-resource trade-offs. These results demonstrate the effectiveness of jointly learning LUT functions and sparse connectivity for compact FPGA-native inference. The code is available at https://github.com/TUDa-HWAI/DiffLUT-Network.
- Abstract(参考訳): フィールドプログラマブルゲートアレイ(FPGA)は効率的なニューラルネットワーク推論を実現するが、ほとんどのデプロイメントフローは乗算累積演算を加速するか、事前訓練された量子化モデルをルックアップテーブル(LUT)に変換する。
FPGAネイティブネットワークであるDiffLUT-Netを,スクラッチからトレーニングした6入力のLUTで接続する。
LUTの64個の真理値のエントリと6つの入力ポートのソースを、微分可能なLUT関数緩和とハードウェアソース選択を用いて共同で学習する。
訓練後、真理表と接続は離散化され、未使用のロジックはプルーニングされ、ネットワークは合成可能なVerilogとして直接エクスポートされる。
5つのベンチマークで、DiffLUT-Netは良好な精度とリソースのトレードオフを達成した。
これらの結果は、コンパクトFPGAネイティブ推論におけるLUT関数とスパース接続の連立学習の有効性を示す。
コードはhttps://github.com/TUDa-HWAI/DiffLUT-Network.comで公開されている。
関連論文リスト
- HGQ-LUT: Fast LUT-Aware Training and Efficient Architectures for DNN Inference [12.364180908244188]
この研究は、最新のGPUで100倍以上のトレーニングを加速しながら、最先端のハードウェア効率を実現する新しいLATアプローチであるHGQ-LUTを提示する。
LUT-Dense 層と LUT-Conv 層を組み合わせることで、HGQ-LUT は手動のビット幅調整なしで精度の低いトレードオフを自動的に探索できる。
さらに、HGQ-LUTをオープンソースツールチェーンに統合し、ハイブリッドアーキテクチャの統一設計、コンパイル、ビット実行検証を可能にする。
論文 参考訳(メタデータ) (2026-04-24T07:13:30Z) - TorchLean: Formalizing Neural Networks in Lean [71.68907600404513]
本稿では,学習モデルを一級数学的対象として扱うフレームワークであるTorchLeanを紹介する。
我々はTorchLeanのエンドツーエンドを、証明された堅牢性、PINNの物理インフォームド残差、Lyapunovスタイルのニューラルコントローラ検証で検証する。
論文 参考訳(メタデータ) (2026-02-26T05:11:44Z) - BitLogic: Training Framework for Gradient-Based FPGA-Native Neural Networks [28.844098517315228]
BitLogicはFPGAネイティブニューラルネットワークのためのエンドツーエンドのトレーニング可能なフレームワークである。
マルチ累積演算をFPGAプリミティブに直接マップする微分可能なLUTノードに置き換える。
ネイティブバイナリ計算、疎結合、効率的なハードウェア実現を提供する。
論文 参考訳(メタデータ) (2026-02-07T06:32:44Z) - SparseLUT: Sparse Connectivity Optimization for Lookup Table-based Deep Neural Networks [0.0]
本稿では,LUTベースのディープニューラルネットワーク(DNN)に適した接続中心トレーニング技術であるSparseLUTを紹介する。
実験の結果、ベンチマーク全体で一貫した精度の改善が見られ、MNISTは最大2.13%向上した。
これはハードウェアのオーバーヘッドを伴わずに実現され、LUTベースのDNNの最先端の結果が得られる。
論文 参考訳(メタデータ) (2025-03-17T05:21:54Z) - NeuraLUT: Hiding Neural Network Density in Boolean Synthesizable Functions [2.7086888205833968]
Field-Programmable Gate Array (FPGA)アクセラレータは、レイテンシとリソースクリティカルなDeep Neural Network (DNN)推論タスクの処理に成功している。
本稿では、ニューロンの境界を緩和し、サブネットワーク全体を単一のLUTにマッピングすることを提案する。
提案手法は,既知の遅延クリティカルタスク,ジェットサブストラクチャタグ,古典的コンピュータビジョンタスク,MNISTを用いた桁分類で検証する。
論文 参考訳(メタデータ) (2024-02-29T16:10:21Z) - T-GAE: Transferable Graph Autoencoder for Network Alignment [79.89704126746204]
T-GAEはグラフオートエンコーダフレームワークで、GNNの転送性と安定性を活用して、再トレーニングなしに効率的なネットワークアライメントを実現する。
実験の結果、T-GAEは最先端の最適化手法と最高のGNN手法を最大38.7%、50.8%で上回っていることがわかった。
論文 参考訳(メタデータ) (2023-10-05T02:58:29Z) - FPGA-based AI Smart NICs for Scalable Distributed AI Training Systems [62.20308752994373]
我々は、フィールドプログラマブルゲートアレイ(FPGA)を用いた分散AI訓練システムのための新しいスマートネットワークインタフェースカード(NIC)を提案する。
提案するFPGAベースのAIスマートNICは,従来のNICを用いたベースラインシステムと比較して,6ノードで1.6倍,32ノードで2.5倍の性能向上が期待できる。
論文 参考訳(メタデータ) (2022-04-22T21:57:00Z) - Logic Shrinkage: Learned FPGA Netlist Sparsity for Efficient Neural
Network Inference [3.2296078260106174]
本稿では,LUTに基づくトポロジの学習最適化を提案する。
既存のアーキテクチャの実装では、LUT, Kあたりの入力数を手動で指定する必要がある。
本稿では,FPGA推論を対象とするニューラルネットワークにおいて,各LUTに対してKを自動的に学習することのできる,詳細なネットリスト解析手法である論理縮小手法を提案する。
論文 参考訳(メタデータ) (2021-12-04T14:23:24Z) - DS-Net++: Dynamic Weight Slicing for Efficient Inference in CNNs and
Transformers [105.74546828182834]
本稿では,様々な難易度を持つ入力に対して,ネットワークパラメータの一部を適応的にスライスする動的ウェイトスライシングという,ハードウェア効率のよい動的推論方式を示す。
我々は、CNNのフィルタ数とCNNと変換器の多重次元を入力依存的に調整することで、動的スライム可能なネットワーク(DS-Net)と動的スライス可能なネットワーク(DS-Net++)を提案する。
論文 参考訳(メタデータ) (2021-09-21T09:57:21Z) - ShiftAddNet: A Hardware-Inspired Deep Network [62.88246517699367]
ShiftAddNetはエネルギー効率のよい乗算レスディープニューラルネットワークである。
エネルギー効率のよい推論とトレーニングの両方につながるが、表現能力は損なわれない。
ShiftAddNetは、DNNのトレーニングと推論において、80%以上のハードウェア量子化されたエネルギーコストを積極的に削減し、同等またはより良い精度を提供する。
論文 参考訳(メタデータ) (2020-10-24T05:09:14Z) - ALF: Autoencoder-based Low-rank Filter-sharing for Efficient
Convolutional Neural Networks [63.91384986073851]
オートエンコーダを用いた低ランクフィルタ共有技術(ALF)を提案する。
ALFは、ネットワークパラメータの70%、オペレーションの61%、実行時間の41%を削減し、精度の低下を最小限にしている。
論文 参考訳(メタデータ) (2020-07-27T09:01:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。