論文の概要: NeuronFabric: A Software Reference Architecture for On-Chip Transformer Training with Local Adam
- arxiv url: http://arxiv.org/abs/2606.16440v1
- Date: Mon, 15 Jun 2026 09:11:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.265252
- Title: NeuronFabric: A Software Reference Architecture for On-Chip Transformer Training with Local Adam
- Title(参考訳): NeuronFabric: ローカルAdamを使ったオンチップトランスフォーマートレーニングのためのソフトウェアリファレンスアーキテクチャ
- Authors: Evgeny Ukladchikov,
- Abstract要約: 本稿では,NuronFabricについて述べる。NuronFabricは将来のFPGAおよびASICによるローカルAdam更新によるトランスフォーマートレーニングの実装を目的としたソフトウェアリファレンスアーキテクチャである。
完全なC#プロトタイプは、外部の機械学習フレームワークなしで、フォワードパス、バックプロパゲーション、Adam最適化を実装している。
本稿では,初期の実験で観測されたボキャブラリ・バジェット制約について述べるとともに,BF16Wメモリの保存量を定量化し,FPGAトレーニングを次の段階として概説する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Publicly documented accelerator architectures generally separate training computation from optimizer-state updates or rely on external memory and host orchestration. This paper presents NeuronFabric, a software reference architecture intended for future FPGA and ASIC implementations of transformer training with local Adam updates. A complete C# prototype implements forward pass, backpropagation, and Adam optimization without external machine-learning frameworks. The goal is to validate numerical correctness and memory requirements before hardware implementation. The evaluated model is a 334K-parameter autoregressive transformer (d=88, H=4, f=264, L=4, vocab=256) trained on the Shakespeare corpus. The BF16W configuration achieves evaluation loss 1.5426 after 80K samples, compared with 1.5224 for an FP32 GPU reference, while producing coherent character-level text. The paper introduces BF16W, which stores weights in BF16 while retaining Adam optimizer moments in FP32. This reduces memory requirements for on-chip training. A 334K-parameter FP32 model with Adam moments requires approximately 4.0 MB, matching the BRAM capacity of a Xilinx ZCU102 device. The BF16W variant requires approximately 3.34 MB, leaving memory available for activation storage. We describe the vocabulary-budget constraint observed during earlier experiments, quantify BF16W memory savings, and outline FPGA training as the next stage of development. No FPGA measurements are included in this paper. This publication serves as a public architectural disclosure and software reference implementation for future FPGA and ASIC exploration of the NeuronFabric architecture.
- Abstract(参考訳): 一般にドキュメント化されたアクセラレータアーキテクチャは、トレーニング計算をオプティマイザ状態のアップデートから分離するか、外部メモリとホストオーケストレーションに依存している。
本稿では,NuronFabricについて述べる。NuronFabricは将来のFPGAおよびASICによるローカルAdam更新によるトランスフォーマートレーニングの実装を目的としたソフトウェアリファレンスアーキテクチャである。
完全なC#プロトタイプは、外部の機械学習フレームワークなしで、フォワードパス、バックプロパゲーション、Adam最適化を実装している。
目標は、ハードウェア実装前の数値的正確性とメモリ要件を検証することである。
評価モデルはシェイクスピアコーパスで訓練した334Kパラメータ自己回帰トランス (d=88, H=4, f=264, L=4, vocab=256) である。
BF16W構成は80Kサンプル後の評価損失 1.5426 を達成するが、FP32 GPU参照の 1.5224 はコヒーレントな文字レベルテキストを生成する。
本稿では、AdamOptimator momentsをFP32に保持しながら、BF16に重みを格納するBF16Wを紹介する。
これにより、オンチップトレーニングのメモリ要件が削減される。
アダム・モーメントを持つ334KパラメータFP32モデルは、Xilinx ZCU102デバイスのBRAM容量に匹敵する約4.0MBを必要とする。
BF16Wは、約3.34MBのメモリを必要とするため、メモリはアクティベーションストレージとして利用できる。
本稿では,初期の実験で観測されたボキャブラリ・バジェット制約について述べるとともに,BF16Wメモリの保存量を定量化し,FPGAトレーニングを次の段階として概説する。
本論文ではFPGA計測は含まない。
この出版物は、NeuronFabricアーキテクチャの将来のFPGAおよびASIC探索のための公開アーキテクチャ開示およびソフトウェアリファレンス実装として機能する。
関連論文リスト
- BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - GPU-Accelerated Optimization of Transformer-Based Neural Networks for Real-Time Inference [0.0]
本稿では,混合精度最適化を用いたNVIDIARTを用いた変圧器モデルのためのGPU加速型推論パイプラインの設計と評価を行う。
このシステムはCPUベースラインの64.4倍のスピードアップ、シングルサンプル推論の10ms以下のレイテンシ、メモリ使用量の63%削減を実現している。
論文 参考訳(メタデータ) (2026-03-30T17:27:33Z) - Real-Time Semantic Segmentation on FPGA for Autonomous Vehicles Using LMIINet with the CGRA4ML Framework [0.0]
本稿では,CGRA4MLハードウェアフレームワークを用いたFPGAによるリアルタイムセマンティックセマンティックセマンティクスの実装について述べる。
実装は,ZCU104 FPGA基板上で50.1msのレイテンシで,20フレーム/秒(FPS)でリアルタイムに動作している平均45%,約90%の画素精度を実現している。
論文 参考訳(メタデータ) (2025-10-25T10:16:22Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - Runtime Tunable Tsetlin Machines for Edge Inference on eFPGAs [0.2294388534633318]
eFPGAはエッジ機械学習(ML)アプリケーションのハードウェアアクセラレータを低消費電力で設計することができる。
限られたeFPGA論理とメモリは計算能力とモデルサイズを著しく制限した。
提案するeFPGAアクセラレータは、リソース使用量の最小化と、スループットに対するオンフィールドリカバリの柔軟性の実現に重点を置いている。
論文 参考訳(メタデータ) (2025-02-10T12:49:22Z) - Ultra Memory-Efficient On-FPGA Training of Transformers via Tensor-Compressed Optimization [13.185242557501754]
本稿では,エンド・ツー・エンド・エンド・トランスフォーマー・トレーニングのための最初のFPGAアクセラレーションを提案する。
アルゴリズム側では、テンソル化変圧器訓練のための双方向の収縮流を提示する。
ハードウェア側では、高度に圧縮されたモデルパラメータと勾配情報をチップに格納する。
論文 参考訳(メタデータ) (2025-01-11T23:29:51Z) - Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification [50.596077598766975]
資源制約のあるシナリオにおける深層話者埋め込み学習のためのメモリ効率のトレーニング戦略について検討する。
アクティベーションのために、中間アクティベーションを格納する必要がない2種類の可逆ニューラルネットワークを設計する。
状態に対して、元の32ビット浮動小数点値を動的ツリーベースの8ビットデータ型に置き換える動的量子化手法を導入する。
論文 参考訳(メタデータ) (2024-12-02T06:57:46Z) - MCUFormer: Deploying Vision Transformers on Microcontrollers with
Limited Memory [76.02294791513552]
我々はMCUFormerと呼ばれるハードウェア・アルゴリズムの協調最適化手法を提案し、メモリが極端に制限されたマイクロコントローラにビジョントランスフォーマーを配置する。
MCUFormerは320KBのメモリを持つ画像分類のためのImageNet上で73.62%のTop-1精度を実現している。
論文 参考訳(メタデータ) (2023-10-25T18:00:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。