論文の概要: DHFP-PE: Dual-Precision Hybrid Floating Point Processing Element for AI Acceleration
- arxiv url: http://arxiv.org/abs/2604.04507v2
- Date: Wed, 08 Apr 2026 22:31:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 14:10:47.867652
- Title: DHFP-PE: Dual-Precision Hybrid Floating Point Processing Element for AI Acceleration
- Title(参考訳): DHFP-PE:AI加速のための2倍精度ハイブリッド浮動小数点処理要素
- Abstract要約: 本稿では,FP8(E4M3,E5M2)およびFP4(2xE2M1,2xE1M2)フォーマットをサポートする二精度浮動小数点MAC処理素子を提案する。
動作周波数は1.94GHzで0.00396mm2、消費電力は2.13mWであり、60.4%の面積削減と86.6%の省電力を実現している。
- 参考スコア(独自算出の注目度): 2.1512536685031285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid adoption of low-precision arithmetic in artificial intelligence and edge computing has created a strong demand for energy-efficient and flexible floating-point multiply-accumulate (MAC) units. This paper presents a dual-precision floating-point MAC processing element supporting FP8 (E4M3, E5M2) and FP4 (2 x E2M1, 2 x E1M2) formats, specifically optimized for low-power and high-throughput AI workloads. The proposed architecture employs a novel bit-partitioning technique that enables a single 4-bit unit multiplier to operate either as a standard 4 x 4 multiplier for FP8 or as two parallel 2 x 2 multipliers for 2-bit operands, achieving maximum hardware utilization without duplicating logic. Implemented in 28 nm technology, the proposed PE achieves an operating frequency of 1.94 GHz with an area of 0.00396 mm^2 and power consumption of 2.13 mW, resulting in up to 60.4% area reduction and 86.6% power savings compared to state-of-the-art designs, making it well suited for energy-constrained AI inference and mixed-precision computing applications when deployed within larger accelerator architectures.
- Abstract(参考訳): 人工知能とエッジコンピューティングにおける低精度算術の急速な採用により、エネルギー効率と柔軟な浮動小数点乗算(MAC)ユニットの需要が高まっている。
本稿では、FP8(E4M3, E5M2)およびFP4(2xE2M1, 2xE1M2)フォーマットをサポートする二精度浮動小数点MAC処理素子を提案する。
提案アーキテクチャでは,FP8 の標準 4 x 4 乗算器として,あるいは2ビットオペランドの並列 2 x 2 乗算器として,単一の 4 ビット単位乗算器を動作可能とした。
28nm技術で実装されたPEは、0.00396mm^2の領域と2.13mWの消費電力を持つ1.94GHzの動作周波数を実現し、その結果、最先端の設計と比較して60.4%の面積削減と86.6%の省電力を実現し、より大きな加速器アーキテクチャに展開する際のエネルギー制約のあるAI推論や混合精度コンピューティング用途に適している。
関連論文リスト
- SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression [46.709828328948724]
スパイキングニューラルネットワーク(SNN)は、ニューロモルフィックハードウェアに固有のエネルギー効率の利点を提供する。
MLLMの最初のスパイクベースフレームワークであるSpikeMLLMを提案する。
この結果から,SpikeMLLMはアグレッシブ・タイムステップ圧縮下でほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-04-13T15:32:44Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration [46.63567524455431]
低精度浮動小数点フォーマットは、遅延化オーバーヘッドを伴わずに安定性、メモリ節約、ハードウェア効率を提供する。
本稿では,エントロピー対応エンコーディングとGPU最適化デコーディングを備えた圧縮フレームワークであるExponent-Concentrated FP8(ECF8)を提案する。
LLMとDiTの最大671Bパラメータの実験では、最大26.9%のメモリ節約と177.1%のスループット加速が示されている。
論文 参考訳(メタデータ) (2025-10-03T02:22:13Z) - Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization [77.67818998672516]
本研究は,MXFP4とNVFP4の学習後量子化に関する総合的研究である。
本稿では,従来のGPTQ量子化アルゴリズムの変種であるMicro-Rotated-GPTQ(MR-GPTQ)を紹介する。
MR-GPTQは最先端の精度で一致または性能が向上することを示す。
論文 参考訳(メタデータ) (2025-09-27T09:22:21Z) - XR-NPE: High-Throughput Mixed-precision SIMD Neural Processing Engine for Extended Reality Perception Workloads [0.0]
XR-NPEは、視覚慣性オドメトリー(VIO)、物体分類、視線抽出のような拡張現実(XR)知覚のために設計されている。
結果が公開され、デザイナと研究者が簡単にそれらを採用して構築できるようになる。
論文 参考訳(メタデータ) (2025-08-18T16:13:00Z) - OISMA: On-the-fly In-memory Stochastic Multiplication Architecture for Matrix-Multiplication Workloads [0.2796197251957244]
OISMAは、準確率計算領域(Bent-Pyramidシステム)の計算単純性を利用する、新しいインメモリコンピューティングアーキテクチャである。
OISMAは通常のメモリ読み取り操作を、無視できるコストでインサイト乗算操作に変換する。
精度は平均相対的なフロベニウス誤差を 9.42% (4x4) から 1.81% (512x512) に減少させる。
論文 参考訳(メタデータ) (2025-08-12T10:24:33Z) - Pushing the Envelope of LLM Inference on AI-PC [45.081663877447816]
ウルトラロービットモデル(1/1.58/2-bit)は、同じモデルサイズを用いて、その完全精度のモデルのパープレキシティとエンドタスクのパフォーマンスとを一致させる。
最先端の推論ランタイム(例えばbitnet)の計算効率は未調査のままである。
まず1ビットと2ビットのマイクロカーネルを設計・実装し,計算効率の最大化を実現した。
我々は、現在のSOTAランタイムビットネットよりも優れた2ビットモデルを用いて、エンドツーエンドの推論結果を示す。
論文 参考訳(メタデータ) (2025-08-08T23:33:38Z) - VEXP: A Low-Cost RISC-V ISA Extension for Accelerated Softmax Computation in Transformers [13.984340807378457]
ソフトマックスの加速は、非ポイント、非線形の性質のために困難であり、指数が最も要求されるステップである。
シュラウドルフ法に基づく新しい近似アルゴリズムを用いて, Bfloat16指数の算術ブロックを設計する。
我々は162.7$times$低レイテンシと74.3$times$低エネルギーでSoftmaxを実行する。
論文 参考訳(メタデータ) (2025-04-15T14:28:48Z) - An Inquiry into Datacenter TCO for LLM Inference with FP8 [18.01919466758935]
大規模言語モデル(LLM)の計算特性をTCOの観点から解析する。
我々は、Intel(Gaudi 2 & 3)とNVIDIA(H100 & H200)のAIアクセラレーターにおけるTCOに影響を与える重要なワークロード特性について検討する。
ガウディHPUは,特にFP8量子化モデルにおいて,薄型GEMMよりも優れた利用率が得られることがわかった。
論文 参考訳(メタデータ) (2025-02-03T05:26:22Z) - Flex-PE: Flexible and SIMD Multi-Precision Processing Element for AI Workloads [0.0]
本研究は,フレキシブル・SIMDマルチ精度処理素子(FlexPE)を提案する。
提案設計では,パイプラインモードで最大16倍FxP4,8倍FxP8,4倍FxP16,1倍FxP32のスループットを実現する。
論文 参考訳(メタデータ) (2024-12-16T12:25:57Z) - QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language
Models [57.04178959678024]
重み付けとアクティベーションの両方を4ビットにキャストすることで、大きな生成モデルに対する推論計算の大部分が実行可能であることを示す。
これをQUIKと呼ばれるハイブリッド量子化戦略により実現し、重みとアクティベーションの大部分を4ビットに圧縮する。
我々は、QUIKフォーマットを高効率なレイヤワイドランタイムに適合させるGPUカーネルを提供し、これにより、エンドツーエンドのスループットが3.4倍に向上する。
論文 参考訳(メタデータ) (2023-10-13T17:15:05Z) - DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures
using Lookup Tables [49.965024476651706]
DeepGEMMはSIMDハードウェア上で超高精度畳み込みニューラルネットワークを実行するためのルックアップテーブルベースのアプローチである。
実装は、x86プラットフォーム上で、対応する8ビット整数カーネルを最大1.74倍の性能で上回る。
論文 参考訳(メタデータ) (2023-04-18T15:13:10Z) - RedMule: A Mixed-Precision Matrix-Matrix Operation Engine for Flexible
and Energy-Efficient On-Chip Linear Algebra and TinyML Training Acceleration [15.869673535117032]
現在のトレーニングアルゴリズムは、精度とダイナミックレンジの要求を満たすために浮動小数点行列演算に依存している。
RedMulEは、多精度浮動小数点一般行列演算(GEMM-Ops)加速のために考案された、低消費電力の特殊アクセラレータである。
RedMulE は FP16 と FP8 で 58.5 GFLOPS と 117 GFLOPS をそれぞれ達成し、計算要素の配列を99.4% 利用している。
論文 参考訳(メタデータ) (2023-01-10T11:07:16Z) - Adaptable Butterfly Accelerator for Attention-based NNs via Hardware and
Algorithm Co-design [66.39546326221176]
多くのAIタスクにおいて、注意に基づくニューラルネットワークが普及している。
注意機構とフィードフォワードネットワーク(FFN)の使用は、過剰な計算とメモリ資源を必要とする。
本稿では,注目機構とFFNの両方を近似するために,バタフライの分散パターンを統一したハードウェアフレンドリーな変種を提案する。
論文 参考訳(メタデータ) (2022-09-20T09:28:26Z) - FP8 Formats for Deep Learning [49.54015320992368]
2つのエンコーディングからなる8ビット浮動小数点(FP8)バイナリインターチェンジフォーマットを提案する。
E4M3のダイナミックレンジは無限大を表現せず、NaNに対して1つのマティーサビットパターンしか持たないことによって拡張される。
16ビットのトレーニングセッションで達成した結果の質を効果的にマッチングし,FP8フォーマットが様々な画像および言語タスクに対して有効であることを示す。
論文 参考訳(メタデータ) (2022-09-12T17:39:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。