論文の概要: BitFair: A 12nm Bit-Serial CNN Accelerator with Learnable Early Termination and Adaptive Bit Ordering for Ultra-Low-Power XR Vision
- arxiv url: http://arxiv.org/abs/2607.05445v1
- Date: Sat, 04 Jul 2026 10:15:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.261585
- Title: BitFair: A 12nm Bit-Serial CNN Accelerator with Learnable Early Termination and Adaptive Bit Ordering for Ultra-Low-Power XR Vision
- Title(参考訳): BitFair:12nmビットシリアルCNN加速器
- Abstract要約: BitFairは、学習可能なビットレベルの早期終了と適応的なビット順序付けを備えたビットシリアルCNNアクセラレータである。
IBM DVS128 GestureとN-Mでは、BitFairはそれぞれ96.5%と97.7%の精度を達成した。
- 参考スコア(独自算出の注目度): 9.413947161787124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Extended Reality (XR) wearables require always-on perception within tight power envelopes of a few watts and motion-to-photon latency budgets below 20 ms, leaving only a few milliseconds for neural-network inference. Bit-serial computing is attractive for such energy-efficient neural network acceleration, but many existing architectures still process all bits even when ReLU sets the final output to zero. This paper presents BitFair, a software-hardware co-designed bit-serial CNN accelerator with learnable bit-level early termination and adaptive bit ordering, working under the ultra-low-power and strict latency requirements of XR applications. BitFair exploits dynamic bit-level sparsity by learning per-layer thresholds that trigger early termination when partial sums reliably predict that the final ReLU output will be zero. Furthermore, it searches for layer-wise bit orders that prioritize informative bits, maximizing early termination without sacrificing accuracy. A GlobalFoundries 12nm FinFET implementation with a core area of 0.34 mm^2, 104 KB on-chip memory, and voltage scaling from 0.55 to 0.70 V achieves sub-millisecond latency, up to 117.0 BTOPS/W, and 0.07 pJ/SOP. On IBM DVS128 Gesture and N-MNIST, BitFair achieves 96.5% and 97.7% accuracy, respectively, while improving effective energy efficiency by 4.0-22.1x and accuracy by up to 9.2% over prior fabricated XR vision accelerators.
- Abstract(参考訳): 拡張現実感(XR)ウェアラブルは、数ワットのタイトなパワーエンベロープ内で常に認識する必要がある。
ビットシリアルコンピューティングはそのようなエネルギー効率のよいニューラルネットワーク加速には魅力的だが、ReLUが最終的な出力を0に設定しても、既存の多くのアーキテクチャは依然として全てのビットを処理している。
本稿では,ビットレベル早期終了および適応ビット順序付けが可能なソフトウェアハードウェアの共同設計型ビットシリアルCNNアクセラレータBitFairについて,XRアプリケーションの超低消費電力かつ厳密なレイテンシ要求の下で動作させる。
BitFairは、最終ReLU出力がゼロであると確実に予測する部分和が早期終了を誘発する層ごとのしきい値を学ぶことによって、動的ビットレベルの空間性を利用する。
さらに、情報ビットを優先し、精度を犠牲にすることなく早期終了を最大化するレイヤワイドビット順序を探索する。
GlobalFoundries 12nm FinFET実装は、コア領域が0.34 mm^2、104KBオンチップメモリ、電圧スケーリングが0.55から0.70Vであり、117.0 BTOPS/Wと0.07 pJ/SOPのサブミリ秒レイテンシを実現する。
IBM DVS128 GestureとN-MNISTでは、BitFairはそれぞれ96.5%と97.7%の精度を達成し、有効エネルギー効率は4.0-22.1x、精度は9.2%向上した。
関連論文リスト
- E-ReCON: An Energy- and Resource-Efficient Precision-Configurable Sparse nvCIM Macro for Conventional and Spiking Neural Edge Inference [0.0]
E-ReCONはエッジAI推論のためのコンパクトな3T1R ReRAMビットセルに基づく16 Kbのデジタルコンピュートインメモリ(DCIM)マクロである。
新たなインターリーブ10T/28T加算木を導入し、トランジスタ数と消費電力をそれぞれ37%と28%削減した。
提案したマクロは、最小レイテンシ0.48 ns、スループット2.31-3.1 TOPS、エネルギー効率419 TOPS/Wを実現している。
論文 参考訳(メタデータ) (2026-05-20T05:18:27Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Enabling Vibration-Based Gesture Recognition on Everyday Furniture via Energy-Efficient FPGA Implementation of 1D Convolutional Networks [11.481972015296812]
本研究では、低消費電力フィールドプログラマブルゲートアレイ(FPGA)上にコンパクトNNを展開させるエネルギー効率のよいソリューションを提案する。
我々は、複雑なスペクトル前処理を生波形入力に置き換え、複雑なオンボード前処理を不要とし、精度を犠牲にすることなく入力サイズを21倍削減する。
組み込みFPGAに適した2つの軽量アーキテクチャ(1D-CNNと1D-SepCNN)を設計し、パラメータを3億6900万から216に削減し、同等の精度を維持した。
論文 参考訳(メタデータ) (2025-10-27T09:30:36Z) - Spark Transformer: Reactivating Sparsity in FFN and Attention [53.221448818147024]
本稿では, FFNとアテンション機構の両方において, 高レベルのアクティベーション間隔を実現する新しいアーキテクチャであるSpark Transformerを紹介する。
これによりFLOPの2.5倍の削減が可能となり、CPUでは1.79倍、GPUでは1.40倍となる。
論文 参考訳(メタデータ) (2025-06-07T03:51:13Z) - TeLLMe: An Energy-Efficient Ternary LLM Accelerator for Prefilling and Decoding on Edge FPGAs [5.889337608109388]
TeLLMeは、低消費電力FPGAのための最初の3次LLMアクセラレータである。
1.58ビットの重みと8ビットのアクティベーションを使用するプリフィルと自動回帰デコードの両方をサポートする。
7Wの電力予算の下では、TeLLMeは最大9トークン/秒のスループットを1,024トークンのコンテキストで提供する。
論文 参考訳(メタデータ) (2025-04-22T21:00:58Z) - Global Vision Transformer Pruning with Hessian-Aware Saliency [93.33895899995224]
この研究はヴィジュアルトランスフォーマー(ViT)モデルの共通設計哲学に挑戦する。
遅延を意識した規則化による直接遅延低減を実現し,すべての層や構造に匹敵する新しいヘッセン型構造解析基準を導出する。
DeiT-Baseモデルで反復的なプルーニングを実行すると、NViT(Novel ViT)と呼ばれる新しいアーキテクチャファミリが生まれ、パラメータをより効率的に利用する新しいパラメータが現れる。
論文 参考訳(メタデータ) (2021-10-10T18:04:59Z) - BEANNA: A Binary-Enabled Architecture for Neural Network Acceleration [0.0]
本稿では,浮動小数点層とバイナリネットワーク層の両方を処理可能なニューラルネットワークハードウェアアクセラレータを提案し,評価する。
BEANNAは100MHzのクロック速度で動作し、ピークスループットは52.8ギガOps/秒である。
論文 参考訳(メタデータ) (2021-08-04T23:17:34Z) - Random and Adversarial Bit Error Robustness: Energy-Efficient and Secure
DNN Accelerators [105.60654479548356]
固定点量子化と重み切り、およびランダムビット誤り訓練(RandBET)の組み合わせにより、量子化DNN重みにおけるランダムビット誤りや逆ビット誤りに対するロバスト性を著しく向上することを示す。
これは低電圧運転のための高省エネと低精度量子化をもたらすが、DNN加速器の安全性も向上する。
論文 参考訳(メタデータ) (2021-04-16T19:11:14Z) - FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation [81.76975488010213]
ディセンス光学フロー推定は、多くのロボットビジョンタスクで重要な役割を果たしています。
現在のネットワークはしばしば多くのパラメータを占有し、計算コストがかかる。
提案したFastFlowNetは、周知の粗大なやり方で、以下のイノベーションで機能する。
論文 参考訳(メタデータ) (2021-03-08T03:09:37Z) - Sound Event Detection with Binary Neural Networks on Tightly
Power-Constrained IoT Devices [20.349809458335532]
サウンドイベント検出(SED)は、消費者およびスマートシティアプリケーションのホットトピックです。
Deep Neural Networksに基づく既存のアプローチは非常に効果的ですが、メモリ、電力、スループットの面で非常に要求が高いです。
本稿では,高エネルギー効率なRISC-V(8+1)コアGAP8マイクロコントローラと,極端量子化と小プリントバイナリニューラルネットワーク(BNN)の組み合わせについて検討する。
論文 参考訳(メタデータ) (2021-01-12T12:38:23Z) - EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware
Multi-Task NLP Inference [82.1584439276834]
BERTのようなトランスフォーマーベースの言語モデルでは、自然言語処理(NLP)タスクの精度が大幅に向上する。
We present EdgeBERT, a in-deepth algorithm- hardware co-design for latency-aware energy optimization for multi-task NLP。
論文 参考訳(メタデータ) (2020-11-28T19:21:47Z) - BitPruning: Learning Bitlengths for Aggressive and Accurate Quantization [57.14179747713731]
精度を維持しつつ,任意の粒度で推論ビット長を最小化するためのトレーニング手法を提案する。
ImageNetでは、平均4.13ビット、3.76ビット、4.36ビットを生成する。
論文 参考訳(メタデータ) (2020-02-08T04:58:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。