論文の概要: Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices
- arxiv url: http://arxiv.org/abs/2605.04282v2
- Date: Thu, 07 May 2026 06:59:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 17:36:06.157134
- Title: Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices
- Title(参考訳): 資源制約デバイスのためのハードウェア対応ニューラル特徴抽出
- Abstract要約: 我々は、リソース制約のあるデバイスのためのハードウェア対応のニューラル特徴抽出器であるGideonを紹介する。
ギデオンは1.5MBのメモリフットプリント以下で9.003msの推論時間を達成する。
Batch Normalizationをアフィン層に置き換えるなどのアーキテクチャ上の選択はINT8の堅牢性を大幅に向上させることを示す。
- 参考スコア(独自算出の注目度): 3.3898825803029067
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Visual SLAM is a core component of spatial computing systems, yet deploying learned local feature extractors on microcontroller-class hardware remains challenging due to memory, bandwidth, and quantization constraints. While modern neural descriptors provide strong robustness, their practical adoption is often hindered by system-level bottlenecks that are not captured by FLOP-based efficiency metrics. In this work, we introduce Gideon, a hardware-aware neural feature extractor explicitly designed for resource-constrained devices. Our approach combines relational knowledge distillation from a SuperPoint teacher with differentiable neural architecture search (DNAS) under strict memory and operator constraints. Unlike conventional design pipelines, we treat quantization stability and dynamic-range compactness as first-class objectives. We show that architectural choices such as replacing Batch Normalization with affine layers significantly improve INT8 robustness, and that descriptor dimensionality directly governs quantization resilience. Deployed on STM32N6, Gideon achieves 9.003 ms inference time (111 fps) while remaining below a 1.5 MB memory footprint. Remarkably, INT8 quantization induces negligible degradation and occasionally matches full-precision performance. These results demonstrate that robust learned feature extraction can be reconciled with embedded hardware constraints through holistic hardware-algorithm co-design.
- Abstract(参考訳): 空間コンピューティングシステムの中核となるコンポーネントであるVisual SLAMは、マイクロコントローラクラスのハードウェアに学習されたローカル特徴抽出器をデプロイするが、メモリ、帯域幅、量子化の制約のため、依然として困難である。
現代のニューラルディスクリプタは強力な堅牢性を提供するが、FLOPベースの効率指標によって捉えられないシステムレベルのボトルネックによって、その実践的採用が妨げられることが多い。
本稿では、リソース制約のあるデバイス用に明示的に設計されたハードウェア対応のニューラル特徴抽出器であるGideonを紹介する。
提案手法は,スーパーポイント教師のリレーショナル知識蒸留と,厳密なメモリと演算子制約下での微分可能なニューラルアーキテクチャ探索(DNAS)を組み合わせたものである。
従来の設計パイプラインとは異なり、量子化安定性と動的レンジコンパクト性を第一級の目的として扱う。
我々は、バッチ正規化をアフィン層に置き換えるなどのアーキテクチャ上の選択がINT8のロバスト性を大幅に向上させ、ディスクリプタ次元が量子化のレジリエンスを直接支配していることを示す。
STM32N6上にデプロイされたGideonは、1.5MBのメモリフットプリント以下で9.003msの推論時間(111fps)を達成した。
注目すべきは、INT8量子化は無視可能な劣化を誘発し、時には完全精度のパフォーマンスと一致することである。
これらの結果から,ロバスト学習機能抽出は,ハードウェア・アルゴリズムの総合設計により,組込みハードウェア制約と整合可能であることが示された。
関連論文リスト
- SpineContextResUNet: A Computationally Efficient Residual UNet for Spine CT Segmentation [0.21485350418225244]
SpineContextResUNetは高速な脊髄局在化のための計算効率の良い3次元残留U-Netである。
我々のアーキテクチャは、長距離解剖学的依存関係をキャプチャするために並列な多次元畳み込みを利用する軽量なContext Blockを統合している。
当社のモデルは、堅牢な推論を実行し、ポイント・オブ・ケアの診断とエッジプラットフォームへのデプロイに有効なソリューションとなる。
論文 参考訳(メタデータ) (2026-05-20T06:00:23Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - Deployment-Aligned Low-Precision Neural Architecture Search for Spaceborne Edge AI [1.1666234644810893]
ハードウェア対応ニューラルアーキテクチャサーチ(NAS)に直接配置整列型低精度トレーニングを導入する。
我々は,Intel Movidius Myriad X Visual Processing Unit (VPU) をターゲットとした,有人海洋監視のための船体セグメンテーションの枠組みについて検討した。
その結果、ハードウェア対応NASに配置一貫性のある数値制約を組み込むことで、リソース制約のあるエッジ人工知能(AI)の最適化と配置の堅牢性と整合性を大幅に向上することが示されている。
論文 参考訳(メタデータ) (2026-04-27T13:58:18Z) - SlimEdge: Lightweight Distributed DNN Deployment on Constrained Hardware [0.6219985442687116]
ディープ・分散・ネットワーク(DNN)は現代のコンピュータビジョンの中心となっている。
本手法は,ネットワーク容量を不均一なデバイス制約に合わせるために,構造化モデルプルーニングと多目的最適化を統合した。
その結果, 精度とメモリフットプリントのユーザ指定境界を満たすとともに, 1.2xから5.0xまでの推論遅延を低減できることがわかった。
論文 参考訳(メタデータ) (2025-12-11T04:02:21Z) - Hardware-Adaptive and Superlinear-Capacity Memristor-based Associative Memory [5.902429789895426]
本稿では,連想記憶のための新しいハードウェア適応学習アルゴリズムであるmemristorハードウェアについて,実験的に紹介する。
提案手法は, 最先端手法と比較して, デバイス故障の50%以下で有効容量を3倍に向上させる。
論文 参考訳(メタデータ) (2025-05-19T10:55:09Z) - Random resistive memory-based deep extreme point learning machine for
unified visual processing [67.51600474104171]
ハードウェア・ソフトウェア共同設計型, ランダム抵抗型メモリベース深部極点学習マシン(DEPLM)を提案する。
我々の共同設計システムは,従来のシステムと比較して,エネルギー効率の大幅な向上とトレーニングコストの削減を実現している。
論文 参考訳(メタデータ) (2023-12-14T09:46:16Z) - On-Chip Hardware-Aware Quantization for Mixed Precision Neural Networks [52.97107229149988]
エッジデバイス上でハードウェア対応の混合精度量子化を行うOn-Chipハードウェア・アウェア量子化フレームワークを提案する。
このパイプラインは、量子化プロセスが量子化演算子の実際のハードウェア効率を知覚することを可能にする。
精度測定のために,マルチチップシナリオにおける演算子の精度への影響を効果的に推定するMask-Guided Quantization Estimation技術を提案する。
論文 参考訳(メタデータ) (2023-09-05T04:39:34Z) - Synaptic metaplasticity with multi-level memristive devices [1.5598974049838272]
推論とトレーニングの両方において,メタ塑性を実現するためのメムリスタベースのハードウェアソリューションを提案する。
MNISTとFashion-MNISTの連続トレーニングにおいて,2層パーセプトロンの精度は97%,86%であった。
我々のアーキテクチャは、mmristorの制限された耐久性と互換性があり、メモリは15倍削減されている。
論文 参考訳(メタデータ) (2023-06-21T09:40:25Z) - DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures
using Lookup Tables [49.965024476651706]
DeepGEMMはSIMDハードウェア上で超高精度畳み込みニューラルネットワークを実行するためのルックアップテーブルベースのアプローチである。
実装は、x86プラットフォーム上で、対応する8ビット整数カーネルを最大1.74倍の性能で上回る。
論文 参考訳(メタデータ) (2023-04-18T15:13:10Z) - FPGA-optimized Hardware acceleration for Spiking Neural Networks [69.49429223251178]
本研究は,画像認識タスクに適用したオフライントレーニングによるSNN用ハードウェアアクセラレータの開発について述べる。
この設計はXilinx Artix-7 FPGAをターゲットにしており、利用可能なハードウェアリソースの40%を合計で使用している。
分類時間を3桁に短縮し、ソフトウェアと比較すると精度にわずか4.5%の影響を与えている。
論文 参考訳(メタデータ) (2022-01-18T13:59:22Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z) - Efficient Micro-Structured Weight Unification and Pruning for Neural
Network Compression [56.83861738731913]
ディープニューラルネットワーク(DNN)モデルは、特にリソース制限されたデバイスにおいて、実用的なアプリケーションに不可欠である。
既往の非構造的あるいは構造化された重量刈り法は、推論を真に加速することはほとんど不可能である。
ハードウェア互換のマイクロ構造レベルでの一般化された重み統一フレームワークを提案し,高い圧縮と加速度を実現する。
論文 参考訳(メタデータ) (2021-06-15T17:22:59Z) - Hardware-Centric AutoML for Mixed-Precision Quantization [34.39845532939529]
従来の量子化アルゴリズムは、異なるハードウェアアーキテクチャを無視し、すべてのレイヤを均一に量子化する。
本稿では、強化学習を利用して量子化ポリシーを自動的に決定するハードウェア・アウェア自動量子化(HAQ)フレームワークを紹介する。
本フレームワークは, 固定ビット幅(8ビット)の量子化と比較して, 遅延を1.4-1.95x, エネルギー消費を1.9x削減した。
論文 参考訳(メタデータ) (2020-08-11T17:30:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。