論文の概要: Low-Power License Plate Detection and Recognition on a RISC-V Multi-Core MCU-Based Vision System
- arxiv url: http://arxiv.org/abs/2607.09768v1
- Date: Tue, 07 Jul 2026 09:24:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.18669
- Title: Low-Power License Plate Detection and Recognition on a RISC-V Multi-Core MCU-Based Vision System
- Title(参考訳): RISC-V Multi-Core MCU-based Vision Systemにおける低出力プレート検出と認識
- Abstract要約: 我々は,ALPR(Automatic License Plate Recognition)のための低消費電力MCUベースエッジデバイスの最初のデモ(私たちの知る限り)を提示する。
この設計は9コアのRISC-Vプロセッサ、GAP8とQVGAの超低消費電力グレースケール・イメージラーを併用している。
提案したビジュアル処理パイプラインは、ライセンスプレート検出にSSDlite-MobilenetV2、光学文字認識にLPRNetをベースとしたマルチモデル推論手法を用いており、最初のタスクでは38.9%のmAPスコア、パブリックデータセットでは99.13%である。
- 参考スコア(独自算出の注目度): 15.675111358084235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we present the first (to the best of our knowledge) demonstration of a low-power MCU-based edge device for Automatic License Plate Recognition (ALPR). The design leverages on a 9-core RISC-V processor, GAP8, coupled with a QVGA ultra-low-power greyscale imager. The proposed visual processing pipeline uses a multi-model inference approach based on SSDlite-MobilenetV2 for license plate detection and LPRNet for optical character recognition, reaching a 38.9% mAP score for the first task and a recognition rate of >99.13% for the latter on public datasets. On real-world data, the pipeline recognizes registration numbers when the size of LP crops is as small as 30x5 pixels. Thanks to the applied compression and optimization strategies, the multi-model inference (687 MMAC) achieves a throughput of 1.09 FPS at a power cost of 117 mW when running on GAP8. Our solution is the first MCU-class device embedding such a level of network complexity, resulting to be 73x more energy-efficient w.r.t. precedent mobile-class ALPR system featuring a Raspberry Pi3. The proposed design does not resort to any hardwired acceleration engines, thus retaining full flexibility for future algorithmic improvements.
- Abstract(参考訳): 本稿では,ALPR (Automatic License Plate Recognition) のための低消費電力MCUベースエッジデバイスの最初の実演を行う。
この設計は9コアのRISC-Vプロセッサ、GAP8とQVGAの超低消費電力グレースケール・イメージラーを併用している。
提案したビジュアル処理パイプラインは、ライセンスプレート検出にSSDlite-MobilenetV2、光学文字認識にLPRNetをベースとしたマルチモデル推論手法を用いており、最初のタスクでは38.9%のmAPスコア、パブリックデータセットでは99.13%である。
実世界のデータでは、LP作物のサイズが30x5ピクセルまで小さい場合、パイプラインは登録番号を認識する。
適用された圧縮と最適化戦略により、マルチモデル推論(687 MMAC)は、GAP8上で動作する場合の電力コスト117 mWで1.09 FPSのスループットを達成する。
我々のソリューションは、そのようなネットワークの複雑さを埋め込んだ最初のMCUクラスデバイスであり、Raspberry Pi3を搭載した先例のモバイルクラスALPRシステムの73倍のエネルギー効率を実現した。
提案した設計は、いかなるハードワイヤ・アクセラレーション・エンジンにも頼らず、将来のアルゴリズム改善のための完全な柔軟性を維持している。
関連論文リスト
- OpenGlass: Ultra-Low-Power On-Device AI Eyewear with Event-based Vision [8.93031966791759]
この研究は、新しいセンサーとアルゴリズムを迅速にプロトタイピングするためのオープンソースのスマートグラスプラットフォームを導入する。
モジュラーデザインはフレキシブルなFPCインターポーザを使用して、完全なPCBなしでイベントベースのカメラとフレームベースのカメラの両方をサポートする。
プロトタイプは200mAhのバッテリーで11.5時間連続したデバイス上でのMLを実現する。
論文 参考訳(メタデータ) (2026-06-05T16:27:02Z) - A Deployment-Friendly Foundational Framework for Efficient Computational Pathology [48.3868019137117]
モデルオーバーパラメータ化とパッチレベルの冗長性を緩和するLitePathを提案する。
LitePathは、1億9000万のパッチを使用して3つの大きなPFMから蒸留されたコンパクトなモデルであるLiteFMを統合している。
LitePathはVirchhow2より104.5倍高速で、3000のスライドに対して0.36 kWhを消費する。
論文 参考訳(メタデータ) (2026-02-15T06:31:50Z) - Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning [0.0]
この研究は、ライセンスプレートの認識、状態分類、車両抽出を1つの前方パスで特徴付ける新しい統一的なアプローチであるNeural Sentinelを提案する。
我々の主な貢献は、Low-Rank Adaptation (LoRA)を介して適応された微調整のPaliGemma 3Bモデルが、車両画像に関する複数の視覚的疑問に同時に答えられることを示すことである。
このシステムは、予測エラー(ECE)0.048で152msの平均推定遅延を達成し、信頼度の高い推定値を示す。
論文 参考訳(メタデータ) (2026-02-04T16:04:15Z) - STEP3-VL-10B Technical Report [115.89015065130127]
STEP3-VL-10Bは、コンパクト効率とフロンティアレベルのマルチモーダルインテリジェンスとのトレードオフを再定義する軽量基盤モデルである。
そこで我々はPallel Coordinated Reasoning(PaCoRe)を実装して,テスト時間計算をスケールし,リソースをスケーラブルな知覚推論に割り当てる。
MMBenchでは92.2%、MMMUでは80.11%、AIME2025では94.43%、MathVisionでは75.95%である。
論文 参考訳(メタデータ) (2026-01-14T17:58:24Z) - Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding [49.218195440600354]
現在の画像ピラミッドは、複数の解像度を処理するために同じ大規模なモデルを使用しており、計算コストを大幅に上回っている。
我々はCOCO変換画像ピラミッドネットワーク(PIIP)と呼ばれる新しいネットワークアーキテクチャを提案する。
PIIPは、事前訓練されたモデル(ViTまたはCNN)を、より小さなネットワークブランチによって高解像度の画像が処理され、計算コストと性能のバランスをとるマルチスケールイメージの処理に使用する。
論文 参考訳(メタデータ) (2025-01-14T01:57:41Z) - Optimizing the Deployment of Tiny Transformers on Low-Power MCUs [12.905978154498499]
この作業は、商用MCU上でのエンコーダTiny Transformersの柔軟性とマルチプラットフォームデプロイメントの実現と最適化を目的としている。
我々のフレームワークは、データの再利用を最大化し、重要な注意ブロックにデータマーシャリング操作を避けるために、カーネルの最適化ライブラリを提供する。
MHSA深度優先のタイリング方式はメモリピークを最大6.19倍に減らし、融合重み付けはランタイムを1.53倍減らし、パラメータ数を25%減らすことを示した。
論文 参考訳(メタデータ) (2024-04-03T14:14:08Z) - FPGA-QHAR: Throughput-Optimized for Quantized Human Action Recognition
on The Edge [0.6254873489691849]
本稿では,8ビット量子化された2ストリームSimpleNet-PyTorch CNNアーキテクチャに基づく,エンドツーエンドHAR拡張型HW/SWアクセラレータの共設計を提案する。
私たちの開発では、部分的にストリーミングデータフローアーキテクチャを使用して、ネットワーク設計やリソース利用のトレードオフよりも高いスループットを実現しています。
提案手法は,ZCU104上の187MHzで約24FPSのリアルタイム推論スループットを用いて,約81%の予測精度を達成した。
論文 参考訳(メタデータ) (2023-11-04T10:38:21Z) - Reduced Precision Floating-Point Optimization for Deep Neural Network
On-Device Learning on MicroControllers [15.37318446043671]
本稿では,MCUクラスデバイス上でのオンデバイス学習(ODL)プリミティブに対して,新しい精度最適化手法を提案する。
我々のアプローチは、シングルコアMCUのための既存のODLソフトウェアフレームワークよりも2桁以上高速である。
論文 参考訳(メタデータ) (2023-05-30T16:14:16Z) - MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning [72.80896338009579]
メモリボトルネックは畳み込みニューラルネットワーク(CNN)の設計における不均衡なメモリ分布に起因する。
本稿では,ピークメモリを大幅に削減するパッチ・バイ・パッチ・推論スケジューリングを提案する。
ニューラルアーキテクチャサーチによるプロセスを自動化し、ニューラルアーキテクチャと推論スケジューリングを共同で最適化し、MCUNetV2に導いた。
論文 参考訳(メタデータ) (2021-10-28T17:58:45Z) - FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation [81.76975488010213]
ディセンス光学フロー推定は、多くのロボットビジョンタスクで重要な役割を果たしています。
現在のネットワークはしばしば多くのパラメータを占有し、計算コストがかかる。
提案したFastFlowNetは、周知の粗大なやり方で、以下のイノベーションで機能する。
論文 参考訳(メタデータ) (2021-03-08T03:09:37Z) - Near-chip Dynamic Vision Filtering for Low-Bandwidth Pedestrian
Detection [99.94079901071163]
本稿では、ダイナミックビジョンセンサ(DVS)を用いた歩行者検出のための新しいエンドツーエンドシステムを提案する。
我々は、複数のセンサがローカル処理ユニットにデータを送信し、検出アルゴリズムを実行するアプリケーションをターゲットにしている。
我々の検出器は450ミリ秒毎に検出を行うことができ、総合的なテストF1スコアは83%である。
論文 参考訳(メタデータ) (2020-04-03T17:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。