論文の概要: LeYOLO, New Scalable and Efficient CNN Architecture for Object Detection
- arxiv url: http://arxiv.org/abs/2406.14239v1
- Date: Thu, 20 Jun 2024 12:08:24 GMT
- ステータス: 処理完了
- システム内更新日: 2024-06-21 14:01:46.554808
- Title: LeYOLO, New Scalable and Efficient CNN Architecture for Object Detection
- Title(参考訳): オブジェクト検出のための新しいスケーラブルで効率的なCNNアーキテクチャLeYOLO
- Authors: Lilian Hollard, Lucas Mohimont, Nathalie Gaveau, Luiz-Angelo Steffenel,
- Abstract要約: FLOPに基づく効率的な物体検出のためのニューラルネットワークアーキテクチャの設計選択に着目する。
そこで本研究では,YOLOモデルの有効性を高めるために,いくつかの最適化手法を提案する。
本稿では、オブジェクト検出のための新しいスケーリングパラダイムと、LeYOLOと呼ばれるYOLO中心のモデルに寄与する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computational efficiency in deep neural networks is critical for object detection, especially as newer models prioritize speed over efficient computation (FLOP). This evolution has somewhat left behind embedded and mobile-oriented AI object detection applications. In this paper, we focus on design choices of neural network architectures for efficient object detection computation based on FLOP and propose several optimizations to enhance the efficiency of YOLO-based models. Firstly, we introduce an efficient backbone scaling inspired by inverted bottlenecks and theoretical insights from the Information Bottleneck principle. Secondly, we present the Fast Pyramidal Architecture Network (FPAN), designed to facilitate fast multiscale feature sharing while reducing computational resources. Lastly, we propose a Decoupled Network-in-Network (DNiN) detection head engineered to deliver rapid yet lightweight computations for classification and regression tasks. Building upon these optimizations and leveraging more efficient backbones, this paper contributes to a new scaling paradigm for object detection and YOLO-centric models called LeYOLO. Our contribution consistently outperforms existing models in various resource constraints, achieving unprecedented accuracy and flop ratio. Notably, LeYOLO-Small achieves a competitive mAP score of 38.2% on the COCOval with just 4.5 FLOP(G), representing a 42% reduction in computational load compared to the latest state-of-the-art YOLOv9-Tiny model while achieving similar accuracy. Our novel model family achieves a FLOP-to-accuracy ratio previously unattained, offering scalability that spans from ultra-low neural network configurations (< 1 GFLOP) to efficient yet demanding object detection setups (> 4 GFLOPs) with 25.2, 31.3, 35.2, 38.2, 39.3 and 41 mAP for 0.66, 1.47, 2.53, 4.51, 5.8 and 8.4 FLOP(G).
- Abstract(参考訳): ディープニューラルネットワークの計算効率は、特に新しいモデルでは、効率的な計算(FLOP)よりも速度が優先されるため、オブジェクト検出に不可欠である。
この進化は、組み込みおよびモバイル指向のAIオブジェクト検出アプリケーションにやや遅れを取っている。
本稿では、FLOPに基づく効率的な物体検出計算のためのニューラルネットワークアーキテクチャの設計選択に焦点をあて、YOLOモデルの有効性を高めるためにいくつかの最適化を提案する。
まず、逆ボトルネックとインフォメーション・ボトルネックの原理からの理論的洞察にインスパイアされた効率的なバックボーンスケーリングを導入する。
第2に、計算資源を削減しつつ、高速なマルチスケール機能共有を容易にするために設計されたFPAN(Fast Pyramidal Architecture Network)を提案する。
最後に、分類および回帰タスクのための高速かつ軽量な計算を実現するために、デカップリングネットワークネットワーク(DNiN)検出ヘッドを提案する。
これらの最適化と、より効率的なバックボーンの活用により、オブジェクト検出のための新しいスケーリングパラダイムと、LeYOLOと呼ばれるYOLO中心のモデルに寄与する。
我々の貢献は、様々な資源制約において既存のモデルより一貫して優れており、前例のない精度とフロップ比を実現している。
特に、LeYOLO-Small は COCOval 上で 4.5 FLOP(G) の38.2% の競合的な mAP スコアを達成し、最新の YOLOv9-Tiny モデルと比較して計算負荷を 42% 削減した。
我々の新しいモデルファミリーは、これまで達成されていなかったFLOP-to-accuracy比を達成し、超低速ニューラルネットワーク構成 ((<1 GFLOP) から、25.2, 31.3, 35.2, 38.2, 39.3, 41 mAP for 0.66, 1.47, 2.53, 4.51, 5.8, 8.4 FLOP(G) の効率的なオブジェクト検出セットアップ (> 4 GFLOPs) までのスケーラビリティを提供する。
関連論文リスト
- YOLO-TLA: An Efficient and Lightweight Small Object Detection Model based on YOLOv5 [19.388112026410045]
YOLO-TLAは、YOLOv5上に構築された高度な物体検出モデルである。
まず、ネックネットワークピラミッドアーキテクチャにおいて、小さなオブジェクトに対する検出層を新たに導入する。
このモジュールはスライディングウィンドウの特徴抽出を使い、計算要求とパラメータ数の両方を効果的に最小化する。
論文 参考訳(メタデータ) (2024-02-22T05:55:17Z) - CNN-transformer mixed model for object detection [3.5897534810405403]
本稿では,トランスを用いた畳み込みモジュールを提案する。
CNNが抽出した詳細特徴と変換器が抽出したグローバル特徴とを融合させることにより、モデルの認識精度を向上させることを目的とする。
Pascal VOCデータセットでの100ラウンドのトレーニングの後、結果の精度は81%に達し、resnet101[5]をバックボーンとして使用したRCNN[4]よりも4.6向上した。
論文 参考訳(メタデータ) (2022-12-13T16:35:35Z) - FlowNAS: Neural Architecture Search for Optical Flow Estimation [65.44079917247369]
本研究では,フロー推定タスクにおいて,より優れたエンコーダアーキテクチャを自動で見つけるために,FlowNASというニューラルアーキテクチャ探索手法を提案する。
実験の結果、スーパーネットワークから受け継いだ重み付きアーキテクチャは、KITTI上で4.67%のF1-allエラーを達成していることがわかった。
論文 参考訳(メタデータ) (2022-07-04T09:05:25Z) - A lightweight and accurate YOLO-like network for small target detection
in Aerial Imagery [94.78943497436492]
小型ターゲット検出のためのシンプルで高速で効率的なネットワークであるYOLO-Sを提案する。
YOLO-SはDarknet20をベースとした小さな特徴抽出器と、バイパスと連結の両方を通じて接続をスキップする。
YOLO-Sはパラメータサイズが87%減少し、約半分のFLOPがYOLOv3となり、低消費電力の産業用アプリケーションに実用化された。
論文 参考訳(メタデータ) (2022-04-05T16:29:49Z) - NAS-FCOS: Efficient Search for Object Detection Architectures [113.47766862146389]
簡易なアンカーフリー物体検出器の特徴ピラミッドネットワーク (FPN) と予測ヘッドを探索し, より効率的な物体検出手法を提案する。
慎重に設計された検索空間、検索アルゴリズム、ネットワーク品質を評価するための戦略により、8つのV100 GPUを使用して、4日以内に最高のパフォーマンスの検知アーキテクチャを見つけることができる。
論文 参考訳(メタデータ) (2021-10-24T12:20:04Z) - Mitigating severe over-parameterization in deep convolutional neural
networks through forced feature abstraction and compression with an
entropy-based heuristic [7.503338065129185]
本稿では,エントロピーに基づく畳み込み層推定(EBCLE)を提案する。
EBCLEを用いて訓練したより広いが浅いモデルの相対的有効性を強調する実証的証拠を提示する。
論文 参考訳(メタデータ) (2021-06-27T10:34:39Z) - ANNETTE: Accurate Neural Network Execution Time Estimation with Stacked
Models [56.21470608621633]
本稿では,アーキテクチャ検索を対象ハードウェアから切り離すための時間推定フレームワークを提案する。
提案手法は,マイクロカーネルと多層ベンチマークからモデルの集合を抽出し,マッピングとネットワーク実行時間推定のためのスタックモデルを生成する。
生成した混合モデルの推定精度と忠実度, 統計モデルとルーフラインモデル, 評価のための洗練されたルーフラインモデルを比較した。
論文 参考訳(メタデータ) (2021-05-07T11:39:05Z) - EfficientPose: Efficient Human Pose Estimation with Neural Architecture
Search [47.30243595690131]
効率的なバックボーンと効率的なヘッドの2つの部分を含む、人間のポーズ推定を目的とした効率的なフレームワークを提案します。
我々の最小モデルは、MPIIで88.1%のPCKh@0.5の0.65 GFLOPしか持たず、我々の大モデルは2 GFLOPしか持たないが、その精度は最先端の大型モデルと競合する。
論文 参考訳(メタデータ) (2020-12-13T15:38:38Z) - Real-time object detection method based on improved YOLOv4-tiny [0.0]
YOLOv4-tiny は YOLOv4 に基づいて提案され,ネットワーク構造をシンプルにし,パラメータを削減する。
まず、Yolov4-tinyの2つのCSPBlockモジュールの代わりにResNet-Dネットワークで2つのResBlock-Dモジュールを使用する。
補助ネットワークの設計では、グローバルな特徴を抽出するために5x5の受容場を得るために2つの連続した3x3畳み込みを使用し、より効果的な情報を抽出するためにチャネルアテンションと空間アテンションも使用される。
論文 参考訳(メタデータ) (2020-11-09T08:26:28Z) - FBNetV3: Joint Architecture-Recipe Search using Predictor Pretraining [65.39532971991778]
サンプル選択とランキングの両方を導くことで、アーキテクチャとトレーニングのレシピを共同でスコアする精度予測器を提案する。
高速な進化的検索をCPU分で実行し、さまざまなリソース制約に対するアーキテクチャと準備のペアを生成します。
FBNetV3は最先端のコンパクトニューラルネットワークのファミリーを構成しており、自動と手動で設計された競合より優れている。
論文 参考訳(メタデータ) (2020-06-03T05:20:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。