論文の概要: LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing
- arxiv url: http://arxiv.org/abs/2607.01949v1
- Date: Thu, 02 Jul 2026 09:40:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.775379
- Title: LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing
- Title(参考訳): 軽量ゼロショット異常検出フレームワークLiZAD
- Abstract要約: LiZADは、エッジデバイスでの使用に適したリアルタイムZSAD用に設計された軽量フレームワークである。
平均メモリダウンは61.5%、パラメータダウンは74.6%、スピードアップは3.02倍である。
NVIDIAのJetson NXとJetson AGXのエッジデバイスに配備され、ヴェローナ大学のインダストリアル・コンピュータ・エンジニアリング・ラボ(ICE Lab)の実際の生産ラインでテストされている。
- 参考スコア(独自算出の注目度): 17.337519621522727
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In modern high-throughput industrial production lines, product configurations and visual characteristics frequently change, making it impractical to collect and annotate data for every new scenario. This dynamic setting makes Zero-Shot Anomaly Detection (ZSAD) particularly suitable, as it enables defect detection without requiring training on target-specific samples. Although recent ZSAD approaches show promising results, they are computationally intensive and thus unsuitable for deployment on resource-constrained devices. We propose LiZAD: a lightweight framework designed for real-time ZSAD specifically tailored for use on edge devices. The proposed approach pairs the dense and spatially aware visual features of DINOv3, crucial for precise pixel-level localization, with the highly computationally efficient text embeddings of MobileCLIP2. These features are then mapped into a shared latent space via low-memory trainable projection heads. Compared to six state-of-the-art ZSAD models, LiZAD achieves an average memory reduction of 61.5%, a parameter reduction of 74.6%, and a speedup of 3.02x in terms of latency. Despite substantial reductions in computational and memory costs, our approach maintains competitive anomaly detection performance, dropping the average P-AUROC by just 6.4% relative to the best state-of-the-art model across the VisA, BTAD, MPDD, and MVTec-AD datasets. Finally, it is successfully deployed on the NVIDIA Jetson NX and Jetson AGX edge devices and tested on the real production line of the Industrial Computer Engineering Laboratory (ICE Lab) at the University of Verona. The code is available at https://github.com/intelligolabs/LiZAD.
- Abstract(参考訳): 現代の高スループットの工業生産ラインでは、製品構成と視覚的特徴が頻繁に変化し、新しいシナリオごとにデータを収集し注釈付けするのは現実的ではない。
この動的設定により、ZSAD(Zero-Shot Anomaly Detection)が特に適している。
最近のZSADアプローチは有望な結果を示しているが、計算集約的で、リソース制約のあるデバイスへの展開には適さない。
エッジデバイスでの使用に適したリアルタイムZSAD用に設計された軽量フレームワークであるLiZADを提案する。
提案手法は、DINOv3の高密度かつ空間的に認識される視覚的特徴と、MobileCLIP2の高計算効率なテキスト埋め込みとを組み合わせたものである。
これらの機能は、低メモリのトレーニング可能なプロジェクションヘッドを介して共有潜在空間にマッピングされる。
最先端の6つのZSADモデルと比較して、LiZADは61.5%のメモリ削減、74.6%のパラメータ削減、レイテンシの3.02倍のスピードアップを実現している。
計算コストとメモリコストの大幅な削減にもかかわらず、我々の手法は競合異常検出性能を維持し、VisA、BTAD、MPDD、MVTec-ADデータセットにおける最先端モデルと比較して平均的なP-AUROCをわずか6.4%減少させる。
最後に、NVIDIA Jetson NXおよびJetson AGXエッジデバイスに配備され、ヴェローナ大学のインダストリアル・コンピュータ・エンジニアリング・ラボ(ICE Lab)の実際の生産ラインでテストされる。
コードはhttps://github.com/intelligolabs/LiZADで入手できる。
関連論文リスト
- LiteEvent-AE: Lightweight Autoencoder for Event-Based Vision on Low-Latency Energy-Constrained Edge Devices [0.3957768262206625]
イベントベースのビジョンは、エネルギ・アウェア・人工知能(AI)にとって有望なパラダイムとして登場した
この研究は、ニューロモルフィックデータを効率的に圧縮するコンパクトでイベント駆動のオートエンコーダを提示する。
アーキテクチャは、軽量エンコーディングと、適応的なイベントしきい値設定下での堅牢なパフォーマンスを統合している。
論文 参考訳(メタデータ) (2026-08-22T04:13:47Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - Efficient Visual Anomaly Detection at the Edge: Enabling Real-Time Industrial Inspection on Resource-Constrained Devices [10.629206528012052]
エッジ配置のための2つの効率的な視覚異常検出法を提案する。
PatchCore-LiteとPadim-Liteは人気のあるPatchCoreとPaDiMモデルをベースにしている。
本手法をMVTec ADとVisAベンチマークで評価し,エッジ環境への適合性を示す。
論文 参考訳(メタデータ) (2026-03-18T10:38:05Z) - TinyGLASS: Real-Time Self-Supervised In-Sensor Anomaly Detection [7.978059159334374]
異常検出は、ラベル付き欠陥サンプルの不足にもかかわらず欠陥を特定する必要がある産業品質管理において重要な役割を担っている。
GLASSのような近年の自己教師型アプローチは、欠陥のないデータのみを用いて通常の視覚パターンを学習し、産業ベンチマークで高い性能を示した。
この研究は、リアルタイムエッジとセンサ内異常検出のために設計されたGLASSフレームワークの軽量な適応であるTinyGLASSを紹介する。
論文 参考訳(メタデータ) (2026-03-17T12:31:34Z) - Lightweight Transformer Architectures for Edge Devices in Real-Time Applications [0.0]
本調査では,エッジデプロイメント用に設計された軽量トランスフォーマーアーキテクチャについて検討する。
我々は、MobileBERT、TinyBERT、DistilBERT、EfficientFormer、EdgeFormer、MobileViTなど、注目すべき軽量版を体系的にレビューした。
実験により, モデルサイズを4~10倍, 推論遅延を3~9倍削減し, モデル精度を75~96%向上できることを確認した。
論文 参考訳(メタデータ) (2026-01-05T01:04:25Z) - DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning [94.62097655403683]
本稿では,ビジョン・ランゲージ・アクション統合フレームワークとして機能する空間認識型4次元MLLMであるDrivePIを提案する。
提案手法は,空間的理解,3次元知覚,予測(占有フロー),計画(行動出力)を並列に行う。
MLLMのバックボーンとして0.5BのQwen2.5モデルしか持たず、単一の統一モデルとしてのDrivePIは既存のVLAモデルと特殊VAモデルの両方を上回るか、あるいは超える。
論文 参考訳(メタデータ) (2025-12-14T18:45:54Z) - Task-Oriented Real-time Visual Inference for IoVT Systems: A Co-design Framework of Neural Networks and Edge Deployment [61.20689382879937]
タスク指向エッジコンピューティングは、データ分析をエッジにシフトすることで、この問題に対処する。
既存の手法は、高いモデル性能と低いリソース消費のバランスをとるのに苦労している。
ニューラルネットワークアーキテクチャを最適化する新しい協調設計フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-29T19:02:54Z) - Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical [4.211747495359569]
Hierarchical Inference (HI)システムは、選択したサンプルをエッジサーバやクラウドにオフロードして、リモートML推論を行う。
本稿では, HIの精度, レイテンシ, エネルギーの測定値に基づいて, デバイス上での推論性能を系統的に比較する。
論文 参考訳(メタデータ) (2024-07-10T16:05:43Z) - EdgeYOLO: An Edge-Real-Time Object Detector [69.41688769991482]
本稿では, 最先端のYOLOフレームワークをベースとした, 効率的で低複雑さかつアンカーフリーな物体検出器を提案する。
我々は,訓練中の過剰適合を効果的に抑制する拡張データ拡張法を開発し,小型物体の検出精度を向上させるためにハイブリッドランダム損失関数を設計する。
私たちのベースラインモデルは、MS 2017データセットで50.6%のAP50:95と69.8%のAP50、VisDrone 2019-DETデータセットで26.4%のAP50と44.8%のAP50に達し、エッジコンピューティングデバイスNvidia上でリアルタイム要求(FPS>=30)を満たす。
論文 参考訳(メタデータ) (2023-02-15T06:05:14Z) - High-Throughput, High-Performance Deep Learning-Driven Light Guide Plate
Surface Visual Quality Inspection Tailored for Real-World Manufacturing
Environments [75.66288398180525]
光導光板は、医療用照明器具からバックライトテレビディスプレイまで幅広い用途で広く利用されている光学部品である。
本研究では,光ガイド板表面の視覚的品質検査(VQI)を現実の製造環境に適した,完全に統合された,高性能なディープラーニング駆動ワークフローを提案する。
完全統合VQIシステム内のエッジコンピューティング上でのVQIの自動化を実現するため、高コンパクトな深層アンチエイリアス型アテンションコンデンサニューラルネットワーク(LightDefectNetと呼ぶ)が開発された。
LightDetectNetが検出精度を実現する実験
論文 参考訳(メタデータ) (2022-12-20T20:11:11Z) - FPGA-optimized Hardware acceleration for Spiking Neural Networks [69.49429223251178]
本研究は,画像認識タスクに適用したオフライントレーニングによるSNN用ハードウェアアクセラレータの開発について述べる。
この設計はXilinx Artix-7 FPGAをターゲットにしており、利用可能なハードウェアリソースの40%を合計で使用している。
分類時間を3桁に短縮し、ソフトウェアと比較すると精度にわずか4.5%の影響を与えている。
論文 参考訳(メタデータ) (2022-01-18T13:59:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。