論文の概要: PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images
- arxiv url: http://arxiv.org/abs/2608.04210v1
- Date: Tue, 04 Aug 2026 20:23:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.623522
- Title: PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images
- Title(参考訳): PADFormer:スパースビュー画像からのPose-Agnostic Anomaly Detection
- Authors: Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang,
- Abstract要約: 突発性異常検出(PAD: Pose-Anostic Anomaly Detection)は、任意の視点で異常が現れるため、依然として困難である。
本研究では、視覚変換器(ViT)を利用して、クエリー画像の異常のないバージョンを直接再構築する新しい画像空間アプローチであるPADFormerを提案する。
PADは、古典的な数発の異常検出タスクにおいて同等のパフォーマンスを維持しながら、PADベンチマークで最先端の結果を達成する。
- 参考スコア(独自算出の注目度): 40.540633292445925
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pose-agnostic Anomaly Detection (PAD) remains challenging as anomalies can appear under arbitrary viewpoints, requiring methods to handle significant pose variations. Existing approaches rely on complex 3D reconstruction, which are computationally expensive and require extensive multi-view data. We propose PADFormer, a novel image-space approach that leverages Vision Transformer (ViT) to directly reconstruct anomaly-free versions of query images while preserving pose information. Our key insight is to adapt cross-view masked reconstruction for anomaly detection through training exclusively on normal data, combined with dynamic patch selection and spatial alignment mechanisms that enable effective learning from sparse reference views under significant pose variations. During inference, we perform multiple forward passes with different masking patterns to generate an ensemble of anomaly-free reconstructions, ensuring comprehensive coverage of the query image. Anomalies are detected by comparing these reconstructions with the query image. PADFormer achieves state-of-the-art results on the PAD benchmark while maintaining comparable performance on classic few-shot anomaly detection (FSAD) tasks, demonstrating superior efficiency and generalization without requiring 3D reconstruction.
- Abstract(参考訳): Pose-Anostic Anomaly Detection (PAD) は、任意の視点で異常が現れるため、重要なポーズのバリエーションを扱う方法を必要とするため、依然として困難である。
既存のアプローチは複雑な3D再構成に依存しており、計算コストが高く、多視点データを必要とする。
PADFormerは、視覚変換器(ViT)を利用して、ポーズ情報を保存しながら、クエリ画像の異常のないバージョンを直接再構築する新しい画像空間アプローチである。
我々の重要な洞察は、通常のデータのみをトレーニングし、ダイナミックパッチ選択と空間アライメント機構を組み合わせることで、スパーク参照ビューから顕著なポーズ変化下で効果的な学習を可能にすることで、異常検出のためのクロスビューマスク再構築を適応することである。
推論中、異なるマスキングパターンで複数のフォワードパスを実行し、異常のない再構成のアンサンブルを生成し、クエリ画像の包括的カバレッジを確保する。
これらの再構成とクエリ画像を比較して異常を検出する。
PADFormerは、従来の数ショット異常検出(FSAD)タスクに匹敵する性能を維持しつつ、PADベンチマークの最先端結果を達成し、3D再構成を必要とせず、優れた効率と一般化を示す。
関連論文リスト
- Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision [7.548589503544904]
前景のマスキングを用いてオブジェクトを分離する視覚的プロンプトパイプラインを導入する。
また,学習者モデルにおける教師の解凍機構を導入し,ドメイン適応性を向上させる。
AeBADデータセットの課題に対して,前回の最先端よりも3.5パーセントの改善を実現した。
論文 参考訳(メタデータ) (2026-06-08T15:52:05Z) - RobustGS: Unified Boosting of Feedforward 3D Gaussian Splatting under Low-Quality Conditions [67.48495052903534]
本稿では,汎用的で効率的なマルチビュー機能拡張モジュールRobustGSを提案する。
各種の有害撮像条件下でのフィードフォワード3DGS法のロバスト性を大幅に向上させる。
RobustGSモジュールはプラグイン・アンド・プレイ方式で既存の事前訓練パイプラインにシームレスに統合できる。
論文 参考訳(メタデータ) (2025-08-05T04:50:29Z) - Bridging 3D Anomaly Localization and Repair via High-Quality Continuous Geometric Representation [1.4763103835215192]
新しいフレームワークは、連続的なポーズ不変の形状表現を学習することで、3D異常の検出と修復を統合する。
Real3D-ADとAnomaly-ShapeNetの実験は最先端の性能を示している。
論文 参考訳(メタデータ) (2025-05-30T10:11:49Z) - FreeSplatter: Pose-free Gaussian Splatting for Sparse-view 3D Reconstruction [69.63414788486578]
FreeSplatterはスケーラブルなフィードフォワードフレームワークで、キャリブレーションされていないスパースビュー画像から高品質な3Dガウシアンを生成する。
当社のアプローチでは,自己注意ブロックが情報交換を容易にする合理化トランスフォーマーアーキテクチャを採用している。
包括的データセットに基づいて,オブジェクト中心とシーンレベルの再構築のための2つの特殊な変種を開発する。
論文 参考訳(メタデータ) (2024-12-12T18:52:53Z) - Unsupervised Anomaly Detection via Masked Diffusion Posterior Sampling [8.887775968482208]
拡散モデルは、その強力な生成能力のために、異常検出に有望な応用を示している。
本稿では,Masked Diffusion Posterior Smpling (MDPS) という,新規かつ高解釈可能な手法を提案する。
MDPSは、異常検出や局所化と同様に、通常の画像再構成の品質において最先端の性能を達成することができる。
論文 参考訳(メタデータ) (2024-04-27T13:13:27Z) - Towards Unified 3D Object Detection via Algorithm and Data Unification [70.27631528933482]
我々は、最初の統一型マルチモーダル3Dオブジェクト検出ベンチマークMM-Omni3Dを構築し、上記のモノクロ検出器をマルチモーダルバージョンに拡張する。
設計した単分子・多モード検出器をそれぞれUniMODEとMM-UniMODEと命名した。
論文 参考訳(メタデータ) (2024-02-28T18:59:31Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection [54.041049052843604]
STEMDは,多フレーム3Dオブジェクト検出のためのDETRのようなパラダイムを改良した,新しいエンドツーエンドフレームワークである。
まず、オブジェクト間の空間的相互作用と複雑な時間的依存をモデル化するために、空間的時間的グラフアテンションネットワークを導入する。
最後に、ネットワークが正のクエリと、ベストマッチしない他の非常に類似したクエリを区別することが課題となる。
論文 参考訳(メタデータ) (2023-07-01T13:53:14Z) - Masked Transformer for image Anomaly Localization [14.455765147827345]
パッチマスキングを用いたビジョントランスフォーマーアーキテクチャに基づく画像異常検出のための新しいモデルを提案する。
マルチレゾリューションパッチとその集合埋め込みは,モデルの性能を大幅に向上させることを示す。
提案モデルはMVTecや頭部CTなどの一般的な異常検出データセットでテストされている。
論文 参考訳(メタデータ) (2022-10-27T15:30:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。