論文の概要: XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection
- arxiv url: http://arxiv.org/abs/2607.23658v1
- Date: Sun, 26 Jul 2026 13:47:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.18232
- Title: XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection
- Title(参考訳): XMatchAD:再構成に基づく異常検出における相互一致の視点
- Authors: Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai,
- Abstract要約: XMatchADは、疑似クロスモーダルマッチングの観点からタスクを再解釈する新しいUADフレームワークである。
提案手法は,マルチクラスの異常検出と局所化において,優れた性能,最先端の手法よりも優れた性能を実現している。
- 参考スコア(独自算出の注目度): 30.401044523780723
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The remarkable success of reconstruction-based methods in Unsupervised Anomaly Detection (UAD) lies in their ability to identify and localize anomalies by modeling discrepancies between input images and their reconstructed counterparts. However, these approaches often struggle to capture subtle anomalies and tend to produce blurred anomaly boundaries, which significantly limits their effectiveness, particularly in complex multi-class scenarios. To address these issues, we present XMatchAD, a novel UAD framework that reinterprets the task from a pseudo cross-modal matching perspective. Specifically, the input and reconstructed images are treated as two complementary modalities and their matching relationships are precisely exploited for anomaly detection. First, a pre-trained feature extractor is employed to encode discriminative representations. Second, an attention-guided cross-modal matching mechanism is introduced to match local inter-modal anomaly-related patterns while mutually refining the features. This enhances the sensitivity to anomalies with diverse shapes and subtle deviations and significantly improves the precision of anomaly detection and localization. Third, we design an adaptive frequency-aware fusion module that further delineates sharp anomaly boundaries through the coupling of high-frequency components from cross-modal multi-scale representations. Comprehensive evaluations on MVTec-AD, VisA, and MPDD benchmarks demonstrate that our method consistently achieves superior performance, outperforming state-of-the-art methods in multi-class anomaly detection and localization. The code will be released at https://github.com/Mingxiu-Cai/XMatchAD.
- Abstract(参考訳): Unsupervised Anomaly Detection (UAD) における再構成に基づく手法の顕著な成功は、入力画像と再構成された画像との相違をモデル化することによって、異常を識別し、局所化する能力にある。
しかしながら、これらのアプローチは微妙な異常を捉えるのに苦労することが多く、特に複雑な多クラスシナリオにおいて、その効果を著しく制限する曖昧な異常境界を生み出す傾向がある。
これらの問題に対処するため、疑似モーダルマッチングの観点からタスクを再解釈する新しいUADフレームワークであるXMatchADを提案する。
具体的には、入力画像と再構成画像を2つの相補的モダリティとして扱い、それらのマッチング関係を高精度に利用して異常検出を行う。
まず、事前訓練された特徴抽出器を用いて識別表現を符号化する。
第2に、特徴を相互に洗練しつつ、局所的なモーダル間異常パターンと一致するように、注意誘導型クロスモーダルマッチング機構を導入する。
これにより、様々な形状と微妙な偏差を持つ異常に対する感受性を高め、異常検出と局所化の精度を大幅に向上させる。
第3に,高周波数成分をクロスモーダルなマルチスケール表現から結合させることにより,シャープな異常境界をさらに明確にする適応周波数対応融合モジュールを設計する。
MVTec-AD, VisA, MPDD ベンチマークの総合評価により, マルチクラス異常検出および局所化において, 本手法は優れた性能, 最先端の手法よりも優れることを示した。
コードはhttps://github.com/Mingxiu-Cai/XMatchADでリリースされる。
関連論文リスト
- HiMatch-AD: DINOv3-driven Hierarchical Matching for Training-free Medical Anomaly Detection [6.789086317935452]
HiMatch-ADは、DINOv3によるトレーニングフリーな医療異常検出のための階層的マッチングフレームワークである。
信頼性に応じて地図を適応的に重み付けする統一的不確実性に基づく融合機構を導入する。
脳MRI、肝CT、網膜OCTデータセットを含むBMADベンチマークの実験は、HiMatch-ADがトレーニングベースとDINOベースの最先端の手法の両方を一貫して上回っていることを示した。
論文 参考訳(メタデータ) (2026-06-21T15:26:48Z) - OoDDINO:A Multi-level Framework for Anomaly Segmentation on Complex Road Scenes [3.0743391441996684]
異常セグメンテーションは、画像内の異常なオブジェクトを識別することを目的としている。
既存のピクセルワイズ手法は、通常、個々の異常スコアを割り当て、グローバルなしきい値戦略を用いて異常を分割する。
OoDDINOは,これらの制約に対処するために設計された,新しいマルチレベル・アノマライ・セグメンテーション・フレームワークである。
論文 参考訳(メタデータ) (2025-07-02T08:15:11Z) - CLIP Meets Diffusion: A Synergistic Approach to Anomaly Detection [49.11819337853632]
異常検出は、異常の定義の曖昧さ、異常型の多様性、トレーニングデータの不足による複雑な問題である。
識別的基盤モデルと生成的基礎モデルの両方を活用するCLIPfusionを提案する。
本手法は, 異常検出の多面的課題に対処する上で, マルチモーダル・マルチモデル融合の有効性を裏付けるものである。
論文 参考訳(メタデータ) (2025-06-13T13:30:15Z) - CAD: A General Multimodal Framework for Video Deepfake Detection via Cross-Modal Alignment and Distillation [24.952907733127223]
クロスモーダルアライメント・蒸留(CAD)を用いたビデオディープフェイク検出のための一般的なフレームワークを提案する。
1)高レベルのセマンティックシンセシスにおける矛盾を識別するクロスモーダルアライメント(例:リップ音声ミスマッチ)、2)モダリティ特異的な法医学的痕跡(例:合成音声のスペクトル歪み)を保存しながらミスマッチを緩和するクロスモーダル蒸留(例:合成音声のスペクトル歪み)である。
論文 参考訳(メタデータ) (2025-05-21T08:11:07Z) - Cross-Modal Learning for Anomaly Detection in Complex Industrial Process: Methodology and Benchmark [19.376814754500625]
複雑な産業プロセスにおける異常検出は、効率的で安定で安全な操作を確実にする上で重要な役割を担っている。
本稿では,マグネシウム溶融プロセスにおける視覚特徴(ビデオ)とプロセス変数(電流)の相関を探索し,異常検出を容易にするクロスモーダルトランスを提案する。
本稿では, マグネシウム溶融プロセスの先駆的なクロスモーダルベンチマークを行い, 同期的に取得したビデオデータと電流データを220万以上のサンプルで分析した。
論文 参考訳(メタデータ) (2024-06-13T11:40:06Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - Hard-normal Example-aware Template Mutual Matching for Industrial Anomaly Detection [78.734927709231]
異常検出器は、クエリー画像の未知の欠陥を検出し、ローカライズするために工業製造で広く使われている。
これらの検出器は異常のないサンプルで訓練され、ほとんどの通常のサンプルと区別された異常を成功させた。
しかし、ハードノーマルな例は、ほとんどの通常のサンプルから遠く離れており、しばしば既存の方法によって異常と誤認される。
論文 参考訳(メタデータ) (2023-03-28T17:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。