論文の概要: Spatial Attention Supervision for Defect Localization: Exploiting Ground-Truth Masks as Training Signal in Diffusion-Augmented Defect Detection
- arxiv url: http://arxiv.org/abs/2609.06232v1
- Date: Sat, 05 Sep 2026 19:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.221052
- Title: Spatial Attention Supervision for Defect Localization: Exploiting Ground-Truth Masks as Training Signal in Diffusion-Augmented Defect Detection
- Title(参考訳): 欠陥局所化のための空間的注意 -拡散付加欠陥検出の訓練信号としての地表面の爆発-
- Authors: Sajjad Rezvani Boroujeni, Muskan Saraf, Gnana Tulasi Makineni, Tom Bush, Hossein Abedi,
- Abstract要約: 産業用データセットの地道欠陥マスクは一般に評価のために予約されている。
本稿では,分類ネットワークの訓練中に空間的監視信号として再利用する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ground-truth defect masks in industrial inspection datasets are typically reserved for evaluation. This paper repurposes them as spatial supervision signals during training of classification networks, teaching a model not just what to predict but where to look. The method adds an activation-based attention alignment loss that steers convolutional feature maps toward defect regions, in a mixed-supervision formulation that also accommodates samples without masks, such as diffusion-generated images. Combined with DDPM augmentation, synthetic images contribute quantity while masks contribute spatial precision. We evaluate 85 models (four CNN backbones under a 2x2 data/training factorial over five seeds, plus a Swin-V2-T transformer baseline) on the MVTec-AD bottle benchmark, with localization measured on held-out defect images excluded from classifier gradient updates. Main findings: (1) attention-guided training improves activation-based localization (Pixel-AUROC) by +18.0% for EfficientNetB0 with augmentation (p=0.005, Cohen's d=2.6) and +18.7% for ResNet50 (p=0.008), significant in four of eight CNN settings (uncorrected for multiple comparisons) with no significant change in classification; (2) for EfficientNetB0 a data x training-mode interaction is significant (p=0.002), consistent with a super-additive effect (+13.6% combined vs +1.6% summed individual effects); (3) architectures with weaker spatial representations benefit most, whereas ConvNeXt-T shows no effect, apparently because its depthwise-convolution activations yield spatially uninformative channel-mean maps; (4) unsupervised PatchCore remains the strongest localizer (Pixel-AUROC=0.983), contextualizing the supervised gains. These results show that existing evaluation masks can act as practical training signals that measurably and reproducibly improve where defect classifiers attend.
- Abstract(参考訳): 産業用検査データセットの地道欠陥マスクは一般に評価のために予約されている。
本稿では、分類ネットワークのトレーニング中に空間的監視信号として再活用し、予測するだけでなく、どこを見るべきかをモデルに教える。
この方法は、拡散生成画像のようなマスクのないサンプルも収容できる混合スーパービジョン定式化において、畳み込み特徴を欠陥領域に向けてマッピングするアクティベーションベースのアライメント損失を追加する。
DDPM増強と組み合わせて、合成画像は量に寄与し、マスクは空間的精度に寄与する。
MVTec-ADボトルベンチマークを用いて,85モデル(5種以上の2x2データ/トレーニング因子による4つのCNNバックボーン,およびSwin-V2-Tトランスフォーマーベースライン)を評価する。
主な発見:(1)注意誘導トレーニングは活性化に基づくローカライゼーション(Pixel-AUROC)を+18.0%改善し、(p=0.005、Cohen's d=2.6)、(p=0.008)ResNet50の+18.7%、(複数の比較のために修正されていない)8つのCNN設定のうち4つの重要な部分(p=0.008)、(2)EfficientNetB0のデータxトレーニングとモードの相互作用が重要な部分(p=0.002)、(+1.6%と合計した個々の効果に対して+13.6%)、(最も少ない空間表現を持つアーキテクチャ)、(最も多い)ConvNeX-Tは、空間的アクセプティベーションが不適切なため、その深度は明らかに変化しないため、(p=0.90)、(p=0.002)。
これらの結果から,既存の評価マスクは,欠陥分類器が関与する場所を計測的かつ再現的に改善する実用的な訓練信号として機能することが示唆された。
関連論文リスト
- Continuity-Driven Representation Learning for Industrial Defect Detection [10.126273003671388]
産業的欠陥検出は、検査画像が繰り返し構造を持つ大きな正常な領域を含むため、自然画像オブジェクト検出とは異なる。
本研究では, 正規支配領域を高密度補助監督として活用する連続性駆動型表現正規化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-18T04:31:55Z) - Rethinking Attention Locality in Spiking Transformers [50.00501275379363]
スパイキングトランスフォーマーは、スパイク駆動計算による効率的なビジュアル処理のための有望なパラダイムを提供する。
彼らのSSA(Softmax-free Spiking Self-Attention)は、空間的に局所化されたトークン相互作用を確立するのに苦労している。
境界連続経路(SCLA-BCP)を用いた空間連続的局所的注意法を提案する。
当社のアプローチでは、2017年のCOCOではmAP@50が9.50%、ADE20KではmIoUが3.42%改善しています。
論文 参考訳(メタデータ) (2026-08-09T07:36:17Z) - PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition [0.0]
本稿では,3つのコントリビューションを持つクロスモーダル顔マッチングフレームワークであるPLGSA-Transformerを提案する。
PLGSA-Transformerは、ROC AUC 1.0000で97.22%のペア検証精度を達成し、VGG-16ベースのMUFMを上回った。
論文 参考訳(メタデータ) (2026-07-03T19:48:17Z) - A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation [78.66324246922831]
本研究では,Sentinel-2イメージとEuroCropsパーセルレベルのアノテーションからセマンティックセグメンテーション対応農業データセットを生成するパイプラインを提案する。
このデータセットには、ヨーロッパ5カ国から67,337のパッチが含まれており、10種類の作物と背景の分類を減らしている。
The four-level U-Net with Group Normalization were training using 10 Sentinel-2 spectrum bands and a Composite loss with class-weighted cross-entropy and Dice loss。
論文 参考訳(メタデータ) (2026-05-30T11:20:29Z) - HADS-Net:A Hybrid Attention-Augmented Dual-Stream Network with Physics-Informed Augmentation for Breast Ultrasound Image Classification [0.04999814847776097]
HADS-Netはハイブリッドアテンション拡張デュアルストリームネットワークである。
グローバルなテクスチャと2つの平行な経路を通して局所的な境界線を利用する。
精度は96.58%、マクロOC-AUCは0.9978、マクロF1は0.9654、クラスF1スコアは0.970、0.951、0.976である。
論文 参考訳(メタデータ) (2026-05-19T22:16:24Z) - When Generative Augmentation Hurts: A Benchmark Study of GAN and Diffusion Models for Bias Correction in AI Classification Systems [0.6875312133832079]
生成モデルは、AIトレーニングパイプラインのクラス不均衡を補うために広く使用されている。
FastGAN拡張は、非常に低いトレーニングセットサイズで性能が劣るだけでなく、バイアスを積極的に増加させる。
低ランク適応による安定拡散は全体として最良の結果を得た。
論文 参考訳(メタデータ) (2026-03-17T05:37:17Z) - HyFormer-Net: A Synergistic CNN-Transformer with Interpretable Multi-Scale Fusion for Breast Lesion Segmentation and Classification in Ultrasound Images [0.0]
HyFormer-Netは、本質的に解釈可能な同時セグメンテーションと分類のためのハイブリッドCNN変換器である。
BUSIデータセットでは、HyFormer-NetがDice Score 0.761 +/-0.072と精度93.2%を獲得し、U-Net、Attention U-Net、TransUNetを上回っている。
乳房超音波におけるハイブリッドCNN変換器のクロスデータセット一般化研究を初めて行った。
論文 参考訳(メタデータ) (2025-11-02T17:06:12Z) - A Comprehensive Study of Image Classification Model Sensitivity to
Foregrounds, Backgrounds, and Visual Attributes [58.633364000258645]
このデータセットをRIVAL10と呼びます。
本研究では,前景,背景,属性の騒音劣化に対する幅広いモデルの感度を評価する。
本稿では,多種多様な最先端アーキテクチャ (ResNets, Transformers) とトレーニング手順 (CLIP, SimCLR, DeiT, Adversarial Training) について考察する。
論文 参考訳(メタデータ) (2022-01-26T06:31:28Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z) - Compressing Visual-linguistic Model via Knowledge Distillation [43.73998154661652]
変圧器を用いた大規模視覚言語モデルを小型モデルに圧縮するための知識蒸留の研究を行う。
提案した蒸留は,画像キャプションおよび視覚的質問応答タスクにおける小型VLモデルの性能を有意に向上させることを示した。
論文 参考訳(メタデータ) (2021-04-05T18:02:17Z) - Generalized Focal Loss: Learning Qualified and Distributed Bounding
Boxes for Dense Object Detection [85.53263670166304]
一段検出器は基本的に、物体検出を密度の高い分類と位置化として定式化する。
1段検出器の最近の傾向は、局所化の質を推定するために個別の予測分岐を導入することである。
本稿では, 上記の3つの基本要素, 品質推定, 分類, ローカライゼーションについて述べる。
論文 参考訳(メタデータ) (2020-06-08T07:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。