論文の概要: DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection
- arxiv url: http://arxiv.org/abs/2608.23723v1
- Date: Mon, 24 Aug 2026 18:09:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.504335
- Title: DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection
- Title(参考訳): DriftAD: 数ショットの産業異常検出のためのビジュアルガイド付きテキストドリフト
- Abstract要約: FSAD(Few-shot Anomaly Detection)は、最近CLIPのようなビジョン言語モデルの恩恵を受けている。
3つの主要なモジュール上に構築されたFSADフレームワークであるDriftADを提案する。
- 参考スコア(独自算出の注目度): 31.825748364606522
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Few-shot anomaly detection (FSAD) has recently benefited from vision-language models such as CLIP, which enable anomaly de?tection by aligning visual features with text descriptions of normal and abnormal states. However, existing methods typically rely on static text prompts that are applied uniformly across the entire feature hierarchy and spatial dimensions. This rigid global-to-local matching fails to capture the highly localized and scale-dependent physical variations of industrial defects. To address this, we propose DriftAD, a FSAD framework built on three key modules. First, an Anomaly Signal Amplification (ASA) module enhances subtle defect signals through spatial and frequency branches before text-visual matching. Second, Visually-Guided Text Drift (VGTD) dynamically transforms frozen CLIP text embeddings, steering them into layer?wise, spatially-adaptive anomaly descriptors conditioned on local visual context at each encoder depth. Third, Drift-Guided Spatial Gating (DGSG) uses the drifted abnormal descriptor as a spatial probe to selectively enhance anomaly-relevant visual features. Addi?tionally, a drift separation loss prevents representational collapse of the drifted descriptors, and a gate supervision loss enforces spatially discriminative gating in DGSG. Extensive experiments on MVTec?AD and VisA demonstrate state-of-the-art performance across all 1-, 2-, and 4-shot settings on both image-level and pixel-level metrics. Code is available at https://github.com/wenyang001/DriftAD.
- Abstract(参考訳): Few-shot Anomaly Detection (FSAD)は、最近CLIPのようなビジョン言語モデルの恩恵を受けている。
正常な状態と異常な状態のテキスト記述と、視覚的特徴を一致させることによる接続。
しかし、既存のメソッドは通常、機能階層と空間次元全体にわたって一様に適用される静的テキストプロンプトに依存している。
この厳密なグローバル-ローカルマッチングは、工業的欠陥の高度に局所化およびスケール依存的な物理的変動を捉えることに失敗する。
そこで我々は,3つのキーモジュール上に構築されたFSADフレームワークであるDriftADを提案する。
まず、Anomaly Signal Amplification (ASA)モジュールは、テキストと視覚のマッチングの前に、空間と周波数の分岐を通して微妙な欠陥信号を強化する。
第2に、Visually-Guided Text Drift (VGTD)は、凍結したCLIPテキストの埋め込みを動的に変換し、それを階層化しますか?
各エンコーダ深さの局所的な視覚的文脈に条件付された、空間適応型異常記述子。
第3に、ドリフトガイド空間ゲーティング(DGSG)は、ドリフトされた異常記述子を空間プローブとして使用し、異常関連視覚的特徴を選択的に増強する。
アディ?
任意に、ドリフト分離損失はドリフトされたディスクリプタの表現的崩壊を防止し、ゲート監督損失はDGSGにおける空間的識別的ゲーティングを強制する。
MVTecの大規模な実験?
ADとVisAは、画像レベルとピクセルレベルのメトリクスの両方で、すべての1-、2-、4-shot設定で最先端のパフォーマンスを示す。
コードはhttps://github.com/wenyang001/DriftADで入手できる。
関連論文リスト
- Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。
既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。
DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:44:26Z) - Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection [2.08058961865456]
ゼロショット3D異常検出は、ターゲットカテゴリからのトレーニングデータにアクセスすることなく、異常を識別することを目的としている。
既存の手法は主に幾何学的手がかりを主に捉える多視点表現に3D観測を投影することに依存している。
本稿では,補助カテゴリからのRGBモダリティをクロスモーダルガイダンスとして活用する2段階統合フレームワークAlign3D-ADを提案する。
論文 参考訳(メタデータ) (2026-05-07T08:24:44Z) - mmAnomaly: Leveraging Visual Context for Robust Anomaly Detection in the Non-Visual World with mmWave Radar [2.1531495561529663]
我々はmmWaveレーダとRGBD入力を組み合わせて視覚コンテキストを組み込むマルチモーダル異常検出フレームワークであるmmAnomalyを提案する。
隠蔽兵器の局所化,スルーウォールの局所化侵入,およびスルーウォールのフォールローカライゼーションの3つの応用にまたがる2つのマルチモーダルデータセットに対するmmAnomalyの評価を行った。
論文 参考訳(メタデータ) (2026-04-01T02:07:57Z) - VID-AD: A Dataset for Image-Level Logical Anomaly Detection under Vision-Induced Distraction [8.968670701930714]
VID-ADは、視覚誘発障害下での論理的異常検出のためのデータセットである。
10の製造シナリオと5つの捕獲条件で構成され、合計50の1級タスクと10,395のイメージで構成されている。
正規画像から生成されたテキスト記述のみに依存する言語ベースの異常検出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-14T14:21:37Z) - VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer [18.348454274148185]
ゼロショット異常検出(ZSAD)では、ターゲットクラスの異常サンプルにアクセスせずに異常を検出し、位置を特定する必要がある。
この作業は、ZSADのテキストブランチの必要性を再考し、ビジョントランスフォーマー上に構築された純粋に視覚的なフレームワークであるVisualADを提示する。
VisualADは、産業ドメインと医療ドメインにまたがる13のゼロショット異常検出ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-09T04:33:56Z) - Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection [65.29550320117526]
我々はFinGrainedADという新しいフレームワークを提案し、異常なローカライゼーション性能を改善する。
実験により、提案されたFinGrainedADは、数ショット設定で全体的なパフォーマンスが優れていることが示された。
論文 参考訳(メタデータ) (2025-10-30T13:09:00Z) - GBlobs: Local LiDAR Geometry for Improved Sensor Placement Generalization [58.36712538433696]
本報告では,RoboSense 2025の上位ソリューションについて概説する。
各種センサ配置下での3次元物体検出における最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-21T11:35:58Z) - Wavelet-Guided Dual-Frequency Encoding for Remote Sensing Change Detection [67.84730634802204]
リモートセンシング画像の変化検出は,自然災害監視,都市拡張追跡,インフラ管理など,さまざまな工学的応用において重要な役割を担っている。
既存のほとんどの手法は空間領域モデリングに依存しており、特徴表現の限られた多様性は微妙な変化領域の検出を妨げる。
本研究では、特にウェーブレット領域における周波数領域の特徴モデリングが周波数成分の微細な違いを増幅し、空間領域において捉えにくいエッジ変化の知覚を高めることを観察する。
論文 参考訳(メタデータ) (2025-08-07T11:14:16Z) - Bi-Grid Reconstruction for Image Anomaly Detection [0.0]
本稿では,textbfGRAD: Bi-textbfGrid textbfReconstruction for Image textbfAnomaly textbfDetectionを紹介する。
2つの連続格子を用いて、正常な視点と異常な視点の両方から異常検出を強化する。
全体的な精度と微妙な違いを識別し、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-01T10:06:38Z) - Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts [57.01985221057047]
本稿では、事前学習された視覚言語モデル(VLM)に基づく、弱教師付きビデオ異常検出および局所化のための時間的プロンプト埋め込み(WSVADL)を学習する新しい手法を提案する。
提案手法は,WSVADLタスクの3つの公開ベンチマークにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2024-08-12T03:31:29Z) - Dual-path Frequency Discriminators for Few-shot Anomaly Detection [12.956761809902167]
本稿では、これらの問題に対処するために、周波数観点からDual-Path Frequency Discriminator (DFD)ネットワークを提案する。
識別者は擬似アノマリーの形で共同表現を学ぶ。
MVTec AD と VisA ベンチマークで行った実験では、DFD が現在の最先端手法を超越していることが示されている。
論文 参考訳(メタデータ) (2024-03-07T02:17:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。