論文の概要: VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection
- arxiv url: http://arxiv.org/abs/2607.29370v1
- Date: Fri, 31 Jul 2026 12:56:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.714661
- Title: VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection
- Title(参考訳): VFAD: ゼロショット異常検出のための周波数適応型表現学習
- Authors: Peng Chen, Kaige Li, Wei Wang, Mingbo Yang, Wenqiang Wang, Li Shen, Fangjun Huang, Chao Huang,
- Abstract要約: 本稿では、周波数適応型表現学習と変分セマンティック・プロンプトを組み合わせた統合フレームワークVFADを提案する。
VFADは、様々な異常シナリオにおいて、既存の最先端のZSAD手法よりも一貫して優れていることを示す。
- 参考スコア(独自算出の注目度): 28.519590715885567
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zero-shot anomaly detection (ZSAD) aims to detect and localize anomalies in unseen categories without access to target-specific training data. Although recent CLIP-based methods have demonstrated promising generalization through vision-language alignment, they remain limited in capturing diverse anomaly semantics and subtle local variations. To address these limitations, we propose VFAD, a unified framework that combines variational semantic prompting with frequency-adaptive representation learning. Specifically, we introduce a Variational Semantic Prompt Extractor (VSPE), which adaptively aggregates anomaly-relevant local semantics from dense patch tokens and regularizes them through a variational information bottleneck, thereby incorporating fine-grained visual cues and enabling more precise cross-modal alignment. Furthermore, we develop a Frequency-Adaptive Representation Aggregation (FARA) module that leverages wavelet-based frequency decomposition and frequency-specific expert aggregation to enhance anomaly-discriminative visual representations. By jointly strengthening semantic guidance and visual representation learning, VFAD improves both anomaly discrimination and fine-grained localization. Extensive experiments on 13 industrial and medical benchmarks demonstrate that VFAD consistently outperforms existing state-of-the-art ZSAD methods across diverse anomaly scenarios. The code will be publicly available upon publication.
- Abstract(参考訳): Zero-shot Anomaly Detection (ZSAD)は、ターゲット固有のトレーニングデータにアクセスせずに、見えないカテゴリの異常を検出し、ローカライズすることを目的としている。
最近のCLIPベースの手法は、視覚言語アライメントによる有望な一般化を実証しているが、様々な異常な意味と微妙な局所的変動を捉えることに制限されている。
これらの制約に対処するため,周波数適応型表現学習と変分セマンティック・プロンプトを組み合わせた統合フレームワークVFADを提案する。
具体的には、高密度パッチトークンから異常関連ローカルセマンティックを適応的に集約し、変動情報のボトルネックを通じてそれらを正規化することで、きめ細かな視覚的手がかりを取り入れ、より正確なクロスモーダルアライメントを可能にする変分セマンティック・プロンプト・エクストラクタ(VSPE)を提案する。
さらに、ウェーブレットに基づく周波数分解と周波数特異的なエキスパートアグリゲーションを活用して、異常識別視覚表現を強化する周波数適応表現アグリゲーション(FARA)モジュールを開発した。
意味指導と視覚表現学習を共同で強化することにより、VFADは異常識別と微粒化の両方を改善する。
13の産業用および医療用ベンチマークに関する大規模な実験により、VFADは様々な異常シナリオで既存の最先端のZSAD手法を一貫して上回っていることが示された。
コードは公開時に公開される。
関連論文リスト
- WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection [9.097817457018179]
ゼロショット異常検出(ZSAD)のためのウェーブレット強化実験用混合学習法を提案する。
変分オートエンコーダは、グローバルな意味表現をモデル化し、それらを多様な異常パターンへの適応性を高めるプロンプトに統合するために用いられる。
14の産業用および医療用データセットに対する実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-06T14:16:06Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - PromptMAD: Cross-Modal Prompting for Multi-Class Visual Anomaly Localization [9.018570847586878]
本稿では,教師なし視覚異常検出と局所化のためのクロスモーダルプロンプトフレームワークPromptMADを提案する。
本手法は,意味的コンテキストによる視覚的再構成を強化し,微妙・テクスチュラルな異常の検出を改善する。
我々のアーキテクチャには、マルチスケールの畳み込み機能とトランスフォーマーに基づく空間的注意を融合させる教師付きセグメンタも含まれている。
論文 参考訳(メタデータ) (2026-01-30T03:04:06Z) - DevPrompt: Deviation-Based Prompt Learning for One-Normal ShotImage Anomaly Detection [0.0]
FNSAD (Few-normal shot anomaly detection) は、画像内の異常領域を検出することを目的としている。
最近のアプローチでは、CLIPのような視覚言語モデルとプロンプトベースの学習を利用して、画像とテキストの特徴を整合させる。
本稿では,視覚言語モデルのセマンティックパワーと,偏差に基づくスコアリングの統計的信頼性を統合した偏差誘導型即時学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-21T20:35:51Z) - Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation [12.030059666003972]
分散シフト下でのゼロショット多重型およびバイナリ異常検出とセグメンテーションのプログレッシブチューニングに基づく,Defect-aware Prompt Optimizationのための新しいアプローチであるDAPOを紹介する。
本手法は,固定されたテキストアンカーと学習可能なトークン埋め込みの両方で,ハイブリッドな欠陥認識プロンプトを学習することにより,異常関連画像特徴と対応するテキストセマンティクスを一致させる。
論文 参考訳(メタデータ) (2025-12-10T09:19:17Z) - Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection [65.29550320117526]
我々はFinGrainedADという新しいフレームワークを提案し、異常なローカライゼーション性能を改善する。
実験により、提案されたFinGrainedADは、数ショット設定で全体的なパフォーマンスが優れていることが示された。
論文 参考訳(メタデータ) (2025-10-30T13:09:00Z) - Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection [50.343419243749054]
異常検出は、医学診断や工業的欠陥検出などの分野において重要である。
CLIPの粗粒化画像テキストアライメントは、微粒化異常に対する局所化と検出性能を制限する。
クレーンは最先端のZSADを2%から28%に改善し、画像レベルとピクセルレベルの両方で、推論速度では競争力を維持している。
論文 参考訳(メタデータ) (2025-04-15T10:42:25Z) - Fine-grained Abnormality Prompt Learning for Zero-shot Anomaly Detection [109.72772150095646]
FAPromptは、精密なZSADのためのきめ細かい異常プロンプトを学習するために設計された新しいフレームワークである。
産業的欠陥と医療的異常の両方をカバーする19の実世界のデータセットの実験は、FAPromptが画像レベルのZSADタスクとピクセルレベルのZSADタスクの両方で最先端の手法を大幅に上回っていることを実証している。
論文 参考訳(メタデータ) (2024-10-14T08:41:31Z) - Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization [60.899082019130766]
本稿では、フレームレベル検出ネットワーク(FDN)と、音声の時間的偽造検出とローカライゼーションのための改良ネットワーク(PRN)を提案する。
FDNは、偽のフレーム間で情報的不整合の手がかりを抽出し、偽の領域を大まかに示すのに有用な識別的特徴を得る。
PRNは、FDNから派生した粗粒度の提案を洗練するために、信頼スコアと回帰オフセットを予測する責任がある。
論文 参考訳(メタデータ) (2024-07-23T15:07:52Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z) - Localizing Anomalies from Weakly-Labeled Videos [45.58643708315132]
Weakly Supervised Anomaly Localization (WSAL)法を提案する。
異常映像の出現差にインスパイアされ, 隣接する時間領域の進化を異常映像の局所化のために評価した。
提案手法は,UCF-CrimeおよびTADデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2020-08-20T12:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。