論文の概要: GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.01049v1
- Date: Wed, 01 Jul 2026 15:11:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.956559
- Title: GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- Title(参考訳): GenAU:視覚言語モデルを用いた言語中心の産業異常理解
- Abstract要約: GenAUは産業異常理解のためのビジョン言語フレームワークである。
画像レベルの検出、ピクセルレベルのセグメンテーション、マルチタイプの異常検出、単一命令追従モデルにおける欠陥解析を統一する。
VisAとReal-IADでCLIPベースのゼロショット法で最強の画像レベルの検出を実現する。
- 参考スコア(独自算出の注目度): 12.502139331711673
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Industrial inspection requires more than binary anomaly detection: a practical system should determine whether an anomaly exists, localize the defective region, identify the defect type, and provide interpretable visual evidence. Existing CLIP-based methods detect and localize anomalies well but offer limited language-level defect understanding, while instruction-tuned vision-language models can describe defects but do not natively produce pixel-level masks. We introduce GenAU, a Generalist vision-language framework for industrial Anomaly Understanding that unifies image-level detection, pixel-level segmentation, multi-type anomaly detection, and defect analysis in a single instruction-following model. GenAU augments a vision-language model with two segmentation tokens, [SEG_defect] and [SEG_normal], whose hidden states act as language-grounded queries over multi-scale visual features for pixel-level localization; the image-level score fuses this map with the decoder's textual normal/defect decision, while the language decoder produces structured defect-aware responses. Trained with a joint language-modeling and segmentation objective, GenAU covers all four tasks within one architecture and recipe, adding zero-shot multi-type detection and language-grounded defect analysis at a quantified cost to detection and segmentation. Across cross-dataset benchmarks, GenAU attains the strongest image-level detection among CLIP-based zero-shot methods on VisA and Real-IAD, with segmentation approaching but not surpassing specialized CLIP baselines.
- Abstract(参考訳): 実用システムは、異常が存在するかどうかを判断し、欠陥領域をローカライズし、欠陥タイプを特定し、解釈可能な視覚的証拠を提供する。
既存のCLIPベースのメソッドは異常を検出し、ローカライズするが、言語レベルでの欠陥理解は限られている。
我々は、画像レベルの検出、画素レベルのセグメンテーション、マルチタイプの異常検出、欠陥解析を単一の命令追従モデルで統一する、産業異常理解のための汎用的なビジョン言語フレームワークGenAUを紹介する。
GenAUは、[SEG_defect]と[SEG_normal]という2つのセグメンテーショントークンを持つビジョン言語モデルを拡張し、その隠れ状態は画素レベルのローカライゼーションのためのマルチスケールな視覚的特徴に対して言語基底クエリとして機能し、画像レベルスコアはデコーダのテキスト正規/欠陥判定と融合し、言語デコーダは構造化された欠陥対応応答を生成する。
GenAUは、共同で言語モデリングとセグメンテーションの目標を訓練し、1つのアーキテクチャとレシピ内の4つのタスクをすべてカバーし、ゼロショットのマルチタイプ検出と言語基底欠陥分析を、検出とセグメンテーションの定量化コストで追加する。
クロスデータセットベンチマーク全体を通じて、GenAUは、VisAとReal-IADのCLIPベースのゼロショットメソッドの中で、最も強力な画像レベルの検出を実現している。
関連論文リスト
- Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation [42.193887957394345]
大規模視覚言語モデル(LVLM)は近年,産業的異常検出(IAD)の強力な可能性を示している。
我々は, LVLM を用いた IAD の高密度自己蒸留フレームワークである textbfOPD-IAD を提案する。
OPD-IADは、特権化された欠陥証拠を、モデル自身の法的な判断軌道に蒸留し、最終生成された判断を、密集した監督下で学習することを可能にする。
論文 参考訳(メタデータ) (2026-07-21T08:37:01Z) - Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection [58.927873049646024]
実画像と比較して,偽画像は対応するキャプションと適切に一致しないことを示す。
本稿では,視覚空間における画像テキストの不一致を識別的手がかりとして活用し,簡易かつ効果的なITEMを提案する。
論文 参考訳(メタデータ) (2025-11-01T06:51:14Z) - Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection [65.29550320117526]
我々はFinGrainedADという新しいフレームワークを提案し、異常なローカライゼーション性能を改善する。
実験により、提案されたFinGrainedADは、数ショット設定で全体的なパフォーマンスが優れていることが示された。
論文 参考訳(メタデータ) (2025-10-30T13:09:00Z) - IAD-GPT: Advancing Visual Knowledge in Multimodal Large Language Model for Industrial Anomaly Detection [70.02774285130238]
本稿では,リッチテキストセマンティクスと画像レベルの情報と画素レベルの情報の組み合わせについて検討する。
産業異常検出のためのMLLMに基づく新しいパラダイムであるIAD-GPTを提案する。
MVTec-ADとVisAデータセットの実験は、私たちの最先端のパフォーマンスを示しています。
論文 参考訳(メタデータ) (2025-10-16T02:48:05Z) - InspectVLM: Unified in Theory, Unreliable in Practice [0.0]
統一視覚言語モデル(VLM)は、単一の言語駆動インタフェース内で複数の視覚タスクをフレキシブルにすることで、コンピュータビジョンパイプラインの合理化を約束する。
InspectMMをトレーニングしたFlorence-2ベースのVLMであるInspectVLMを用いて,この統一パラダイムの有効性を批判的に評価する。
論文 参考訳(メタデータ) (2025-08-03T21:09:35Z) - OoDDINO:A Multi-level Framework for Anomaly Segmentation on Complex Road Scenes [3.0743391441996684]
異常セグメンテーションは、画像内の異常なオブジェクトを識別することを目的としている。
既存のピクセルワイズ手法は、通常、個々の異常スコアを割り当て、グローバルなしきい値戦略を用いて異常を分割する。
OoDDINOは,これらの制約に対処するために設計された,新しいマルチレベル・アノマライ・セグメンテーション・フレームワークである。
論文 参考訳(メタデータ) (2025-07-02T08:15:11Z) - MultiADS: Defect-aware Supervision for Multi-type Anomaly Detection and Segmentation in Zero-Shot Learning [27.235318937019255]
曲がったり、切られたり、引っかいたりといった、異なるタイプの欠陥を知ることが重要です。
欠陥タイプ」を認識する能力は、現代の生産ラインにおける異常の自動処理を可能にする。
ゼロショット学習手法であるMultiADSを提案する。
論文 参考訳(メタデータ) (2025-04-09T09:52:04Z) - FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model [0.9226774742769024]
製造業界における品質検査には,少ないショット・ゼロショット異常検出が重要である。
視覚言語CLIPモデルを利用したFew-shot/zero-shot Anomaly Engine Detection (FADE)を提案する。
FADEは、ゼロショットで89.6%(91.5%)、ノーマルショットで95.4%(97.5%)の異常セグメンテーションにおいて、他の最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2024-08-31T23:05:56Z) - Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot
Anomaly Localization [63.61093388441298]
対照的な言語-画像事前学習モデルは、ゼロショット視覚認識タスクで有望なパフォーマンスを示した。
本研究では,ゼロショット異常局所化のためのAnoCLIPを提案する。
論文 参考訳(メタデータ) (2023-08-30T10:35:36Z) - Reference-based Defect Detection Network [57.89399576743665]
最初の問題はテクスチャシフトであり、これはトレーニングされた欠陥検出モデルが目に見えないテクスチャの影響を受けやすいことを意味する。
第2の問題は部分的な視覚的混乱であり、部分的な欠陥ボックスが完全なボックスと視覚的に類似していることを示している。
本稿では,これら2つの問題に対処する参照型欠陥検出ネットワーク(RDDN)を提案する。
論文 参考訳(メタデータ) (2021-08-10T05:44:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。