論文の概要: SteelDefectX: A Coarse-to-Fine Vision-Language Dataset and Benchmark for Generalizable Steel Surface Defect Detection
- arxiv url: http://arxiv.org/abs/2603.21824v1
- Date: Mon, 23 Mar 2026 11:06:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.625241
- Title: SteelDefectX: A Coarse-to-Fine Vision-Language Dataset and Benchmark for Generalizable Steel Surface Defect Detection
- Title(参考訳): SteelDefectX: 粗視領域データセットと一般化可能な鋼表面欠陥検出ベンチマーク
- Abstract要約: 鉄鋼表面欠陥検出は、現代の製造における製品品質と信頼性を確保するために不可欠である。
SteelDefectXは、25の欠陥カテゴリにわたる7,778のイメージを含む視覚言語データセットである。
粗いレベルでは、データセットは欠陥カテゴリ、代表的視覚属性、関連する産業原因など、クラスレベルの情報を提供する。
きめ細かいレベルでは、形状、サイズ、深さ、位置、コントラストなどのサンプル固有の属性をキャプチャし、モデルがよりリッチでより詳細な欠陥表現を学習できるようにする。
- 参考スコア(独自算出の注目度): 37.308452484052175
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Steel surface defect detection is essential for ensuring product quality and reliability in modern manufacturing. Current methods often rely on basic image classification models trained on label-only datasets, which limits their interpretability and generalization. To address these challenges, we introduce SteelDefectX, a vision-language dataset containing 7,778 images across 25 defect categories, annotated with coarse-to-fine textual descriptions. At the coarse-grained level, the dataset provides class-level information, including defect categories, representative visual attributes, and associated industrial causes. At the fine-grained level, it captures sample-specific attributes, such as shape, size, depth, position, and contrast, enabling models to learn richer and more detailed defect representations. We further establish a benchmark comprising four tasks, vision-only classification, vision-language classification, few/zero-shot recognition, and zero-shot transfer, to evaluate model performance and generalization. Experiments with several baseline models demonstrate that coarse-to-fine textual annotations significantly improve interpretability, generalization, and transferability. We hope that SteelDefectX will serve as a valuable resource for advancing research on explainable, generalizable steel surface defect detection. The data will be publicly available on https://github.com/Zhaosxian/SteelDefectX.
- Abstract(参考訳): 鉄鋼表面欠陥検出は、現代の製造における製品品質と信頼性を確保するために不可欠である。
現在の手法は、しばしばラベルのみのデータセットで訓練された基本的な画像分類モデルに依存しており、解釈可能性と一般化を制限している。
これらの課題に対処するために、25の欠陥カテゴリにわたる7,778のイメージを含む視覚言語データセットであるSteelDefectXを紹介した。
粗いレベルでは、データセットは欠陥カテゴリ、代表的視覚属性、関連する産業原因など、クラスレベルの情報を提供する。
きめ細かいレベルでは、形状、サイズ、深さ、位置、コントラストなどのサンプル固有の属性をキャプチャし、モデルがよりリッチでより詳細な欠陥表現を学習できるようにする。
さらに、モデルの性能と一般化を評価するために、視覚のみの分類、視覚言語分類、少数/ゼロショット認識、ゼロショット転送の4つのタスクからなるベンチマークを確立する。
いくつかのベースラインモデルを用いた実験により、粗いテキストのアノテーションは解釈可能性、一般化、転送可能性を大幅に改善することが示された。
我々は、SteelDefectXが説明可能な、一般化可能な鋼表面欠陥検出の研究を進めるための貴重な資源になることを期待している。
データはhttps://github.com/Zhaosxian/SteelDefectX.comで公開される。
関連論文リスト
- Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery [3.016488960368601]
本稿では,損傷評価から検出を分離するハイブリッドフレームワークを提案する。
CVモデルはまず建物を検知し、画像上の境界ボックスを生成し、損傷分類と文脈解釈のためにLVLMに渡される。
我々はRescueNetとFloodNetの2つの実世界のベンチマークでフレームワークを評価した。
論文 参考訳(メタデータ) (2026-08-03T08:39:59Z) - Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence [88.74800617923083]
視覚機能を備えた軽量な大規模言語モデルであるGranite Visionを紹介した。
我々のモデルは、包括的な命令追従データセットに基づいて訓練されている。
Granite Visionは、ビジュアル文書理解に関連する標準ベンチマークで強力な結果を得る。
論文 参考訳(メタデータ) (2025-02-14T05:36:32Z) - Leveraging Large Language Models and Topic Modeling for Toxicity Classification [2.1506858566021037]
コンテンツモデレーションのためのトピック・モデリング手法を用いて,アノテータの位置がデータセットに与える影響について検討した。
その結果,特定のトピックについてモデルを微調整すると,モデルのF1スコアが顕著に向上することが示唆された。
論文 参考訳(メタデータ) (2024-11-26T20:47:24Z) - CableInspect-AD: An Expert-Annotated Anomaly Detection Dataset [14.246172794156987]
$textitCableInspect-AD$は、カナダの公共ユーティリティであるHydro-Qu'ebecのドメインエキスパートによって作成、注釈付けされた高品質なデータセットである。
このデータセットには、現実世界の異常に挑戦する高解像度の画像が含まれており、さまざまな重度レベルの欠陥をカバーしている。
モデルの性能を評価するために,クロスバリデーションに基づく包括的評価プロトコルを提案する。
論文 参考訳(メタデータ) (2024-09-30T14:50:13Z) - Wake Vision: A Tailored Dataset and Benchmark Suite for TinyML Computer Vision Applications [7.219686928616842]
低消費電力デバイスのためのティニー機械学習(TinyML)は、大規模で高品質なデータセットを作成するための体系的な方法論を欠いている。
プロダクショングレードシステムに適したバイナリ分類データセットを生成するための自動パイプラインを提案する。
対象とする2つのカテゴリにまたがる大規模TinyMLデータセットの自動生成に適用可能性を示す。
論文 参考訳(メタデータ) (2024-05-01T22:33:45Z) - Defect Spectrum: A Granular Look of Large-Scale Defect Datasets with Rich Semantics [27.03052142039447]
Defect Spectrumは、広範囲の産業的欠陥に対して、正確でセマンティックな、そして大規模なアノテーションを提供する包括的なベンチマークである。
4つの重要な産業ベンチマークに基づいて、私たちのデータセットは既存のアノテーションを洗練し、単一のイメージ内の複数の欠陥タイプを識別する、リッチなセマンティックな詳細を導入します。
また、高品質で多様な欠陥画像を作成するために設計された2段階拡散ベースジェネレータであるDefect-Genを紹介する。
論文 参考訳(メタデータ) (2023-10-26T11:23:24Z) - Bilevel Fast Scene Adaptation for Low-Light Image Enhancement [50.639332885989255]
低照度シーンにおける画像の強調は、コンピュータビジョンにおいて難しいが、広く懸念されている課題である。
主な障害は、異なるシーンにまたがる分散の相違によるモデリングの混乱にある。
上述の潜在対応をモデル化するための双レベルパラダイムを導入する。
エンコーダのシーン非関連な一般化を多様なシーンにもたらすために、双方向学習フレームワークを構築した。
論文 参考訳(メタデータ) (2023-06-02T08:16:21Z) - Unveiling the Unseen: A Comprehensive Survey on Explainable Anomaly Detection in Images and Videos [49.07140708026425]
画像やビデオを含む視覚データの異常検出とローカライゼーションは、機械学習や現実世界のアプリケーションにおいて不可欠である。
本稿では,説明可能な2次元視覚異常検出(X-VAD)に焦点を当てた初の包括的調査を行う。
本稿では,その基礎技術によって分類された説明可能な手法の文献レビューを行う。
我々は、将来的な方向性と、説明品質の定量化を含むオープンな問題について議論する。
論文 参考訳(メタデータ) (2023-02-13T20:17:41Z) - Revisiting Classifier: Transferring Vision-Language Models for Video
Recognition [102.93524173258487]
ダウンストリームタスクのためのタスク非依存の深層モデルから知識を伝達することは、コンピュータビジョン研究において重要なトピックである。
本研究では,映像分類作業における知識の伝達に着目した。
予測された言語モデルを用いて、効率的な翻訳学習のための適切なセマンティックターゲットを生成する。
論文 参考訳(メタデータ) (2022-07-04T10:00:47Z) - On Guiding Visual Attention with Language Specification [76.08326100891571]
注意をそらすのではなく,タスク関連機能に分類証拠を限定するためのアドバイスとして,ハイレベルな言語仕様を用いる。
この方法で空間的注意を監督することは、偏りのあるノイズのあるデータを用いた分類タスクの性能を向上させる。
論文 参考訳(メタデータ) (2022-02-17T22:40:19Z) - Towards Understanding Sample Variance in Visually Grounded Language
Generation: Evaluations and Observations [67.4375210552593]
視覚的基盤言語生成において,重要だがしばしば無視される問題を理解するために実験を設計する。
人間にはさまざまなユーティリティと視覚的注意があるので、マルチ参照データセットのサンプルのばらつきはモデルの性能にどのように影響しますか?
人為的な参照は、異なるデータセットやタスクで大きく変化する可能性があり、それぞれのタスクの性質が明らかになる。
論文 参考訳(メタデータ) (2020-10-07T20:45:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。