論文の概要: CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection
- arxiv url: http://arxiv.org/abs/2605.26294v1
- Date: Mon, 25 May 2026 19:37:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.388096
- Title: CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection
- Title(参考訳): 皮膚がん検出のためのCNN, トランスフォーマー, ハイブリッド, ビジョン言語モデル
- Authors: Durjoy Dey, Yuhong Yan, Hassan Hajjdiab,
- Abstract要約: PAD-UFES-20データセットを用いた2値皮膚がん検出のための12種類の深層学習モデルの統一評価を行った。
モデルは、畳み込みニューラルネットワーク(CNN)、ビジョントランスフォーマー(ViT)、ハイブリッド畳み込みトランスフォーマーバックボーン、ビジョン言語モデル(VLM)の4つのファミリーにまたがる。
結果は、よく調整されたCNNが既に強力なベースラインを提供していることを示しているが、トランスフォーマーベースのファミリーは、常に差別を改善している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skin cancer is a common and fast rising malignancy worldwide. Early detection is critical for improving outcomes. Deep learning models trained on dermoscopic and clinical images can support automated and fast triage. However, many studies evaluate only a limited set of architectures. Experimental setups also vary across studies. In this paper, we present a unified evaluation of twelve deep learning models for binary skin cancer detection on the PAD-UFES-20 dataset. The models span four families: convolutional neural networks (CNN), vision transformers (ViT), hybrid convolution transformer backbones, and vision language models (VLM). Performance is assessed using AUC, the maximum F1 score with its precision and recall, and sensitivity at 80% specificity, reflecting screening oriented requirements. Our results show that well tuned CNNs already provide strong baselines, but transformer based families consistently improve discrimination. Hybrid models (MaxViT Tiny, CoAtNet0) and a SigLIP based VLM achieve the best overall trade off between ranking performance and clinically relevant operating points, while CLIP based model offers high precision. The full codebase for all experiments is publicly released. Together, these findings offer practical guidance on which model families are most suitable for real world deployment in skin cancer screening and establish a reproducible reference point for future work on PAD-UFES-20.
- Abstract(参考訳): 皮膚がんは世界中で一般的で急速に増加する悪性腫瘍である。
早期発見は結果を改善するために重要である。
皮膚内視鏡および臨床画像に基づいてトレーニングされたディープラーニングモデルは、自動的および高速なトリアージをサポートすることができる。
しかし、多くの研究は限定的なアーキテクチャのみを評価している。
実験装置も研究によって異なる。
本稿では,PAD-UFES-20データセットを用いた2値皮膚癌検出のための12種類のディープラーニングモデルの統一的な評価を行う。
モデルには、畳み込みニューラルネットワーク(CNN)、ビジョントランスフォーマー(ViT)、ハイブリッド畳み込みトランスフォーマーバックボーン、ビジョン言語モデル(VLM)の4つのファミリーがある。
AUCは、その精度とリコールによる最大F1スコア、80%の特異性で感度を評価、スクリーニング指向の要求を反映している。
以上の結果から,順調に調整されたCNNはすでに強力なベースラインを提供するが,トランスフォーマーに基づく家族による差別は一貫して改善していることがわかった。
ハイブリッドモデル(MaxViT Tiny, CoAtNet0)とSigLIPベースのVLMは、ランキングパフォーマンスと臨床的に関係のある運用ポイントのトレードオフを最大限に達成し、CLIPベースのモデルは高い精度を提供する。
すべての実験のための完全なコードベースが公開されている。
これらの知見は, 皮膚がん検診において, モデルファミリーが現実の展開に最も適しているか, 今後のPAD-UFES-20の再現可能な基準点を確立するための実践的ガイダンスを提供するものである。
関連論文リスト
- Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening [0.0]
我々は、畳み込みニューラルネットワーク、ビジョントランスフォーマー、ハイブリッドCNN変換器バックボーン、ビジョン言語モデルという、4つのモデルファミリにまたがる12のアーキテクチャをベンチマークした。
網膜疾患に対するバイナリスクリーニングと,28の疾患クラスにまたがる多ラベル分類の2つの課題について検討した。
SwinTinyとCoAtNet0とMaxViTTinyのハイブリッドモデルは、最強のバイナリスクリーニング結果を実現し、マルチラベル設定におけるマクロおよびマイクロF1を改善する。
論文 参考訳(メタデータ) (2026-05-25T19:09:35Z) - Towards Explainable Skin Cancer Classification: A Dual-Network Attention Model with Lesion Segmentation and Clinical Metadata Fusion [1.503974529275767]
本稿では,皮膚病変の分類を精度と解釈性の両方の観点から向上させる,二重エンコーダアテンションに基づくフレームワークを提案する。
Dual Attention Gates (DAG) と Atrous Space Pyramid Pooling (ASPP) を用いた新しいDeep-UNetアーキテクチャが最初に採用されている。
我々は,HAM10000データセットとISIC 2018と2019の課題に対するアプローチを評価した。
論文 参考訳(メタデータ) (2025-10-20T17:33:51Z) - Skin Cancer Classification: Hybrid CNN-Transformer Models with KAN-Based Fusion [0.0]
Convolutional Kolmogorov-Arnold Network (CKAN) を用いた逐次および並列ハイブリッドCNN-Transformerモデルについて検討する。
そこでCNNは局所的な空間的特徴を抽出し、トランスフォーマーはグローバルな依存関係をモデル化し、CKANは表現学習を改善するために非線形な特徴融合を促進する。
HAM10000データセットで92.81%の精度と92.47%のF1スコア、PAD-UFESデータセットで97.83%のF1スコア、91.79%のF1スコア、91.17%のF1スコアを示す。
論文 参考訳(メタデータ) (2025-08-17T19:57:34Z) - Towards Improved Cervical Cancer Screening: Vision Transformer-Based Classification and Interpretability [1.0026364432018122]
EVA-02トランスモデルを用いた子宮頸癌検診のための新しい手法を提案する。
我々は、細調整EVA-02、特徴抽出、機械学習モデルによる重要な特徴の選択、新しい人工知能ニューラルネットワークのトレーニングという4段階のパイプラインを開発した。
ベストモデルではF1スコアの0.85227を達成し,ベースラインのEVA-02モデルを上回った。
論文 参考訳(メタデータ) (2025-04-30T05:59:56Z) - GS-TransUNet: Integrated 2D Gaussian Splatting and Transformer UNet for Accurate Skin Lesion Analysis [44.99833362998488]
本稿では,2次元ガウススプラッティングとTransformer UNetアーキテクチャを組み合わせた皮膚癌自動診断手法を提案する。
セグメンテーションと分類の精度は著しく向上した。
この統合は、新しいベンチマークをこの分野に設定し、マルチタスク医療画像解析手法のさらなる研究の可能性を強調している。
論文 参考訳(メタデータ) (2025-02-23T23:28:47Z) - Brain Tumor Classification on MRI in Light of Molecular Markers [56.99710477905796]
1p/19q遺伝子の同時欠失は、低グレードグリオーマの臨床成績と関連している。
本研究の目的は,MRIを用いた畳み込みニューラルネットワークを脳がん検出に活用することである。
論文 参考訳(メタデータ) (2024-09-29T07:04:26Z) - Comparative Performance Analysis of Transformer-Based Pre-Trained Models for Detecting Keratoconus Disease [0.0]
本研究は、変性眼疾患である角膜症(keratoconus)の診断のために、訓練済みの8つのCNNを比較した。
MobileNetV2は角膜と正常な症例を誤分類の少ない場合に最も正確なモデルであった。
論文 参考訳(メタデータ) (2024-08-16T20:15:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。