論文の概要: When AI and Experts Agree on Error: Intrinsic Ambiguity in Dermatoscopic Images
- arxiv url: http://arxiv.org/abs/2604.00651v1
- Date: Wed, 01 Apr 2026 09:01:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.912823
- Title: When AI and Experts Agree on Error: Intrinsic Ambiguity in Dermatoscopic Images
- Title(参考訳): AIと専門家がエラーについて語る:皮膚内視鏡画像の内在的曖昧性
- Authors: Loris Cino, Pier Luigi Mazzeo, Alessandro Martella, Giulia Radi, Renato Rossi, Cosimo Distante,
- Abstract要約: 我々は、すべてのCNNアーキテクチャで体系的に誤って分類された画像のサブセットを分離した。
専門の皮膚科医は、これらの課題を対照群と共に評価した。
結果,AIミス分類画像の診断性能は低下した。
両システム障害の原原因は画像品質であった。
- 参考スコア(独自算出の注目度): 37.92086450087161
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The integration of artificial intelligence (AI), particularly Convolutional Neural Networks (CNNs), into dermatological diagnosis demonstrates substantial clinical potential. While existing literature predominantly benchmarks algorithmic performance against human experts, our study adopts a novel perspective by investigating the intrinsic complexity of dermatoscopic images. Through rigorous experimentation with multiple CNN architectures, we isolated a subset of images systematically misclassified across all models-a phenomenon statistically proven to exceed random chance. To determine if these failures stem from algorithmic biases or inherent visual ambiguity, expert dermatologists independently evaluated these challenging cases alongside a control group. The results revealed a collapse in human diagnostic performance on the AI-misclassified images. First, agreement with ground-truth labels plummeted, with Cohen's kappa dropping to a mere 0.08 for the difficult images, compared to a 0.61 for the control group. Second, we observed a severe deterioration in expert consensus; inter-rater reliability among physicians fell from moderate concordance (Fleiss kappa = 0.456) on control images to only modest agreement (Fleiss kappa = 0.275) on difficult cases. We identified image quality as a primary driver of these dual systematic failures. To promote transparency and reproducibility, all data, code, and trained models have been made publicly available
- Abstract(参考訳): 人工知能(AI)、特に畳み込みニューラルネットワーク(CNN)の皮膚科診断への統合は、かなりの臨床的可能性を示している。
既存の文献は人間の専門家に対してアルゴリズムのパフォーマンスをベンチマークすることが多いが,本研究では,皮膚内視鏡像の内在的な複雑さを調査することによって,新しい視点を採用する。
複数のCNNアーキテクチャを用いて厳密な実験を行い、ランダムな確率を超える確率で統計的に証明された現象である、すべてのモデルで体系的に誤って分類された画像のサブセットを分離した。
これらの失敗がアルゴリズム的バイアスや固有の視覚的曖昧性に由来するかどうかを判断するために、専門家の皮膚科医は、これらの困難なケースをコントロールグループと共に独立に評価した。
その結果,AIミス分類画像の診断性能は低下した。
まず、コントラストラベルとの合意が急落し、コーエンのカッパは難しい画像に対してわずか0.08に落ち、コントロールグループでは0.61に落ち込んだ。
第2に, 医師間信頼度は, コントロール画像では中等度一致 (Fleiss kappa = 0.456) から軽度一致 (Fleiss kappa = 0.275) に低下し, 難易度では軽度一致 (Fleiss kappa = 0.456) に低下した。
両システム障害の原原因は画像品質であった。
透明性と再現性を促進するため、すべてのデータ、コード、訓練されたモデルが公開されている。
関連論文リスト
- GRASP-PsONet: Gradient-based Removal of Spurious Patterns for PsOriasis Severity Classification [0.0]
本稿では,突発的な相関を導入し,問題のあるトレーニングイメージを自動的にフラグするフレームワークを提案する。
フラグ付き画像の8.2%は、保持されたテストセットでモデルAUC-ROCを5%(85%から90%)改善する。
2人の皮膚科医によって評価された訓練データのサブセットに適用した場合、この方法は、レイター間不一致の90%以上を識別する。
論文 参考訳(メタデータ) (2025-06-27T03:42:09Z) - Lightweight Relational Embedding in Task-Interpolated Few-Shot Networks for Enhanced Gastrointestinal Disease Classification [0.0]
大腸癌の検出は、患者の生存率を高めるために重要である。
大腸内視鏡は、適切な高品質の内視鏡画像を取得することに依存する。
Few-Shot Learning アーキテクチャにより、我々のモデルは、目に見えないきめ細かな内視鏡画像パターンに迅速に適応できる。
精度は90.1%,精度は0.845,リコールは0.942,F1スコアは0.891であった。
論文 参考訳(メタデータ) (2025-05-30T16:54:51Z) - Epistemic Uncertainty for Generated Image Detection [107.62647907393377]
本稿では,創成モデルの時代において重要なセキュリティ問題に対処することを目的とした,てんかん不確実性によるAI生成画像検出のための新しいフレームワークを提案する。
我々の重要な洞察は、トレーニングとテストデータの分布の相違が、機械学習モデルのエピステマティック不確実性空間に顕著に現れていることに起因している。
論文 参考訳(メタデータ) (2024-12-08T11:32:25Z) - MedIAnomaly: A comparative study of anomaly detection in medical images [26.319602363581442]
異常検出(AD)は、期待される正常なパターンから逸脱する異常なサンプルを検出することを目的としている。
医学的ADのための多くの方法が出現したにもかかわらず、公平で包括的な評価が欠如しているため、明確な結論が得られなかった。
本稿では,この問題に対処するため,比較を統一したベンチマークを構築した。
論文 参考訳(メタデータ) (2024-04-06T06:18:11Z) - Rescuing referral failures during automated diagnosis of domain-shifted
medical images [17.349847762608086]
異なる人口層から取得した医療画像や、別の技術を用いて測定した場合、最先端の領域一般化アプローチでさえ、参照中に深刻な失敗を犯すことが示される。
我々は,これらの障害を解消し,大幅な性能向上を実現する,ロバストな一般化とポストホック参照アプローチの新たな組み合わせを評価する。
論文 参考訳(メタデータ) (2023-11-28T13:14:55Z) - Uncertainty-inspired Open Set Learning for Retinal Anomaly
Identification [71.06194656633447]
9つの網膜条件の基底像をトレーニングし,不確実性に着想を得たオープンセット(UIOS)モデルを構築した。
しきい値戦略を持つUIOSモデルはF1スコア99.55%、97.01%、91.91%を達成した。
UIOSは、高い不確実性スコアを正しく予測し、非ターゲットの網膜疾患、低品質の眼底画像、および非基本画像のデータセットを手動でチェックする必要があることを示唆した。
論文 参考訳(メタデータ) (2023-04-08T10:47:41Z) - GraVIS: Grouping Augmented Views from Independent Sources for
Dermatology Analysis [52.04899592688968]
皮膚科画像から自己教師付き特徴を学習するために特に最適化されたGraVISを提案する。
GraVISは、病変のセグメンテーションと疾患分類のタスクにおいて、転送学習と自己教師型学習を著しく上回っている。
論文 参考訳(メタデータ) (2023-01-11T11:38:37Z) - Significantly improving zero-shot X-ray pathology classification via fine-tuning pre-trained image-text encoders [50.689585476660554]
本稿では,正対損失緩和とランダムな文サンプリングを含む新たな微調整手法を提案する。
提案手法は,胸部X線データセットと3つの事前訓練モデル間のゼロショット病理分類を一貫して改善する。
論文 参考訳(メタデータ) (2022-12-14T06:04:18Z) - Anomaly Detection in Medical Imaging with Deep Perceptual Autoencoders [1.7277957019593995]
画像異常検出の新しい強力な手法を提案する。
これは、再設計されたトレーニングパイプラインを備えた古典的なオートエンコーダアプローチに依存している。
複雑な医用画像解析タスクにおける最先端のアプローチよりも優れています。
論文 参考訳(メタデータ) (2020-06-23T18:45:55Z) - Semi-supervised Medical Image Classification with Relation-driven
Self-ensembling Model [71.80319052891817]
医用画像分類のための関係駆動型半教師付きフレームワークを提案する。
これは、摂動下で与えられた入力の予測一貫性を促進することでラベルのないデータを利用する。
本手法は,シングルラベルおよびマルチラベル画像分類のシナリオにおいて,最先端の半教師付き学習手法よりも優れる。
論文 参考訳(メタデータ) (2020-05-15T06:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。