論文の概要: Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance
- arxiv url: http://arxiv.org/abs/2607.26333v1
- Date: Tue, 28 Jul 2026 23:11:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.493978
- Title: Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance
- Title(参考訳): 胸部X線機械学習における臨床関連性の再考 : 評価基準がパフォーマンスをどのように定義するか
- Abstract要約: 機械学習は、臨床判断の近似を目的とした基準基準を用いた自動評価に大きく依存する。
病理分類と画像品質評価の両方において,評価基準選択がモデル性能とランキングに与える影響について検討した。
- 参考スコア(独自算出の注目度): 26.96793950588378
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chest X-ray (CXR) machine learning relies heavily on automated evaluation using reference standards that aim to approximate clinical judgment. However, commonly used report-derived labels for pathology classification or generic image quality metrics for reconstruction may not reliably reflect clinical judgment. We systematically investigate how evaluation-reference choices affect model performance and ranking in both pathology classification and image quality assessment (IQA). To enable controlled comparison across evaluation references, we collected paired expert image- and report-derived labels for thoracic findings from a clinical cohort at Cambridge University Hospitals (CUH) and curated a subset of the public MIMIC-CXR dataset, along with expert ratings of diagnostic image quality. We show that for supervised image classifiers (ResNet, DenseNet), several zero-shot and fine-tuned vision-language models (e.g., MedKLIP, GLoRIA, and ConVIRT), changing the label source leads to substantial differences not only in performance estimates but also in model rankings. In parallel, alignment of IQA measures with expert judgment depends heavily on the choice of measure, and commonly used IQA metrics such as SSIM and PSNR often fail to align with expert assessments of diagnostic usability. Our results demonstrate that evaluation choices are crucial: they can determine which models and methods appear best and are therefore selected for further development or deployment. The selection of evaluation references should therefore be treated as a central component of clinical validity in CXR machine learning, and justified with respect to the pathology, imaging task, and intended downstream clinical use.
- Abstract(参考訳): 胸部X線(CXR)機械学習は,臨床判定の近似を目的とした基準基準を用いた自動評価に大きく依存している。
しかし,病理分類や画像品質の一般的な指標として一般的に用いられているラベルは,臨床的判断を確実に反映するものではない。
病理分類と画像品質評価(IQA)の両方において,評価基準選択がモデル性能とランキングに与える影響を系統的に検討した。
評価基準間での対照比較を可能にするため,ケンブリッジ大学病院(CUH)の臨床コホートから胸郭所見を鑑別し,診断画像品質のエキスパート評価とともにMIMIC-CXRデータセットのサブセットをキュレートした。
教師付き画像分類器(ResNet, DenseNet)では、ゼロショットおよび微調整された視覚言語モデル(例えば、MedKLIP, GLoRIA, ConVIRT)がラベルソースを変更することで、性能推定だけでなく、モデルランキングにも大きな違いが生じることを示す。
対照的に、IQA測度と専門家の判断との整合性は、測定の選択に大きく依存しており、一般的に使用されるSSIMやPSNRのようなIQA測度は、診断のユーザビリティに関する専門家の評価と一致しないことが多い。
提案手法は,どのモデルや手法が最適であるかを判断し,さらなる開発や展開のために選択することができる。
したがって, 評価基準の選択は, CXR機械学習における臨床的妥当性の中心的な要素として扱われ, 病理学, 画像診断, 下流臨床の目的に対して正当化されるべきである。
関連論文リスト
- CBCT-IQ: A Publicly Available Annotated Cone-Beam CT Dataset for Image Quality Assessment and Benchmarking [13.49893413630687]
我々は1,764個の注釈付き画像スライスを含む最初のオープンアクセスCBCT IQAデータセットを提供する。
専門家のアノテーションに対する参照ベースのIQA尺度を26の基準でベンチマークし、調査的なIQA尺度に基づくランキングを導入する。
論文 参考訳(メタデータ) (2026-07-31T10:24:20Z) - PathReportEval: A Systematic Benchmark for Pathology Report Generation [5.733136272690028]
本稿では,病理報告生成のための標準化されたベンチマークと評価フレームワークを提案する。
このフレームワークは、事前処理、特徴抽出、トレーニング、復号化、評価を標準化する。
臨床報告品質スコア(英: Clinical Report Quality Score, CRQS)は、事実の正確性を評価するための臨床基準である。
論文 参考訳(メタデータ) (2026-07-20T18:59:47Z) - ReportQA: QA-Based Radiology Report Evaluation [34.29681217890862]
臨床関連およびフレキシブルな放射線診断評価フレームワークであるReportQAを提案する。
まず、複数の画像モダリティと解剖学的領域をカバーするデータセットを収集する。
次に,臨床対象と属性の知識ツリーを放射線医の指導で構築し,大規模言語モデル(LLM)を用いて生レポートから構造化情報を抽出する。
評価中、レポートは文脈として扱われ、LCMは判断モデルとして機能し、QAペアに応答する。
論文 参考訳(メタデータ) (2026-06-13T00:43:03Z) - CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation [51.11942945171396]
従来の評価指標は、語彙重なり合いやエンティティマッチングの粗い尺度のみを提供する。
我々はCT-RATEとMerlinのベンチマークであるCT-FineBenchを提案し、CTレポートの微細な事実整合性を評価する。
我々のベンチマークは、綿密な質問回答(QA)ベースのプロセスによって構築されます。
論文 参考訳(メタデータ) (2026-04-27T03:32:46Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation [32.410641778559544]
ICARE (Interpretable and Clinicallygrounded Agent-based Report Evaluation) は、解釈可能な評価フレームワークである。
2つのエージェントは、それぞれが基礎的真実または生成されたレポートを持ち、臨床的に有意義な質問を発生し、互いにクイズする。
スコアを質問応答ペアにリンクすることで、ICAREは透明で解釈可能な評価を可能にする。
論文 参考訳(メタデータ) (2025-08-04T18:28:03Z) - Automated Quality Evaluation of Cervical Cytopathology Whole Slide Images Based on Content Analysis [8.346023537846357]
ThinPrep Cytological Test (TCT) は頸部がん検診において最も広く用いられている方法であり, 検診の精度に直接影響を及ぼす。
従来の手作業による評価手法は、顕微鏡下での病理学者の観察に依存している。
The Bethesda System (TBS) の診断基準, 人工知能アルゴリズム, 臨床データの特徴に基づく, 頸椎細胞病理全スライド画像(WSI)の完全自動品質評価手法を提案する。
論文 参考訳(メタデータ) (2025-05-20T03:30:38Z) - Metrics that matter: Evaluating image quality metrics for medical image generation [48.85783422900129]
本研究は、脳MRIデータを用いて、一般的に使用される非参照画像品質指標を包括的に評価する。
本研究は, ノイズ, 分布変化, および臨床的に関係のある不正確さを模倣した形態的変化を含む, 様々な課題に対する計量感度を評価する。
論文 参考訳(メタデータ) (2025-05-12T01:57:25Z) - Malignancy Prediction and Lesion Identification from Clinical
Dermatological Images [65.1629311281062]
臨床皮膚画像から機械学習に基づく悪性度予測と病変の同定を検討する。
まず, サブタイプや悪性度に関わらず画像に存在するすべての病変を同定し, その悪性度を推定し, 凝集により, 画像レベルの悪性度も生成する。
論文 参考訳(メタデータ) (2021-04-02T20:52:05Z) - Variational Knowledge Distillation for Disease Classification in Chest
X-Rays [102.04931207504173]
我々は,X線に基づく疾患分類のための新しい確率的推論フレームワークである反復的知識蒸留(VKD)を提案する。
提案手法の有効性を,X線画像とEHRを用いた3つの公開ベンチマークデータセットに示す。
論文 参考訳(メタデータ) (2021-03-19T14:13:56Z) - An Extensive Study on Cross-Dataset Bias and Evaluation Metrics
Interpretation for Machine Learning applied to Gastrointestinal Tract
Abnormality Classification [2.985964157078619]
GI領域における疾患の自動解析は、コンピュータ科学や医学関連雑誌でホットな話題となっている。
クロスデータセットによる評価指標と機械学習モデルの明確な理解は、この分野の研究を新たな品質レベルに導くために不可欠である。
16種類のGIトラクタ条件を分類できる5つの異なる機械学習モデルの包括的評価を行う。
論文 参考訳(メタデータ) (2020-05-08T08:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。