論文の概要: Metamorphic Testing for Clinical ML Models: A Framework Proposal and Pilot Study
- arxiv url: http://arxiv.org/abs/2607.22984v1
- Date: Sat, 25 Jul 2026 01:42:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.955591
- Title: Metamorphic Testing for Clinical ML Models: A Framework Proposal and Pilot Study
- Title(参考訳): 臨床MLモデルのメタモルフィックテスト:フレームワークの提案とパイロット研究
- Abstract要約: 臨床予測タスクのための機械学習モデルは、定期的に高いAUROCスコアを達成する。
AUROCは、臨床的感受性よりもランキングパフォーマンスを計測する。
本稿では,機械学習モデルにメタモルフィックテストを適用し,行動の正しさを評価する。
- 参考スコア(独自算出の注目度): 3.4905170154782343
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Machine learning models for clinical prediction tasks, such as in-hospital mortality and sepsis onset, routinely achieve high AUROC scores. However, AUROC measures ranking performance rather than clinical sensibility. A model may rank patients correctly overall while predicting a lower mortality risk when a patient's SOFA score worsens, contradicting established medical knowledge. This paper proposes applying metamorphic testing (MT) to clinical machine learning models to evaluate behavioral correctness without requiring ground-truth labels for individual predictions. We design a catalog of 12 candidate metamorphic relations (MRs) for three ICU prediction tasks using the MIMIC-III and MIMIC-IV datasets, with each MR grounded in an authoritative clinical guideline. We further propose a five-layer validation strategy to ensure that MRs are clinically sound before deployment. As a feasibility study, we evaluate the approach on the UCI Heart Disease dataset. Although the three clinical models achieve strong predictive performance (AUROC = 0.849-0.900), they exhibit MT violation rates ranging from 27% to 87% across five pilot MRs. An injected-fault experiment further shows that a sign-negation error in a blood pressure feature remains undetected by AUROC but increases the MT violation rate by 31-67 percentage points. These findings suggest that metamorphic testing provides a valuable complement to conventional performance metrics for assessing the behavioral correctness of clinical prediction models.
- Abstract(参考訳): 院内死亡や敗血症発症などの臨床予測タスクのための機械学習モデルは、定期的に高いAUROCスコアを達成している。
しかし、AUROCは、臨床的感受性よりも、ランキングパフォーマンスを計測している。
モデルは、患者のSOFAスコアが悪化した場合の死亡リスクを予測しながら、確立した医療知識と矛盾しながら、患者全体を正しくランク付けすることができる。
本稿では,臨床機械学習モデルにメタモルフィックテスト(MT)を適用して,個々の予測に地味ラベルを必要とせず,行動の正しさを評価することを提案する。
我々は,MIMIC-IIIおよびMIMIC-IVデータセットを用いて,3つのICU予測タスクのための12の候補準同型関係(MRs)のカタログを設計し,それぞれのMRを信頼性のある臨床ガイドラインに定めている。
さらに, MRが展開前に臨床的に健全であることを保証するため, 5層検証戦略を提案する。
本研究は,UCI心疾患データセットに対するアプローチについて検討した。
3つの臨床モデルは高い予測性能(AUROC = 0.849-0.900)を達成しているが、MT違反率は5つのパイロットMRで27%から87%の範囲に及んでいる。
これらの結果から, メタモルフィック検査は, 臨床予測モデルの行動的正当性を評価する上で, 従来の評価指標の補完となることが示唆された。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Estimating Individualized Treatment Effects in Acute Ischemic Stroke with Causal Transformation Models (TRAM-DAG): A Multi-Centre Observational Study with External RCT Validation [0.5359378066251386]
ランダム化対照試験(RCTs)では,機械的血栓摘出術が解離よりも平均的に有効であることが示されている。
本研究の目的は, メカニカル・トロンボミーの患者に対して, 解離と比較して最も有益な患者を特定することである。
我々は,脳卒中患者の観察データに照準を合わせることで,指向性非環状グラフ(TRAM-DAG)の因果変換モデルをITT推定に利用できることを示した。
論文 参考訳(メタデータ) (2026-06-10T19:29:43Z) - Multimodal Ordinal Modeling of Alzheimer's Disease Severity Using Structural MRI and Clinical Data [0.9786690381850356]
アルツハイマー病(AD)は、重症度を評価するための正確でスケーラブルなツールを必要とする。
自動かつ解釈可能なAD重度ステージングのための順序回帰を用いた注目強化型機械学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-10T08:26:11Z) - ReMedi: Reasoner for Medical Clinical Prediction [70.84466325266068]
EHRによる臨床結果予測を改善するためのフレームワークであるReMediを提案する。
ReMediは、複雑な臨床問題に対する挑戦的なサンプル再生機構を用いて有理応答対を生成する。
複数のEHR予測タスクの実験では、F1スコアで最先端のベースラインを19.9%上回った。
論文 参考訳(メタデータ) (2026-05-02T14:44:49Z) - Explainable Machine Learning for Sepsis Outcome Prediction Using a Novel Romanian Electronic Health Record Dataset [0.5277756703318045]
本研究の目的は,3つの分類課題にまたがる最先端の成果を達成しつつ,臨床的に強い予測因子を同定することである。
Eosinopeniaはトップ予測ツールとして登場し、現在の評価基準に含まれていない未使用のマーカーとしての価値を強調した。
論文 参考訳(メタデータ) (2026-04-06T14:07:23Z) - Prediction of Lung Metastasis from Hepatocellular Carcinoma using the SEER Database [0.9055332067000195]
肝細胞癌(HCC)は、がん関連死亡の原因である。
HCCにおける肺転移の予測モデルは、範囲と臨床応用性に限られている。
本研究では,Surveillance, Epidemiology, End Results (SEER)データベースのデータを用いて,エンドツーエンドの機械学習パイプラインの開発と検証を行う。
論文 参考訳(メタデータ) (2025-01-20T20:06:31Z) - CRTRE: Causal Rule Generation with Target Trial Emulation Framework [47.2836994469923]
ターゲットトライアルエミュレーションフレームワーク(CRTRE)を用いた因果ルール生成という新しい手法を提案する。
CRTREは、アソシエーションルールの因果効果を推定するためにランダム化トライアル設計原則を適用している。
次に、病気発症予測などの下流アプリケーションにそのような関連ルールを組み込む。
論文 参考訳(メタデータ) (2024-11-10T02:40:06Z) - Advancements In Heart Disease Prediction: A Machine Learning Approach For Early Detection And Risk Assessment [0.0]
本稿では,臨床データを用いた心疾患のリスク予測における機械学習モデルの役割,関連性,効率性を理解し,評価し,分析する。
Support Vector Machine (SVM) は91.51%の精度を示し、予測能力の観点から評価されたモデル間にその優位性を確認している。
論文 参考訳(メタデータ) (2024-10-16T22:32:19Z) - Machine Learning for ALSFRS-R Score Prediction: Making Sense of the Sensor Data [44.99833362998488]
筋萎縮性側索硬化症(Amyotrophic Lateral Sclerosis、ALS)は、急速に進行する神経変性疾患である。
iDPP@CLEF 2024チャレンジを先導した今回の調査は,アプリから得られるセンサデータを活用することに焦点を当てている。
論文 参考訳(メタデータ) (2024-07-10T19:17:23Z) - Multimodal Pretraining of Medical Time Series and Notes [45.89025874396911]
ディープラーニングモデルは、意味のあるパターンを抽出する際の約束を示すが、広範囲なラベル付きデータが必要である。
本稿では,臨床測定値とノートのアライメントに着目し,自己指導型事前学習を用いた新しいアプローチを提案する。
病院内での死亡予測や表現型化などの下流タスクでは、データのごく一部がラベル付けされた設定において、ベースラインよりも優れています。
論文 参考訳(メタデータ) (2023-12-11T21:53:40Z) - TREEMENT: Interpretable Patient-Trial Matching via Personalized Dynamic
Tree-Based Memory Network [54.332862955411656]
臨床試験は薬物開発に不可欠であるが、しばしば高価で非効率な患者募集に苦しむ。
近年,患者と臨床試験を自動マッチングすることで患者採用を高速化する機械学習モデルが提案されている。
本稿では,TREement という名前の動的ツリーベースメモリネットワークモデルを導入する。
論文 参考訳(メタデータ) (2023-07-19T12:35:09Z) - MIA-Prognosis: A Deep Learning Framework to Predict Therapy Response [58.0291320452122]
本稿では,患者の予後と治療反応を予測するための統合型深層学習手法を提案する。
我々は,マルチモーダル非同期時系列分類タスクとして,確率モデリングを定式化する。
我々の予測モデルは、長期生存の観点から、低リスク、高リスクの患者をさらに階層化する可能性がある。
論文 参考訳(メタデータ) (2020-10-08T15:30:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。