論文の概要: MedFL-Stress: A Systematic Robustness Evaluation of Federated Brain Tumor Segmentation under Cross-Hospital MRI Appearance Shift
- arxiv url: http://arxiv.org/abs/2605.09025v1
- Date: Sat, 09 May 2026 16:04:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.028084
- Title: MedFL-Stress: A Systematic Robustness Evaluation of Federated Brain Tumor Segmentation under Cross-Hospital MRI Appearance Shift
- Title(参考訳): MedFL-Stress: クロスホスピタルMRI像におけるフェデレーション脳腫瘍分節の全身的ロバスト性評価
- Abstract要約: 統合学習は、患者データを共有することなく、病院がセグメンテーションモデルを協調的に訓練することを可能にする。
現在の評価プロトコルでは、クライアント間での平均的なパフォーマンスのみを報告し、個々のサイトの障害をマスキングしている。
MedFL-Stress(リンク)は、この障害モードを正確に公開する、制御されたストレステストフレームワークである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Federated learning enables hospitals to collaboratively train segmentation models without sharing patient data. However, current evaluation protocols report only average performance across clients, masking failures at individual sites. In clinical deployment, a model that fails consistently at one hospital is a real safety risk that a good mean score can hide entirely. We introduce MedFL-Stress, a controlled stress-testing framework that exposes exactly this failure mode. Using 2D axial slices from BraTS 2020 distributed across four simulated hospital clients, we apply graded MRI appearance shifts (gamma contrast, scale-shift, and noise-plus-blur) reflecting scanner and acquisition variability in real multi-site deployments. Three federated baselines are evaluated: FedAvg, FedProx, and FedBN. Worst-hospital Dice and inter-hospital disparity are treated as primary metrics, not supplementary observations. FedAvg achieves the highest global mean Dice (0.8159) but conceals a 0.0850 gap between its best and worst-performing hospital. FedBN closes that gap by 41% (0.0850 to 0.0503) while sacrificing less than half a Dice point in mean accuracy (0.8159 to 0.8109), and the weakest hospital gains 3.5 Dice points outright (0.7309 to 0.7656). These findings demonstrate that robustness-oriented evaluation protocols are essential for reliable federated medical imaging deployment.
- Abstract(参考訳): 統合学習は、患者データを共有することなく、病院がセグメンテーションモデルを協調的に訓練することを可能にする。
しかし、現在の評価プロトコルでは、クライアント間で平均的なパフォーマンスしか報告せず、個々のサイトにおける障害を隠蔽している。
臨床展開において、1つの病院で一貫して失敗するモデルは、良い平均スコアを完全に隠せる真の安全リスクである。
MedFL-Stress(リンク)は、この障害モードを正確に公開する、制御されたストレステストフレームワークである。
シミュレーションした4つの病院クライアントに分散したBraTS 2020の2次元軸方向スライスを用いて, 実地展開におけるMRIの視差変化(ガンマコントラスト, スケールシフト, ノイズ+ブルー)の反射型スキャナーと取得変数を適用した。
フェデレーションベースラインとして、FedAvg、FedProx、FedBNの3つが評価されている。
最悪のホスピタル・ディスとホスピタル間の格差は、補足的な観察ではなく、主要な指標として扱われる。
FedAvgは世界平均のDice(0.8159)を達成しているが、最高の病院とパフォーマンスの悪い病院の間には0.0850のギャップを隠している。
FedBNはこのギャップを41%(0.0850から0.0503)縮め、Diceポイントの半分未満(0.8159から0.8109)、最も弱い病院は3.5Diceポイント(0.7309から0.7656)で埋める。
これらの結果から, 堅牢性を考慮した評価プロトコルは, 信頼性の高い医用画像作成に不可欠であることが示唆された。
関連論文リスト
- OmniMed-FL: A Robust Multimodal Federated Learning Framework for Clinical Diagnosis [17.411567668075577]
OmniMed-FLは,5段階の臨床条件分類のためのマルチモーダル学習の制御システムである。
本研究のプロキシコーパスでは, 患者ではなくクラス別に, 3000の公衆胸部X線写真と3,000のクラスFOLD合成ノートを照合した。
すべてのノートは合成され、ペアリングは患者レベルではないため、これらは記述的なプロキシ比較であり、診断性能やデプロイメントの準備ができていない。
論文 参考訳(メタデータ) (2026-09-09T15:56:26Z) - A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks [46.43161388634735]
医用視覚言語モデル(VLM)は、画像と質問応答ペアが何年も無料でダウンロードされている公開ベンチマークで評価される。
SLAKE-En,PathVQA,VQA-RAD,および4つの検出器ファミリを用いたOmniMedVQAミラーのオープンVLMを検査した。
論文 参考訳(メタデータ) (2026-06-08T18:40:10Z) - Improving Generalization of Deep Learning for Brain Metastases Segmentation Across Institutions [5.4585656405659195]
この作業の目標は、BMセグメンテーションを複数の機関で使用できるようにするためのドメイン適応フレームワークを作ることである。
本稿では,変分オートエンコーダ(VAE)と平均誤差損失(MMD)を組み合わせたVAE-MMD前処理パイプラインを提案する。
論文 参考訳(メタデータ) (2026-04-01T02:25:25Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology [48.732366302949515]
大規模言語モデル(LLM)は、標準化された検査において専門家レベルの性能を達成したが、複数の選択精度は現実の臨床的有用性や安全性を十分に反映していない。
我々は、未確認患者の質問に対して、専門家のルーブリックを作成するための、ループ内人間パイプラインを開発した。
LLM-as-a-judge フレームワークを用いて,22のプロプライエタリおよびオープンソース LLM の評価を行い,臨床完全性,事実精度,Web-search 統合について検討した。
論文 参考訳(メタデータ) (2026-03-02T00:50:39Z) - Pillar-0: A New Frontier for Radiology Foundation Models [41.640120966890954]
腹部骨盤CT42,990例,胸部CT86,411例,頭部CT14,348例,胸部MRI11,543例にPillar-0を導入した。
Pillar-0は平均86.4、88.0、90.1、82.9のAUROCを達成し、MedGemma (Google)、MedImageInsight (Microsoft)、Lingshu (Alibaba)、Merlin (スタンフォード)を7.8-15.8のAUROCポイントで上回り、87.2% (319/366)タスクでランクインしている。
論文 参考訳(メタデータ) (2025-11-21T21:50:34Z) - Transparent Early ICU Mortality Prediction with Clinical Transformer and Per-Case Modality Attribution [42.85462513661566]
ICU滞在後48時間から, 生理的時系列測定と非構造的臨床記録とを融合した, 軽量で透明なマルチモーダルアンサンブルを提案する。
ロジスティック回帰モデルは、バイタル用双方向LSTMとノート用微調整された臨床ModernBERT変換器の2つのモード固有モデルからの予測を組み合わせる。
MIMIC-IIIベンチマークでは、遅延融合アンサンブルは、よく校正された予測を維持しながら、最高の単一モデルに対する差別を改善する。
論文 参考訳(メタデータ) (2025-11-19T20:11:49Z) - Click, Predict, Trust: Clinician-in-the-Loop AI Segmentation for Lung Cancer CT-Based Prognosis within the Knowledge-to-Action Framework [0.7340285482623061]
肺がんは依然としてがん死亡の主な原因であり、CT像はスクリーニング、予後、治療の中心となっている。
ディープラーニング(DL)は自動化を提供するが、臨床導入の障壁に直面している。
本研究は, 診断精度, 臨床信頼度を高めるために, ループ内DLパイプラインを開発した。
論文 参考訳(メタデータ) (2025-10-19T23:02:43Z) - Explainable Anatomy-Guided AI for Prostate MRI: Foundation Models and In Silico Clinical Trials for Virtual Biopsy-based Risk Assessment [3.5408411348831232]
MRIによる前立腺癌(PCa)のリスク階層化のための,完全に自動化された,解剖学的に指導されたディープラーニングパイプラインを提案する。
パイプラインは、前立腺とそのゾーンを軸方向のT2強調MRI上にセグメント化するためのnnU-Netモジュール、オプションの解剖学的先行と臨床データで3Dパッチに微調整されたDiceedPT Swin Transformer基盤モデルに基づく分類モジュール、決定駆動画像領域をローカライズする反ファクトなヒートマップを生成するVAE-GANフレームワークの3つの重要なコンポーネントを統合する。
論文 参考訳(メタデータ) (2025-05-23T14:40:09Z) - Predicting Length of Stay in Neurological ICU Patients Using Classical Machine Learning and Neural Network Models: A Benchmark Study on MIMIC-IV [49.1574468325115]
本研究は、MIMIC-IVデータセットに基づく神経疾患患者を対象とした、ICUにおけるLOS予測のための複数のMLアプローチについて検討する。
評価されたモデルには、古典的MLアルゴリズム(K-Nearest Neighbors、Random Forest、XGBoost、CatBoost)とニューラルネットワーク(LSTM、BERT、テンポラルフュージョントランス)が含まれる。
論文 参考訳(メタデータ) (2025-05-23T14:06:42Z) - Multi-centric AI Model for Unruptured Intracranial Aneurysm Detection and Volumetric Segmentation in 3D TOF-MRI [6.397650339311053]
我々は3DTOF-MRIで未破裂脳動脈瘤(UICA)の検出と分節を併用したオープンソースのnnU-NetベースのAIモデルを開発した。
4つの異なるトレーニングデータセットが作成され、nnU-Netフレームワークがモデル開発に使用された。
一次モデルは85%の感度と0.23FP/ケースレートを示し、ADAM-challengeの勝者(61%)と、ADAMデータでトレーニングされたnnU-Net(51%)を感度で上回った。
論文 参考訳(メタデータ) (2024-08-30T08:57:04Z) - DeepCOVID-Fuse: A Multi-modality Deep Learning Model Fusing Chest
X-Radiographs and Clinical Variables to Predict COVID-19 Risk Levels [8.593516170110203]
DeepCOVID-Fuseは、新型コロナウイルス患者のリスクレベルを予測するディープラーニング融合モデルである。
CXRと臨床変数で訓練されたDeepCOVID-Fuseの精度は0.658であり、AUCは0.842である。
論文 参考訳(メタデータ) (2023-01-20T20:54:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。