論文の概要: A multicenter benchmark and clinically structured metric for coronary CTA report generation
- arxiv url: http://arxiv.org/abs/2609.00909v1
- Date: Tue, 01 Sep 2026 08:38:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.483148
- Title: A multicenter benchmark and clinically structured metric for coronary CTA report generation
- Title(参考訳): 冠動脈CTAレポート生成のためのマルチセンターベンチマークと臨床組織学的指標
- Authors: Zhiyu Ye, Yue Sun, Limiao Zou, Cheng Xu, Keting Xu, Tong Hu, Yue Yu, Hairong Zheng, Yining Wang, Tong Zhang,
- Abstract要約: CSM$_textCCTA$, CSM$_textCCTA$。
CCTAをトレーニングしたC2RGモデルは4つの病院で最高CSM$_textCCTA$スコアを達成した。
- 参考スコア(独自算出の注目度): 31.91974570774084
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable evaluation of automated coronary computed tomography angiography (CCTA) report generation requires standardized multicentre benchmarks and clinically structured metrics. We established a four-centre benchmark comprising 3,021 CCTA series from 818 patient-report pairs to evaluate seven open-source three-dimensional vision-language models. We developed CSM$_{\text{CCTA}}$, a clinically structured metric for CCTA report evaluation, with patient-, vessel-, and segment-level variables defined according to clinical guidelines. Report pairs are compared at the finest shared anatomical level, and the contributions of different clinical components are weighted based on expert assessments. We estimated these weights using 70 expert-scored cases and evaluated clinical alignment in a non-overlapping set of 30 cases. CSM$_{\text{CCTA}}$ showed a strong correlation with radiologist scores (Pearson's $r=0.97$, $p<0.001$), exceeding the next-best metric, FORTE ($r=0.70$), by 0.27, and agreed with expert preferences in 115 of 160 pairwise comparisons (71.9\%). Under controlled perturbations, CSM$_{\text{CCTA}}$ remained stable to clinically equivalent wording and decreased monotonically with progressive information omission. In the multicenter benchmark, the CCTA-trained C2RG model achieved the highest CSM$_{\text{CCTA}}$ scores across all four hospitals, although its performance remained far from optimal. In contrast, CCTA-irrelevant reports accounted for up to 98.7\% of the outputs from generalist models. Together, the benchmark provides a standardized setting for model comparison, while CSM$_{\text{CCTA}}$ enables clinically structured evaluation of finding agreement and anatomical specificity. These results support a more clinically aligned and anatomically resolved approach to evaluating CCTA report generation. Code is available at https://openi.pcl.ac.cn/OpenMedIA/CSM_CCTA.
- Abstract(参考訳): 自動冠状動脈造影(CCTA)レポート作成の信頼性評価には,標準化されたマルチセント・ベンチマークと臨床的に構造化された指標が必要である。
我々は,オープンソース3次元視覚言語モデル7つを評価するために,818対のCCTAシリーズ3,021点からなる4セントのベンチマークを構築した。
CSM$_{\text{CCTA}}$。CSM$_{\text{CCTA}}$,CSM$_{\text{CCTA}}$。
報告ペアは、最も優れた共有解剖学的レベルで比較され、専門家の評価に基づいて、異なる臨床成分の寄与を重み付けする。
以上の結果から,70例の専門的検査症例を用いて重み付けを行い,30例の非重み付け群で臨床的アライメントを評価した。
CSM$_{\text{CCTA}}$は、ラジオロジストのスコア(ピアソンの$r=0.97$, $p<0.001$)と強い相関を示し(Pearsonの$r=0.97$, $p<0.001$)、次の最高の測定値であるFORT($r=0.70$)を0.27で上回り、160対比較のうち115対比較(71.9\%)で専門家の好みに同意した。
制御摂動下では, CSM$_{\text{CCTA}}$は, 臨床的に等価な言い回しに安定であり, 進行性情報消失とともに単調に低下した。
CCTAをトレーニングしたC2RGモデルは,全4病院で最高CSM$_{\text{CCTA}}$スコアを達成した。
対照的にCCTA関連のない報告は、ジェネラリストモデルからの出力の98.7%を占めていた。
CSM$_{\text{CCTA}}$は、合意の発見と解剖学的特異性に関する臨床的に構造化された評価を可能にする。
これらの結果は、CCTAレポート生成を評価するための、より臨床的に整合し、解剖学的に解決されたアプローチを支持する。
コードはhttps://openi.pcl.ac.cn/OpenMedIA/CSM_CCTAで公開されている。
関連論文リスト
- PathReportEval: A Systematic Benchmark for Pathology Report Generation [5.733136272690028]
本稿では,病理報告生成のための標準化されたベンチマークと評価フレームワークを提案する。
このフレームワークは、事前処理、特徴抽出、トレーニング、復号化、評価を標準化する。
臨床報告品質スコア(英: Clinical Report Quality Score, CRQS)は、事実の正確性を評価するための臨床基準である。
論文 参考訳(メタデータ) (2026-07-20T18:59:47Z) - Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases [71.12461204050985]
MedSP1000 (MedSP1000) は、SP由来の臨床エージェント評価のための対話型ベンチマークである。
ピアレビューされたSPの授業ケースを、定義されたSPケーススクリプト、臨床環境コンテキスト、人為的な構造化ルーブリックで実行可能なシナリオに変換する。
MedSP1000を多種多様な汎用および医療用LLMに適用すると、静的ベンチマークの性能がそのような教育シナリオに確実に変換されないことが分かる。
論文 参考訳(メタデータ) (2026-06-03T17:17:16Z) - Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters [3.018184429993625]
スコアリングインスタンス毎のエキスパートレビューを必要とするメソッドは、安全で反復的なデプロイメントには遅すぎるし、コストも高くつく。
20人の臨床医が、プライマリケア、精神医学、腫瘍学、行動保健の823の患者に1,646個のルーブリックを作成した。
ケース固有のルーリックは、専門家の判断を維持しながら3桁のコストで自動化を可能にする、臨床AI評価のためのパスを提供する。
論文 参考訳(メタデータ) (2026-04-27T17:17:56Z) - CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation [51.11942945171396]
従来の評価指標は、語彙重なり合いやエンティティマッチングの粗い尺度のみを提供する。
我々はCT-RATEとMerlinのベンチマークであるCT-FineBenchを提案し、CTレポートの微細な事実整合性を評価する。
我々のベンチマークは、綿密な質問回答(QA)ベースのプロセスによって構築されます。
論文 参考訳(メタデータ) (2026-04-27T03:32:46Z) - Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment [56.62016795093786]
CerebraはインタラクティブなマルチエージェントAIチームで、ERH、臨床ノート、医療画像分析のための特殊エージェントをコーディネートする。
構造化された表現を操作することで、プライバシ保護デプロイメントをサポートし、モダリティが不完全であれば、堅牢である。
Cerebraは、有識者のパフォーマンスを著しく改善し、前向き認知症リスク推定において精度を17.5ポイント向上させた。
論文 参考訳(メタデータ) (2026-03-23T05:46:45Z) - GOLDMARK: Governed Outcome-Linked Diagnostic Model Assessment Reference Kit [7.891604152731754]
CB(Computational Biomarker)は、ヘマトキシリン・エオシン(H&E)全スライディング画像(WSI)から抽出した組織由来のパターンで、治療効果や予後を予測する。
臨床応用可能な OncoKB レベル1-3 バイオマーカーラベルを持つTCGAコーホート上に構築された標準化されたベンチマークフレームワークである GOLDMARK を紹介する。
論文 参考訳(メタデータ) (2026-03-21T15:09:06Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - CTest-Metric: A Unified Framework to Assess Clinical Validity of Metrics for CT Report Generation [8.08950963137043]
CTest-Metricは,CT RRGのメトリクスの臨床的実現可能性を決定する3つのモジュールを備えた,最初の統合された計量評価フレームワークである。
モジュールテストでは, (i) LLMによるリフレッシングによるWSG, (ii) 重症度における合成エラー注入(SEI) および (iii) MvE (Metrics-vs-Expert correlation) を用いて臨床評価を行った。
8つの広く使われているメトリクス(BLEU, ROUGE, METEOR, BERTScore-F1, F1-RadGraph, Ra)
論文 参考訳(メタデータ) (2026-01-16T18:09:19Z) - COPE: Chain-Of-Thought Prediction Engine for Open-Source Large Language Model Based Stroke Outcome Prediction from Clinical Notes [23.044580867637105]
CoT (Chain-of-Thought) Outcome Prediction Engine (COPE) は、構造化されていない臨床ノートから結果を予測するための推論強化された大規模言語モデルフレームワークである。
本研究は急性虚血性脳梗塞(AIS)464例と90日間のRanin Scale(mRS)スコアを比較検討した。
COPEは1.01 (95% CI 0.92-1.11), +/-1 の精度 74.4% (69.9, 78.8%), 正確な精度 32.8% (28.0, 37.6%) を達成した。
論文 参考訳(メタデータ) (2025-12-02T07:44:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。