論文の概要: RadMatch: Auditable Radiology Report Evaluation via Finding-Level Matching
- arxiv url: http://arxiv.org/abs/2609.01470v1
- Date: Tue, 01 Sep 2026 16:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.830602
- Title: RadMatch: Auditable Radiology Report Evaluation via Finding-Level Matching
- Title(参考訳): RadMatch: レベルマッチングによる聴取可能な放射線診断の評価
- Authors: Charles Corbière, Léo Machado, Aubin Charley, Baptiste Callard, Pierre Manceron, Corentin Dancette,
- Abstract要約: RadMatchは、レポートの比較を、意味認識のスコアリングとエラーのキャラクタリゼーションとの構造化された発見レベルマッチングに分解するメトリクスである。
最も臨床的に整合した測定基準であり、ReXValに関する放射線学者間の合意と一致しており、より硬いRadEvalExpert上での最高の測定基準を2倍にしている。
結果を検査するためのインタラクティブなダッシュボードを備えたオープンソースコードとしてRadMatchをリリースします。
- 参考スコア(独自算出の注目度): 5.0049748707447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As AI systems are increasingly used to draft radiology reports, reliably evaluating their clinical quality remains a critical challenge. Large language model (LLM)-based metrics are now the best-correlated with radiologist judgment, yet they output a single opaque score that neither a clinician nor a model builder can easily interpret or audit. We introduce RadMatch, a multi-stage, LLM-based metric that decomposes report comparison into a structured finding-level matching with significance-aware scoring and error characterization across seven clinical attribute dimensions (status, location, severity, morphology, certainty, longitudinal comparison, and measurement). The main score is the actionable-error count, both interpretable and auditable. Candidate findings are graded correct, partial, or incorrect, and unmatched findings are counted as missed or hallucinated. Triage and actionable safety recall/precision and per-subset views add complementary, deployment-oriented lenses. Across two expert benchmarks, RadMatch is the most clinically aligned metric, matching inter-radiologist agreement on ReXVal and more than doubling the best prior metric on the harder RadEvalExpert. Relying only on few-shot prompting, it is designed to extend to other modalities and anatomies. We will release RadMatch as open-source code with an interactive dashboard for inspecting results.
- Abstract(参考訳): AIシステムは、放射線学レポートの草案作成にますます使われているため、臨床品質を確実に評価することは重要な課題である。
大規模言語モデル(LLM)に基づくメトリクスは、現在では放射線学の判断と最もよく関連しているが、臨床医でもモデル構築者でも容易に解釈・監査できるような単一の不透明なスコアを出力する。
RadMatchは, レポート比較を, 7つの臨床属性次元(統計, 位置, 重大度, 形態, 確実性, 縦断的比較, 測定値)で有意な評価と誤り評価とを一致させる構造的発見レベルに分解する多段階LLM尺度である。
主なスコアは、解釈可能かつ監査可能な、実行可能なエラーカウントである。
候補は, 正解, 偏差, 不一致, 未一致の所見は, 欠落, 幻覚とみなす。
トリアージとアクション可能な安全リコール/精度とサブセットごとのビューは、補完的でデプロイメント指向のレンズを追加する。
2つの専門家ベンチマークで、RadMatchは最も臨床的に整合した指標であり、ReXValに関する放射線学者間の合意に一致する。
数発のプロンプトのみに頼り、他のモダリティや解剖に拡張するように設計されている。
結果を検査するためのインタラクティブなダッシュボードを備えたオープンソースコードとしてRadMatchをリリースします。
関連論文リスト
- Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Calibrated Confidence Expression for Radiology Report Generation [33.24673060327421]
放射線学レポート生成における大規模視覚言語モデル(LVLM)は、正確な予測と臨床的に解釈可能な指標を必要とする。
現在の最先端言語モデルはしばしば自信過剰であり、放射線学レポート生成などのマルチモーダル設定における校正に関する研究は限られている。
本稿では,LVLMを微調整する医療強化学習フレームワークであるConRadを紹介する。
論文 参考訳(メタデータ) (2026-03-31T09:37:33Z) - CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation [2.61152955442649]
CRIMSONは胸部X線レポート生成のための臨床基盤評価フレームワークである。
エラーを、誤った発見、不明な発見、8つの属性レベルのエラーを含む包括的な分類に分類する。
CRIMSONは、6人の放射線技師によって注釈された臨床的に重要なエラー数と強く一致して検証される。
論文 参考訳(メタデータ) (2026-03-06T11:43:42Z) - Semantic Similarity in Radiology Reports via LLMs and NER [1.2489632787815885]
放射線医学報告の評価は放射線医の訓練において重要な部分であり、診断精度の確保に重要な役割を果たしている。
予備報告と最終報告のセマンティックな差異を識別することは、訓練ツールとして、臨床知識のギャップを明らかにするためにも不可欠である。
放射線学におけるAIは急速に発展している分野であるが、専門知識を必要とするため、大規模言語モデル(LLM)の適用は依然として困難である。
Llama-EntScore は Llama 3.1 と NER の組み合わせとチューナブルウェイトを組み合わせた意味的類似性スコア法である。
論文 参考訳(メタデータ) (2025-10-03T15:31:11Z) - RadEval: A framework for radiology text evaluation [18.848190941379222]
RadEvalは、放射線学のテキストを評価するための統一されたオープンソースフレームワークである。
古典的なn-gramオーバーラップから臨床概念に基づくスコアまで、さまざまなメトリクスを統合する。
450以上の臨床的に重要なエラーラベルを持つリッチな注釈付き専門家データセットをリリースする。
論文 参考訳(メタデータ) (2025-09-22T17:03:48Z) - Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation [32.410641778559544]
ICARE (Interpretable and Clinicallygrounded Agent-based Report Evaluation) は、解釈可能な評価フレームワークである。
2つのエージェントは、それぞれが基礎的真実または生成されたレポートを持ち、臨床的に有意義な質問を発生し、互いにクイズする。
スコアを質問応答ペアにリンクすることで、ICAREは透明で解釈可能な評価を可能にする。
論文 参考訳(メタデータ) (2025-08-04T18:28:03Z) - RaTEScore: A Metric for Radiology Report Generation [59.37561810438641]
本稿では,Radiological Report (Text) Evaluation (RaTEScore) として,新しい実体認識尺度を提案する。
RaTEScoreは、診断結果や解剖学的詳細などの重要な医療機関を強調し、複雑な医学的同義語に対して堅牢であり、否定表現に敏感である。
我々の評価は、RaTEScoreが既存の指標よりも人間の嗜好とより密接に一致していることを示し、確立された公開ベンチマークと、新たに提案したRaTE-Evalベンチマークの両方で検証した。
論文 参考訳(メタデータ) (2024-06-24T17:49:28Z) - End-to-End Page-Level Assessment of Handwritten Text Recognition [69.55992406968495]
HTRシステムは、文書のエンドツーエンドのページレベルの書き起こしに直面している。
標準メトリクスは、現れる可能性のある不整合を考慮していない。
本稿では、転写精度とROの良さを別々に検討する2つの評価法を提案する。
論文 参考訳(メタデータ) (2023-01-14T15:43:07Z) - COMPOSE: Cross-Modal Pseudo-Siamese Network for Patient Trial Matching [70.08786840301435]
本稿では, CrOss-Modal PseudO-SiamEse Network (COMPOSE) を提案する。
実験の結果,患者基準マッチングでは98.0%,患者基準マッチングでは83.7%の精度でAUCに到達できることがわかった。
論文 参考訳(メタデータ) (2020-06-15T21:01:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。