論文の概要: PathReportEval: A Systematic Benchmark for Pathology Report Generation
- arxiv url: http://arxiv.org/abs/2607.18448v1
- Date: Mon, 20 Jul 2026 18:59:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.219091
- Title: PathReportEval: A Systematic Benchmark for Pathology Report Generation
- Title(参考訳): PathReportEval: 病理報告生成のためのシステムベンチマーク
- Abstract要約: 本稿では,病理報告生成のための標準化されたベンチマークと評価フレームワークを提案する。
このフレームワークは、事前処理、特徴抽出、トレーニング、復号化、評価を標準化する。
臨床報告品質スコア(英: Clinical Report Quality Score, CRQS)は、事実の正確性を評価するための臨床基準である。
- 参考スコア(独自算出の注目度): 5.733136272690028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pathology report generation from whole-slide images (WSIs) is a rapidly growing multimodal learning problem, yet progress is difficult to measure because existing studies use heterogeneous datasets, model settings, visual encoders, and evaluation protocols. Moreover, commonly used natural language generation metrics, including BLEU, ROUGE, and METEOR, primarily reward lexical similarity and often fail to detect clinically consequential errors such as omitted diagnoses, hallucinated findings, or discordant tumor attributes. We present a standardized benchmark and evaluation framework for pathology report generation. The benchmark evaluates four representative methods across three datasets (TCGA, HistAI, and REG 2025) using three pathology foundation encoders (CONCHv1.5, UNI2-h, and H-Optimus-1). Our framework standardizes preprocessing, feature extraction, training, decoding, and evaluation, enabling fair comparison across models while providing a modular platform for integrating new methods, datasets, and encoders. A central contribution is the Clinical Report Quality Score (CRQS), a clinically grounded metric for evaluating factual correctness. CRQS maps reference and generated reports into structured clinical attributes and measures four complementary dimensions: clinical fact coverage, key information recall, hallucination rate, and clinical discordance, producing both an overall score and interpretable sub-scores. Experiments demonstrate that conventional language-generation metrics are weakly aligned with clinical correctness and frequently overestimate report quality. In contrast, CRQS reveals clinically meaningful differences between models and encoders that lexical metrics fail to capture. Together, the benchmark, public plug-and-play framework, and CRQS establish a reproducible foundation for rigorous evaluation of pathology report generation.
- Abstract(参考訳): 全身スライディング画像(WSI)からの病理報告は、急速に増加するマルチモーダル学習の問題であるが、既存の研究では、異種データセット、モデル設定、ビジュアルエンコーダ、評価プロトコルを使用しているため、測定は困難である。
さらに、BLEU、ROUGE、METEORなどのよく使われる自然言語生成指標は、主に語彙的類似性を認め、省略診断、幻覚所見、不協和性腫瘍属性などの臨床的に連続した誤りを検出するのに失敗することが多い。
本稿では,病理報告生成のための標準化されたベンチマークと評価フレームワークを提案する。
このベンチマークは、3つのデータセット(TCGA, HistAI, REG 2025)を3つの病理基盤エンコーダ(CONCHv1.5, UNI2-h, H-Optimus-1)で比較した。
我々のフレームワークは、事前処理、特徴抽出、トレーニング、復号化、評価を標準化し、モデル間で公正な比較を可能にしながら、新しいメソッド、データセット、エンコーダを統合するモジュールプラットフォームを提供する。
臨床報告品質スコア(英: Clinical Report Quality Score, CRQS)は、事実の正確性を評価するための臨床基準である。
CRQSは、構造化された臨床属性への参照およびレポートを作成し、臨床事実カバレッジ、重要な情報リコール、幻覚率、臨床不一致の4つの相補的な次元を測定し、総合スコアと解釈可能なサブスコアの両方を生成する。
実験により、従来の言語生成指標は、臨床的正確性や報告品質の過大評価に弱いことが示されている。
対照的にCRQSは、レキシカルメトリクスが捕捉できないモデルとエンコーダの臨床的に有意な差異を明らかにしている。
ベンチマーク、パブリックプラグイン・アンド・プレイフレームワーク、CRQSは、厳密な病理報告生成評価のための再現可能な基盤を確立する。
関連論文リスト
- Concept-Grounded Reasoning with Prompt-Driven Localization for Interpretable Structured Report Generation [66.62662330558906]
CORALは、空間的接地と概念レベルの監督を統一的な推論プロセスに統合するマルチモーダルフレームワークである。
コーラルは、疾患の局所化とコンセプション・ボトルネックモジュールによる多クラス臨床属性の予測のために、プロンプト駆動型医療セグメンテーションモデルを採用している。
BUS-CoTとIU X線データセットの実験では、診断精度、概念整合性、報告品質が強力な汎用および医療MLLMよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-14T10:21:23Z) - Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models [46.202482780666635]
Graph-Hierarchicald Supervised Clinical Alignmentは、階層的な臨床アライメント問題としてイメージレポートの監督を再構築する。
本手法は, このアライメントを, 管理を2つのレベルに分解した疾患条件付きプロセスとして構成する。
MIMIC-CXR,IU-Xray,COV-CTRを用いた実験により,本手法は従来と臨床の両方の指標における性能を一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-08-25T06:32:26Z) - Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance [26.96793950588378]
機械学習は、臨床判断の近似を目的とした基準基準を用いた自動評価に大きく依存する。
病理分類と画像品質評価の両方において,評価基準選択がモデル性能とランキングに与える影響について検討した。
論文 参考訳(メタデータ) (2026-07-28T23:11:04Z) - SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation [1.5782980044380892]
放射線診断におけるビジョン・ランゲージモデルに対する現在の評価プロトコルは、語彙重なりを計測するレポートレベルの指標や、総合的な臨床的正確性に依存している。
本稿では、RRGにおける視覚ショートカット動作を評価するためのベンチマークであるSHOVIRを紹介する。
論文 参考訳(メタデータ) (2026-06-29T12:17:35Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - ReportQA: QA-Based Radiology Report Evaluation [34.29681217890862]
臨床関連およびフレキシブルな放射線診断評価フレームワークであるReportQAを提案する。
まず、複数の画像モダリティと解剖学的領域をカバーするデータセットを収集する。
次に,臨床対象と属性の知識ツリーを放射線医の指導で構築し,大規模言語モデル(LLM)を用いて生レポートから構造化情報を抽出する。
評価中、レポートは文脈として扱われ、LCMは判断モデルとして機能し、QAペアに応答する。
論文 参考訳(メタデータ) (2026-06-13T00:43:03Z) - CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation [51.11942945171396]
従来の評価指標は、語彙重なり合いやエンティティマッチングの粗い尺度のみを提供する。
我々はCT-RATEとMerlinのベンチマークであるCT-FineBenchを提案し、CTレポートの微細な事実整合性を評価する。
我々のベンチマークは、綿密な質問回答(QA)ベースのプロセスによって構築されます。
論文 参考訳(メタデータ) (2026-04-27T03:32:46Z) - Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation [10.15221228043609]
本稿では,テンプレート崩壊に拘わらず,高い集合トークンオーバラップスコアにつながる復号方式について検討する。
本稿では,人口統計に基づく単語の関連性の変化を定量化するための語彙レベルのフレームワークである,臨床協会変位(CAD)について紹介する。
決定論的復号化は意味的消去のレベルが高いことを示し、サンプリングは多様な出力を生成するが、新しいバイアスをもたらすリスクを示す。
論文 参考訳(メタデータ) (2026-03-02T08:59:39Z) - AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning [73.50200033931148]
本稿では,放射線科医の協調診断ワークフローをエミュレートしたマルチエージェントストリーム推論フレームワークであるAgensEvalを紹介する。
評価プロセスを基準定義、エビデンス抽出、アライメント、一貫性スコアなどの解釈可能なステップに分割することで、AgensEvalは明確な推論トレースと構造化された臨床フィードバックを提供する。
実験結果から,AgensEvalは,言い換え,意味的,スタイリスティックな摂動の下でも頑健な臨床的整合性,意味的忠実性,解釈可能な評価を提供することが示された。
論文 参考訳(メタデータ) (2026-01-23T11:59:13Z) - CTest-Metric: A Unified Framework to Assess Clinical Validity of Metrics for CT Report Generation [8.08950963137043]
CTest-Metricは,CT RRGのメトリクスの臨床的実現可能性を決定する3つのモジュールを備えた,最初の統合された計量評価フレームワークである。
モジュールテストでは, (i) LLMによるリフレッシングによるWSG, (ii) 重症度における合成エラー注入(SEI) および (iii) MvE (Metrics-vs-Expert correlation) を用いて臨床評価を行った。
8つの広く使われているメトリクス(BLEU, ROUGE, METEOR, BERTScore-F1, F1-RadGraph, Ra)
論文 参考訳(メタデータ) (2026-01-16T18:09:19Z) - S-RRG-Bench: Structured Radiology Report Generation with Fine-Grained Evaluation Framework [39.542375803362965]
胸部X線などの診断画像のための放射線診断レポート生成(RRG)は、臨床とAIの両方において重要な役割を担っている。
従来のフリーテキストレポートは冗長性と一貫性のない言語に悩まされ、臨床的に重要な詳細の抽出が複雑になる。
本稿では、データセット構築、モデルトレーニング、新しい評価フレームワークの導入を含む、S-RRGに対する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2025-08-04T05:49:41Z) - RaTEScore: A Metric for Radiology Report Generation [59.37561810438641]
本稿では,Radiological Report (Text) Evaluation (RaTEScore) として,新しい実体認識尺度を提案する。
RaTEScoreは、診断結果や解剖学的詳細などの重要な医療機関を強調し、複雑な医学的同義語に対して堅牢であり、否定表現に敏感である。
我々の評価は、RaTEScoreが既存の指標よりも人間の嗜好とより密接に一致していることを示し、確立された公開ベンチマークと、新たに提案したRaTE-Evalベンチマークの両方で検証した。
論文 参考訳(メタデータ) (2024-06-24T17:49:28Z) - Semi-supervised Medical Image Classification with Relation-driven
Self-ensembling Model [71.80319052891817]
医用画像分類のための関係駆動型半教師付きフレームワークを提案する。
これは、摂動下で与えられた入力の予測一貫性を促進することでラベルのないデータを利用する。
本手法は,シングルラベルおよびマルチラベル画像分類のシナリオにおいて,最先端の半教師付き学習手法よりも優れる。
論文 参考訳(メタデータ) (2020-05-15T06:57:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。