論文の概要: SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation
- arxiv url: http://arxiv.org/abs/2606.30201v1
- Date: Mon, 29 Jun 2026 12:17:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.214319
- Title: SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation
- Title(参考訳): SHOVIR:放射線学レポート生成における視覚的ショートカット学習の評価ベンチマーク
- Abstract要約: 放射線診断におけるビジョン・ランゲージモデルに対する現在の評価プロトコルは、語彙重なりを計測するレポートレベルの指標や、総合的な臨床的正確性に依存している。
本稿では、RRGにおける視覚ショートカット動作を評価するためのベンチマークであるSHOVIRを紹介する。
- 参考スコア(独自算出の注目度): 1.5782980044380892
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Current evaluation protocols for Vision-Language Models (VLMs) in Radiology Report Generation (RRG) rely on report-level metrics that measure lexical overlap or aggregate clinical correctness. However, such metrics do not test whether individual diagnostic statements stem from the actual pathological evidence visible in the image. This allows models to achieve competitive scores by exploiting learned priors or spurious correlations, a failure mode we refer to as vision shortcut. We introduce SHOVIR, a benchmark for evaluating vision shortcut behavior in RRG. SHOVIR extends two spatially annotated chest X-ray datasets, MIMIC-CXR and PadChest-GR, with per-box CheXpert labels, and defines image-level and disease-level occlusion experiments that contrast baseline performance on clean images against localized, region-specific perturbations. Comparing predictions across these conditions isolates two failure modes at the disease-class level: direct shortcuts, where a finding persists after its visual evidence is removed, and contextual shortcuts, where detection degrades once co-occurring pathologies are occluded despite the target region remaining intact. Benchmarking eight state-of-the-art VLMs, we find that shortcut behavior varies substantially across architectures and datasets. Models achieving the highest baseline report quality do not necessarily rank highest in spatial grounding, revealing that clinically fluent generation can coexist with shallow reliance on visual evidence. These findings expose a blind spot in current RRG evaluation and motivate region-aware assessment protocols.
- Abstract(参考訳): 放射線学報告生成(RRG)におけるビジョン・ランゲージ・モデル(VLM)の現在の評価プロトコルは、レキシカルオーバーラップを測定したり、臨床的正確さを集計するレポートレベルの指標に依存している。
しかし、これらの指標は、個々の診断文が、画像に現われる実際の病理的証拠に由来するかどうかを検査しない。
これにより、学習済みの事前や急激な相関、すなわちビジョンショートカットと呼ばれる障害モードを活用することで、モデルが競争的なスコアを達成できます。
本稿では、RRGにおける視覚ショートカット動作を評価するためのベンチマークであるSHOVIRを紹介する。
SHOVIRは、2つの空間アノテートされた胸部X線データセットMIMIC-CXRとPadChest-GRをボックスごとのCheXpertラベルで拡張し、画像レベルと疾患レベルの閉塞実験を定義する。
直接的ショートカット、視覚的証拠が取り除かれた後、発見が持続するショートカット、そして、検出は、標的領域が無傷であるにもかかわらず、一度同時に発生した病理が閉鎖されると劣化するコンテキスト的ショートカットである。
8つの最先端のVLMをベンチマークした結果、ショートカットの挙動はアーキテクチャやデータセットによって大きく異なることがわかった。
最高のベースラインレポート品質を達成するモデルは、必ずしも空間的接地において最高にランク付けされるわけではない。
これらの結果から,現在のRRG評価における盲点が明らかとなり,地域対応評価プロトコルのモチベーションが示唆された。
関連論文リスト
- Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models [46.202482780666635]
Graph-Hierarchicald Supervised Clinical Alignmentは、階層的な臨床アライメント問題としてイメージレポートの監督を再構築する。
本手法は, このアライメントを, 管理を2つのレベルに分解した疾患条件付きプロセスとして構成する。
MIMIC-CXR,IU-Xray,COV-CTRを用いた実験により,本手法は従来と臨床の両方の指標における性能を一貫して改善することが示された。
論文 参考訳(メタデータ) (2026-08-25T06:32:26Z) - Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP [1.4336070582473752]
医療用CLIPモデルであるMedCLIPの様々な層に現実世界のショートカットがどのように現れるかを検討する。
最終線形プローブは高いAUROCが得られるが、モデルのキャリブレーションは不十分である。
ドレインのような局所的なショートカットと整合したパターンが後続のレイヤに現れ、スキャナ固有のノイズパターンのような拡散ショートカットと整合したパターンが早く現れる。
論文 参考訳(メタデータ) (2026-08-12T14:08:52Z) - PathReportEval: A Systematic Benchmark for Pathology Report Generation [5.733136272690028]
本稿では,病理報告生成のための標準化されたベンチマークと評価フレームワークを提案する。
このフレームワークは、事前処理、特徴抽出、トレーニング、復号化、評価を標準化する。
臨床報告品質スコア(英: Clinical Report Quality Score, CRQS)は、事実の正確性を評価するための臨床基準である。
論文 参考訳(メタデータ) (2026-07-20T18:59:47Z) - Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data [9.98520042320808]
脳MRI診断に明示的な領域マーキングを導入したBrReMarkを提案する。
モデルはまず、潜在的な異常についての仮説を生成し、明示的な境界ボックスマーキングを通じてそれらをグラウンド化する。
我々は,ドメインランダム化に基づく病理合成の強化戦略を統合し,OEDデータに対するモデルの一般化性を向上させる。
論文 参考訳(メタデータ) (2026-06-24T14:41:27Z) - CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays [13.566972599173084]
CheXperceptは、胸部X線分析のためのシーケンシャルなマルチレベル知覚ベンチマークである。
これは、粗いレベルの検出、きめ細かい輪郭の評価と修正、意味レベルの属性抽出にまたがる放射線学者の認知ワークフローを反映している。
CheXperceptは2,100個のCXRから抽出された10,400個のQA項目を含み、7つの臨床的に重要な肺と心臓の病変をカバーしている。
論文 参考訳(メタデータ) (2026-06-19T01:10:24Z) - Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports [49.5225801722164]
既存のメトリクスは、医学的に根拠のないスカラーにレポートの品質を低下させることによって、この要件を曖昧にしている。
テストベッドとしてReEvalMedベンチマークを用いて,この境界について検討し,計量レベルの臨床的意義を評価する。
論文 参考訳(メタデータ) (2026-06-17T08:10:30Z) - Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs [63.535652574541764]
MLLM(Multimodal Large Language Models)は医用画像解析において顕著な可能性を示した。
消化器内視鏡におけるそれらの応用は、現在、2つの重要な限界によって妨げられている。
本稿では,これらの課題に対処する新しい臨床認知アライメント(CogAlign)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-21T07:47:37Z) - Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering [94.37535002230504]
本研究では,Semantically Decoupled Latent Steeringと呼ばれる学習自由な推論時間制御フレームワークを開発した。
提案手法は,大言語モデル (LLM) による意味分解による意味のない介入ベクトルを構築する。
本手法は歴史的幻覚の可能性を著しく低下させることを示す。
論文 参考訳(メタデータ) (2026-02-27T04:49:01Z) - A Disease-Aware Dual-Stage Framework for Chest X-ray Report Generation [15.331803613974365]
胸部X線レポート生成のための新しい2段階疾患認識フレームワークを提案する。
ステージ1では,特定の病理カテゴリに対応する病的意味トークン(DAST)を学習する。
ステージ2では,病を意識した表現と視覚的特徴を統合するために,病的・視覚的注意融合モジュールを導入する。
論文 参考訳(メタデータ) (2025-11-15T15:31:51Z) - XBench: A Comprehensive Benchmark for Visual-Language Explanations in Chest Radiography [6.447908430647854]
胸部X線におけるクロスモーダル解釈性を評価するための最初の体系的ベンチマークを示す。
我々は,クロスアテンションと類似性に基づくローカライズマップを用いた視覚的説明を生成する。
複数の病理組織を横断する放射線診断領域とのアライメントを定量的に評価した。
論文 参考訳(メタデータ) (2025-10-22T13:52:19Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - You've Got Two Teachers: Co-evolutionary Image and Report Distillation
for Semi-supervised Anatomical Abnormality Detection in Chest X-ray [33.272751884183556]
公的なMIMIC-CXRベンチマークの実験結果は、CEIRDがいくつかの最新の弱い半教師付き手法に優れていることを示す。
論文 参考訳(メタデータ) (2023-07-18T12:18:21Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z) - Rethinking Semi-Supervised Medical Image Segmentation: A
Variance-Reduction Perspective [51.70661197256033]
医用画像セグメンテーションのための階層化グループ理論を用いた半教師付きコントラスト学習フレームワークARCOを提案する。
まず、分散還元推定の概念を用いてARCOを構築することを提案し、特定の分散還元技術が画素/ボクセルレベルのセグメンテーションタスクにおいて特に有用であることを示す。
5つの2D/3D医療データセットと3つのセマンティックセグメンテーションデータセットのラベル設定が異なる8つのベンチマークで、我々のアプローチを実験的に検証する。
論文 参考訳(メタデータ) (2023-02-03T13:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。