論文の概要: RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding
- arxiv url: http://arxiv.org/abs/2608.00147v1
- Date: Fri, 31 Jul 2026 16:14:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.510053
- Title: RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding
- Title(参考訳): RadPRISM: 画像表現と視覚的接地のためのスキーマ・ストラテファイド・ラジオロジー-レポート管理
- Authors: Fabian Drexel, Marlene Fritzsche, Era Stambollxhiu, Miriam Kumpf, Lena Schmitzer, Lea Schumann, Jannik Kahmann, Friedrich Puttkammer, Johannes Moll, Jannik Lübberstedt, Zeineb Ben Chaaben, Anirudh Narayanan, Cosmin I. Bercea, Sebastian Ziegelmayer, Marcus R. Makowski, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem,
- Abstract要約: 本稿では,RadPRISMについて紹介する。
オンプレミスの大規模言語モデルは、自由テキストレポートから概念単位のテキストを抽出し、それぞれの臨床概念を専用の視覚サブ空間に整列させる。
- 参考スコア(独自算出の注目度): 14.036871627954156
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language pretraining learns rich medical image representations from radiology reports, but previous model variants commonly operate within a single shared embedding space, so concept-level structure and interpretability must be recovered post hoc, limiting model transparency and, hence, clinical utility. We introduce RadPRISM, which makes a clinician-defined radiology schema a designated stratification axis: an on-premise large language model extracts per-concept text spans from free-text reports, and each clinical concept is aligned in its own dedicated visual subspace, turning concept stratification into direct, top-level alignment supervision. Instantiated on chest radiographs with a 19-concept schema over $203{,}602$ examinations from an internal multi-year archive, RadPRISM improved internal dataset zero-shot classification from $0.717$ (95% CI, $0.710-0.723$) to $0.868$ (95% CI, $0.863-0.872$) macro AUROC over a matched global-alignment baseline, performed on par with the purpose-built CARZero reference in external zero-shot classification while substantially outperforming it (up to 4.3-fold) in pointing-game visual grounding. In addition, a radiologist reader study demonstrated concept-stratified retrieval ability ($0.78$ macro retrieval correctness rate within rank 3), surfacing disentangled descriptive findings that report-level retrieval and fixed-label vocabularies cannot express. RadPRISM yields discriminative, spatially faithful, natively concept-stratified representations shaped by and transparently inspectable by clinicians.
- Abstract(参考訳): 視覚言語による事前訓練は、放射線医学レポートから豊かな医用画像表現を学習するが、以前のモデル変種は、単一の共有埋め込み空間内で一般的に機能するため、概念レベルの構造と解釈性は、ホック後に回復し、モデルの透明性を制限し、臨床的有用性を制限する必要がある。
本稿では,RadPRISMについて紹介する。RadPRISMは,診療者が定義した放射線学スキーマを特定の階層化軸とし,オンプレミスの大規模言語モデルがフリーテキストレポートから概念単位のテキストを抽出し,各臨床概念を専用の視覚サブ空間に整列させて,概念階層化を直接的,トップレベルのアライメント・インテリジェンス・インテリジェンス・インテリジェンスに変換する。
203{,}602$を超える19のコンセプションスキーマを用いた胸部ラジオグラフィーで、RadPRISMは内部のデータセットゼロショット分類を$0.717$ (95% CI, $0.710-0.723$)から$0.868$ (95% CI, $0.863-0.872$)マクロAUROCに改良した。
さらに、放射線学者の読者による研究では、レポートレベルの検索や固定ラベルの語彙が表現できないような非絡み合った記述的な発見を、概念階層化された検索能力(ランク3内のマクロ検索精度0.78$マクロ検索率)で実証した。
RadPRISMは、差別的で、空間的に忠実で、ネイティブに概念階層化された表現を、臨床医によって形成され、透過的に検査可能である。
関連論文リスト
- A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports [58.14965296904734]
EndoCLIPは125,756の病変レベルの画像テキストペアに基づいて訓練された視覚言語基盤モデルである。
これは、ゼロショットとリニアプローブの両方の設定において、汎用およびバイオメディカルな視覚言語エンコーダよりも優れている。
論文 参考訳(メタデータ) (2026-07-30T16:24:36Z) - DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization [0.4418222884390162]
我々は,MedGemma-4Bの教師付き微調整とグループ相対ポリシー最適化を組み合わせた視覚言語モデルであるDobicVLMを紹介する。
我々のアプローチでは、構造検証、解剖学的チェックリスト、意味的類似性、長さ制約といった、解釈可能なルールベースの報酬コンポーネントを使用します。
DobicVLMはGemini 2.5 Flashよりも優れており、Gemini 2.5 FlashとMedGemma 4Bベースラインと比較して、印象精度(27.2%)と医療用語(86.5%)が最も高い。
論文 参考訳(メタデータ) (2026-07-21T11:20:09Z) - CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation [5.995766869240907]
CogRad(コグラッド)は、放射線学者の読影過程の4段階にまたがる生成を構造化するフレームワークである。
CheXpert Plusでは、CagRadが0.316のBLEU-4と0.322のCIDErを獲得しています。
論文 参考訳(メタデータ) (2026-07-04T12:43:04Z) - A Vision-language Framework for Comparative Reasoning in Radiology [68.52471827773482]
我々は,放射線学的比較を実体認識のクロスイメージ推論問題として定式化する。
我々は,日常的な画像とレポートのペアから得られた大規模比較画像資源を構築した。
臨床類似症例の検索を制御可能なエンティティ対応ビジュアルエンコーダであるMedReCoを開発した。
論文 参考訳(メタデータ) (2026-06-04T17:12:47Z) - Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance [16.566888073449714]
ラジオロジーレポート生成(RRG)のための視覚言語モデル(VLM)は、ボリュームスキャンから長めの胸部CTレポートを生成することができる。
既存の方法は2つの重要な制限に直面している: (i) トレーニングの監督は、しばしば粗くなり、きめ細かい属性や病理の場所を明示的に調整することなく、CTのボリューム全体を完全な自由テキストのレポートと整列する。
本稿では,フリーテキストレポートから微細なキューを蒸留し,レポート生成をガイドするプラグイン・アンド・プレイフレームワークであるPrompt Dropout (DCP-PD) を用いたemphDiscrimi Cue-Promptingを提案する。
論文 参考訳(メタデータ) (2026-04-12T03:25:41Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment [10.67889367763112]
RadAlignは、視覚言語モデルの予測精度と大きな言語モデルの推論能力を組み合わせた、新しいフレームワークである。
本フレームワークは, 幻覚の低減, 自動医用画像の進歩, 予測AIと生成AIの統合による報告分析を両立させながら, 強力な臨床解釈可能性を維持している。
論文 参考訳(メタデータ) (2025-01-13T17:55:32Z) - Radiology Report Generation Using Transformers Conditioned with
Non-imaging Data [55.17268696112258]
本稿では,胸部X線画像と関連する患者の人口統計情報を統合したマルチモーダルトランスフォーマーネットワークを提案する。
提案ネットワークは、畳み込みニューラルネットワークを用いて、CXRから視覚的特徴を抽出し、その視覚的特徴と患者の人口統計情報のセマンティックテキスト埋め込みを組み合わせたトランスフォーマーベースのエンコーダデコーダネットワークである。
論文 参考訳(メタデータ) (2023-11-18T14:52:26Z) - Auxiliary Signal-Guided Knowledge Encoder-Decoder for Medical Report
Generation [107.3538598876467]
放射線技師の動作パターンを模倣する補助信号誘導知識デコーダ(ASGK)を提案する。
ASGKは、内的特徴融合と外部医療言語情報を統合して、医療知識の伝達と学習をガイドする。
論文 参考訳(メタデータ) (2020-06-06T01:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。