論文の概要: CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography
- arxiv url: http://arxiv.org/abs/2607.27779v1
- Date: Thu, 30 Jul 2026 07:10:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.432985
- Title: CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography
- Title(参考訳): CXR-Retrieve:胸部X線写真における合成テキスト画像検索
- Abstract要約: 視覚言語モデルは、テキストから画像への検索に自然なインターフェイスを提供する。
現在のバイオメディカルモデルは、主にレポート・ツー・イメージマッチングに最適化されている。
胸部X線テキスト・画像検索のための構造化ベンチマークであるCXR-Retrieveを紹介する。
- 参考スコア(独自算出の注目度): 8.663183634036624
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large chest radiography archives are difficult to search because most studies are paired only with free-text reports rather than structured clinical annotations. Vision-language models offer a natural interface for text-to-image retrieval, but current biomedical models are primarily optimized for report-to-image matching rather than for satisfying short clinical search queries. This creates an objective mismatch: a model may retrieve images related to words in the query while failing to satisfy the full clinical constraint, especially for conjunctions and negations such as ``atelectasis and no pneumonia.'' We introduce CXR-Retrieve, a structured benchmark for compositional chest X-ray text-to-image retrieval. The benchmark contains 5,159 test images from the official test-split of MIMIC-CXR-JPG and 145 textual queries spanning single and conjunction findings, both positive and negative. Relevance is defined by whether a retrieved image satisfies all asserted pathology constraints, rather than by whether it matches a paired report. We further propose a label-aware contrastive fine-tuning objective for clinical retrieval. Our method attracts image-text pairs with compatible asserted pathology constraints, including shared confirmed absences, while explicitly repelling contradictory pairs. Starting from the in-domain CXR-CLIP checkpoint, our method improves Precision@5 over CXR-CLIP by 8.5 percentage points on two-pathology conjunctions and by 22.0 percentage points on negation queries. These results show that reliable chest X-ray retrieval requires training objectives that model not only which findings are mentioned, but also how they are clinically asserted.
- Abstract(参考訳): 胸部X線写真アーカイブの検索は困難であり、ほとんどの研究は、構造化された臨床アノテーションではなく、自由テキストレポートと組み合わせられている。
視覚言語モデルは、テキスト・ツー・イメージ検索の自然なインターフェースを提供するが、現在のバイオメディカル・モデルは、短い臨床検索クエリを満たすのではなく、レポート・ツー・イメージマッチングに最適化されている。
これは客観的なミスマッチを生成する:モデルは、完全な臨床的制約を満たすのに失敗しながら、クエリ内の単語に関連するイメージを検索することができる。
胸部X線テキスト・画像検索のための構造化ベンチマークであるCXR-Retrieveを紹介する。
このベンチマークには、MIMIC-CXR-JPGの公式テストスプリットから5,159枚のテストイメージと、単独および共同研究結果にまたがる145個のテキストクエリが含まれている。
関連性は、検索された画像が、ペア化されたレポートにマッチするかどうかではなく、すべての主張された病理制約を満たすかどうかによって定義される。
さらに,臨床検索のためのラベル認識型コントラスト微調整手法を提案する。
提案手法は,矛盾するペアを明示的に取り除きつつ,共有された不在を含む相反する病態制約を持つ画像テキストペアを惹きつける。
ドメイン内CXR-CLIPチェックポイントから始めると、CXR-CLIPよりも精度@5が8.5ポイント、否定クエリでは22.0ポイント向上する。
これらの結果から, 胸部X線検索には, どの所見が言及されているかだけでなく, 臨床的にどう主張されているかをモデル化する訓練目的が必要であることが示唆された。
関連論文リスト
- MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models [2.2090506971647144]
ヴィジュアル言語モデル(VLM)は、胸部X線が検索された報告、予備メモ、または以前の画像と共に解釈される臨床パイプラインでますます用いられる。
既存のベンチマークでは、モデルが単独で正しく答えるかどうかを計測するが、妥当なコンテキストが画像と矛盾する場合に、正しい画像のみの決定を保持するかどうかを判断する。
マルチコンテキストチェストX線 (MC-CXR) を導入し, 240のケースを2,522のインスタンスに拡張した。
論文 参考訳(メタデータ) (2026-08-25T06:28:17Z) - Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation [0.0]
放射線学レポート生成のための病理アライメントフレームワークであるPALMを提案する。
PALMは、共有病理学のプロトタイプを通じて視覚的およびテキスト的特徴を整列する。
MIMIC-CXR、IU X-Ray、MIMIC-ABNの実験は、PALMがレポート生成と異常に焦点を絞った堅牢性の両方を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-31T20:31:19Z) - A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports [58.14965296904734]
EndoCLIPは125,756の病変レベルの画像テキストペアに基づいて訓練された視覚言語基盤モデルである。
これは、ゼロショットとリニアプローブの両方の設定において、汎用およびバイオメディカルな視覚言語エンコーダよりも優れている。
論文 参考訳(メタデータ) (2026-07-30T16:24:36Z) - A Vision-language Framework for Comparative Reasoning in Radiology [68.52471827773482]
我々は,放射線学的比較を実体認識のクロスイメージ推論問題として定式化する。
我々は,日常的な画像とレポートのペアから得られた大規模比較画像資源を構築した。
臨床類似症例の検索を制御可能なエンティティ対応ビジュアルエンコーダであるMedReCoを開発した。
論文 参考訳(メタデータ) (2026-06-04T17:12:47Z) - Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation [51.509572354327986]
本稿では,CTRG(Computed Tomography Report Generation)に適した新しい2段階(構造とレポートの学習)フレームワークを提案する。
第1段階では、CT画像中の対応する構造を学習可能な構造特異的な視覚的クエリーの集合を観察し、その結果として得られる観察トークンと、それに伴う放射線学レポートから抽出された構造特異的なテキスト特徴とを、構造的に画像テキストのコントラストロスとで対比する。
第2段階では、視覚構造クエリを凍結し、各解剖学的構造を描写したクリティカルイメージパッチ埋め込みを選択するために使用し、メモリ消費を低減しつつ、無関係領域からの注意を最小化する。
論文 参考訳(メタデータ) (2026-03-05T07:07:07Z) - The Effect of Negation on CLIP in Medical Imaging: Limitations of Contrastive Language-Image Pretraining [2.797002704887474]
我々は,Stanford AIMI CheXagentモデルの胸部X線像を,否定を伴わないプロンプトを用いて正確に検索する能力について評価した。
以上の結果から,CLIPモデルにおける否定処理の処理精度は,肯定的評価の精度をわずかに低下させることが明らかとなった。
論文 参考訳(メタデータ) (2025-12-18T23:19:19Z) - RadIR: A Scalable Framework for Multi-Grained Medical Image Retrieval via Radiology Report Mining [64.66825253356869]
本稿では,複数の粒度で画像の類似度を決定するために,高密度ラジオロジーレポートを利用した新しい手法を提案する。
我々は、胸部X線用MIMIC-IRとCTスキャン用CTRATE-IRの2つの総合的な医用画像検索データセットを構築した。
RadIR-CXR と Model-ChestCT という2つの検索システムを開発し,従来の画像画像検索と画像レポート検索に優れた性能を示す。
論文 参考訳(メタデータ) (2025-03-06T17:43:03Z) - Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation [91.63262242041695]
本稿では,胸部X線画像領域と医療報告における単語を関連付けるために,適応パッチワードマッチング(AdaMatch)モデルを提案する。
AdaMatchは、適応パッチと単語のきめ細かい関係を利用して、対応する単語で特定の画像領域の説明を提供する。
CXRレポート生成タスクの明示的な説明性を提供するため,循環型CXRレポート生成のためのAdaMatchベースの双方向大言語モデルを提案する。
論文 参考訳(メタデータ) (2023-12-13T11:47:28Z) - Multimodal Image-Text Matching Improves Retrieval-based Chest X-Ray
Report Generation [3.6664023341224827]
X-REM (Contrastive X-Ray Report Match) は、X-REM (X-REM) という新しい検索方式の放射線学レポート生成モジュールである。
X-REMは、胸部X線画像の類似度を測定するための画像テキストマッチングスコアと、レポート検索のための放射線診断レポートを使用する。
論文 参考訳(メタデータ) (2023-03-29T04:00:47Z) - Medical Image Captioning via Generative Pretrained Transformers [57.308920993032274]
我々は、Show-Attend-Tell と GPT-3 という2つの言語モデルを組み合わせて、包括的で記述的な放射線学記録を生成する。
提案モデルは、Open-I、MIMIC-CXR、汎用MS-COCOの2つの医療データセットで検証される。
論文 参考訳(メタデータ) (2022-09-28T10:27:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。