論文の概要: Solving the Needle-in-a-Haystack Problem in Mammography Vision-Language Model with Differentiable Subset Sampling
- arxiv url: http://arxiv.org/abs/2609.03085v1
- Date: Wed, 02 Sep 2026 18:59:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.839521
- Title: Solving the Needle-in-a-Haystack Problem in Mammography Vision-Language Model with Differentiable Subset Sampling
- Title(参考訳): 差分サブセットサンプリングを用いたマンモグラフィ視覚言語モデルにおけるニードル・イン・ア・ヘイスタック問題の解法
- Authors: Young Seok Jeon, Beatrice Brown-Mulry, Rohan Satya Isaac, Anjana Dissanayaka, Theo Dapamede, Mohammadreza Chavoshi, Judy Gichoya, Hari Trivedi,
- Abstract要約: TopKSigLIPはマンモグラフィのための視覚言語モデル(VLM)である。
VLMトレーニングの解像度-バッチサイズトレードオフを横取りして、病変を含む可能性のある、粗い高解像度パッチのサンプルを学習する。
これは、密度評価、BI-RADS分類、サブタイプ発見、ゼロショット評価による癌予測に関する内部および外部のベンチマークにおいて、既存のオープンソースマンモグラフィーおよび一般的な医用VLMよりも優れている。
- 参考スコア(独自算出の注目度): 1.1391065477320765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: There is growing interest in adopting CLIP-style vision--language model (VLM) pretraining for mammography. However, models that directly employ the standard CLIP architecture and training objective exhibit limited zero-shot performance in clinically important tasks such as cancer, finding-type, and BI-RADS predictions. We argue that this underwhelming performance is due to neglecting two characteristics of mammography data: (1) its high-res nature, and (2) homogeneity of radiology reports, largely driven by a predominance of negative/benign findings on examinations. We propose TopKSigLIP, a VLM designed to address these two limitations through a novel architecture and learning objectives. Instead of downscaling high-res mammography images to satisfy GPU memory constraints, TopKSigLIP introduces TopK-Patch module that learns to sample a sparse set of high-res patches likely to contain lesions, sidestepping the resolution--batch size tradeoff of VLM training. The sampled patch locations additionally serve as a built-in localization tool. To address report homogeneity, we replace the contrastive loss, which falsely repels semantically similar pairs, with a Sup-sigmoid loss. Sup-sigmoid loss extends the sigmoid loss from SigLIP with soft labels derived from structured data. TopKSigLIP outperforms existing open-source mammography and general medical VLMs on both internal and external benchmarks on density assessment, BI-RADS classification, finding subtyping, and cancer prediction under zero-shot evaluation. TopKSigLIP remains competitive under linear probing despite using a significantly smaller vision encoder and smaller training batches than baselines. The TopK-Patch module additionally achieves superior lesion localization over post-hoc Grad-CAM. Code and weights are made public:https://github.com/Youngseok0001/TopKSigLIP.
- Abstract(参考訳): マンモグラフィにCLIP-style Vision-Language Model(VLM)を適用することへの関心が高まっている。
しかし、標準のCLIPアーキテクチャとトレーニング目標を直接採用するモデルは、がん、発見型、BI-RADS予測などの臨床的に重要なタスクにおいて、ゼロショットのパフォーマンスが制限されている。
本研究は, マンモグラフィーデータの2つの特徴, 1)高解像度性, (2) 検診における陰性・良性所見の先行による放射線学報告の均一性, を無視することによるものである,と論じる。
そこで本研究では,これら2つの制約に,新しいアーキテクチャと学習目的を通じて対処するためのVLMであるTopKSigLIPを提案する。
GPUメモリの制約を満たすために、高解像度のマンモグラフィ画像をダウンスケールする代わりに、TopKSigLIPはTopK-Patchモジュールを導入した。
サンプルのパッチロケーションは、組み込みのローカライゼーションツールとして機能する。
報告の均一性に対処するために、意味論的に類似したペアを誤って再現する対照的な損失をSup-sigmoid損失に置き換える。
SigLIPによるSup-Sigmoid損失は、構造化データから得られたソフトラベルによるSigLIPからのSigmoid損失を延長する。
TopKSigLIPは、内部および外部のベンチマーク、BI-RADS分類、サブタイプ発見、ゼロショット評価による癌予測において、既存のオープンソースマンモグラフィーおよび一般的な医用VLMよりも優れている。
TopKSigLIPは、視覚エンコーダが大幅に小さく、ベースラインよりも訓練バッチが小さいにもかかわらず、線形探索の下で競争力を維持している。
TopK-Patchモジュールは、ポストホックのGrad-CAMよりも優れた病変の局在を達成する。
コードとウェイトは公開されています。https://github.com/Youngseok0001/TopKSigLIP。
関連論文リスト
- Re-thinking Mammography Transfer Learning: The Dataset-Informed Transfer Learning (DITL) Framework for Breast Cancer Screening and Lesion Diagnosis [3.616534682321388]
本稿では,データセット由来の難易度信号と近隣3重項監視を統合したデータセットインフォームド・トランスファー学習フレームワークを提案する。
DITLは、全乳房密度分類における最先端のパフォーマンスを達成し、精度、F1スコア、AUCを大きく改善した。
大規模な密度推定で小さな病変解析をブリッジすることにより、DITLは臨床的に関連性があり、スケーラブルで、一般化可能なマンモグラフィ分類の枠組みを確立する。
論文 参考訳(メタデータ) (2026-07-28T17:52:36Z) - Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification [69.87877580725768]
MVSC(Multimodal Visual Surrogate Compression)は、大規模な3D sMRIボリュームをコンパクトな2D機能に圧縮し、適応させることを学ぶ。
MVSCには2つの重要なコンポーネントがある: テキストガイダンスの下でグローバルなクロススライスコンテキストをキャプチャするボリュームコンテキストと、テキストエンハンスでパッチワイズな方法でスライスレベルの情報を集約するAdaptive Slice Fusionモジュール。
論文 参考訳(メタデータ) (2026-01-29T13:05:46Z) - Towards Explainable Skin Cancer Classification: A Dual-Network Attention Model with Lesion Segmentation and Clinical Metadata Fusion [1.503974529275767]
本稿では,皮膚病変の分類を精度と解釈性の両方の観点から向上させる,二重エンコーダアテンションに基づくフレームワークを提案する。
Dual Attention Gates (DAG) と Atrous Space Pyramid Pooling (ASPP) を用いた新しいDeep-UNetアーキテクチャが最初に採用されている。
我々は,HAM10000データセットとISIC 2018と2019の課題に対するアプローチを評価した。
論文 参考訳(メタデータ) (2025-10-20T17:33:51Z) - Revolutionizing Precise Low Back Pain Diagnosis via Contrastive Learning [0.3499870393443268]
腰痛は世界中の何百万もの人に影響を与え、堅牢な診断モデルの必要性を喚起する。
我々は,腰椎MRIスキャンとそれに対応する放射線学的記述との整合性を確保するために,コントラスト言語画像事前訓練を利用する新しいフレームワークであるLumbarCLIPを提案する。
論文 参考訳(メタデータ) (2025-09-25T06:52:25Z) - A Vision-Language Model for Focal Liver Lesion Classification [0.0]
Contrastive Language-Image Pre-Training Model (CLIP) などの視覚言語モデル(VLM)が画像分類に適用されている。
局所肝病変(FLL)分類に特化して設計されたモデルであるLiver-VLMを提案する。
論文 参考訳(メタデータ) (2025-05-06T09:19:12Z) - Pathological Prior-Guided Multiple Instance Learning For Mitigating Catastrophic Forgetting in Breast Cancer Whole Slide Image Classification [50.899861205016265]
乳癌のWSI分類における破滅的忘れを緩和する新しい枠組みであるPaGMILを提案する。
私たちのフレームワークでは、共通のMILモデルアーキテクチャに2つの重要なコンポーネントを導入しています。
複数の乳がんデータセットを対象としたPaGMILの連続学習性能の評価を行った。
論文 参考訳(メタデータ) (2025-03-08T04:51:58Z) - Weakly-supervised positional contrastive learning: application to
cirrhosis classification [45.63061034568991]
大規模な医療画像データセットは、低信頼で弱いラベルで安価に注釈を付けることができる。
組織学に基づく診断のような高信頼なラベルへのアクセスは稀で費用がかかる。
提案手法は,効率的な弱教師付き位置対応学習戦略 (WSP) を提案する。
論文 参考訳(メタデータ) (2023-07-10T15:02:13Z) - Hierarchical Transformer for Survival Prediction Using Multimodality
Whole Slide Images and Genomics [63.76637479503006]
下流タスクのためのギガピクセルレベルのスライド病理画像(WSI)の良質な表現を学習することが重要である。
本稿では,病理画像と対応する遺伝子間の階層的マッピングを学習する階層型マルチモーダルトランスフォーマーフレームワークを提案する。
より優れたWSI表現能力を維持しながら、ベンチマーク手法と比較してGPUリソースが少ないアーキテクチャです。
論文 参考訳(メタデータ) (2022-11-29T23:47:56Z) - Mixed-UNet: Refined Class Activation Mapping for Weakly-Supervised
Semantic Segmentation with Multi-scale Inference [28.409679398886304]
我々は、デコードフェーズに2つの並列分岐を持つMixed-UNetという新しいモデルを開発する。
地域病院や公開データセットから収集したデータセットに対して,いくつかの一般的なディープラーニングに基づくセグメンテーションアプローチに対して,設計したMixed-UNetを評価した。
論文 参考訳(メタデータ) (2022-05-06T08:37:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。