論文の概要: CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding
- arxiv url: http://arxiv.org/abs/2605.13544v1
- Date: Wed, 13 May 2026 13:54:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:28.08633
- Title: CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding
- Title(参考訳): CA-GCL:ロバスト3次元医用画像理解のためのクロス解剖学的グローバルローカルコントラスト学習
- Authors: Hanwen Zhang, Yao Liu, Die Dai, Jiaye Yang, Qiao Liu, Yutong Xie, Peng Wang,
- Abstract要約: 3次元医用画像の理解において、微粒な視線前訓練は有意な可能性を秘めている。
既存のパラダイムは、しばしばテキスト埋め込み空間において深刻な表現の崩壊に悩まされる。
この分布の縮退は、モデルに過敏な変化を誘発し、信頼性の高い臨床展開を妨げる。
本稿では,これらの課題に対処する新しいクロス・解剖学的グローバル・ローカル・コントラシティブ・ラーニング・フレームワーク(CA-GCL)を提案する。
- 参考スコア(独自算出の注目度): 10.148965935742543
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fine-grained Vision-Language Pre-training (FVLP) demonstrates significant potential in 3D medical image understanding by aligning anatomy-level visual representations with corresponding textual descriptions. However, existing FVLP paradigms often suffer from severe representation collapse in the textual embedding space, where text embeddings of distinct anatomical structures become highly clustered and indistinguishable. This distributional degeneracy renders the model hypersensitive to prompt variations, hindering reliable clinical deployment. To address these challenges, we propose a novel Cross-Anatomy Global-Local Contrastive Learning framework (CA-GCL). CA-GCL introduces a global contrastive objective that enforces separation between anatomical categories in the latent space, effectively counteracting the aggregation tendency induced by local alignment. Furthermore, we incorporate a clinical-aware text augmentation strategy based on permutation invariance and partial completeness to enhance robustness against descriptive incompleteness. Extensive evaluations on the CT-RATE and Rad-ChestCT datasets demonstrate that CA-GCL consistently outperforms existing VLP paradigms in zero-shot abnormality detection, achieving superior performance while exhibiting strong cross-dataset generalization. Crucially, CA-GCL reduces performance variance across diverse prompt templates, transforming the collapsed textual similarity distribution into a bell-shaped distribution. These results validate CA-GCL as an effective framework for robust 3D medical image understanding.
- Abstract(参考訳): FVLPは、解剖学的レベルの視覚表現と対応するテキスト記述を一致させることにより、3次元の医用画像理解において有意な可能性を示す。
しかし、既存のFVLPパラダイムは、異なる解剖学的構造のテキスト埋め込みが高度にクラスタ化され、識別不能になるテキスト埋め込み空間において、深刻な表現の崩壊に悩まされることが多い。
この分布の縮退は、モデルに過敏な変化を誘発し、信頼性の高い臨床展開を妨げる。
これらの課題に対処するため、我々は新しいクロス解剖学グローバルローカルコントラスト学習フレームワーク(CA-GCL)を提案する。
CA-GCLは、潜在空間における解剖学的カテゴリーの分離を強制するグローバルコントラスト的目的を導入し、局所的なアライメントによって引き起こされる凝集傾向を効果的に抑制する。
さらに,文章の不完全性に対する堅牢性を高めるために,置換不変性と部分完全性に基づく臨床対応型テキスト増強戦略を取り入れた。
CT-RATEデータセットとRad-ChestCTデータセットの大規模な評価は、CA-GCLがゼロショット異常検出において既存のVLPパラダイムを一貫して上回り、強力なクロスデータセットの一般化を示しながら、優れたパフォーマンスを達成していることを示している。
重要なことは、CA-GCLは様々なプロンプトテンプレート間の性能のばらつきを減らし、崩壊したテキストの類似度分布をベル型の分布に変換する。
以上の結果から,CA-GCLは堅牢な3次元医用画像理解の有効な枠組みであると考えられた。
関連論文リスト
- CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis [0.4551615447454768]
ワイヤレスカプセル内視鏡(WCE)は小腸の非侵襲的視覚的評価を可能にする。
WCEの既存の学習ベースのアプローチは主に視覚のみであり、しばしば狭い病理セットに限られる。
本稿では,WCEのためのドメイン固有視覚言語表現学習フレームワークであるCapCLIPを紹介する。
論文 参考訳(メタデータ) (2026-05-08T21:14:56Z) - Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification [59.24009931000134]
MVSL(Multi-View Synergistic Learning)は、適応パラダイム、表現の粒度、疾患の意味的関係に対処する統合フレームワークである。
MVSLは、視覚的およびテキスト的エンコーダの適応を分離し、それぞれの表現特性を尊重する。
さらに、グローバルなイメージセマンティクスと局所的な病変レベルの証拠の両方を明示的にモデル化するために、多粒性コントラスト学習を導入する。
MVSLは、いくつかのショットとゼロショットの分類設定において、最先端のメソッドを一貫して上回る。
論文 参考訳(メタデータ) (2026-04-27T02:41:27Z) - OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis [53.01523944168442]
臨床解釈はスライス駆動の局所特徴と体積駆動の空間表現の両方に依存している。
既存のLVLM(Large Vision-Language Models)は、CTスライスとボリューム理解で断片化されている。
我々は,CTシナリオのための強力な統合スライスボリュームLVLMであるOmniCTを提案する。
論文 参考訳(メタデータ) (2026-02-18T00:42:41Z) - GCA-ResUNet: Medical Image Segmentation Using Grouped Coordinate Attention [3.6679095759171645]
GCA-ResUNetは、軽量でプラグ&プレイのGrouped Coordinate Attention (GCA)モジュールを備えた効率的な医用画像セグメンテーションフレームワークである。
Synapse と ACDC の2つの広く使われているベンチマークによる大規模な実験では、それぞれ GCA-ResUNet が 86.11% と 92.64% のDice のスコアを達成している。
論文 参考訳(メタデータ) (2025-12-30T05:13:20Z) - Curvilinear Structure-preserving Unpaired Cross-domain Medical Image Translation [29.978321741632197]
画像から画像への翻訳の欠如は, 医用画像の撮影において重要な技術である。
既存のアプローチは、しばしば微小血管のような微細な曲線構造を歪ませる。
本稿では,不対翻訳中の微細な曲線構造を明示的に保存するフレームワークであるCurvilinear Structure-Reserving Translation (CST)を提案する。
論文 参考訳(メタデータ) (2025-10-22T15:24:32Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Prompt-Guided Patch UNet-VAE with Adversarial Supervision for Adrenal Gland Segmentation in Computed Tomography Medical Images [0.3437656066916039]
CT画像における副腎などの小さな腹部臓器は、厳密な階級不均衡、空間的状況の悪化、限られた注釈付きデータによる永続的な課題である。
本稿では,これらの制約を原則的かつスケーラブルに対処するために,変分再構成,教師付きセグメンテーション,および逆パッチベースのフィードバックを組み合わせた統合フレームワークを提案する。
本研究は,小組織セグメンテーションにおけるハイブリッド世代別訓練体制の有効性を明らかにするとともに,データ共有シナリオにおける現実性,多様性,解剖学的整合性のバランスに関する新たな知見を提供する。
論文 参考訳(メタデータ) (2025-09-03T10:18:06Z) - Reliable Joint Segmentation of Retinal Edema Lesions in OCT Images [55.83984261827332]
本稿では,信頼性の高いマルチスケールウェーブレットエンハンストランスネットワークを提案する。
本研究では,ウェーブレット型特徴抽出器ネットワークとマルチスケール変圧器モジュールを統合したセグメンテーションバックボーンを開発した。
提案手法は,他の最先端セグメンテーション手法と比較して信頼性の高いセグメンテーション精度を実現する。
論文 参考訳(メタデータ) (2022-12-01T07:32:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。