論文の概要: Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy
- arxiv url: http://arxiv.org/abs/2607.09135v1
- Date: Fri, 10 Jul 2026 06:47:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.801223
- Title: Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy
- Title(参考訳): スーパージェネラリスト:ジェネラリストとスペシャリストのシナジーによる総合的・正確な医用画像理解を目指して
- Authors: Shaoteng Zhang, Weiwei Cao, Wanxing Chang, Yutong Xie, Kai Cao, Zaiyi Liu, Yu Shi, Tingbo Liang, Qi Zhang, Ling Zhang, Yong Xia, Jianpeng Zhang,
- Abstract要約: SuGは、視覚言語学習を専門的な目的と統合するスーパージェネリストフレームワークである。
複数のセグメンテーションの専門家の空間的事前情報を組み込むことにより、SuGの専門的な視覚言語アライメントを行う。
我々は,CT-RATE,Merlin,MedVL-CT69K,およびいくつかの社内腫瘍データセットを含む,広範囲な胸部CTおよび腹部CTでSuGを評価した。
- 参考スコア(独自算出の注目度): 26.735307902248266
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical images require comprehensive and accurate interpretation to support the diagnosis of diverse clincial conditions. Recent vision-language generalist models offer broad task coverage and promising zero-shot capabilities, yet often lack fine-grained anatomical and lesion awareness for reliable diagnosis and spatial interpretability. In contrast, supervised specialist models achieve strong performance on specific tasks but typically lack generalization across diseases and anatomies. In this work, we present SuG, a Super-Generalist framework that unifies generalist vision-language learning with specialist objectives, enabling both broad generalization and specialist-level diagnostic capability. We perform specialist-enhanced vision-language alignment in SuG by incorporating spatial priors from multiple segmentation experts, including anatomy, class-specific lesion and class-agnostic lesion segmentors that captures lesions beyond anatomies annotated during training. To improve lesion grounding capability, we leverage lesion masks as spatial priors to calibrate text-conditioned visual attention, encouraging disease-related semantics to focus on clinically relevant regions. We evaluate SuG on extensive chest and abdominal CT benchmarks, including CT-RATE, Merlin, MedVL-CT69K, and several in-house tumor datasets. SuG achieves state-of-the-art performance across a wide range of disease diagnosis tasks and surpasses specialist models on several critical tumor diagnosis benchmarks. Furthermore, SuG demonstrates strong lesion grounding capability, including robust generalization to lesion types lacking class-specific supervision.
- Abstract(参考訳): 医学画像は、様々な盲腸疾患の診断を支援するために、包括的かつ正確な解釈を必要とする。
最近の視覚言語ジェネラリストモデルは、広範囲なタスクカバレッジとゼロショット能力を提供するが、信頼性の高い診断と空間的解釈性のために、微細な解剖学的および病変の認識を欠いていることが多い。
対照的に、教師付きスペシャリストモデルは特定のタスクにおいて強いパフォーマンスを達成するが、典型的には病気や解剖学全体にわたる一般化を欠いている。
本研究では,汎用的な視覚言語学習と専門的目的を一体化し,広範な一般化と専門レベルの診断能力を両立するスーパージェネリストフレームワークSuGを提案する。
我々は, 解剖学, クラス特異的病変, および, 訓練中にアノテートされた解剖以外の病変を捕捉するクラス非依存病変のセグメンタを含む, 複数のセグメンテーション専門家の空間的先行を組み込むことにより, SuGの専門的な視覚言語アライメントを行う。
病変の接地能力を向上させるために,病変マスクを空間的先行として活用し,テキスト条件の視覚的注意を校正し,疾患関連意味論を臨床関連領域に焦点を合わせるよう奨励する。
我々は,CT-RATE,Merlin,MedVL-CT69K,およびいくつかの社内腫瘍データセットを含む,広範囲な胸部CTおよび腹部CTでSuGを評価した。
SuGは、幅広い疾患診断タスクで最先端のパフォーマンスを達成し、いくつかの重要な腫瘍診断ベンチマークのスペシャリストモデルを上回っている。
さらに、SuGは、クラス固有の監督を欠く病変タイプへの堅牢な一般化を含む、強い病変の接地能力を示す。
関連論文リスト
- Rad-VLSM: A Cross-Modal Framework with Semantics-Assisted Prompting for Medical Segmentation and Diagnosis [8.57681725607293]
Rad-VLSMはセマンティクス支援病変焦点と堅牢なセグメンテーションのための2段階のクロスモーダルフレームワークである。
Rad-VLSMは、直接予測ではなく、意味情報を用いて、テキストから診断への依存を減らし、病変レベルの証拠を診断する。
論文 参考訳(メタデータ) (2026-05-18T09:35:26Z) - OrthoDiffusion: A Generalizable Multi-Task Diffusion Foundation Model for Musculoskeletal MRI Interpretation [36.4629764779715]
筋骨格障害は、世界的な健康上の重荷であり、世界中の障害の主要な原因である。
マルチタスク筋骨格MRIの解釈のために設計された統合拡散基盤モデルOrthoDiffusionを開発した。
このフレームワークは、3つの方向特異的な3D拡散モデルを利用しており、15,948個のラベルのない膝MRIスキャンで自己指導的に事前訓練されている。
論文 参考訳(メタデータ) (2026-02-24T10:29:10Z) - Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation [12.39187443971813]
マルチスケール情報を含む視覚言語モデルAnatomy-VLMを紹介する。
まず、医用画像全体から重要な解剖学的特徴をローカライズするモデルエンコーダを設計する。
第二に、これらの領域は文脈認識解釈のための構造化された知識に富んでいる。
第3に、モデルエンコーダは、多スケールの医療情報を整列して、臨床的に解釈可能な疾患予測を生成する。
論文 参考訳(メタデータ) (2025-11-11T16:18:01Z) - From Generic to Specialized: A Subspecialty Diagnostic System Powered by Self-Supervised Learning for Cervical Histopathology [29.378512559906977]
本稿では,Cervical Sub-Path (CerS-Path) 診断システムについて紹介する。
11万のスライドから1億9000万の組織パッチを自己教師付きで学習し、頸部特異的な特徴抽出装置を構築する。
250万のイメージテキストペアによるマルチモーダルエンハンスメント、続いて複数の下流診断機能との統合。
論文 参考訳(メタデータ) (2025-10-11T12:22:35Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation [56.52520416420957]
医用画像セグメンテーションにおける領域一般化に取り組むために, MCDRL(Multimodal Causal-Driven Representation Learning)を提案する。
MCDRLは競合する手法より一貫して優れ、セグメンテーション精度が優れ、堅牢な一般化性を示す。
論文 参考訳(メタデータ) (2025-08-07T03:41:41Z) - Potential of Multimodal Large Language Models for Data Mining of Medical Images and Free-text Reports [51.45762396192655]
特にGemini-Vision-Series (Gemini) と GPT-4-Series (GPT-4) は、コンピュータビジョンのための人工知能のパラダイムシフトを象徴している。
本研究は,14の医用画像データセットを対象に,Gemini,GPT-4,および4つの一般的な大規模モデルの性能評価を行った。
論文 参考訳(メタデータ) (2024-07-08T09:08:42Z) - Semantics-Aware Attention Guidance for Diagnosing Whole Slide Images [5.856390270089738]
我々はSemantics-Aware Attention Guidance(SAG)という新しいフレームワークを紹介する。
SAGは,1) 診断関連エンティティを注意信号に変換する技術,2) 意味的に重要な情報を効率的に統合する柔軟な注意損失を含む。
2つの異なるがんデータセットに対する実験は、精度、精度、リコールにおいて一貫した改善を示す。
論文 参考訳(メタデータ) (2024-04-16T20:37:14Z) - Spectral-Spatial Recurrent-Convolutional Networks for In-Vivo
Hyperspectral Tumor Type Classification [49.32653090178743]
ハイパースペクトル画像とディープラーニングを用いたin-vivo腫瘍型分類の可能性を示した。
我々の最良のモデルは76.3%のAUCを達成し、従来の学習手法とディープラーニング手法を著しく上回っている。
論文 参考訳(メタデータ) (2020-07-02T12:00:53Z) - Spatio-spectral deep learning methods for in-vivo hyperspectral
laryngeal cancer detection [49.32653090178743]
頭頸部腫瘍の早期発見は患者の生存に不可欠である。
ハイパースペクトルイメージング(HSI)は頭頸部腫瘍の非侵襲的検出に用いられる。
HSIに基づく喉頭癌診断のための複数の深層学習手法を提案する。
論文 参考訳(メタデータ) (2020-04-21T17:07:18Z) - Weakly supervised multiple instance learning histopathological tumor
segmentation [51.085268272912415]
スライド画像全体のセグメント化のための弱教師付きフレームワークを提案する。
トレーニングモデルに複数のインスタンス学習スキームを利用する。
提案するフレームワークは,The Cancer Genome AtlasとPatchCamelyonデータセットのマルチロケーションとマルチ中心公開データに基づいて評価されている。
論文 参考訳(メタデータ) (2020-04-10T13:12:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。