論文の概要: Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis
- arxiv url: http://arxiv.org/abs/2608.03225v1
- Date: Tue, 04 Aug 2026 06:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.068455
- Title: Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis
- Title(参考訳): クロスサイト解釈型皮膚科画像診断のためのオープン言語概念統一学習
- Authors: Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng,
- Abstract要約: 人間解釈型コンピュータ支援診断は臨床的意思決定に不可欠である。
さまざまなモダリティに概念ベースのモデルを適用することは、コホートを越えた可用性、粒度、セマンティクスの異なる異種の概念のため、難しい。
マルチモーダル・インタプリタブル・ビジョン言語診断のためのオープン言語統合型概念学習フレームワークUniConを提案する。
- 参考スコア(独自算出の注目度): 27.376170530265295
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-interpretable computer-aided diagnosis is crucial for clinical decision making. Concept-based models excel by providing transparent reasoning and enabling post-hoc, clinician-in-the-loop interventions. However, their rigid dataset-specific adaptation inherently restricts cross-site generalization. Applying them across diverse modalities, such as dermoscopic and clinical photographs, is challenging due to heterogeneous concept taxonomies varying in availability, granularity, and semantics across cohorts. Consequently, adapting Foundation Vision-Language Models (FVLMs) demands costly label engineering and repeated post-training. Existing intervention mechanisms remain rigidly tied to predefined concepts, lacking adaptability and hindering scalable dermatology CAD deployment. To address these bottlenecks, we propose UniCon, an open-linguistic unified concept learning framework for multimodal interpretable vision-language diagnosis. UniCon resolves these challenges through three contributions: (1) A shared semantic representation space via a unified concept prototype codebook, seamlessly coordinating heterogeneous concept systems across modalities without dataset-specific retraining. (2) Open-linguistic based multi-faceted semantic specifications to overcome sparse textual label limitations, improving boundary sensitivity in uncertain clinical contexts. (3) A robust, cross-site adjustable intervention interface powered by reliability-gated bottleneck aggregation, enabling consistent reasoning and transferable clinician corrections. Extensive experiments demonstrate that beyond securing top-tier diagnostic accuracy, UniCon successfully bridges disparate clinical taxonomies, unlocking unprecedented cross-site intervention capabilities. Code is available at https://github.com/wuchengyu123/UniCon.
- Abstract(参考訳): 人間解釈型コンピュータ支援診断は臨床的意思決定に不可欠である。
概念に基づくモデルは、透明な推論を提供し、ホック後のクリニアン・イン・ザ・ループの介入を可能にすることで優れている。
しかし、その厳密なデータセット固有の適応は本質的にクロスサイト一般化を制限する。
皮膚内視鏡写真や臨床写真などの多彩なモダリティに応用することは、コホートにまたがる可利用性、粒度、意味の異なる異質な概念の分類が原因で困難である。
その結果、ファンデーション・ビジョン・ランゲージ・モデル(FVLM)の適用には、高価なラベルのエンジニアリングと繰り返しのポストトレーニングが必要である。
既存の介入メカニズムは、事前定義された概念と厳密に結びついており、適応性に欠け、スケーラブルな皮膚科CADの展開を妨げる。
これらのボトルネックに対処するため,マルチモーダル解釈型視覚言語診断のためのオープン言語統合型概念学習フレームワークUniConを提案する。
統一されたコンセプトのプロトタイプコードブックを通じて共有セマンティックな表現空間を設計し、データセット固有のリトレーニングなしでモジュール間のシームレスに異種の概念システムをコーディネートする。
2) オープン言語に基づく多面的セマンティック仕様は, テキストラベルの少ない制限を克服し, 不確実な臨床文脈における境界感度を向上させる。
(3)信頼性を付与したボトルネックアグリゲーションによる堅牢でクロスサイト調整可能な介入インタフェースにより、一貫した推論と転送可能なクリニック修正が可能となる。
広範囲にわたる実験は、最上位の診断精度の確保を超えて、UniConが異なる臨床分類学を橋渡しし、前例のないクロスサイト介入能力を解き放つことを実証している。
コードはhttps://github.com/wuchengyu123/UniConで入手できる。
関連論文リスト
- ConceptM$^3$oE: Concept-Guided Multimodal Mixture of Experts for Interpretable Computational Pathology [33.27476666910628]
ConceptM$3$oEは、Interaction-Aware Mixed-of-expertsパスに直接概念形成を組み込む。
このアーキテクチャは、エビデンスをモダリティ固有の、冗長で、シナジスティックな専門家に分解し、その後、構造化された概念ボトルネックに投影する。
データ制限付きレシエーションでは、ConceptM$3$oEはデータ制限性能を改善し、小さなトレーニングサイズでマクロF1を56.41%から66.70%に向上させた。
論文 参考訳(メタデータ) (2026-05-23T04:55:16Z) - DCG-Net: Dual Cross-Attention with Concept-Value Graph Reasoning for Interpretable Medical Diagnosis [14.035057926904559]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の解釈可能な臨床概念による構造予測である。
既存のCBMは、コンセプト間のコンテキスト依存を概ね見落としている。
本稿では,マルチモーダルアライメントと構造化概念推論を統合した,エンドツーエンドの解釈可能なフレームワークであるemphDCG-Netを提案する。
論文 参考訳(メタデータ) (2026-03-20T01:11:58Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging [67.74482877175797]
MIRNetは、自己教師付き事前学習と制約付きグラフベースの推論を統合する新しいフレームワークである。
TongueAtlas-4Kは,22の診断ラベルを付した4,000枚の画像からなるベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T06:30:41Z) - Interpretable Neuropsychiatric Diagnosis via Concept-Guided Graph Neural Networks [56.75602443936853]
青少年の5人に1人は、不安、うつ病、行動障害などの精神状態または行動の健康状態と診断されている。
従来の研究では、障害予測にグラフニューラルネットワーク(GNN)アプローチを使用していたが、ブラックボックスのままであり、信頼性と臨床翻訳を制限している。
本研究では,解釈可能な機能接続の概念を符号化する概念に基づく診断フレームワークを提案する。
我々の設計は臨床的に意味のある接続パターンを通じて予測を保証し、解釈可能性と強い予測性能の両方を可能にする。
論文 参考訳(メタデータ) (2025-10-02T19:38:46Z) - RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis [56.373297358647655]
Retrieval-Augmented Diagnosis (RAD)は、下流タスクで直接マルチモーダルモデルに外部知識を注入する新しいフレームワークである。
RADは、複数の医療ソースからの疾患中心の知識の検索と改善、ガイドライン強化コントラスト損失トランスフォーマー、デュアルデコーダの3つの主要なメカニズムで機能する。
論文 参考訳(メタデータ) (2025-09-24T10:36:14Z) - Towards generating more interpretable counterfactuals via concept vectors: a preliminary study on chest X-rays [46.667021835430155]
我々は、臨床概念を生成モデルの潜在空間にマッピングし、概念活性化ベクトル(CAV)を同定する。
抽出された概念はデータセット全体にわたって安定しており、臨床的に関連する特徴を強調する視覚的説明を可能にする。
胸部X線検査の予備的結果から, 胸部X線検査は, 心筋症などの大きな病態を呈するが, より小さな病態はいまだに困難である。
論文 参考訳(メタデータ) (2025-06-04T15:23:12Z) - A Two-Step Concept-Based Approach for Enhanced Interpretability and Trust in Skin Lesion Diagnosis [6.6635650150737815]
概念ボトルネックモデル (Concept Bottleneck Models, CBM) は、人間の理解できない概念のセットに対する最終疾患予測を制約することにより、固有の解釈可能性を提供する。
これらの課題に対処する新しい2段階の方法論を導入する。
CBMの2段階をシミュレートすることにより,臨床概念を自動予測する事前訓練型視覚言語モデル(VLM)と,外来型大規模言語モデル(LLM)を用いて疾患診断を行う。
論文 参考訳(メタデータ) (2024-11-08T14:52:42Z) - Robust and Interpretable Medical Image Classifiers via Concept
Bottleneck Models [49.95603725998561]
本稿では,自然言語の概念を用いた堅牢で解釈可能な医用画像分類器を構築するための新しいパラダイムを提案する。
具体的には、まず臨床概念をGPT-4から検索し、次に視覚言語モデルを用いて潜在画像の特徴を明示的な概念に変換する。
論文 参考訳(メタデータ) (2023-10-04T21:57:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。