論文の概要: Beyond Classification: Structured Supervision Aligns Visual Evidence with Medical Semantics
- arxiv url: http://arxiv.org/abs/2609.05937v1
- Date: Sat, 05 Sep 2026 07:03:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 12:14:34.371153
- Title: Beyond Classification: Structured Supervision Aligns Visual Evidence with Medical Semantics
- Title(参考訳): 分類を超えて:構造化されたスーパービジョンは、医用セマンティックスで視覚的エビデンスに適応する
- Abstract要約: ヴィジュアルトランスフォーマー(ViT)は医用画像解析において大きな可能性を秘めている。
グローバル画像分類による標準的な事前訓練は、空間的崩壊に悩まされる。
視覚的エビデンスと正確な医学的意味論を整合させるための訓練前パラダイムについて検討する。
- 参考スコア(独自算出の注目度): 7.711063174717135
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Transformers (ViTs) have shown immense potential in medical image analysis. However, standard pre-training via global image classification suffers from spatial collapse, where models rely heavily on background shortcuts rather than localising critical foreground lesions. To overcome this limitation and align visual evidence with precise medical semantics, we systematically investigate alternative pre-training paradigms.Specifically, we evaluate three independent forms of structured supervision: topological priors via graph self-supervision, dense pixel-level constraints via segmentation, and cross-modal semantic grounding via image-text pairs. Notably, our empirical analysis reveals that while all three forms of structured supervision successfully alleviate the global pooling bottleneck and steer visual attention towards foreground regions, image-text alignment achieves the most superior performance. By embedding high-dimensional diagnostic logic, the cross-modal approach not only anchors attention on precise visual evidence but also enables profound abstract reasoning. Extensive experiments demonstrate that this semantically enriched pre-training fundamentally enhances the model's feature representation. Consequently, when fine-tuned for downstream clinical classification tasks, our models achieve superior accuracy and yield highly interpretable attention maps focused on true pathological features, vastly outperforming vanilla classification baselines.
- Abstract(参考訳): ヴィジュアルトランスフォーマー(ViT)は医用画像解析において大きな可能性を秘めている。
しかし、グローバル画像分類による標準的な事前訓練は、重要な前景病変を局所化するのではなく、背景ショートカットに大きく依存する空間的崩壊に悩まされている。
そこで我々は,この制限を克服し,視覚的エビデンスを正確な医学的意味論と整合させるために,新たな事前学習パラダイムを体系的に検討する。特に,グラフによるトポロジカル事前制御,セグメンテーションによる高密度画素レベルの制約,画像テキストペアによるクロスモーダルセマンティックグラウンドディングの3つの独立した形態について検討する。
筆者らの実証分析では,3種類の構造的監視がすべてグローバルプールのボトルネックを緩和し,前景領域に対する視覚的注意を喚起する一方で,画像テキストのアライメントが最も優れたパフォーマンスを実現している。
高次元の診断ロジックを埋め込むことで、クロスモーダルなアプローチは正確な視覚的証拠に注意を向けるだけでなく、深い抽象的推論を可能にする。
広範囲な実験により、この意味的に豊かな事前学習が、モデルの特徴表現を根本的に強化することを示した。
その結果, 下流臨床分類タスクを微調整すると, 精度が向上し, 真の病理的特徴に着目した高度に解釈可能な注意マップが得られ, バニラ分類ベースラインをはるかに上回る結果となった。
関連論文リスト
- EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment [15.371433625713232]
EndoVLMは348K以上の内視鏡検査で事前訓練された新しい視覚言語FMである。
Anatomy-Guided Sparse Poolingメカニズムは、テキスト記述をクエリとして利用してスパース注意を喚起する。
プログレッシブ・セマンティック・アウェア・アライメント・ストラテジー(Progressive Semantic-Aware Alignment Strategy)は、構造化されたソフトターゲットを介して臨床分類(解剖学と病理学)をモデル化する。
Semantic-Concentrated Masked Autoencoderは、これらのセマンティックリッチなフレームにのみ適用され、低レベルの視覚的精度と堅牢な高レベルのセマンティック表現を統合する。
論文 参考訳(メタデータ) (2026-08-05T05:56:41Z) - Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs [53.697403481143404]
LVLM(Large Vision-Language Models)は、医用画像処理タスクにおいて強力なパフォーマンスを実現している。
しかし、実際の不整合、視力の低下、臨床的に有意義なフィードバックによる不一致が続く傾向にある。
論文 参考訳(メタデータ) (2026-06-10T18:35:36Z) - SAIL: Structure-Aware Interpretable Learning for Anatomy-Aligned Post-hoc Explanations in OCT [14.34264989195413]
深層学習(DL)は、OCTベースの網膜疾患検出において専門家レベルの精度を達成したが、その「黒い箱」の性質は、臨床応用の課題となっている。
既存のポストホックな説明可能なAI(XAI)メソッドは、きめ細かい病変構造を規定したり、解剖学的境界を尊重したり、ノイズを抑えるのに苦労することが多い。
本稿では、網膜解剖学の先行情報を表現レベルで統合し、それらを意味的特徴と結合する構造認識解釈学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-04T15:13:47Z) - From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology [9.268389327736735]
臨床的に現実的な数ショット問題として,細粒度糸球体サブタイプをモデル化した。
この条件下では、病理特化モデルと汎用視覚言語モデルの両方を評価する。
論文 参考訳(メタデータ) (2025-11-15T01:44:11Z) - MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging [67.74482877175797]
MIRNetは、自己教師付き事前学習と制約付きグラフベースの推論を統合する新しいフレームワークである。
TongueAtlas-4Kは,22の診断ラベルを付した4,000枚の画像からなるベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T06:30:41Z) - Self-Supervised Anatomical Consistency Learning for Vision-Grounded Medical Report Generation [61.350584471060756]
医用画像の臨床的に正確な記述を作成することを目的とした医用レポート生成。
本稿では, 自己監督型解剖学的一貫性学習(SS-ACL)を提案し, 生成された報告を対応する解剖学的領域と整合させる。
SS-ACLは、ヒト解剖学の不変のトップダウン包摂構造にインスパイアされた階層的な解剖学的グラフを構築する。
論文 参考訳(メタデータ) (2025-09-30T08:59:06Z) - From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation [48.45209969191245]
視覚言語モデル(VLM)は、テキスト記述を通して意味的コンテキストを提供するが、説明精度は欠如している。
本稿では,その補完的強みを活かし,視線と言語指導を統合した教師教育フレームワークを提案する。
本手法は,8.78%,80.53%,84.22%のDiceスコアをそれぞれ達成し,アノテーション負担を増大させることなく視線ベースラインよりも3.5%向上した。
論文 参考訳(メタデータ) (2025-04-15T16:32:15Z) - Rethinking Semi-Supervised Medical Image Segmentation: A
Variance-Reduction Perspective [51.70661197256033]
医用画像セグメンテーションのための階層化グループ理論を用いた半教師付きコントラスト学習フレームワークARCOを提案する。
まず、分散還元推定の概念を用いてARCOを構築することを提案し、特定の分散還元技術が画素/ボクセルレベルのセグメンテーションタスクにおいて特に有用であることを示す。
5つの2D/3D医療データセットと3つのセマンティックセグメンテーションデータセットのラベル設定が異なる8つのベンチマークで、我々のアプローチを実験的に検証する。
論文 参考訳(メタデータ) (2023-02-03T13:50:25Z) - Towards to Robust and Generalized Medical Image Segmentation Framework [17.24628770042803]
本稿では,ロバストな一般化セグメンテーションのための新しい2段階フレームワークを提案する。
特に、教師なしTile-wise AutoEncoder(T-AE)事前学習アーキテクチャは、意味のある表現を学ぶために作成される。
複数の胸部X線データセットに対する肺分画実験を行った。
論文 参考訳(メタデータ) (2021-08-09T05:58:49Z) - Structured Landmark Detection via Topology-Adapting Deep Graph Learning [75.20602712947016]
解剖学的顔と医学的ランドマーク検出のための新しいトポロジ適応深層グラフ学習手法を提案する。
提案手法は局所像特徴と大域形状特徴の両方を利用するグラフ信号を構成する。
3つの公開顔画像データセット(WFLW、300W、COFW-68)と3つの現実世界のX線医学データセット(ケパロメトリ、ハンド、ペルビス)で実験を行った。
論文 参考訳(メタデータ) (2020-04-17T11:55:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。