論文の概要: HyFormer-Net: A Synergistic CNN-Transformer with Interpretable Multi-Scale Fusion for Breast Lesion Segmentation and Classification in Ultrasound Images
- arxiv url: http://arxiv.org/abs/2511.01013v1
- Date: Sun, 02 Nov 2025 17:06:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-05 16:37:27.026573
- Title: HyFormer-Net: A Synergistic CNN-Transformer with Interpretable Multi-Scale Fusion for Breast Lesion Segmentation and Classification in Ultrasound Images
- Title(参考訳): HyFormer-Net:乳房病変の分割と超音波画像の分類のための解釈可能な多スケール核融合を用いた相乗的CNN変換器
- Abstract要約: HyFormer-Netは、本質的に解釈可能な同時セグメンテーションと分類のためのハイブリッドCNN変換器である。
BUSIデータセットでは、HyFormer-NetがDice Score 0.761 +/-0.072と精度93.2%を獲得し、U-Net、Attention U-Net、TransUNetを上回っている。
乳房超音波におけるハイブリッドCNN変換器のクロスデータセット一般化研究を初めて行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: B-mode ultrasound for breast cancer diagnosis faces challenges: speckle, operator dependency, and indistinct boundaries. Existing deep learning suffers from single-task learning, architectural constraints (CNNs lack global context, Transformers local features), and black-box decision-making. These gaps hinder clinical adoption. We propose HyFormer-Net, a hybrid CNN-Transformer for simultaneous segmentation and classification with intrinsic interpretability. Its dual-branch encoder integrates EfficientNet-B3 and Swin Transformer via multi-scale hierarchical fusion blocks. An attention-gated decoder provides precision and explainability. We introduce dual-pipeline interpretability: (1) intrinsic attention validation with quantitative IoU verification (mean: 0.86), and (2) Grad-CAM for classification reasoning. On the BUSI dataset, HyFormer-Net achieves Dice Score 0.761 +/- 0.072 and accuracy 93.2%, outperforming U-Net, Attention U-Net, and TransUNet. Malignant Recall of 92.1 +/- 2.2% ensures minimal false negatives. Ensemble modeling yields exceptional Dice 90.2%, accuracy 99.5%, and perfect 100% Malignant Recall, eliminating false negatives. Ablation studies confirm multi-scale fusion contributes +16.8% Dice and attention gates add +5.9%. Crucially, we conduct the first cross-dataset generalization study for hybrid CNN-Transformers in breast ultrasound. Zero-shot transfer fails (Dice: 0.058), confirming domain shift. However, progressive fine-tuning with only 10% target-domain data (68 images) recovers 92.5% performance. With 50% data, our model achieves 77.3% Dice, exceeding source-domain performance (76.1%) and demonstrating true generalization.
- Abstract(参考訳): 乳がん診断のためのBモード超音波は、スペックル、オペレーター依存、不特定境界という課題に直面している。
既存のディープラーニングは、シングルタスクの学習、アーキテクチャ上の制約(CNNにはグローバルなコンテキストがない、トランスフォーマーのローカル機能)、ブラックボックスの意思決定に悩まされている。
これらのギャップは臨床導入を妨げる。
本稿では,HyFormer-NetというハイブリッドCNN変換器を提案する。
デュアルブランチエンコーダはEfficientNet-B3とSwin Transformerをマルチスケール階層型核融合ブロックを介して統合する。
アテンションゲートデコーダは精度と説明性を提供する。
1) 定量的IoU検証(平均0.86)と(2) 分類推論のためのGrad-CAM。
BUSIデータセットでは、HyFormer-NetがDice Score 0.761 +/-0.072と精度93.2%を獲得し、U-Net、Attention U-Net、TransUNetを上回っている。
92.1 +/- 2.2%の悪性リコールは、最小の偽陰性を保証する。
アンサンブル・モデリングは例外的なDice 90.2%、精度99.5%、完璧な100%悪性リコールをもたらし、偽陰性を排除している。
アブレーション研究により、マルチスケール核融合は+16.8%Diceに寄与し、アテンションゲートは+5.9%増加した。
胸部超音波検査におけるハイブリッドCNN変換器のクロスデータセット一般化研究について検討した。
ゼロショット転送は失敗する(Dice:0.058)。
しかし、目標ドメインデータ(68画像)の10%しか持たないプログレッシブ微調整は92.5%のパフォーマンスを回復させる。
50%のデータで77.3%のDiceを実現し、ソースドメイン性能(76.1%)を超え、真の一般化を示した。
関連論文リスト
- Unsupervised Anatomical Feature Learning via Diffusion Models: Enhanced Medical Image Segmentation with Denoising Diffusion Probabilistic Models [0.8590539335179757]
本研究では,非教師付き拡散確率モデル(DDPM)を用いて解剖学的特徴を抽出する手法を提案する。
21個の腹部CTでMDPMを訓練し, エンコーダ重みを下流セグメンテーションタスクに転送する。
拡散に基づく事前訓練にラベルのない画像を使用することで、人間の監督に先立って堅牢な解剖学的特徴を組み込むことに成功した。
論文 参考訳(メタデータ) (2026-08-26T12:10:56Z) - Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention [46.03321798937855]
ドメインシフトの際,GDL(Generalized Dice Loss)が不安定であることを示す。
本稿では,ボトルネック機能を再校正するサブスペース・アウェア・クラス・アテンション(SACA)モジュールを提案し,腫瘍の感度を8%向上させる。
論文 参考訳(メタデータ) (2026-07-23T09:59:30Z) - Cross-Stage Attention Multi-Expert Network for Radiologist-Inspired Breast Ultrasound Diagnosis [6.727825549527392]
本稿では,CSA-MoE-Net(Cross-Stage Attention-of-Experts Network)を提案する。
Cross-Stage Attention-enhanced ResNet-18をバックボーンとして採用し、Cross-Stage Attentionモジュールがマルチレベル機能を適応的に再調整する。
2,129枚の胸部超音波画像のバランスの取れたデータセットの実験では、平均20回の独立ランで96.33%の精度、94.09%の精度、98.53%のリコール、96.25%のF1スコアを達成した。
論文 参考訳(メタデータ) (2026-05-25T07:20:13Z) - HADS-Net:A Hybrid Attention-Augmented Dual-Stream Network with Physics-Informed Augmentation for Breast Ultrasound Image Classification [0.04999814847776097]
HADS-Netはハイブリッドアテンション拡張デュアルストリームネットワークである。
グローバルなテクスチャと2つの平行な経路を通して局所的な境界線を利用する。
精度は96.58%、マクロOC-AUCは0.9978、マクロF1は0.9654、クラスF1スコアは0.970、0.951、0.976である。
論文 参考訳(メタデータ) (2026-05-19T22:16:24Z) - Performance of a Deep Learning-Based Segmentation Model for Pancreatic Tumors on Public Endoscopic Ultrasound Datasets [2.925528117330222]
膵癌は最も攻撃的ながんの1つであり、生存率も低い。
本研究では, 膵腫瘍に対するVision Transformerを用いたディープラーニングセグメンテーションモデルについて検討した。
論文 参考訳(メタデータ) (2026-01-09T16:48:50Z) - Validating Vision Transformers for Otoscopy: Performance and Data-Leakage Effects [42.465094107111646]
本研究では、耳疾患の診断精度を高めるために、視覚トランスモデル、特にスウィントランスモデルの有効性を評価する。
この研究はチリ大学臨床病院の耳鼻咽喉科の実際のデータセットを利用した。
論文 参考訳(メタデータ) (2025-11-06T23:20:37Z) - MSRANetV2: An Explainable Deep Learning Architecture for Multi-class Classification of Colorectal Histopathological Images [3.4859776888706233]
大腸癌(CRC)は、世界中のがん関連死亡率の高い疾患である。
ディープラーニングアルゴリズムは、診断精度と効率を高めるための強力なアプローチとなっている。
大腸組織像の分類に最適化されたMSRANetV2という畳み込みニューラルネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-10-28T07:22:34Z) - Uncertainty-aware Cross-training for Semi-supervised Medical Image Segmentation [45.96892342675963]
半教師型医療画像(UC-Seg)のための不確実性を考慮したクロストレーニングフレームワークを提案する。
本手法は,他の最先端半教師付き手法と比較して,セグメンテーション精度と一般化性能に優れる。
論文 参考訳(メタデータ) (2025-08-12T15:28:10Z) - A Semantic Segmentation Algorithm for Pleural Effusion Based on DBIF-AUNet [22.657295396752023]
胸水セマンティックセグメンテーションは臨床診断と治療の精度とタイムラインを大幅に向上させる可能性がある。
既存の手法は、様々な画像のバリエーションや複雑なエッジに悩まされることが多い。
本稿では,これらの課題に対処するため,Dual-Branch Interactive Fusion Attention Model (DBIF-AUNet)を提案する。
論文 参考訳(メタデータ) (2025-08-08T10:14:51Z) - FUTransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation [0.0]
糖尿病性足潰瘍 (DFUs) の自動分節は, 臨床診断, 治療計画, 縦断的創傷モニタリングにおいて重要な役割を担っている。
従来の畳み込みニューラルネットワーク(CNN)は、強力なローカライゼーション機能を提供するが、長距離空間依存のモデル化に苦慮している。
視覚変換器(ViT)のグローバルアテンション機構をU-Netフレームワークに統合するハイブリッドアーキテクチャであるFUTransUNetを提案する。
論文 参考訳(メタデータ) (2025-08-04T11:05:14Z) - Advanced U-Net Architectures with CNN Backbones for Automated Lung Cancer Detection and Segmentation in Chest CT Images [0.0]
本研究では, 各種畳み込みニューラルネットワーク(CNN)のバックボーンと統合したU-Netアーキテクチャの有効性について検討し, 胸部CT画像における肺がんの自動検出とセグメンテーションについて検討した。
U-Netモデルは3つのCNNバックボーン(ResNet50、VGG16、Xception)で開発された。
分類において、U-Net with Xceptionを用いたCNNモデルは99.1%の精度、99.74パーセントのリコール、99.42パーセントのF1スコアを達成した。
論文 参考訳(メタデータ) (2025-07-14T04:08:33Z) - Breast Ultrasound Tumor Classification Using a Hybrid Multitask
CNN-Transformer Network [63.845552349914186]
胸部超音波(BUS)画像分類において,グローバルな文脈情報の収集が重要な役割を担っている。
ビジョントランスフォーマーは、グローバルなコンテキスト情報をキャプチャする能力が改善されているが、トークン化操作によって局所的なイメージパターンを歪めてしまう可能性がある。
本研究では,BUS腫瘍分類とセグメンテーションを行うハイブリッドマルチタスクディープニューラルネットワークであるHybrid-MT-ESTANを提案する。
論文 参考訳(メタデータ) (2023-08-04T01:19:32Z) - Scaling Up 3D Kernels with Bayesian Frequency Re-parameterization for
Medical Image Segmentation [25.62587471067468]
RepUX-Netは、単純な大きなカーネルブロック設計を持つ純粋なCNNアーキテクチャである。
人間の視覚系における空間周波数にインスパイアされ、カーネル収束を要素的設定に変化させるよう拡張する。
論文 参考訳(メタデータ) (2023-03-10T08:38:34Z) - Hybrid Window Attention Based Transformer Architecture for Brain Tumor
Segmentation [28.650980942429726]
細かな特徴を抽出するための2つのウィンドウ化戦略に従うボリューム視覚変換器を提案する。
FeTS Challenge 2022データセット上で,ネットワークアーキテクチャをトレーニングし,評価した。
オンライン検証データセットのパフォーマンスは以下の通りである。 Dice similarity Score of 81.71%, 91.38%, 85.40%。
論文 参考訳(メタデータ) (2022-09-16T03:55:48Z) - Automated Pulmonary Embolism Detection from CTPA Images Using an
End-to-End Convolutional Neural Network [31.58557856188164]
本研究では,肺塞栓症(PE)検出のための終末から終末までトレーニング可能な畳み込みニューラルネットワーク(CNN)を提案する。
本システムでは,0mm,2mm,5mmで1体積あたりの偽陽性が63.2%,78.9%,86.8%であった。
論文 参考訳(メタデータ) (2021-11-10T03:01:55Z) - Vision Transformers for femur fracture classification [59.99241204074268]
Vision Transformer (ViT) はテスト画像の83%を正確に予測することができた。
史上最大かつ最もリッチなデータセットを持つサブフラクチャーで良い結果が得られた。
論文 参考訳(メタデータ) (2021-08-07T10:12:42Z) - D2A U-Net: Automatic Segmentation of COVID-19 Lesions from CT Slices
with Dilated Convolution and Dual Attention Mechanism [9.84838467721235]
拡張型コンボリューションと新しいデュアルアテンション機構に基づくCTスライスにおけるCOVID-19病変セグメンテーションのための拡張型デュアルアテンションU-Net(D2A U-Net)を提案する。
以上の結果から,拡張畳み込みと二重注意機構を導入することにより,偽陽性の数が大幅に減少することが示唆された。
論文 参考訳(メタデータ) (2021-02-10T01:21:59Z) - An Uncertainty-Driven GCN Refinement Strategy for Organ Segmentation [53.425900196763756]
本研究では,不確実性解析とグラフ畳み込みネットワークに基づくセグメンテーション改善手法を提案する。
半教師付きグラフ学習問題を定式化するために、特定の入力ボリュームにおける畳み込みネットワークの不確実性レベルを用いる。
本手法は膵臓で1%,脾臓で2%向上し,最先端のCRF改善法よりも優れていた。
論文 参考訳(メタデータ) (2020-12-06T18:55:07Z) - Classification of COVID-19 in CT Scans using Multi-Source Transfer
Learning [91.3755431537592]
我々は,従来のトランスファー学習の改良にマルチソース・トランスファー・ラーニングを応用して,CTスキャンによる新型コロナウイルスの分類を提案する。
マルチソースファインチューニングアプローチでは、ImageNetで微調整されたベースラインモデルよりも優れています。
我々の最高のパフォーマンスモデルは、0.893の精度と0.897のリコールスコアを達成でき、ベースラインのリコールスコアを9.3%上回った。
論文 参考訳(メタデータ) (2020-09-22T11:53:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。