論文の概要: Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Localization
- arxiv url: http://arxiv.org/abs/2608.09801v1
- Date: Mon, 10 Aug 2026 16:22:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.38355
- Title: Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Localization
- Title(参考訳): マンモグラフィ分類と病変局所化のためのマルチタスクDETRの改良
- Abstract要約: マンモグラフィにおける統合検査レベルの予測と候補領域のローカライゼーションにより,AIサポートの有用性が向上する可能性がある。
画像レベルの悪性度予測と病変局所化の両方をサポートする多タスクDETRフレームワークを用いて,この設定について検討する。
現代のバックボーンは、ConvNeXtV2とDINOv3で、古いResNetスタイルの機能を一貫して上回った。
- 参考スコア(独自算出の注目度): 0.6982666633050445
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Joint exam-level prediction and candidate-region localization may improve the usefulness of AI support in mammography. We study this setting using a multi-task DETR framework, where shared representations support both image-level malignancy prediction and lesion localization, and evaluate its performance on OPTIMAM and a biopsy-confirmed SGM1k cohort. Across both datasets, modern backbones consistently outperformed older ResNet-style features, with ConvNeXtV2 and DINOv3 giving the strongest overall results, whereas MambaVision was less competitive. On OPTIMAM, ConvNeXtV2 achieved the best overall performance, reaching 97.96% AUC, 99.89% sensitivity, 25.08% mAP@.5, and 74.38% recall@.25. On SGM1k, DINOv3 gave the strongest overall results, with 90.97% AUC, 86.28% sensitivity, 82.00% specificity, 27.04% mAP@.5, and 77.32% recall@.25. These findings suggest that backbone quality is a critical factor in effective multi-task mammography, with ConvNeXtV2 emerging as a particularly strong and well-matched CNN backbone for mammography in this framework.
- Abstract(参考訳): マンモグラフィにおける統合検査レベルの予測と候補領域のローカライゼーションにより,AIサポートの有用性が向上する可能性がある。
画像レベルの悪性度予測と病変局所化の両方をサポートする多タスクDETRフレームワークを用いてこの設定を検討し,OPTIMAMと生検確認SGM1kコホートの性能評価を行った。
両方のデータセット全体で、現代のバックボーンは、ConvNeXtV2とDINOv3が最強の総合結果を与えるのに対して、MambaVisionは競争力の低い古いResNetスタイルの機能を一貫して上回った。
OPTIMAMでは、ConvNeXtV2が97.96%のAUC、99.89%の感度、25.08%のmAP@.5、74.38%のリコール@.25に到達した。
SGM1kでは、DINOv3が90.97%のAUC、86.28%の感度、82.00%の特異性、27.04%のmAP@.5、77.32%のリコール@.25という最強の総合的な結果を得た。
以上の結果から, バックボーンの品質はマルチタスク・マンモグラフィーにおいて重要な因子であり, ConvNeXtV2はマンモグラフィーにおいて特に強く, 適合したCNNバックボーンとして出現することが示唆された。
関連論文リスト
- Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening [0.0]
我々は、畳み込みニューラルネットワーク、ビジョントランスフォーマー、ハイブリッドCNN変換器バックボーン、ビジョン言語モデルという、4つのモデルファミリにまたがる12のアーキテクチャをベンチマークした。
網膜疾患に対するバイナリスクリーニングと,28の疾患クラスにまたがる多ラベル分類の2つの課題について検討した。
SwinTinyとCoAtNet0とMaxViTTinyのハイブリッドモデルは、最強のバイナリスクリーニング結果を実現し、マルチラベル設定におけるマクロおよびマイクロF1を改善する。
論文 参考訳(メタデータ) (2026-05-25T19:09:35Z) - Brain Tumor Classification in MRI Images: A Computationally Efficient Convolutional Neural Network [0.0]
マルチクラス脳腫瘍分類のための軽量かつ高性能な畳み込みニューラルネットワーク(CNN)を提案する。
このモデルは、FigshareとKaggleの2つの公開データセットで厳格に評価された。
提案手法は計算オーバーヘッドを減らし,優れた性能を示した。
論文 参考訳(メタデータ) (2026-05-11T21:39:24Z) - Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction [0.0]
マスク付き視覚言語学習に目標を明示的に組み込んだ自己教師型事前学習フレームワークであるRobust Multi-Modal Masked Reconstruction (Robust-MMR)を提案する。
VQA-RAD, クロスドメイン画像テキスト分類 (MELINDA), 堅牢画像キャプチャ検索 (ROCO) などである。
以上の結果から,事前トレーニング中にロバスト性を明確にモデル化することで,実世界展開における医療ビジョン言語表現の信頼性が向上することが示された。
論文 参考訳(メタデータ) (2026-02-06T01:20:56Z) - SAMM2D: Scale-Aware Multi-Modal 2D Dual-Encoder for High-Sensitivity Intracrania Aneurysm Screening [0.0]
本稿では,RSNAの頭蓋内動脈瘤データセット上でAUC0.686を達成するデュアルエンコーダフレームワークであるSAMM2Dを紹介する。
以上の結果から,将来の医療画像は,より複雑な拡張パイプラインよりも,強い事前訓練の恩恵を受ける可能性が示唆された。
論文 参考訳(メタデータ) (2025-12-20T01:44:30Z) - Comparative Study of UNet-based Architectures for Liver Tumor Segmentation in Multi-Phase Contrast-Enhanced Computed Tomography [0.0]
肝腫瘍セグメンテーションのためのUNetアーキテクチャの性能について検討した。
驚くべきことに、モダンアーキテクチャの進歩にもかかわらず、ResNetベースのモデルはTransformerとMambaベースの代替品を一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-29T13:46:19Z) - DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights [54.87947751720332]
脳腫瘍の正確なセグメンテーションは、臨床診断と治療に重要である。
マンバを拠点とするState Space Modelsは、有望なパフォーマンスを示している。
本稿では,計算オーバーヘッドを最小限に抑えながら,マルチスケールの長距離依存関係をキャプチャするマルチ解像度双方向マンバを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:31:21Z) - AXIAL: Attention-based eXplainability for Interpretable Alzheimer's Localized Diagnosis using 2D CNNs on 3D MRI brain scans [43.06293430764841]
本研究では,3次元MRIを用いたアルツハイマー病診断の革新的手法を提案する。
提案手法では,2次元CNNがボリューム表現を抽出できるソフトアテンション機構を採用している。
ボクセルレベルの精度では、どの領域に注意が払われているかを同定し、これらの支配的な脳領域を同定する。
論文 参考訳(メタデータ) (2024-07-02T16:44:00Z) - Breast Ultrasound Tumor Classification Using a Hybrid Multitask
CNN-Transformer Network [63.845552349914186]
胸部超音波(BUS)画像分類において,グローバルな文脈情報の収集が重要な役割を担っている。
ビジョントランスフォーマーは、グローバルなコンテキスト情報をキャプチャする能力が改善されているが、トークン化操作によって局所的なイメージパターンを歪めてしまう可能性がある。
本研究では,BUS腫瘍分類とセグメンテーションを行うハイブリッドマルチタスクディープニューラルネットワークであるHybrid-MT-ESTANを提案する。
論文 参考訳(メタデータ) (2023-08-04T01:19:32Z) - EMT-NET: Efficient multitask network for computer-aided diagnosis of
breast cancer [58.720142291102135]
乳腺腫瘍の分類と分別を同時に行うための,効率的で軽量な学習アーキテクチャを提案する。
腫瘍分類ネットワークにセグメンテーションタスクを組み込むことにより,腫瘍領域に着目したバックボーンネットワークで表現を学習する。
腫瘍分類の精度、感度、特異性はそれぞれ88.6%、94.1%、85.3%である。
論文 参考訳(メタデータ) (2022-01-13T05:24:40Z) - Vision Transformers for femur fracture classification [59.99241204074268]
Vision Transformer (ViT) はテスト画像の83%を正確に予測することができた。
史上最大かつ最もリッチなデータセットを持つサブフラクチャーで良い結果が得られた。
論文 参考訳(メタデータ) (2021-08-07T10:12:42Z) - CovidDeep: SARS-CoV-2/COVID-19 Test Based on Wearable Medical Sensors
and Efficient Neural Networks [51.589769497681175]
新型コロナウイルス(SARS-CoV-2)がパンデミックを引き起こしている。
SARS-CoV-2の逆転写-ポリメラーゼ連鎖反応に基づく現在の試験体制は、試験要求に追いついていない。
我々は,効率的なDNNと市販のWMSを組み合わせたCovidDeepというフレームワークを提案する。
論文 参考訳(メタデータ) (2020-07-20T21:47:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。