論文の概要: Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks
- arxiv url: http://arxiv.org/abs/2605.18491v1
- Date: Mon, 18 May 2026 14:41:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:49.803059
- Title: Benchmarking transferability of SSL pretraining to same and different modality segmentation tasks
- Title(参考訳): SSLの同一および異なるモダリティセグメンテーションタスクへの事前訓練のベンチマーク化可能性
- Authors: Jue Jiang, Harini Veeraraghavan,
- Abstract要約: SMIT (Self-distilled masked image transformer) は、9つのタスクで最も高いセグメンテーション精度を達成した。
MIMベースのSimMIMと自己蒸留法(DINO, iBOT)は、対照的な学習と回転予測に優れていた。
- 参考スコア(独自算出の注目度): 5.34064424681599
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Methods: Nine SSL methods spanning four pretext-task families were pretrained from scratch using the same 10{,}412 3D CT scans (1.89~M 2D axial slices) covering varied disease sites. The pretrained Swin Transformer encoder from each method was integrated into a SwinUNETR-style segmentation network (Swin encoder with a 3D CNN decoder and skip connections) and fine-tuned on nine public segmentation tasks of varying complexity, including large abdominal organs, head-and-neck structures, and tumors from CT and MRI. Performance was assessed using Dice similarity coefficient (DSC). Fine-tuning convergence speed, transferability across modalities (CT-to-MRI), and feature-reuse patterns between few- and many-shot fine tuning were further analyzed using centered kernel alignment. Results: Self-distilled masked image transformer (SMIT), which combines masked image modeling (MIM) with local and global self-distillation, achieved the highest overall segmentation accuracy across the nine tasks, the fastest fine-tuning convergence, and the smallest few-shot-to-many-shot performance gap, indicating the strongest data efficiency. SMIT also showed the most consistent feature-reuse patterns between few- and many-shot fine tuning. MIM-based SimMIM and self-distillation methods (DINO, iBOT) outperformed contrastive learning and rotation prediction, which rely on image-level global representations. Differences between SSL methods were largest in the few-shot setting and narrowed as the size of the labeled fine-tuning dataset increased, indicating that the choice of SSL pretraining matters most under limited annotation budgets.
- Abstract(参考訳): 方法: 4つのプレテキスト・タスク・ファミリーにまたがる9つのSSL法を10{,}412のCTスキャン(1.89〜M 2D軸スライス)を用いて,スクラッチからプレトレーニングした。
トレーニング済みのSwin TransformerエンコーダはSwinUNETRスタイルのセグメンテーションネットワーク(Swin encoder with a 3D CNN decoder and skip connection)に統合され、大きな腹部臓器、頭頸部構造、CTおよびMRIの腫瘍を含む、複雑さの異なる9つの公的なセグメンテーションタスクに微調整された。
Dice similarity coefficient (DSC) を用いて評価した。
カーネルアライメントを用いて,微調整コンバージェンス速度,CT-to-MRI(CT-to-MRI),および少数・多ショット微調整における特徴再現パターンを解析した。
結果: マスク画像モデリング(MIM)と局所的およびグローバル的自己蒸留を組み合わせた自己蒸留マスク画像トランスフォーマ (SMIT) は,9つのタスクの全体セグメンテーション精度が最も高く, ファインチューニングコンバージェンスが最も高速で, 最少数対多のパフォーマンスギャップを達成し, 最強のデータ効率を示した。
SMITはまた、少数の微調整と多ショットの微調整の間に最も一貫性のある機能再利用パターンを示した。
MIMベースのSimMIMと自己蒸留法(DINO, iBOT)は、画像レベルのグローバル表現に依存する対照的な学習と回転予測に優れていた。
SSLメソッドの違いは、数ショット設定で最大であり、ラベル付き微調整データセットのサイズが大きくなるにつれて縮小され、SSL事前トレーニングの選択は、制限されたアノテーション予算の下で最も重要なものとなった。
関連論文リスト
- Enhanced Masked Image Modeling to Avoid Model Collapse on Multi-modal MRI Datasets [6.3467517115551875]
マスク付き画像モデリング(MIM)は、ラベルなしデータの利用において有望であることを示す。
モデル崩壊を, 完全崩壊と次元崩壊の2つのタイプで解析し, 対処する。
HMPとPBTモジュールを併用した拡張MIM(E-MIM)を構築し,マルチモーダルMRIのモデル崩壊を回避する。
論文 参考訳(メタデータ) (2024-07-15T01:11:30Z) - Swin SMT: Global Sequential Modeling in 3D Medical Image Segmentation [4.915744683251151]
我々は,Swin UNETRに基づく新しいアーキテクチャであるSwin Soft Mixture Transformer (Swin SMT)を紹介する。
このモデルにはSoft Mixture-of-Experts (Soft MoE)が組み込まれており、複雑で多様な長距離依存関係を効果的に扱う。
We evaluate Swin SMT on the public available TotalSegmentator-V2 dataset, including 117 major anatomical structure in WBCT images。
論文 参考訳(メタデータ) (2024-07-10T10:05:22Z) - CIS-UNet: Multi-Class Segmentation of the Aorta in Computed Tomography
Angiography via Context-Aware Shifted Window Self-Attention [10.335899694123711]
大動脈セグメンテーションのためのディープラーニングモデルであるContext Infused Swin-UNet(CIS-UNet)を紹介する。
CIS-UNetは、CNNエンコーダ、対称デコーダ、スキップ接続、新しいコンテキスト対応シフトウィンドウ自己認識(CSW-SA)をボトルネックブロックとする階層型エンコーダデコーダ構造を採用している。
CIS-UNetは,従来のSwinUNetRセグメンテーションモデルよりも優れた平均Dice係数0.713を達成し,コンピュータ断層撮影(CT)の訓練を行った。
論文 参考訳(メタデータ) (2024-01-23T19:17:20Z) - Multi-scale Transformer Network with Edge-aware Pre-training for
Cross-Modality MR Image Synthesis [52.41439725865149]
クロスモダリティ磁気共鳴(MR)画像合成は、与えられたモダリティから欠落するモダリティを生成するために用いられる。
既存の(教師付き学習)手法は、効果的な合成モデルを訓練するために、多くのペア化されたマルチモーダルデータを必要とすることが多い。
マルチスケールトランスフォーマーネットワーク(MT-Net)を提案する。
論文 参考訳(メタデータ) (2022-12-02T11:40:40Z) - Self-supervised 3D anatomy segmentation using self-distilled masked
image transformer (SMIT) [2.7298989068857487]
自己教師型学習は、畳み込みネットワークを用いた医用画像のセグメンテーションに成功している。
我々は、我々のアプローチがより正確で、他のプリテキストタスクよりも微調整データセットを少なくする必要があることを示した。
論文 参考訳(メタデータ) (2022-05-20T17:55:14Z) - Two-Stream Graph Convolutional Network for Intra-oral Scanner Image
Segmentation [133.02190910009384]
本稿では,2ストリームグラフ畳み込みネットワーク(TSGCN)を提案する。
TSGCNは3次元歯(表面)セグメンテーションにおいて最先端の方法よりも優れています。
論文 参考訳(メタデータ) (2022-04-19T10:41:09Z) - Negligible effect of brain MRI data preprocessing for tumor segmentation [36.89606202543839]
我々は3つの公開データセットの実験を行い、ディープニューラルネットワークにおける異なる前処理ステップの効果を評価する。
その結果、最も一般的な標準化手順は、ネットワーク性能に何の価値も与えないことが示されている。
画像の規格化に伴う信号分散の低減のため,画像強度正規化手法はモデル精度に寄与しない。
論文 参考訳(メタデータ) (2022-04-11T17:29:36Z) - Coarse-to-Fine Sparse Transformer for Hyperspectral Image Reconstruction [138.04956118993934]
本稿では, サース・トゥ・ファインス・スパース・トランス (CST) を用いた新しいトランス方式を提案する。
HSI再構成のための深層学習にHSI空間を埋め込んだCST
特に,CSTは,提案したスペクトル認識スクリーニング機構(SASM)を粗いパッチ選択に使用し,選択したパッチを,細かなピクセルクラスタリングと自己相似性キャプチャのために,カスタマイズしたスペクトル集約ハッシュ型マルチヘッド自己アテンション(SAH-MSA)に入力する。
論文 参考訳(メタデータ) (2022-03-09T16:17:47Z) - A Unified Framework for Generalized Low-Shot Medical Image Segmentation
with Scarce Data [24.12765716392381]
距離距離距離距離学習(DML)に基づく医用画像分割の一般化のための統一的枠組みを提案する。
DMLでは,各カテゴリの多モード混合表現を学習し,画素の深層埋め込みとカテゴリ表現との間の余弦距離に基づいて密接な予測を行う。
脳MRIおよび腹部CTデータセットの実験において,提案手法は標準DNN(3D U-Net)法と古典的登録(ANT)法に対して,低ショットセグメンテーションにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2021-10-18T13:01:06Z) - Automatic size and pose homogenization with spatial transformer network
to improve and accelerate pediatric segmentation [51.916106055115755]
空間変換器ネットワーク(STN)を利用することにより、ポーズとスケール不変の新たなCNNアーキテクチャを提案する。
私たちのアーキテクチャは、トレーニング中に一緒に見積もられる3つのシーケンシャルモジュールで構成されています。
腹部CTスキャナーを用いた腎および腎腫瘍の分節法について検討した。
論文 参考訳(メタデータ) (2021-07-06T14:50:03Z) - MetricUNet: Synergistic Image- and Voxel-Level Learning for Precise CT
Prostate Segmentation via Online Sampling [66.01558025094333]
本稿では,前立腺領域を高速に局在させる第1段階と,前立腺領域を正確に区分する第2段階の2段階のフレームワークを提案する。
マルチタスクネットワークにおけるボクセルワイドサンプリングによる新しいオンラインメトリック学習モジュールを提案する。
本手法は,従来のクロスエントロピー学習法やDice損失学習法と比較して,より代表的なボクセルレベルの特徴を効果的に学習することができる。
論文 参考訳(メタデータ) (2020-05-15T10:37:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。