論文の概要: DALE-CT: Depth-Aware Foundation Models for Computed Tomography
- arxiv url: http://arxiv.org/abs/2606.07775v1
- Date: Fri, 05 Jun 2026 18:39:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.387987
- Title: DALE-CT: Depth-Aware Foundation Models for Computed Tomography
- Title(参考訳): DALE-CT:Depth-Aware Foundation Models for Computed Tomography
- Authors: Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner,
- Abstract要約: 本研究では,2次元スライスアーキテクチャを,ボリュームCTデータ処理のためのネイティブ3次元モデルに代わるフレキシブルな代替品として検討する。
表現の質を高めるため,自動的な解剖マスクと人手による異常の両面から高密度の補助的監視を施した3次元深度対応型事前訓練戦略を開発した。
この性能は最先端の3Dビジョン言語モデルとほぼ同等であり、スクラッチから完全に達成される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent breakthroughs in self-supervised learning (SSL), such as the Latent-Euclidean Joint-Embedding Predictive Architecture (LeJEPA), alongside successes in integrating visual encoders with language models, have driven the demand for adaptable, high-capacity vision encoders in Computed Tomography (CT). In this work, we explore 2D slice-based architectures as a flexible alternative to native 3D models for processing volumetric CT data. Using the CT-RATE dataset, we trained DALE-CT (Depth-Aware Latent-Euclidean Computed Tomography), a 2D model family built entirely from scratch using LeJEPA, and compared its performance against a continually pre-trained DINOv2 baseline. To enhance representation quality, we developed a novel 3D depth-aware pre-training strategy anchored by dense auxiliary supervision from both automated anatomical masks and human-annotated abnormalities. Under linear probe evaluation with Multiple Instance Learning (MIL) for multi-abnormality detection, the frozen backbone of this dual-supervised model (DALE-CT-2S) achieves a Macro AUROC of 0.833. This performance demonstrates near-parity with state-of-the-art 3D vision-language models, achieved entirely from scratch with significantly less data and no textual supervision. To ensure reproducibility, all training code, evaluation scripts, and model weights have been made publicly available.
- Abstract(参考訳): 近年の自己教師型学習(SSL)のブレークスルー、例えばラテン・ユークリッド合同埋め込み予測アーキテクチャ(LeJEPA)は、視覚エンコーダと言語モデルの統合の成功とともに、CT(Computed Tomography)における適応可能で高容量の視覚エンコーダの需要を押し上げている。
本研究では,2次元スライスアーキテクチャを,ボリュームCTデータ処理のためのネイティブ3次元モデルに代わるフレキシブルな代替品として検討する。
CT-RATEデータセットを用いて,LeJEPAを用いてスクラッチから完全に構築された2DモデルであるDALE-CT(Depth-Aware Latent-Euclidean Computed Tomography)を訓練し,その性能を継続的にトレーニングされたDINOv2ベースラインと比較した。
表現の質を高めるため,自動的な解剖マスクと人手による異常の両面から高密度の補助的監視を施した3次元深度対応型事前訓練戦略を開発した。
マルチ異常検出のためのマルチインスタンス学習(MIL)を用いた線形プローブ評価では,この二重教師付きモデル(DALE-CT-2S)の冷凍バックボーンは0.833のマクロAUROCを達成する。
この性能は最先端の3Dビジョン言語モデルとほぼ同等であり、スクラッチから完全に達成される。
再現性を確保するため、すべてのトレーニングコード、評価スクリプト、モデルの重み付けが公開されている。
関連論文リスト
- GauSSmart: Enhanced 3D Reconstruction through 2D Foundation Models and Geometric Filtering [50.675710727721786]
2次元基礎モデルと3次元ガウススプラッティング再構成をブリッジするハイブリッド手法であるGauSSmartを提案する。
提案手法は,凸フィルタリングや意味的特徴監視など,確立した2次元コンピュータビジョン技術を統合している。
GauSSmartは既存のGaussian Splattingよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-10-16T03:38:26Z) - Semi-Supervised 3D Medical Segmentation from 2D Natural Images Pretrained Model [0.8758593614464055]
本稿では,3次元医用画像のセグメンテーションを改善するために,2次元自然画像に事前訓練された一般視覚モデルからの知識の伝達について検討する。
本稿では,2次元事前学習モデルからスクラッチから学習した3次元セグメンテーションモデルまで,段階的に知識を蒸留するモデル非依存フレームワークを提案する。
我々のアプローチであるM&Nは、互いに生成した擬似マスクを用いて2つのモデルの反復的協調学習と、提案した学習率誘導サンプリングを含む。
論文 参考訳(メタデータ) (2025-09-18T17:17:52Z) - UAVTwin: Neural Digital Twins for UAVs using Gaussian Splatting [57.63613048492219]
UAVTwinは,無人航空機(UAV)に埋め込まれた下流モデルの訓練を行うための,実環境からデジタル双生児を作成する方法である。
これは、背景を再構築するための3Dガウススティング(3DGS)と、多様な外観と動作を複数のポーズで表示する制御可能な合成人間モデルを統合することで実現される。
論文 参考訳(メタデータ) (2025-04-02T22:17:30Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - Enhancing Single-Slice Segmentation with 3D-to-2D Unpaired Scan Distillation [21.69523493833432]
本研究では, 事前学習した3次元モデルを用いて, 2次元単一スライスセグメンテーションを向上する新しい3D-to-2D蒸留フレームワークを提案する。
同じデータ入力を必要とする従来の知識蒸留法とは異なり、我々のアプローチでは、2次元の学生モデルをガイドするために、コントラストのない3次元CTスキャンを採用しています。
論文 参考訳(メタデータ) (2024-06-18T04:06:02Z) - Simultaneous Alignment and Surface Regression Using Hybrid 2D-3D
Networks for 3D Coherent Layer Segmentation of Retinal OCT Images with Full
and Sparse Annotations [32.69359482975795]
本研究は, ハイブリッド2D-3D畳み込みニューラルネットワーク(CNN)を基盤として, OCTボリュームから連続した3次元網膜層表面を得るための新しい枠組みを提案する。
人工的データセットと3つのパブリックな臨床データセットの実験により、我々のフレームワークは、潜在的運動補正のためにBスキャンを効果的に調整できることを示した。
論文 参考訳(メタデータ) (2023-12-04T08:32:31Z) - Leveraging Large-Scale Pretrained Vision Foundation Models for
Label-Efficient 3D Point Cloud Segmentation [67.07112533415116]
本稿では3Dポイントクラウドセグメンテーションタスクに様々な基礎モデルを適用する新しいフレームワークを提案する。
我々のアプローチでは、異なる大きな視覚モデルを用いて2次元セマンティックマスクの初期予測を行う。
本研究では,ロバストな3Dセマンティックな擬似ラベルを生成するために,投票による全ての結果を効果的に組み合わせたセマンティックなラベル融合戦略を提案する。
論文 参考訳(メタデータ) (2023-11-03T15:41:15Z) - Interpretable 2D Vision Models for 3D Medical Images [47.75089895500738]
本研究では,3次元画像処理における中間特徴表現を用いた2次元ネットワークの適応手法を提案する。
我々は、ベンチマークとして3D MedMNISTデータセットと、既存の手法に匹敵する数百の高分解能CTまたはMRIスキャンからなる2つの実世界のデータセットを示す。
論文 参考訳(メタデータ) (2023-07-13T08:27:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。