論文の概要: Extending 2D foundational DINOv3 representations to 3D segmentation of neonatal brain MR images
- arxiv url: http://arxiv.org/abs/2602.23962v1
- Date: Fri, 27 Feb 2026 12:16:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-02 19:48:24.413135
- Title: Extending 2D foundational DINOv3 representations to 3D segmentation of neonatal brain MR images
- Title(参考訳): 新生児脳MR画像における2次元基礎的DINOv3表現の3次元分割への拡張
- Abstract要約: グローバルMRIボリュームは、重複しない3Dウィンドウまたはサブキューブに分解され、それぞれが凍結した高忠実度機能の上に構築された別個のデコードアームを介して処理される。
提案手法は、1つの3Dウィンドウに対してDiceスコア0.65を達成する。
- 参考スコア(独自算出の注目度): 3.186130813218338
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Precise volumetric delineation of hippocampal structures is essential for quantifying neurodevelopmental trajectories in pre-term and term infants, where subtle morphological variations may carry prognostic significance. While foundation encoders trained on large-scale visual data offer discriminative representations, their 2D formulation is a limitation with respect to the $3$D organization of brain anatomy. We propose a volumetric segmentation strategy that reconciles this tension through a structured window-based disassembly-reassembly mechanism: the global MRI volume is decomposed into non-overlapping 3D windows or sub-cubes, each processed via a separate decoding arm built upon frozen high-fidelity features, and subsequently reassembled prior to a ground-truth correspendence using a dense-prediction head. This architecture preserves constant a decoder memory footprint while forcing predictions to lie within an anatomically consistent geometry. Evaluated on the ALBERT dataset for hippocampal segmentation, the proposed approach achieves a Dice score of 0.65 for a single 3D window. The method demonstrates that volumetric anatomical structure could be recovered from frozen 2D foundation representations through structured compositional decoding, and offers a principled and generalizable extension for foundation models for 3D medical applications.
- Abstract(参考訳): 海馬構造物の精密な容積デライン化は、未熟児および長期乳児における神経発達軌跡の定量化に必須であり、微妙な形態学的変化は予後に重要な意味を持つ可能性がある。
大規模な視覚データで訓練された基礎エンコーダは差別的な表現を提供するが、2Dの定式化は脳解剖学の3ドルの組織に対する制限である。
我々は,このテンションを,構造化されたウィンドウベース分解分解機構により再構成するボリュームセグメンテーション戦略を提案する。大域的なMRIボリュームは,非重なり合う3Dウィンドウまたはサブキューブに分解され,それぞれ,凍結した高忠実度特徴の上に構築された別個のデコードアームを介して処理され,その後,高密度予測ヘッドを用いて地表面の相関に先立って再組み立てされる。
このアーキテクチャはデコーダのメモリフットプリントを一定に保ちつつ、予測を解剖学的に一貫した幾何学内に配置させる。
海馬セグメンテーションのためのALBERTデータセットに基づいて、提案手法は単一の3Dウィンドウに対してDiceスコア0.65を達成する。
本手法は, 構造的合成復号により凍結した2次元基礎表現から体積解剖学的構造を復元できることを示し, 3次元医療応用の基礎モデルに対する原理的, 一般化可能な拡張を提供する。
関連論文リスト
- VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis [33.836541706312055]
高忠実度3D MRI合成には、大域的なコヒーレントな解剖学と微細なボクセルレベルの詳細が必要である。
フル解像度MRIボリュームを直接モデル化するボクセル空間フローマッチングフレームワークであるVoxStruct3Dを提案する。
病理学的および健康的なT1強調脳MRIデータセットの実験では、VoxStruct3Dが全体的なパフォーマンスが最も高いことが示されている。
論文 参考訳(メタデータ) (2026-08-05T07:51:35Z) - Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models [8.949206640442354]
本稿では,新しいスライスワイズデータ合成パラダイムを用いて構築した大規模構造化推論データセットを提案する。
放射線技師の真の診断ワークフローに触発されたこのパラダイムは、複雑な3D読み取りプロセスを分解して視覚認知をモデル化する。
この戦略は、計算に高価な3D特化事前学習を必要とせずに、深いボリューム理解と高度に解釈可能な臨床論理を解き放つ。
論文 参考訳(メタデータ) (2026-07-15T14:05:58Z) - Pano3D: Unified 3D Reconstruction and Panoptic Segmentation [68.18993232814061]
統合されたフレームワークで3次元再構成と3次元パノプティクスのセグメンテーションを行う手法を提案する。
既存の3次元再構成モデルを構築し,それをマスクデコーダで拡張する。
提案手法は,ScanNet,ScanNet200,ScanNet++データセット間の3次元パノプティクスセグメンテーションにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-06-12T09:43:13Z) - HyDAR-Pano3D: A Hybrid Disentangled Anatomical Recovery Framework for Panoramic-to-3D Reconstruction [10.481519508246437]
解剖学的回復問題としてPR-CBCT再構成を再構成する2段階フレームワークであるHyDAR-Pano3Dを提案する。
ステージ1では、デュアルエンコーダネットワークがSAM由来のセマンティックプリエントと放射線学的特徴を統合し、アーチ正規化された標準ボリュームを再構築する。
ステージ2では、解剖学的復元ネットワークが事前拘束された構造変形場を予測し、この標準体積をネイティブ空間にマッピングする。
論文 参考訳(メタデータ) (2026-05-20T07:20:56Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints [51.7011449975586]
Land-Regは変形可能な登録フレームワークで、潜伏した2D-3Dのランドマーク対応を学習する。
厳格な登録のために、Land-Regはクロスモーダルラテントアライメントモジュールを採用している。
類似性マッチングを持つ不確実なオーバーラップランドマーク検出器を提案し, 明確な2D-3Dランドマーク対応を強く推定する。
論文 参考訳(メタデータ) (2026-03-02T10:44:03Z) - Advanced Geometric Correction Algorithms for 3D Medical Reconstruction: Comparison of Computed Tomography and Macroscopic Imaging [0.9395222766576343]
本稿では, マクロスライスから3次元腎解剖を再構築するためのハイブリッド2段階登録フレームワークを提案する。
これは、マクロ画像の典型的なデータスカシティと高歪みの課題に対処する。
提案手法は,光学的および写真的断面から再構成した他の軟部臓器に一般化する。
論文 参考訳(メタデータ) (2026-01-30T17:16:17Z) - Multimodal Visual Surrogate Compression for Alzheimer's Disease Classification [69.87877580725768]
MVSC(Multimodal Visual Surrogate Compression)は、大規模な3D sMRIボリュームをコンパクトな2D機能に圧縮し、適応させることを学ぶ。
MVSCには2つの重要なコンポーネントがある: テキストガイダンスの下でグローバルなクロススライスコンテキストをキャプチャするボリュームコンテキストと、テキストエンハンスでパッチワイズな方法でスライスレベルの情報を集約するAdaptive Slice Fusionモジュール。
論文 参考訳(メタデータ) (2026-01-29T13:05:46Z) - Towards Generalisable Foundation Models for 3D Brain MRI [5.527537739064968]
我々は、DINO-v2を拡張することで構築された脳MRIのための自己教師型基礎モデルBrainFoundを紹介する。
BrainFoundはDINO-v2を、シーケンシャルMRIスライスからの情報を取り込むことで、完全な3D脳解剖学をモデル化する。
シングルモーダル入力とマルチモーダル入力の両方をサポートし、疾患検出やイメージセグメンテーションなど、幅広い下流タスクを可能にする。
論文 参考訳(メタデータ) (2025-10-27T15:19:46Z) - Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction [65.67001243986981]
我々は,スケールワイド自己回帰モデルに基づく粗大なfMRI画像再構成フレームワークであるMindHierを提案する。
MindHierは、拡散ベースのベースラインよりも優れたセマンティック忠実さ、4.67倍高速な推論、より決定論的結果を達成する。
論文 参考訳(メタデータ) (2025-10-25T15:40:07Z) - Bidirectional Mammogram View Translation with Column-Aware and Implicit 3D Conditional Diffusion [17.309030641962]
ビュー・ツー・ビューの翻訳は、行方不明のビューを回復し、病変のアライメントを改善するのに役立つ。
自然画像とは異なり、マンモグラフィーにおけるこの課題は、X線投影において大きな非剛性変形と重い組織が重なり合うため、非常に困難である。
本稿では,新しい双方向マンモグラムビュー変換フレームワークであるカラム・アウェア・インプリシット3次元拡散(CA3D-Diff)を提案する。
論文 参考訳(メタデータ) (2025-10-06T15:48:27Z) - Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos [69.21508595833623]
Ov3Rは、RGBビデオストリームからのセマンティック3D再構成のためのフレームワークである。
CLIP3Rは、オブジェクトレベルのセマンティクスを埋め込みながら、重複するクリップから高密度なポイントマップを予測する。
2D-3D OVSは、空間的、幾何学的、意味的な手がかりを統合した融合記述子を学習することで、2D機能を3Dに持ち上げる。
論文 参考訳(メタデータ) (2025-07-29T17:55:58Z) - Vector Representations of Vessel Trees [12.391128284848135]
本稿では,3次元血管ネットワークに着目した木構造幾何データのベクトル表現を学習するための新しいフレームワークを提案する。
我々のフレームワークであるVeTTAは、医用画像における解剖学的構造を正確に、柔軟で、位相的に一貫したモデリングを提供する。
論文 参考訳(メタデータ) (2025-06-11T20:34:08Z) - Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding [58.38294408121273]
CUA-O3Dと呼ばれるオープン語彙3次元シーン理解のためのクロスモーダル・不確実性認識アグリゲーションを提案する。
提案手法は,(1)空間認識型視覚基盤モデルの幾何学的知識とともに,VLMのセマンティックな先入観を取り入れること,(2)モデル固有の不確かさを捉えるために,新しい決定論的不確実性推定を用いること,の2つの課題に対処する。
論文 参考訳(メタデータ) (2025-03-20T20:58:48Z) - MedTet: An Online Motion Model for 4D Heart Reconstruction [59.74234226055964]
本研究は, 術後の軽度データから3次元心臓運動を再構築するための新しいアプローチを提案する。
既存の方法では、フル3次元の体積像から3次元の臓器のジオメトリーを正確に再構築することができる。
このような部分的データから3次元運動を再構築するための汎用的なフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-03T17:18:33Z) - Interpretable 2D Vision Models for 3D Medical Images [47.75089895500738]
本研究では,3次元画像処理における中間特徴表現を用いた2次元ネットワークの適応手法を提案する。
我々は、ベンチマークとして3D MedMNISTデータセットと、既存の手法に匹敵する数百の高分解能CTまたはMRIスキャンからなる2つの実世界のデータセットを示す。
論文 参考訳(メタデータ) (2023-07-13T08:27:09Z) - CORPS: Cost-free Rigorous Pseudo-labeling based on Similarity-ranking
for Brain MRI Segmentation [3.1657395760137406]
本稿では,新しいアトラスを用いた擬似ラベル法と3次元脳MRI分割のための3次元深部畳み込みニューラルネットワーク(DCNN)に基づく半教師付きセグメンテーションフレームワークを提案する。
実験により, 定性的, 定量的に比較して, 提案手法の優位性を示した。
論文 参考訳(メタデータ) (2022-05-19T14:42:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。