論文の概要: SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting
- arxiv url: http://arxiv.org/abs/2607.29033v1
- Date: Fri, 31 Jul 2026 05:11:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.593796
- Title: SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting
- Title(参考訳): SAM+D:奥行き制御LORAと深さシフトによるSAM-Familyモデルのパラメータ効率の良い次元リフティング
- Authors: Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen,
- Abstract要約: textbfSAM+Dはパラメータ効率のよいフレームワークで、SAMファミリーモデルを1つの空間次元で持ち上げる。
textbfSAM+Dは2つの軽量モデルに依存しないモジュールを凍結トランスフォーマーブロックに導入する。
textbfSAM+DはSAMファミリーアーキテクチャ、ターゲット次元(3D, 4D)、医用画像とバイオシーン理解にまたがる領域を一般化する。
- 参考スコア(独自算出の注目度): 13.388638483362628
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing methods for adapting 2D foundation models such as SAM to 3D volumes either process slices independently---ignoring inter-slice context---or require substantial architectural changes and retraining. In this paper, we present \textbf{SAM+D}, a parameter-efficient framework that lifts SAM-family models by one spatial dimension---enabling 3D volumetric segmentation from 2D SAM and, for the first time via parameter-efficient fine-tuning, end-to-end 4D (3D+T) spatiotemporal segmentation from video-based SAM2---while keeping the vast majority of pre-trained parameters frozen. SAM+D introduces two lightweight, model-agnostic modules into frozen transformer blocks: (1)~\textbf{Depth-Routed LoRA (DRLoRA)} experts with learned routing for spatially adaptive low-rank updates, and (2)~\textbf{Depth Shift Modules (DSM)} for cross-slice feature exchange at zero additional parameter cost. Together, they provide volume-level context while tuning only ${\sim}$2.8\% of parameters for SAM and ${\sim}$3.7\% for SAM2. We evaluate SAM+D in two distinct settings, each lifting the base model by one spatial dimension: 3D segmentation, where SAM(2D$\,\to\,$3D) is evaluated on four CT benchmarks (KiTS, Pancreas, LiTS, Colon), and 4D segmentation, where SAM2 (2D+T$\,\to\,$3D+T) is evaluated on a cell tracking challenge (CTC) dataset (Fluo-N3DH-SIM+). In both settings SAM+D achieves competitive or superior results under the single-point prompt setting while using fewer trainable parameters than existing methods, demonstrating that SAM+D generalizes across SAM-family architectures, target dimensionalities (3D, 4D), and domains spanning medical imaging and bio-scene understanding. Code is publicly available at https://github.com/JerrySongCST/SAM-Plus-D.
- Abstract(参考訳): SAMのような2Dファンデーションモデルを3Dボリュームに適応させる既存の方法は、プロセススライスを独立して行うか、スライス間コンテキストを無視します。
本稿では、2次元SAMから3次元ボリュームセグメンテーションを誘導し、ビデオベースSAM2からパラメータ効率の高い4D(3D+T)の時空間セグメンテーションを初めて行うことで、SAMファミリーモデルを1つの空間次元で持ち上げるパラメータ効率のよいフレームワークである \textbf{SAM+D}を提案する。
SAM+Dでは,(1)〜\textbf{Depth-Routed LoRA(DRLoRA)の専門家による空間適応型低ランク更新のための学習ルーティング,(2)〜\textbf{Depth Shift Modules(DSM)によるクロススライス機能交換のための追加パラメータコストゼロである。
共にボリュームレベルのコンテキストを提供し、SAMのパラメータの${\sim}$2.8\%とSAM2の${\sim}$3.7\%のみをチューニングする。
3Dセグメンテーション(SAM(2D$\,\to\,$3D)を4つのCTベンチマーク(KiTS, Pancreas, LiTS, Colon)と4Dセグメンテーション(SAM2(2D+T$\,\to\,$3D+T)をCTCデータセット(Fluo-N3DH-SIM+)で評価する。
SAM+DはSAMファミリーアーキテクチャ、ターゲット次元(3D, 4D)、医用画像とバイオシーンの理解にまたがる領域にまたがる一般化を示す。
コードはhttps://github.com/JerrySongCST/SAM-Plus-Dで公開されている。
関連論文リスト
- M$^4$-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection [43.183940069110186]
メモリ拡張SAM (M$4$-SAM) を用いたマルチモーダル混合実験を行い, SAM2 にモダリティ関連PEFT と階層的特徴融合を実装した。
M$4$-SAMは、3つのパブリックRGB-D VSODデータセット上のすべての評価指標の最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-12T08:33:08Z) - Comparing SAM 2 and SAM 3 for Zero-Shot Segmentation of 3D Medical Data [0.3867363075280543]
SAM、SAM 2、および最近リリースされたSAM 3を含むプロンプト可能なセグメンテーションの基礎モデルは、医療画像のゼロショットセグメンテーションに再び関心を寄せている。
そこで本研究では, SAM 2 と SAM 3 を比較して, 純粋視覚的プロンプト下での3次元医用ボリュームとビデオのゼロショットセグメンテーションについて検討した。
両モデルを,54の解剖学的構造,病理,手術器具を含む16の公開データセットでベンチマークした。
論文 参考訳(メタデータ) (2025-11-26T21:36:58Z) - VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel [68.24765319399286]
本稿では,2次元血管セグメンテーションに適した,強力で効率的なフレームワークであるVesSAMを提案する。
VesSAMは、(1)局所的なテクスチャ機能を強化する畳み込みアダプタ、(2)解剖学的プロンプトを融合するマルチプロンプトエンコーダ、(3)ジャグアーティファクトを減らす軽量マスクデコーダを統合する。
VesSAMは、最先端のPEFTベースのSAMを10%以上のDiceと13%のIoUで一貫して上回っている。
論文 参考訳(メタデータ) (2025-11-02T15:47:05Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners [87.76470518069338]
SAM2Pointは,Segment Anything Model 2 (SAM2) に適応した予備的な探索手法である。
本フレームワークは3Dポイントやボックス,マスクなど,さまざまなプロンプトタイプをサポートし,3Dオブジェクトや屋内シーン,疎外環境,生のLiDARなど,さまざまなシナリオを一般化することができる。
我々の知る限り、SAMの3Dにおける最も忠実な実装は、3Dセグメンテーションにおける将来の研究の出発点となるかもしれない。
論文 参考訳(メタデータ) (2024-08-29T17:59:45Z) - Multi-Scale and Detail-Enhanced Segment Anything Model for Salient Object Detection [58.241593208031816]
Segment Anything Model (SAM) は、強力なセグメンテーションと一般化機能を提供する視覚的基本モデルとして提案されている。
実物検出のためのMDSAM(Multi-scale and Detail-enhanced SAM)を提案する。
実験により,複数のSODデータセット上でのモデルの優れた性能が示された。
論文 参考訳(メタデータ) (2024-08-08T09:09:37Z) - WSI-SAM: Multi-resolution Segment Anything Model (SAM) for histopathology whole-slide images [8.179859593451285]
病理画像の正確なオブジェクト分割機能を備えたWSI-SAM, Segment Anything Model (SAM) を提案する。
トレーニングオーバーヘッドを最小限にしながら、トレーニング済みの知識を完全に活用するために、SAMは凍結し、最小限のパラメータしか導入しません。
本モデルでは, 膵管癌 in situ (DCIS) セグメンテーションタスクと乳癌転移セグメンテーションタスクにおいて, SAMを4.1, 2.5パーセント上回った。
論文 参考訳(メタデータ) (2024-03-14T10:30:43Z) - Stable Segment Anything Model [79.9005670886038]
SAM(Segment Anything Model)は、高品質なプロンプトが与えられた場合、顕著に迅速なセグメンテーションを実現する。
本稿では,SAMのセグメンテーション安定性について,多様なプロンプト特性のスペクトルにわたって包括的解析を行った。
1)SAMのセグメンテーション安定性を広範囲に改善し,2)SAMの強力なセグメンテーション効率と一般化を維持した。
論文 参考訳(メタデータ) (2023-11-27T12:51:42Z) - MedLSAM: Localize and Segment Anything Model for 3D CT Images [13.320012515543116]
MedLAM(MedLAM)は,数個のテンプレートスキャンを用いて体内の解剖学的部位を正確に同定する3次元基礎局在モデルである。
私たちはMedLAMとSegment Anything Model(SAM)を統合してMedLSAMを開発した。
1)MedLSAMはSAMの性能と,その専門的な医療適応を手動のプロンプトと密に一致させ,データセット全体にわたる広範なポイントアノテーションの必要性を最小限に抑えながら,いくつかのテンプレートスキャンを用いて解剖学的構造を直接ローカライズすることができる。
論文 参考訳(メタデータ) (2023-06-26T15:09:02Z) - Personalize Segment Anything Model with One Shot [52.54453744941516]
我々は,Segment Anything Model (SAM) のためのトレーニング不要なパーソナライズ手法を提案する。
PerSAMは、参照マスクを持つ1つのイメージしか持たないため、最初にターゲットのコンセプトを以前のロケーションでローカライズする。
PerSAMは、ターゲット誘導された注意、ターゲットセマンティックなプロンプト、そしてカスケードされたポストリファインメントという3つのテクニックを通じて、他の画像やビデオにセグメントする。
論文 参考訳(メタデータ) (2023-05-04T17:59:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。