論文の概要: Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)
- arxiv url: http://arxiv.org/abs/2608.08844v1
- Date: Sun, 09 Aug 2026 18:11:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.967793
- Title: Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)
- Title(参考訳): テクストプロンプテッドセグメンテーションモデル3(SAM3)を用いた内視鏡画像からのマスク注釈なし手術器具セグメンテーションに向けて
- Abstract要約: そこで本研究では,実情マスクや手動操作を必要とせず,インスタンスレベルのセグメンテーションを実現するための2段階フレームワークを提案する。
最初の段階では、自然言語対応のジェネリックプロンプト "tool" を利用してSAM3のゼロショット機能を使ってバイナリマスクを生成する。
第2段階では、これらのマスクはSAM3の生成したマスキング領域に微調整された視覚言語モデル(Qwen)を統合することで、インスタンスレベルに拡張される。
- 参考スコア(独自算出の注目度): 0.866627581195388
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Surgical instrument segmentation is a fundamental task for computer-assisted interventions, yet most existing methods rely on pixel-level annotations or manual spatial prompts, which limit scalability and automation. The recently introduced Segment Anything Model 3 (SAM3) offers a pathway to annotation-free, automatic segmentation via text-based prompting; however, the instrument name as a text prompt could not be directly used due to a large domain gap. To overcome these limitations, we propose a two-stage framework that achieves instance-level segmentation without requiring ground truth masks or manual interaction. In the first stage, we leverage a natural-language-aligned generic prompt - "tool" - to produce binary masks using SAM3's zero-shot capability. In the second stage, these masks are extended to instance-level by integrating a vision-language model (Qwen) that is fine-tuned on SAM3-generated masked regions for instrument classification. We evaluate our approach on the EndoVis 2017 and 2018 datasets. Results show that, while our two-stage approach does not reach the performance of current fully supervised methods, it significantly outperforms the direct use of SAM3 for instance-level instrument segmentation with text prompts. Overall, our findings highlight both the limitations and potential of SAM3, suggesting a promising direction toward annotation-free surgical instrument segmentation.
- Abstract(参考訳): 手術器具のセグメンテーションは、コンピュータ支援による介入の基本的なタスクであるが、既存のほとんどの手法は、スケーラビリティと自動化を制限するピクセルレベルのアノテーションや手動の空間的プロンプトに依存している。
最近導入されたSegment Anything Model 3 (SAM3) は、テキストベースのプロンプトを通じて、アノテーションのない自動セグメンテーションの経路を提供するが、大きなドメインギャップのために、テキストプロンプトとしてのインスツルメンツ名は直接使用できなかった。
これらの制約を克服するため,本研究では,素質マスクや手動操作を必要とせず,インスタンスレベルのセグメンテーションを実現する2段階のフレームワークを提案する。
最初の段階では、自然言語対応のジェネリックプロンプト "tool" を利用してSAM3のゼロショット機能を使ってバイナリマスクを生成する。
第2段階では、これらのマスクはSAM3の生成したマスキング領域に微調整された視覚言語モデル(Qwen)を統合することで、インスタンスレベルに拡張される。
当社のアプローチは、2017年と2018年のデータセットで評価しています。
その結果,2段階の手法は,現行の完全教師付き手法の性能には達していないものの,SAM3のインスタンスレベルの楽器セグメンテーションにおけるテキストプロンプトの直接的使用よりも有意に優れていた。
以上の結果から,SAM3の限界と可能性の両方が指摘され,無注の手術器具セグメンテーションに向けて有望な方向性が示唆された。
関連論文リスト
- EOVSAM: Efficient Open-Vocabulary Segmentation with SAM 3 in One Pass [79.69317943751223]
SAM 3 (EOVSAM) を用いた効率的な開語彙セグメンテーションフレームワークを提案する。
EOVSAMはSAM 3をシングルパス予測に適応させる。
評価されたすべてのデータセットにおいて、バニラSAM 3よりもセグメンテーション精度が一貫して向上する。
論文 参考訳(メタデータ) (2026-08-03T14:15:37Z) - Is SAM3 ready for pathology segmentation? [13.272947729025027]
SAM3はPromptable Conceptを導入し、テキストプロンプトを介して潜在的に自動化されたインターフェースを提供する。
我々は、ゼロショット、少数ショット、および様々なプロンプト戦略で監督されたSAM3を、異なる監督条件下で評価する。
本研究は,病理領域の領域分割におけるSAM3の境界を記述し,病理領域適応の必要性に関する実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2026-04-20T13:10:07Z) - Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation [18.568343383992072]
Tarot-SAM3は、任意の参照式から正確にセグメンテーションできる、トレーニング不要のフレームワークである。
Tarot-SAM3は2つの重要なフェーズで構成されている。第一に、推論補助的なプロンプトオプションを導入するReasoning Expression Interpreter (ERI) フェーズである。
第2に、マスク自己精製(MSR)フェーズは、プロンプトタイプにまたがる最高のマスクを選択し、自己精製を行う。
論文 参考訳(メタデータ) (2026-04-09T07:37:09Z) - SegEarth-OV3: Exploring SAM 3 for Open-Vocabulary Semantic Segmentation in Remote Sensing Images [51.42466259821335]
我々は, SAM 3 をリモートセンシング OVSS タスクに適用するための予備的な検討を行った。
まず,SAM 3のセマンティックセグメンテーションヘッドとトランスフォーマーデコーダの出力を組み合わせたマスク融合戦略を実装した。
第2に、シーンに存在しないカテゴリをフィルタリングするために、プレゼンスヘッドからのプレゼンススコアを利用する。
論文 参考訳(メタデータ) (2025-12-09T15:42:28Z) - Evaluating SAM2 for Video Semantic Segmentation [60.157605818225186]
Anything Model 2 (SAM2)は、画像とビデオの両方において、迅速な視覚オブジェクトのセグメンテーションのための強力な基盤モデルであることが証明されている。
本稿では, SAM2 から高密度ビデオセマンティック (VSS) への拡張について検討する。
我々の実験は、SAM2を利用することでVSSの全体的な性能が向上することを示唆している。
論文 参考訳(メタデータ) (2025-12-01T15:15:16Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - Surgical-DeSAM: Decoupling SAM for Instrument Segmentation in Robotic Surgery [9.466779367920049]
安全クリティカルな外科的タスクでは、教師あり学習のためのフレーム単位のプロンプトが欠如しているため、プロンプトは不可能である。
リアルタイムトラッキングアプリケーションのフレーム単位でのプロンプトは非現実的であり,オフラインアプリケーションのアノテートには費用がかかる。
実時間ロボット手術において,SAMを分離するための自動バウンディングボックスプロンプトを生成するために,手術用デSAMを開発した。
論文 参考訳(メタデータ) (2024-04-22T09:53:55Z) - PosSAM: Panoptic Open-vocabulary Segment Anything [58.72494640363136]
PosSAMはオープン・ボキャブラリ・パノプティ・セグメンテーション・モデルであり、Segment Anything Model(SAM)の強みを、エンドツーエンドのフレームワークで視覚ネイティブのCLIPモデルと統合する。
本稿では,マスクの質を適応的に向上し,各画像の推論中にオープン語彙分類の性能を高めるマスク対応選択組立アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-14T17:55:03Z) - SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation [66.21356751558011]
Segment Anything Model (SAM)は、ジェネリックオブジェクトセグメンテーションの約束を示し、様々なアプリケーションに可能性を提供します。
既存の方法では、SAMベースのフレームワークを手術データにチューニングすることで、手術器具セグメンテーション(SIS)にSAMを適用している。
本稿では,楽器構造知識をSAMの汎用知識と明確に統合する新しいSAM効率的なチューニング手法であるStuial Part-SAMを提案する。
論文 参考訳(メタデータ) (2023-12-22T07:17:51Z) - BoxCell: Leveraging SAM for Cell Segmentation with Box Supervision [22.761067372749398]
本研究では,境界ボックスの監視のみが可能な弱教師付き環境について検討し,これをSAM(Segment Anything)を用いて微調整する。
そこで我々は,SAMの機能を利用したセルセグメンテーションフレームワークであるBoxCellを提案する。
我々は、CoNSep、MoNuSeg、TNBCの3つの公開セルセグメンテーションデータセットを実験し、BoxCellが既存のボックス管理画像セグメンテーションモデルを大幅に上回っていることを発見した。
論文 参考訳(メタデータ) (2023-11-29T11:18:48Z) - SAF-IS: a Spatial Annotation Free Framework for Instance Segmentation of
Surgical Tools [10.295921059528636]
トレーニングに空間アノテーションを頼らずに,実例分割のためのフレームワークを開発する。
我々のソリューションはバイナリツールマスクのみを必要とし、最新の教師なしアプローチとバイナリツール存在ラベルを使って取得できる。
当社のフレームワークは、2017年と2018年のセグメンテーションデータセット上で検証しています。
論文 参考訳(メタデータ) (2023-09-04T17:13:06Z) - SurgicalSAM: Efficient Class Promptable Surgical Instrument Segmentation [65.52097667738884]
そこで本研究では,SAMの知識と外科的特異的情報を統合し,汎用性を向上させるための,新しいエンドツーエンドの効率的なチューニング手法であるScientialSAMを紹介した。
具体的には,タイピングのための軽量なプロトタイプベースクラスプロンプトエンコーダを提案し,クラスプロトタイプから直接プロンプト埋め込みを生成する。
また,手術器具カテゴリー間のクラス間差異の低さに対応するために,コントラッシブなプロトタイプ学習を提案する。
論文 参考訳(メタデータ) (2023-08-17T02:51:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。