論文の概要: Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding
- arxiv url: http://arxiv.org/abs/2608.01663v1
- Date: Mon, 03 Aug 2026 03:54:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.321843
- Title: Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding
- Title(参考訳): 視覚的接地によるセグメンテーション基礎モデルのためのFew-Shot概念のプロンプト学習
- Abstract要約: Few-Shot Concept Prompt Learning (FS-CPL) は、 encoder-decoder バックボーンをフリーズしたマスク監視を通じて、$K$イメージ-マスクペアの小さなサポートセットから、mathbbRT times d$に $mathbfp* を埋め込むという継続的概念を学ぶ。
FS-CPLは、標準テキストプロンプトで最大$+0.62$のDiceを絶対的に改善し、Emphbackboneに依存しない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Promptable segmentation foundation models (FMs) such as SAM3 and Medical SAM3 promise few-shot, interactively-specified segmentation for medical imaging through a natural language interface, yet their performance on clinical tasks falls well short of this promise. We posit that this shortfall is not an artefact of insufficient medical pretraining or imperfect prompt phrasing, but a structural limitation that will persist in any domain where paired image-text supervision is scarce, as it is across most clinical modalities. We further hypothesize that the limitation is specific to natural language as a control signal: a visually grounded prompt, learned directly from the target distribution, should recover the lost performance without additional image-text data or backbone retraining. We propose Few-Shot Concept Prompt Learning (FS-CPL), which learns a continuous concept prompt embedding $\mathbf{p}^* \in \mathbb{R}^{T \times d}$ from a small support set of $K$ image--mask pairs via mask supervision, with the encoder-decoder backbone frozen. Across four public benchmarks spanning ultrasound and endoscopy (BUSI, HC18, TN3K, CVC-Clinic), FS-CPL delivers absolute Dice improvements of up to $+0.62$ over canonical text prompts and is \emph{backbone-agnostic}: it lifts both vanilla SAM3 and the domain-specifically pretrained Medical SAM3, showing that visual concept prompting is complementary to in-domain pretraining.
- Abstract(参考訳): SAM3 や Medical SAM3 のような有望なセグメンテーション基盤モデル (FM) は、自然言語インタフェースによる医療画像のための数発のインタラクティブなセグメンテーションを約束するが、臨床タスクにおけるそれらのパフォーマンスは、この約束にかなり及ばない。
この不足は、医学的事前訓練や不完全な即時表現が不十分な成果ではなく、画像・テキストの相互監督が不十分な領域に留まる構造的制限であり、多くの臨床的モダリティにまたがるものであると仮定する。
さらに、この制限は制御信号として自然言語に固有のものであり、ターゲット分布から直接学習した視覚的に基底化されたプロンプトは、追加の画像テキストデータやバックボーン再トレーニングを伴わずに、失われた性能を回復すべきである、という仮説を立てた。
マスク監視によるマスク対の小さなサポートセットから$\mathbf{p}^* \in \mathbb{R}^{T \times d}$を埋め込み、エンコーダ・デコーダのバックボーンをフリーズしたFew-Shot Concept Prompt Learning (FS-CPL)を提案する。
超音波と内視鏡(BUSI, HC18, TN3K, CVC-Clinic)にまたがる4つの公開ベンチマーク(BUSI, HC18, TN3K, CVC-Clinic)で、FS-CPLは標準テキストプロンプトを最大$+0.62$で改善し、バニラSAM3とドメイン固有の事前訓練された医療SAM3の両方を持ち上げる。
関連論文リスト
- Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation [15.034102800030217]
Mask to Concept (M2C) は、SAM3を外部モジュールを使わずに、医療的な小ショットアノテーションに適応する効率的なフレームワークである。
M2Cは、その凍結したアーキテクチャの中で、転送可能な視覚概念を検索する。
医用セグメンテーションのベンチマーク実験により,SOTAの少数ショットセグメンテーション性能と優れたアノテーション効率が得られた。
論文 参考訳(メタデータ) (2026-06-25T07:44:37Z) - Few-Shot Semantic Segmentation Meets SAM3 [23.28277367328234]
Few-Shot Semantic (FSS)は、注釈付きサンプルのごく一部から新しいオブジェクトカテゴリのセグメンテーションに焦点を当てている。
我々は、現代のビジョン基盤モデルの観点からFSSを再考し、Segment Anything Model 3 (SAM3) のトレーニングフリーソリューションとしての可能性を探る。
Promptable Concept (PCS) 機能を再利用することで,サポートとクエリの画像を共有キャンバスに配置するシンプルな空間結合戦略を採用する。
論文 参考訳(メタデータ) (2026-04-07T04:59:50Z) - Taming SAM3 in the Wild: A Concept Bank for Open-Vocabulary Segmentation [57.427604620940734]
TextscConceptBankは、視覚的証拠とプロンプトの整合性を取り戻すためのフレームワークだ。
我々のアプローチは、クラスワイドなビジュアルプロトタイプによるターゲットドメインの証拠をアンロックし、(textitii)マイニングの代表者はデータドリフト下でのアウトリーチを抑えることをサポートし、(textitiii)コンセプトドリフトの修正のために候補概念を融合させる。
論文 参考訳(メタデータ) (2026-02-06T02:59:11Z) - S$^3$POT: Contrast-Driven Face Occlusion Segmentation via Self-Supervised Prompt Learning [46.05577414378133]
S$3$POTは、自己教師付き空間的プロンプトによる顔生成を相乗化するためのコントラスト駆動型フレームワークである。
特に、S$3$POTは、参照生成、機能拡張、Prompt Selectionの3つのモジュールで構成されている。
専用のデータセットの実験では、S$3$POTの優れたパフォーマンスと各モジュールの有効性が示されている。
論文 参考訳(メタデータ) (2026-01-31T10:05:13Z) - TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation [56.09179939570486]
本稿では,パラメータ効率,タスク固有適応に着目したCLIPベースのフレームワークであるTGC-Netを提案する。
TGC-Netは、挑戦的なベンチマークで顕著なDiceゲインを含む、トレーニング可能なパラメータをかなり少なくして、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-12-24T12:06:26Z) - PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation [56.238478239463575]
PPBoostは弱いテキスト由来の信号を強く、空間的に接地された視覚的プロンプトに変換する。
画像やピクセルレベルのセグメンテーションラベルを持たない厳格なゼロショット方式で動作する。
テキストや視覚的にプロンプトされたベースラインよりも、Diceと正規化されたSurface Distanceを一貫して改善する。
論文 参考訳(メタデータ) (2025-11-26T23:49:44Z) - SmartCLIP: Modular Vision-language Alignment with Identification Guarantees [59.16312652369709]
Contrastive Language-Image Pre-Traiing (CLIP)citepradford2021 Learningは、コンピュータビジョンとマルチモーダル学習において重要なモデルとして登場した。
CLIPは、多くの画像テキストデータセットにおける潜在的な情報ミスアライメントに苦労し、絡み合った表現に悩まされている。
モジュラー方式で、最も関連性の高い視覚的およびテキスト的表現を特定し、調整する新しいアプローチである。
論文 参考訳(メタデータ) (2025-07-29T22:26:20Z) - Hierarchical Self-Prompting SAM: A Prompt-Free Medical Image Segmentation Framework [22.156422571599453]
Hierarchical Self-Prompting SAM (HSP-SAM) は医療画像セグメンテーションのための新しいセルフプロンプトフレームワークである。
HSP-SAMはポリープや皮膚病変のセグメンテーションのような古典的なセグメンテーションタスクにおいて優れた性能を発揮する。
未確認データセットへの強力な一般化を示し、従来の最先端手法よりも14.04%の改善を実現している。
論文 参考訳(メタデータ) (2025-06-03T13:23:33Z) - Disruptive Autoencoders: Leveraging Low-level features for 3D Medical
Image Pre-training [51.16994853817024]
本研究は、3Dラジオグラフィ画像のための効果的な事前学習フレームワークの設計に焦点をあてる。
ローカルマスキングと低レベルの摂動の組み合わせによって生成された破壊から、オリジナルのイメージを再構築しようとする事前トレーニングフレームワークであるDisruptive Autoencodersを紹介する。
提案する事前トレーニングフレームワークは、複数のダウンストリームタスクでテストされ、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2023-07-31T17:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。