論文の概要: Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation
- arxiv url: http://arxiv.org/abs/2606.26711v2
- Date: Tue, 30 Jun 2026 06:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.700154
- Title: Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation
- Title(参考訳): Mask to Concept:Few-Shotアノテーションのための効率的なテスト時間概念埋め込みによるオートプロンプタブルSAM3
- Abstract要約: Mask to Concept (M2C) は、SAM3を外部モジュールを使わずに、医療的な小ショットアノテーションに適応する効率的なフレームワークである。
M2Cは、その凍結したアーキテクチャの中で、転送可能な視覚概念を検索する。
医用セグメンテーションのベンチマーク実験により,SOTAの少数ショットセグメンテーション性能と優れたアノテーション効率が得られた。
- 参考スコア(独自算出の注目度): 15.034102800030217
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transforming foundation segmentation models from human-prompted tools into auto-promptable annotators is critical for scalable medical data annotation. Current methods commonly depend on external feature matchers or auxiliary networks to automate geometric prompting, but introducing architectural overhead and limiting performance scalability. Although SAM3 natively supports concept segmentation via reusable text prompts, its direct use in medical imaging is hindered by a lack of fine-grained clinical knowledge and the ambiguity of human-written descriptions. In this work, we propose Mask to Concept (M2C), an efficient framework that adapts SAM3 for medical few-shot annotation without external modules, parameter retraining, or manual text engineering. Using only a few labeled images, M2C enables SAM3 to automatically search for transferable visual concepts entirely within its frozen architecture: it initializes a learnable concept embedding, uses it to prompt segmentation, and updates the embedding by gradients of minimizing the concept segmentation error. We further introduce a Hybrid Uncertainty Estimation (HUE) module that calculates the prediction entropy and maps concept predictions back to the box prompts, measuring concept-geometry prompting inconsistency. Highly uncertain samples are flagged actively for human correction, and the corrected masks are then fed back to M2C to continuously search for more precise concept embeddings, forming a self-enhancing annotation loop with minimal expert effort. Experiments on medical segmentation benchmarks show that our method achieves SOTA few-shot segmentation performance and outstanding annotation efficiency, offering a practical and efficient pathway toward scalable medical image labeling. Codes are at https://github.com/Huster-Hq/M2C.
- Abstract(参考訳): ヒトのプロンプトされたツールから自動プロンプト可能なアノテータへの基盤セグメンテーションモデルを変換することは、スケーラブルな医療データアノテーションにとって重要である。
現在の手法は通常、幾何学的プロンプトを自動化するために外部の機能マッチングや補助ネットワークに依存しているが、アーキテクチャ上のオーバーヘッドを導入し、性能のスケーラビリティを制限している。
SAM3は、再利用可能なテキストプロンプトを通じて概念セグメンテーションをネイティブにサポートしているが、医療画像への直接的利用は、詳細な臨床知識の欠如と人間の記述の曖昧さによって妨げられている。
本研究では、外部モジュールやパラメータ再トレーニング、手動テキストエンジニアリングを使わずにSAM3を医療用小ショットアノテーションに適用する効率的なフレームワークであるMask to Concept (M2C)を提案する。
M2Cはいくつかのラベル付きイメージのみを使用して、SAM3が凍結したアーキテクチャ内で自動的に転送可能な視覚概念を検索できるようにする。
さらに,予測エントロピーを計算し,概念予測をボックスプロンプトにマッピングするハイブリッド不確実性推定(HUE)モジュールを導入する。
非常に不確実なサンプルは、人間の修正のために積極的にフラグ付けされ、修正されたマスクはM2Cに送られ、より正確な概念の埋め込みを継続的に探索し、最小限の専門家の努力で自己改善のアノテーションループを形成する。
医用セグメンテーションベンチマーク実験により,SOTAの少数ショットセグメンテーション性能と優れたアノテーション効率を実現し,スケーラブルな医用画像ラベリングへの実用的で効率的な経路を提供する。
コードはhttps://github.com/Huster-Hq/M2Cにある。
関連論文リスト
- DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation [11.100699187381961]
本稿では,高いセグメンテーション精度と極端なパラメータ効率を実現する新しいフレームワークであるDual-Adaptive SAM3(DA-SAM3)を提案する。
私たちの最初の適応はタスク認識であり、最も関係のある専門家をわずかに活性化する動的エキスパートルータ(DER)です。
第2の適応はパラメータ認識です。
専門家(DPE)は、各専門家を共有凍結ベースとして表現する。
論文 参考訳(メタデータ) (2026-06-30T08:14:18Z) - Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation [14.712933368175008]
テスト時間適応(TTA)は、アノテーションなしでオンザフライでモデルを更新することで、テストパフォーマンスを改善するために不可欠である。
既存の視覚言語TTA法は主に画像レベルの不確実性最小化によって駆動される。
本稿では,SAM3の医用画像に対するConcept Alignment ContrastとLongShort Prompt Memory for Test-Time Adaptation (CM-TTA)を提案する。
論文 参考訳(メタデータ) (2026-06-22T07:43:19Z) - From Pixels to Concepts: Do Segmentation Models Understand What They Segment? [26.89265297426196]
我々は,CAFE: textbfCounterfactual textbfAttribute textbfFactuality textbfEvaluationを紹介した。
本ベンチマークでは,2,146対のサンプルを対象画像,接地トラスマスク,正のプロンプト,誤った負のプロンプトから構成した。
論文 参考訳(メタデータ) (2026-05-10T15:07:17Z) - MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models [59.180043227905294]
MedPrunerは、3次元医用画像の効率的な理解のためのトレーニング不要でモデルに依存しない階層的トークンプレーニングフレームワークである。
我々は、MedPrunerによって、MedGemmaのようなモデルが元の性能を維持したり、超えたりすることが可能であり、ビジュアルトークンの5%以下を維持していることを示す。
論文 参考訳(メタデータ) (2026-03-12T07:37:00Z) - Where Do Flow Semantics Reside? A Protocol-Native Tabular Pretraining Paradigm for Encrypted Traffic Classification [5.044786941116112]
自己監督型マスクドモデリングは、生のバイトをマスキングして再構築することで、暗号化されたトラフィック分類を約束する。
最近の研究によると、これらの手法はコストのかかる事前訓練にもかかわらずラベル付きデータへの依存を減らすことができない。
トラフィックをシーケンスバイトにフラットにすることで、プロトコル定義のセマンティクスを破壊します。
論文 参考訳(メタデータ) (2026-03-09T15:15:23Z) - Hierarchical Concept-based Interpretable Models [23.16720677779406]
概念埋め込みモデル(CEM)は、入力を人間の解釈可能な概念表現にマッピングし、タスクを予測できる。
しかし、CEMは概念間の関係を表現できず、トレーニング中に異なる粒度で概念アノテーションを必要とする。
階層的概念埋め込みモデル(HiCEM)は,階層的構造を通じて概念関係を明示的にモデル化するCEMの新しいファミリーである。
論文 参考訳(メタデータ) (2026-02-27T11:49:56Z) - Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept Discovery [52.498055901649025]
ディープニューラルネットワークの「ブラックボックス」問題に対処するために、概念ボトルネックモデル(CBM)が提案されている。
本稿では,典型的なパラダイムを逆転させる新しいCBMアプローチであるDiscover-then-Name-CBM(DN-CBM)を提案する。
我々の概念抽出戦略は、下流のタスクに非依存であり、既にそのモデルに知られている概念を使用するため、効率的である。
論文 参考訳(メタデータ) (2024-07-19T17:50:11Z) - ALSO: Automotive Lidar Self-supervision by Occupancy estimation [70.70557577874155]
本稿では,ポイントクラウド上で動作している深層知覚モデルのバックボーンを事前学習するための自己教師型手法を提案する。
中心となる考え方は、3Dポイントがサンプリングされる表面の再構成であるプリテキストタスクでモデルをトレーニングすることである。
直感的には、もしネットワークがわずかな入力ポイントのみを考慮し、シーン表面を再構築できるなら、おそらく意味情報の断片をキャプチャする。
論文 参考訳(メタデータ) (2022-12-12T13:10:19Z) - Attentive Symmetric Autoencoder for Brain MRI Segmentation [56.02577247523737]
視覚変換器(ViT)をベースとした3次元脳MRIセグメンテーションタスクのための新しいアテンテーティブシンメトリオートエンコーダを提案する。
事前学習の段階では、提案するオートエンコーダがより注意を払って、勾配測定値に従って情報パッチを再構築する。
実験の結果,提案手法は最先端の自己教師付き学習法や医用画像分割モデルよりも優れていた。
論文 参考訳(メタデータ) (2022-09-19T09:43:19Z) - MAPLE: Masked Pseudo-Labeling autoEncoder for Semi-supervised Point
Cloud Action Recognition [160.49403075559158]
本稿では,Pseudo-Labeling autoEncoder (textbfMAPLE) フレームワークを提案する。
特に、MAPLEのバックボーンとして、新規で効率的なtextbfDecoupled textbfspatial-textbftemporal TranstextbfFormer(textbfDestFormer)を設計する。
MAPLEは3つの公開ベンチマークにおいて優れた結果を得て、MSR-Action3の精度を8.08%向上させる。
論文 参考訳(メタデータ) (2022-09-01T12:32:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。