論文の概要: Perceptual Anchoring: Prototype-Guided Text Calibration for Training-free Open-Vocabulary Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2608.03991v2
- Date: Wed, 05 Aug 2026 12:56:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.355027
- Title: Perceptual Anchoring: Prototype-Guided Text Calibration for Training-free Open-Vocabulary Semantic Segmentation
- Title(参考訳): 知覚的アンコリング:訓練不要なオープンボキャブラリセマンティックセマンティックセグメンテーションのためのプロトタイプガイドテキスト校正
- Authors: Wanli Ma, Jiangwen Lu, Qinmu Peng, Xinge You,
- Abstract要約: 訓練自由なオープン語彙セマンティックセグメンテーション(OVSS)は任意のテキスト記述に基づいてイメージを意味的に異なる領域に分割する。
トレーニング不要なOVSSのためのPTC(Prototype-Guided TextGuided)を提案する。
PTCは、初期マッチングスコアに基づいて信頼できる視覚的エビデンスを選択して、カテゴリ固有の視覚的プロトタイプを構築する。
アンチョリング段階では、PTCはこれらのプロトタイプを使用して対応するテキスト埋め込みを校正し、視覚的証拠の量に基づいて校正強度を適応的に調整する。
- 参考スコア(独自算出の注目度): 18.72475103290795
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training-free open-vocabulary semantic segmentation (OVSS) partitions an image into semantically distinct regions based on arbitrary text descriptions, without learning any additional parameters. However, existing methods typically focus on improving visual representations while treating text embeddings that encode only generic category concepts as fixed classification references. The resulting semantic gap between these generic concepts and the visual representations that capture the specific appearances of target instances often causes incomplete masks and erroneous predictions in non-target regions. Inspired by the symbol-percept correspondence underlying perceptual anchoring, we propose Prototype-Guided Text Calibration (PTC) for training-free OVSS. In the Perceiving stage, PTC selects reliable visual evidence based on initial matching scores to construct category-specific visual prototypes. In the Anchoring stage, PTC uses these prototypes to calibrate their corresponding text embeddings, with the calibration strength adaptively adjusted based on the amount of visual evidence. Consequently, the calibrated text embeddings align more accurately with instance-specific visual representations while preserving generic category semantics and open-vocabulary generalization. Moreover, PTC requires neither additional training nor external models and can serve as a plug-and-play module for existing methods. Extensive experiments across eight benchmarks show that PTC significantly enhances the performance of six representative methods and yields more complete and accurate segmentation results. These results validate PTC as a simple and effective approach to improving visual-text alignment.
- Abstract(参考訳): 訓練自由なオープン語彙セマンティックセグメンテーション(OVSS)は、任意のテキスト記述に基づいてイメージを意味的に異なる領域に分割する。
しかし、既存の手法は一般的に視覚表現の改善に重点を置いており、一般的なカテゴリ概念のみを固定分類参照としてエンコードするテキスト埋め込みを扱います。
これらの一般的な概念と、ターゲットインスタンスの特定の外観を捉える視覚的表現との間に生じる意味的ギャップは、しばしば不完全なマスクと非ターゲット領域における誤った予測を引き起こす。
知覚アンカーを基盤としたシンボル・パーセプティブ対応に着想を得て,トレーニング不要なOVSSのためのPTC(Prototype-Guided Text Calibration)を提案する。
知覚段階において、PTCは初期マッチングスコアに基づいて信頼性の高い視覚的エビデンスを選択し、カテゴリ固有の視覚的プロトタイプを構築する。
アンチョリング段階では、PTCはこれらのプロトタイプを使用して対応するテキスト埋め込みを校正し、視覚的証拠の量に基づいて校正強度を適応的に調整する。
その結果、キャリブレーションされたテキスト埋め込みは、一般的なカテゴリのセマンティクスとオープン語彙の一般化を保持しながら、インスタンス固有の視覚表現とより正確に一致している。
さらに、PTCは追加のトレーニングも外部モデルも必要とせず、既存のメソッドのプラグイン・アンド・プレイモジュールとして機能する。
8つのベンチマークによる大規模な実験により、PTCは6つの代表法の性能を大幅に向上し、より完全で正確なセグメンテーション結果が得られることが示された。
これらの結果は、PSCを視覚的テキストアライメントを改善するためのシンプルで効果的なアプローチとして評価する。
関連論文リスト
- Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification [52.48204114948899]
本研究は,画像とテキストのプロトタイプを直接混合した場合の影響について考察する。
試作品の混合は, 収縮推定器として機能することを示す。
そこで本研究では,画像のプロトタイプをセマンティックテキスト埋め込み空間の主方向へ投影し,テキスト対応のセマンティックイメージ部分空間を得る。
論文 参考訳(メタデータ) (2026-03-25T17:04:43Z) - Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models [57.357091028792325]
ウェブスケールのデータに基づいて事前訓練された視覚言語モデル(VLM)は、ゼロショットの一般化を約束するが、しばしば意味的ミスアライメントに悩まされる。
視覚・テクストアライメントを改善するために,制約付きプロンプトエンハンスメント(CPE)法を提案する。
提案手法はTGSSG(Topology-Guided Synonymous Semantic Generation)とCADRS(Calegory-Agnostic Discriminative Region Selection)の2つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-08-24T15:45:22Z) - SDVPT: Semantic-Driven Visual Prompt Tuning for Open-World Object Counting [70.49268117587562]
本稿では,トレーニングセットから未知のカテゴリに知識を伝達する,セマンティック駆動型ビジュアルプロンプトチューニングフレームワーク(SDVPT)を提案する。
推論中,見知らぬカテゴリと訓練カテゴリのセマンティックな相関に基づいて,見つからないカテゴリの視覚的プロンプトを動的に合成する。
論文 参考訳(メタデータ) (2025-04-24T09:31:08Z) - Exploring Interpretability for Visual Prompt Tuning with Hierarchical Concepts [39.92376420375139]
視覚的プロンプトの解釈可能性を検討するために,最初のフレームワークであるInterpretable Visual Prompt Tuningを提案する。
視覚的プロンプトは、カテゴリーに依存しないプロトタイプのセットとして表される、人間の理解可能なセマンティックな概念と関連付けられている。
IVPTはこれらの領域の特徴を集約して解釈可能なプロンプトを生成する。
論文 参考訳(メタデータ) (2025-03-08T06:12:50Z) - Toward Modality Gap: Vision Prototype Learning for Weakly-supervised Semantic Segmentation with CLIP [19.697857943845012]
本稿では,テキストプロトタイプの助けを借りて,視覚空間におけるクラス固有の視覚プロトタイプを学習するためのフレームワークを提案する。
また、対応するプロトタイプに埋め込まれた領域を対比する地域意味コントラストモジュールを提案する。
提案するフレームワークは,2つのベンチマークデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2024-12-27T13:55:11Z) - Beyond Mask: Rethinking Guidance Types in Few-shot Segmentation [67.35274834837064]
我々は、テキスト、マスク、ボックス、画像からのプロンプトを統合するユニバーサルビジョン言語フレームワーク(UniFSS)を開発した。
UniFSSは最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2024-07-16T08:41:01Z) - CFPL-FAS: Class Free Prompt Learning for Generalizable Face Anti-spoofing [66.6712018832575]
ドメイン一般化 (DG) ベースの Face Anti-Spoofing (FAS) は、目に見えないドメインにおけるモデルの性能を改善することを目的としている。
私たちはCLIPのような大規模VLMを利用し、テキスト機能を利用して分類器の重みを動的に調整し、一般化可能な視覚的特徴を探索する。
論文 参考訳(メタデータ) (2024-03-21T11:58:50Z) - Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models [19.683461002518147]
Test-Time Prototype Shifting (TPS)は、未ラベルのテスト入力を使用したデータセットのテストに視覚言語モデルを適用するために設計された先駆的なアプローチである。
TPSは、その後の予測のために最適化不要なプロトタイプの再利用を促進するだけでなく、プロンプトエンジニアリングにおける現在の進歩とシームレスに統合することを可能にする。
我々のフレームワークの特筆すべき点は、従来のテキストプロンプトチューニング手法と比較して、メモリと計算要求が大幅に削減されていることである。
論文 参考訳(メタデータ) (2024-03-19T17:54:34Z) - Visually-augmented pretrained language models for NLP tasks without
images [77.74849855049523]
既存のソリューションはしばしば視覚的知識増強のために明示的なイメージに依存している。
我々は、新しいtextbfVisually-textbfAugmented fine-tuningアプローチを提案する。
我々のアプローチは、BERT、RoBERTa、BART、T5を異なるスケールで継続的に改善することができる。
論文 参考訳(メタデータ) (2022-12-15T16:13:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。