論文の概要: Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2608.08290v1
- Date: Sat, 08 Aug 2026 18:51:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.761306
- Title: Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation
- Title(参考訳): Open-Vocabulary Semantic Segmentationのためのテスト時間プロトタイプ適応
- Authors: Haozhe Wang, Jintao Cheng, Weibin Li, Xiaoyu Tang,
- Abstract要約: Test-time Prototype Adaptation (TPA) は出力レベルで動作し、ホストのフォワードパスとウェイトは変更されていない。
TPAは、未ラベルのデプロイメントドメインイメージの小さなプール上で、ホスト自身の出力予測から確実なアンカーパッチを特定する。
この凍結された銀行に対する1つのコサイン類似性のルックアップは、ホストのロジットと線形に融合された補助スコアを提供する。
- 参考スコア(独自算出の注目度): 5.483657589815383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary semantic segmentation (OVSS) repurposes a pretrained CLIP encoder for dense prediction without additional labeled supervision. Existing methods improve CLIP's spatial behavior either by redesigning its internal attention or by injecting features from auxiliary vision foundation models; both require access to the host's internal computation and are tailored to its specific forward pass. In this work, we propose Test-time Prototype Adaptation (TPA), a training-free plug-in that operates at the output level, leaving the host's forward pass and weights unmodified. By leveraging a lightweight transductive adaptation phase, TPA identifies confident anchor patches from the host's own output predictions on a small pool of unlabeled deployment-domain images, and aggregates their frozen DINO features into per-class prototypes; at inference, a single cosine similarity lookup against this frozen bank provides an auxiliary score fused linearly with the host's logits. TPA composes with five representative OVSS hosts spanning attention-redesign and VFM-injection designs, across three CLIP backbones, eight benchmarks, and multiple internal VFM choices. Under a single set of hyper-parameters and without per-host tuning or parameter updates, TPA consistently improves segmentation accuracy, with as few as approximately 10% of unlabeled deployment-domain images sufficing for effective bank construction on most benchmarks.
- Abstract(参考訳): Open-vocabulary semantic segmentation (OVSS)は、事前訓練されたCLIPエンコーダを、追加のラベル付き監視なしで高密度な予測のために再利用する。
既存の方法は、内部の注意を再設計するか、補助的な視覚基盤モデルから特徴を注入することでCLIPの空間的挙動を改善する。
本研究では,テストタイムプロトタイプ適応(TPA)を提案する。これはトレーニング不要なプラグインで,出力レベルで動作し,ホストのフォワードパスとウェイトは変更されない。
軽量なトランスダクティブ適応フェーズを活用することで、TPAは、未ラベルのデプロイメントドメインイメージの小さなプール上のホスト自身の出力予測からの確実なアンカーパッチを特定し、凍結されたDINO機能をクラスごとのプロトタイプに集約する。
TPAは、3つのCLIPバックボーン、8つのベンチマーク、複数の内部VFM選択にまたがる、アテンション・リデザインとVFMインジェクションの設計にまたがる5つの代表的OVSSホストで構成されている。
単一のハイパーパラメータセットの下で、ホストごとのチューニングやパラメータの更新なしに、TPAはセグメンテーションの精度を一貫して改善し、ほとんどのベンチマークで効果的なバンク構築のために、ラベル付けされていないデプロイメントドメインイメージの約10%しかサポートしていない。
関連論文リスト
- Faster or Stronger: Towards Flexible Visual Place Recognition via Weighted Aggregation and Token Pruning [27.4981354426677]
ビジュアルプレース認識(VPR)は、大規模データベース内の同じ場所の参照画像とクエリイメージをマッチングすることを目的としている。
自己蒸留による特徴抽出コストを削減するVPR指向のトークンプルーニングフレームワークであるWeiToPを紹介する。
WeiToPは、推論時にプラグアンドプレイトークンのプルーニングを可能にし、追加のトレーニングなしで正確性と効率のトレードオフを柔軟かつオンデマンドに制御できる。
論文 参考訳(メタデータ) (2026-05-19T23:01:57Z) - MoASE++: Mixture of Activation Sparsity Experts with Domain-Adaptive On-policy Distillation for Continual Test Time Adaptation [65.068801413044]
連続的なテスト時間適応は、非定常な未ラベルのターゲットストリームにソース予測モデルを適用する。
ドメインに依存しない構造をドメイン固有のテクスチャから切り離す。
論文 参考訳(メタデータ) (2026-05-18T01:52:12Z) - GAFSV-Net: A Vision Framework for Online Signature Verification [6.4768782466318795]
ImageSV-Netは、各シグネチャを6チャンネルの非対称なグラミアン角野画像SV-Netとして表現する。
デュアルブランチのConvNeXt-TinyエンコーダはGASFとGADFを独立して処理する。
We evaluate on DeepSignDB and BiosecurID, outform all sequence-based baselines training under same objectives。
論文 参考訳(メタデータ) (2026-04-30T18:21:07Z) - Neural Organ Transplantation (NOT): Checkpoint-Based Modular Adaptation for Transformer Models [0.0]
我々は、トレーニングされたトランスフォーマー層をドメイン適応のための再利用可能なチェックポイントとして機能させることができるモジュラー適応フレームワークであるNeural Organ Transplantation (NOT)を導入する。
事前訓練されたモデルから連続的なレイヤサブセット(ドナーオルガン)を抽出せず、ドメイン固有のデータで独立してトレーニングし、元のトレーニングデータにアクセスせずに互換性のあるモデルに移植可能なスタンドアロンのチェックポイントファイルとして保存する。
論文 参考訳(メタデータ) (2026-01-20T04:10:57Z) - Prototype-Guided Pseudo-Labeling with Neighborhood-Aware Consistency for Unsupervised Adaptation [12.829638461740759]
CLIPのような視覚言語モデルに対する教師なし適応では、ゼロショット予測からの擬似ラベルは大きなノイズを示すことが多い。
本稿では,プロトタイプの整合性と近傍の整合性を統合することで,CLIPの適応性能を向上させる適応型擬似ラベルフレームワークを提案する。
提案手法は、教師なし適応シナリオにおける最先端性能を実現し、計算効率を維持しつつ、より正確な擬似ラベルを提供する。
論文 参考訳(メタデータ) (2025-07-22T19:08:24Z) - Semi-supervised Semantic Segmentation with Multi-Constraint Consistency Learning [81.02648336552421]
本稿では,エンコーダとデコーダの段階的拡張を容易にするためのマルチ制約一貫性学習手法を提案する。
自己適応型特徴マスキングとノイズ注入は、デコーダの堅牢な学習のための特徴を摂動させるために、インスタンス固有の方法で設計されている。
Pascal VOC2012およびCityscapesデータセットの実験結果から,提案したMCCLが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-03-23T03:21:33Z) - Beyond the Prototype: Divide-and-conquer Proxies for Few-shot
Segmentation [63.910211095033596]
少ないショットのセグメンテーションは、少数の濃密なラベル付けされたサンプルのみを与えられた、目に見えないクラスオブジェクトをセグメンテーションすることを目的としている。
分割・分散の精神において, 単純かつ多目的な枠組みを提案する。
提案手法は、DCP(disvision-and-conquer proxies)と呼ばれるもので、適切な信頼性のある情報の開発を可能にする。
論文 参考訳(メタデータ) (2022-04-21T06:21:14Z) - Amplitude Spectrum Transformation for Open Compound Domain Adaptive
Semantic Segmentation [62.68759523116924]
オープン化合物ドメイン適応(OCDA)は、実用的な適応セットとして現れている。
我々は、新しい特徴空間振幅スペクトル変換(AST)を提案する。
論文 参考訳(メタデータ) (2022-02-09T05:40:34Z) - Exploring Sequence Feature Alignment for Domain Adaptive Detection
Transformers [141.70707071815653]
本稿では,検出変圧器の適応に特化して設計された新しいシーケンス特徴アライメント(SFA)法を提案する。
SFAはドメインクエリベースの機能アライメント(DQFA)モジュールとトークンワイド機能アライメント(TDA)モジュールで構成される。
3つの挑戦的なベンチマーク実験により、SFAは最先端のドメイン適応オブジェクト検出方法より優れていることが示された。
論文 参考訳(メタデータ) (2021-07-27T07:17:12Z) - Pruning Redundant Mappings in Transformer Models via Spectral-Normalized
Identity Prior [54.629850694790036]
スペクトル正規化アイデンティティ事前 (SNIP) は、トランスフォーマーモデルにおける残余モジュール全体をアイデンティティマッピングに向けてペナライズする構造化プルーニング手法である。
5つのGLUEベンチマークタスクでBERTを用いて実験を行い、SNIPが同等の性能を維持しながら効率的な刈り取り結果が得られることを示した。
論文 参考訳(メタデータ) (2020-10-05T05:40:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。