論文の概要: DouC: Dual-Branch CLIP for Training-Free Open-Vocabulary Segmentation
- arxiv url: http://arxiv.org/abs/2604.24997v1
- Date: Mon, 27 Apr 2026 20:59:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.600448
- Title: DouC: Dual-Branch CLIP for Training-Free Open-Vocabulary Segmentation
- Title(参考訳): DouC:Dual-Branch CLIP for Training-free Open-Vocabulary Segmentation
- Authors: Mohamad Zamini, Diksha Shukla,
- Abstract要約: DouCはトレーニングフリーのデュアルブランチCLIPフレームワークで、密度の高い予測を2つの補完的なコンポーネントに分解する。
OG-CLIPは軽量な推論時間トークンゲーティングによってパッチレベルの信頼性を向上させる。
FADE-CLIPは、凍結した視覚基盤モデルによって導かれるプロキシアテンションを通じて、外部構造を注入する。
- 参考スコア(独自算出の注目度): 0.6015898117103069
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Open-vocabulary semantic segmentation requires assigning pixel-level semantic labels while supporting an open and unrestricted set of categories. Training-free CLIP-based approaches preserve strong zero-shot generalization but typically rely on a single inference mechanism, limiting their ability to jointly address unreliable local tokens and insufficient spatial coherence. We propose DouC, a training-free dual-branch CLIP framework that decomposes dense prediction into two complementary components. OG-CLIP improves patch-level reliability via lightweight, inference-time token gating, while FADE-CLIP injects external structural priors through proxy attention guided by frozen vision foundation models. The two branches are fused at the logit level, enabling local token reliability and structure-aware patch interactions to jointly influence final predictions, with optional instance-aware correction applied as post-processing. DouC introduces no additional learnable parameters, requires no retraining, and preserves CLIP's zero-shot generalization. Extensive experiments across eight benchmarks and multiple CLIP backbones demonstrate that DouC consistently outperforms prior training-free methods and scales favorably with model capacity.
- Abstract(参考訳): オープンボキャブラリセマンティックセグメンテーションでは、ピクセルレベルのセマンティックラベルを割り当てると同時に、オープンで制限のないカテゴリのセットをサポートする必要がある。
訓練のないCLIPベースのアプローチは強力なゼロショット一般化を維持しているが、通常は単一の推論機構に依存し、信頼できない局所トークンと不十分な空間コヒーレンスに共同で対処する能力を制限する。
そこで我々は,密度予測を2つの相補的なコンポーネントに分解する,トレーニングフリーのデュアルブランチCLIPフレームワークであるDouCを提案する。
OG-CLIPは軽量な推論時間トークンゲーティングによってパッチレベルの信頼性を改善し、FADE-CLIPはフリーズされたビジョン基盤モデルによってガイドされたプロキシアテンションを通じて外部構造的事前情報を注入する。
2つのブランチはロジットレベルで融合され、ローカルトークンの信頼性と構造対応パッチのインタラクションが最終予測に共同で影響を与え、オプションのインスタンス認識補正が後処理として適用される。
DouCは、追加の学習可能なパラメータを導入せず、再トレーニングを必要とせず、CLIPのゼロショット一般化を保存する。
8つのベンチマークと複数のCLIPバックボーンにわたる大規模な実験は、DouCがトレーニング不要のメソッドとスケールをモデルキャパシティで一貫して上回っていることを示している。
関連論文リスト
- Decouple and Rectify: Semantics-Preserving Structural Enhancement for Open-Vocabulary Remote Sensing Segmentation [23.298715255853782]
リモートセンシング(RS)分野におけるオープンボキャブラリセマンティックセマンティックセマンティックセマンティクスは、言語対応認識と細粒度空間デライン化の両方を必要とする。
最近の手法は、RS-pretrained DINO特徴を導入して、これを補おうとしている。
本稿では, DR-Segを提案する。
論文 参考訳(メタデータ) (2026-04-02T13:15:05Z) - BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning [84.56022893225422]
CIL(Class-Incremental Learning)は,従来の知識を忘れずに,新たなカテゴリを継続的に学習することを目的としている。
CLIP から CIL への視覚言語モデルの適用には,次の2つの大きな課題がある。(1) 下流タスクへの適応には,新たな学習可能なモジュールを必要とする場合が多いこと,2) モデル複雑性の増大と忘れやすいこと,2) マルチモーダル表現は相補的な長所を提供する一方で,既存の手法では,視覚的およびテキスト的モダリティを効果的に統合する可能性を完全には実現できていない。
論文 参考訳(メタデータ) (2025-11-14T15:51:40Z) - Hierarchical Self-Supervised Representation Learning for Depression Detection from Speech [51.14752758616364]
音声による抑うつ検出 (SDD) は、従来の臨床評価に代わる有望で非侵襲的な代替手段である。
HAREN-CTCは,マルチタスク学習フレームワーク内でのクロスアテンションを用いて,多層SSL機能を統合した新しいアーキテクチャである。
このモデルはDAIC-WOZで0.81、MODMAで0.82の最先端マクロF1スコアを達成し、両方の評価シナリオで先行手法より優れている。
論文 参考訳(メタデータ) (2025-10-05T09:32:12Z) - Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors [50.7383184560431]
連続学習(CL)は、破滅的な忘れ込みを避けながら、ディープネットワークが新たな知識を得ることを可能にする。
インクリメンタルなプロンプトチューニングに基づくCLIPのための簡潔なCLアプローチを提案する。
我々の双方向監視戦略は、忘れを減らしながら、新しい知識をより効果的に学習することを可能にする。
論文 参考訳(メタデータ) (2025-05-27T03:51:37Z) - Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation [19.749490092520006]
Self-Calibrated CLIP (SC-CLIP) は、CLIPを校正してより微細な表現を生成する訓練不要の手法である。
SC-CLIPはバニラCLIP ViT-L/14の性能を6.8倍向上させる。
論文 参考訳(メタデータ) (2024-11-24T15:14:05Z) - Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation [38.16802763051431]
トレーニング不要なセマンティックセグメンテーション戦略であるCLIPtraseを提案する。
パッチ間の自己相関を補正することで、局所的な特徴認識を高める。
実験の結果、CLIPよりも平均して9つのセグメンテーションベンチマークで22.3%先行していることがわかった。
論文 参考訳(メタデータ) (2024-07-11T08:12:16Z) - CLAP4CLIP: Continual Learning with Probabilistic Finetuning for Vision-Language Models [23.398619576886375]
継続学習(CL)は、ディープラーニングが学習したものを保持しながら、新しい知識を学ぶのを支援することを目的としている。
タスクごとの視覚誘導テキスト機能に対する確率的モデリングフレームワークであるCLAP(Continuous LeArning with Probabilistic Finetuning)を提案する。
論文 参考訳(メタデータ) (2024-03-28T04:15:58Z) - CLIPood: Generalizing CLIP to Out-of-Distributions [73.86353105017076]
対照的に、CLIP(Language-image Pre-training)モデルでは、印象的なゼロショット能力を示しているが、下流タスクにおけるCLIPのさらなる適応は、OODのパフォーマンスを好ましくない劣化させる。
ドメインシフトとオープンクラスの両方が見えないテストデータ上で発生する可能性があるOOD状況にCLIPモデルを適用するための微調整手法であるCLIPoodを提案する。
さまざまなOODシナリオによるさまざまなデータセットの実験は、CLIPoodが既存の一般化テクニックを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2023-02-02T04:27:54Z) - DenseCLIP: Extract Free Dense Labels from CLIP [130.3830819077699]
対照的に、CLIP(Contrastive Language- Image Pre-Training)は、オープンボキャブラリゼロショット画像認識において画期的な進歩を遂げた。
DenseCLIP+はSOTAトランスダクティブなゼロショットセマンティックセグメンテーション法を大きなマージンで上回る。
我々の発見は、DenseCLIPが高密度予測タスクの信頼性の高い新たな監視源となることを示唆している。
論文 参考訳(メタデータ) (2021-12-02T09:23:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。