論文の概要: Repurposing CLIP to Localize at Pixel Level
- arxiv url: http://arxiv.org/abs/2607.05253v1
- Date: Mon, 06 Jul 2026 16:00:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.232592
- Title: Repurposing CLIP to Localize at Pixel Level
- Title(参考訳): CLIPをPixelレベルでローカライズするために再利用する
- Authors: Jiaxiang Fang, Shiqiang Ma, Jing Wang, Siyu Chen, Fei Guo, Shengfeng He,
- Abstract要約: ピクセルレベルのローカライゼーションを行うためにCLIPを再利用するフレームワークであるCLIPixを紹介する。
CLIPの分類プロセスを遡ることで、CLIPixはオブジェクト固有の注意領域を特定し、ピクセルレベルのローカライゼーションキューとして再利用する。
提案手法は,CLIPの一般化強度を保ち,任意のオブジェクトをセグメント化する可能性を解き放つ。
- 参考スコア(独自算出の注目度): 45.29918547765855
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large-scale Vision-Language Models like CLIP have demonstrated impressive open-set localization capabilities at the image level. However, adapting this capability to pixel-level dense prediction poses challenges due to global feature biases. In this paper, we introduce CLIPix, a simple yet effective framework that repurposes CLIP to perform pixel-level localization. By tracing back CLIP's classification process, CLIPix identifies object-specific attentive regions and repurposes them as pixel-level localization cues. To address noise introduced by global biases, we propose a Noise-Resistant Correction strategy, refining these cues for more precise segmentation. Additionally, we introduce a Localization Embedding strategy to integrate both localization and enriched detail information, enabling accurate, high-resolution segmentation. Our approach preserves CLIP's generalization strength and unlocks its potential for segmenting arbitrary objects. Extensive experiments on the PASCAL and COCO datasets demonstrate that CLIPix achieves state-of-the-art performance, underscoring its effectiveness.
- Abstract(参考訳): CLIPのような大規模ビジョンランゲージモデルでは、イメージレベルでのオープンセットローカライゼーション機能が目覚ましい。
しかし、この能力をピクセルレベルの高密度予測に適応させることは、グローバルな特徴バイアスによる課題を引き起こす。
本稿では,CLIPを用いて画素レベルのローカライゼーションを行うシンプルなフレームワークであるCLIPixを紹介する。
CLIPの分類プロセスを遡ることで、CLIPixはオブジェクト固有の注意領域を特定し、ピクセルレベルのローカライゼーションキューとして再利用する。
グローバルバイアスによるノイズに対処するため,より精密なセグメンテーションのためのノイズ抵抗補正手法を提案する。
さらに,ローカライゼーション・エンリッチディテール情報を統合し,高精度なセグメンテーションを可能にするローカライズ・エンベディング・ストラテジーを導入する。
提案手法は,CLIPの一般化強度を保ち,任意のオブジェクトをセグメント化する可能性を解き放つ。
PASCALとCOCOデータセットに関する大規模な実験は、CLIPixが最先端のパフォーマンスを達成し、その効果を裏付けていることを示している。
関連論文リスト
- CLNet: Cross-View Correspondence Makes a Stronger Geo-Localizationer [48.52152634356309]
本稿では,異なるビュー間の意味的および幾何学的ギャップを明示的に橋渡しする,CLNetと呼ばれる通信対応機能改善フレームワークを提案する。
CLNetはビューアライメントプロセスを3つの学習可能な補完モジュールに分解する。
提案するCLNetは、より優れた解釈性と一般化性を提供しながら、最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-16T16:31:41Z) - Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective [47.99651635870674]
本研究では,人間の注意を標的領域へ向けて注意を向けるために,注意喚起行動のエミュレートを行うトレーニングフリーアプローチを提案する。
提案手法は,高い推論効率を維持しつつ,8つのベンチマーク上でのSOTA性能を実現する。
論文 参考訳(メタデータ) (2025-11-20T09:16:33Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - Helping CLIP See Both the Forest and the Trees: A Decomposition and Description Approach [43.419607730361996]
CLIPのようなビジョンランゲージモデル(VLM)は、対照的な学習を通じて、横断的なアライメントを実現する。
伝統的なプロンプトエンジニアリングは、きめ細かいカテゴリラベルに依存しており、きめ細かい局所的意味論を無視している。
そこで我々は,CLIPが局所化された視覚ディスクリプタを処理できるプラグイン・アンド・プレイソリューションを提案する。
論文 参考訳(メタデータ) (2025-07-04T10:24:26Z) - Self-Calibrated CLIP for Training-Free Open-Vocabulary Segmentation [19.749490092520006]
Self-Calibrated CLIP (SC-CLIP) は、CLIPを校正してより微細な表現を生成する訓練不要の手法である。
SC-CLIPはバニラCLIP ViT-L/14の性能を6.8倍向上させる。
論文 参考訳(メタデータ) (2024-11-24T15:14:05Z) - Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation [38.16802763051431]
トレーニング不要なセマンティックセグメンテーション戦略であるCLIPtraseを提案する。
パッチ間の自己相関を補正することで、局所的な特徴認識を高める。
実験の結果、CLIPよりも平均して9つのセグメンテーションベンチマークで22.3%先行していることがわかった。
論文 参考訳(メタデータ) (2024-07-11T08:12:16Z) - Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation [20.880942041889444]
画像からピクセルへのCLIPの適応性を改善する一段階アプローチであるSPT-SEGを提案する。
具体的には、スペクトルプロンプトチューニング(SPT)を導入し、CLIP視覚エンコーダの浅い層にスペクトルプロンプトを組み込む。
我々は、最先端のアプローチよりもメソッドが優れていることを実証し、すべてのクラスでうまく機能し、特に目に見えないクラスを扱うのに優れています。
論文 参考訳(メタデータ) (2023-12-20T04:27:13Z) - CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense
Prediction [67.43527289422978]
そこで我々は,CLIPSelfというアプローチを提案し,CLIP ViTの画像レベルの認識能力を局所画像領域に適用する。
オープンボキャブラリオブジェクト検出,セマンティックセグメンテーション,パン光学セグメンテーションを,様々なベンチマークで実現した。
論文 参考訳(メタデータ) (2023-10-02T17:58:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。