論文の概要: CLIP-Guided Label-Free Discriminative Region Scoring for Fine-Grained Classification
- arxiv url: http://arxiv.org/abs/2607.13437v1
- Date: Wed, 15 Jul 2026 04:40:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.639453
- Title: CLIP-Guided Label-Free Discriminative Region Scoring for Fine-Grained Classification
- Title(参考訳): 細粒度分類のためのCLIP-Guided Label-free Discriminative Region Scoring
- Authors: Yujie Zhu,
- Abstract要約: 粒度分類のためのCLIP誘導型ラベルフリー領域スコアリングフレームワークを提案する。
このフレームワークは、SAM生成マスクとランダム作物の両方を用いてコサイン類似性、マージンベース、エントロピーに基づく評価戦略を評価する。
我々は,5つのきめ細かい分類データセットを用いて,異なる領域生成手法と評価戦略を体系的に比較する実験を行った。
- 参考スコア(独自算出の注目度): 0.9669369645900444
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent vision models such as CLIP and SAM enable training-free segmentation and semantic encoding for fine-grained classification. A common approach is to compare the representations of segmented image regions with the text prompt embeddings of the corresponding labels. However, it remains unclear how different local regions and CLIP-based scoring strategies affect the selection of discriminative evidence, especially when ground-truth labels are unavailable. In this paper, we propose a unified CLIP-guided label-free region scoring framework for fine-grained classification. The framework evaluates cosine similarity-based, margin-based, and entropy-based scoring strategies using both SAM-generated masks and random crops, and introduces two label-free pseudo-label variants based on global image embeddings and local region embeddings. We conduct experiments on five fine-grained classification datasets to systematically compare different region generation methods and scoring strategies. The results show that Soft Negative Margin scoring achieves the strongest performance, and pseudo-label scoring closely approximates true-label performance. Although SAM produces semantically meaningful masks, random-crop-based pseudo-label scoring consistently outperforms SAM-based scoring across all datasets, suggesting that random crops preserve surrounding information and provide more stable semantic context when pseudo-labels are noisy. In addition, SAM masks benefit from aggregating embeddings from all regions, whereas random crops tend to perform better with a smaller top-k subset. These findings provide new insights for fine-grained classification.
- Abstract(参考訳): 近年のCLIPやSAMのようなビジョンモデルでは、きめ細かい分類のためのトレーニング不要なセグメンテーションとセマンティックエンコーディングが実現されている。
一般的なアプローチは、セグメント化された画像領域の表現と対応するラベルのテキストプロンプト埋め込みを比較することである。
しかし,地域差やCLIPに基づく評価戦略が差別的証拠の選択にどのような影響を及ぼすかは明らかになっていない。
本稿では,詳細な分類のためのCLIP誘導型ラベルフリー領域スコアリングフレームワークを提案する。
このフレームワークは、SAM生成マスクとランダムな作物の両方を用いてコサイン類似性に基づく、マージンに基づく、エントロピーに基づく評価戦略を評価し、グローバルな画像埋め込みと局所的な埋め込みに基づく2つのラベルのない擬ラベル変異を導入する。
我々は,5つのきめ細かい分類データセットを用いて,異なる領域生成手法と評価戦略を体系的に比較する実験を行った。
その結果,ソフト負のマージンスコアは最強のパフォーマンスを達成し,擬似ラベルスコアは真-ラベルスコアを近似することがわかった。
SAMは意味的に意味のあるマスクを生成するが、ランダムクロップベースの擬似ラベルスコアは、すべてのデータセットでSAMベースのスコアよりも一貫して優れており、擬似ラベルがうるさい場合には、ランダムな作物が周囲の情報を保存し、より安定した意味的コンテキストを提供することを示唆している。
さらにSAMマスクは、すべての領域からの埋め込みを集約することの恩恵を受ける一方、ランダムな作物は、より小さなトップkサブセットでより良く機能する傾向にある。
これらの発見は、きめ細かい分類の新しい洞察を与える。
関連論文リスト
- Do Instance Priors Help Weakly Supervised Semantic Segmentation? [82.75875820720616]
SeSAMは、セグメンテーションモデル(Segment Anything Model、SAM)と弱いラベルを持つフレームワークである。
SeSAMはクラスマスクを接続されたコンポーネントに分解し、オブジェクトスケルトンに沿ってサンプルポイントプロンプトを抽出し、弱いラベルカバレッジを使用してSAMマスクを選択し、擬似ラベルを使用してラベルを反復的に洗練する。
SeSAMは、半教師付き学習フレームワークと統合され、基底構造ラベル、SAMベースの擬似ラベル、高信頼の擬似ラベルのバランスをとる。
論文 参考訳(メタデータ) (2026-04-13T08:29:49Z) - Learning Semantic-Aware Threshold for Multi-Label Image Recognition with Partial Labels [12.477433449244543]
部分ラベル付きマルチラベル画像認識(MLR-PL)は、既知のラベルと未知のラベルを混合してモデルを訓練するように設計されている。
従来の手法は、識別されていないラベルの擬似ラベルを作成するために意味的あるいは特徴的相関に依存する。
本研究では,Semantic-Aware Threshold Learning (SATL)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-07-31T05:54:10Z) - TagCLIP: A Local-to-Global Framework to Enhance Open-Vocabulary
Multi-Label Classification of CLIP Without Training [29.431698321195814]
Contrastive Language-Image Pre-Training (CLIP) はオープン語彙分類において顕著な能力を示した。
CLIPは、グローバル機能が最も顕著なクラスに支配される傾向があるため、マルチラベルデータセットのパフォーマンスが低い。
画像タグを得るための局所言語フレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-20T08:15:40Z) - Prompt-based Pseudo-labeling Strategy for Sample-Efficient Semi-Supervised Extractive Summarization [12.582774521907227]
半教師付き学習(SSL)は、ラベル付きデータが不足し、ラベルなしデータが豊富であるシナリオで広く使われているテクニックである。
標準SSLメソッドは、まず分類モデルをトレーニングし、次に分類器の信頼性値を使用して擬似ラベルを選択するために教師-学生パラダイムに従う。
より正確な擬似ラベルでラベルなしのサンプルを抽出するLLMを用いたプロンプトベースの擬似ラベル方式を提案する。
論文 参考訳(メタデータ) (2023-11-16T04:29:41Z) - Generalized Category Discovery with Clustering Assignment Consistency [56.92546133591019]
一般化圏発見(GCD)は、最近提案されたオープンワールドタスクである。
クラスタリングの一貫性を促進するための協調学習ベースのフレームワークを提案する。
提案手法は,3つの総合的なベンチマークと3つのきめ細かい視覚認識データセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2023-10-30T00:32:47Z) - Class-Distribution-Aware Pseudo Labeling for Semi-Supervised Multi-Label
Learning [97.88458953075205]
Pseudo-labelingは、ラベルなしデータを利用するための人気で効果的なアプローチとして登場した。
本稿では,クラスアウェアの擬似ラベル処理を行うCAP(Class-Aware Pseudo-Labeling)という新しい手法を提案する。
論文 参考訳(メタデータ) (2023-05-04T12:52:18Z) - Semi-Supervised Semantic Segmentation With Region Relevance [28.92449538610617]
半教師付きセマンティックセグメンテーションは、少数のラベル付きデータと多くのラベルなしデータから学ぶことを目的としている。
最も一般的なアプローチは、トレーニングデータを増やすためにラベルのない画像のための擬似ラベルを生成することである。
本稿では、上記の問題を緩和する地域関連ネットワーク(RRN)を提案する。
論文 参考訳(メタデータ) (2023-04-23T04:51:27Z) - Rethinking Pseudo Labels for Semi-Supervised Object Detection [84.697097472401]
物体検出に適した確実な擬似ラベルを導入する。
我々は,クラス不均衡問題を緩和するために,各カテゴリの擬似ラベルと再重み付き損失関数を生成するために使用する閾値を動的に調整する。
提案手法では,COCOのラベル付きデータのみを用いて,教師付きベースラインを最大10%改善する。
論文 参考訳(メタデータ) (2021-06-01T01:32:03Z) - The Weakly-Labeled Rand Index [2.989889278970106]
SASサーベイは海底型間の大きな遷移領域を持つ画像を生成する。
画像のラベル付けと分割は困難であり、さらに画像のセグメンテーションを適切にスコア付けすることが困難である。
論文 参考訳(メタデータ) (2021-03-08T16:21:15Z) - Joint Visual and Temporal Consistency for Unsupervised Domain Adaptive
Person Re-Identification [64.37745443119942]
本稿では,局所的なワンホット分類とグローバルなマルチクラス分類を組み合わせることで,視覚的・時間的整合性を両立させる。
3つの大規模ReIDデータセットの実験結果は、教師なしと教師なしの両方のドメイン適応型ReIDタスクにおいて提案手法の優位性を示す。
論文 参考訳(メタデータ) (2020-07-21T14:31:27Z) - MatchGAN: A Self-Supervised Semi-Supervised Conditional Generative
Adversarial Network [51.84251358009803]
本稿では,条件付き生成逆数ネットワーク(GAN)に対する,半教師付き環境下での自己教師型学習手法を提案する。
利用可能な数少ないラベル付きサンプルのラベル空間から無作為なラベルをサンプリングして拡張を行う。
本手法は,ベースラインのトレーニングに使用したラベル付きサンプルの20%に過ぎません。
論文 参考訳(メタデータ) (2020-06-11T17:14:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。