論文の概要: PCLM: Small-target localization with frozen CLIP via prototype contrast and local magnification
- arxiv url: http://arxiv.org/abs/2610.05115v1
- Date: Sun, 04 Oct 2026 10:48:25 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:38:51.264766
- Title: PCLM: Small-target localization with frozen CLIP via prototype contrast and local magnification
- Title(参考訳): PCLM: 試作コントラストと局所倍率による冷凍CLIPによる小型ターゲットローカライゼーション
- Abstract要約: Prototype Contrast and Local Magnification (PCLM) はフリーズされたCLIPエンコーダを使用するサポート条件付きローカライゼーション手法である。
クラスごとに5つのマスク付きサポートイメージは、均等に重み付けされた地域特徴を通じて、前景と背景のプロトタイプを定義する。
局所倍率により、シーンの小さなAPを4.51から5.68ポイント改善する。
- 参考スコア(独自算出の注目度): 13.409475573271473
- License:
- Abstract: Small targets occupy few patches in a vision-language encoder, so spatial features often mix object appearance with surrounding content. We propose Prototype Contrast and Local Magnification (PCLM), a support-conditioned localization method that uses a frozen CLIP encoder. Five masked support images per class define foreground and background prototypes through equally weighted regional features. Their difference provides a shared scoring direction for query patches, explicitly comparing target evidence with the demonstrated background. Nine overlapping query windows are enlarged and encoded independently to sample small targets more densely. Reprojection and coverage averaging combine their scores into a continuous localization map. The class direction occupies 2 KiB regardless of support count and transfers unchanged across datasets with mapped categories. On 5,047 small-target queries from VOC, COCO, ADE20K and Oxford-IIIT Pets, PCLM achieves higher mean pixel AP than every evaluated text-conditioned localization baseline on each dataset under our evaluation protocol. Gains over the strongest scene-dataset baselines range from 5.63 to 13.23 percentage points. At comparable measured latency, local magnification improves scene small-target AP by 4.51 to 5.68 points over whole-canvas enlargement. Factorial experiments show that prototype contrast increases the benefit of local observation, including under matched image-coordinate filtering. Support-budget experiments show that additional examples refine category estimation without increasing representation size or query-time scoring cost.
- Abstract(参考訳): 小さなターゲットは視覚言語エンコーダのパッチがほとんどないため、空間的特徴はしばしば周囲のコンテンツとオブジェクトの外観を混合する。
冷凍CLIPエンコーダを用いたサポート条件付きローカライゼーション手法であるPCLM(Prototype Contrast and Local Magnification)を提案する。
クラスごとに5つのマスク付きサポートイメージは、均等に重み付けされた地域特徴を通じて、前景と背景のプロトタイプを定義する。
それらの違いは、クエリパッチの共有スコアリングの方向を提供し、対象のエビデンスと実証されたバックグラウンドを明示的に比較する。
9つの重なり合うクエリウィンドウは、より密集した小さなターゲットをサンプリングするために、独立して拡張され、エンコードされる。
リジェクションとカバレッジ平均化はスコアを連続したローカライゼーションマップに組み合わせます。
クラス方向はサポート数に関わらず2KiBを占めており、マップされたカテゴリを持つデータセット間で変更されていない。
VOC,COCO,ADE20K,Oxford-IIIT Petsの5,047個の小ターゲットクエリに対して,PCLMは評価プロトコルの下で評価された各データセット上のテキスト条件のローカライゼーションベースラインよりも高い平均画素APを達成する。
最強のシーンデータセットベースラインは5.63から13.23ポイントである。
同等のレイテンシで、局所倍率により、シーンの小さなAPを4.51から5.68ポイント改善する。
因子的実験により,プロトタイプのコントラストは局所的な観測の利点を増大させることが示された。
補助予算実験では、表現サイズやクエリ時間スコアリングコストを増大させることなくカテゴリ推定を洗練させる例が示されている。
関連論文リスト
- Geometric Multi-Session Map Merging with Learned Local Descriptors [1.826848871278733]
大規模なマルチセッションポイントクラウドマップ統合のための学習ベースのローカル記述フレームワークであるGMLDを提案する。
提案フレームワークはキーポイント対応エンコーダと平面型幾何変換器を用いてループ閉包検出と相対ポーズ推定のための識別特徴を抽出する。
その結果, 高精度でロバストなマップを低誤差でマージし, ループクロージャ検出と相対ポーズ推定の両方において, 高い性能が得られることがわかった。
論文 参考訳(メタデータ) (2025-12-30T17:56:15Z) - LC-SLab -- An Object-based Deep Learning Framework for Large-scale Land Cover Classification from Satellite Imagery and Sparse In-situ Labels [25.42215602005236]
本研究では,大規模土地被覆分類のためのオブジェクトベース深層学習手法をスパース監督下で探索するLC-SLabを提案する。
LC-SLabは、グラフニューラルネットワークによる入力レベルアグリゲーションと、後処理の結果による出力レベルアグリゲーションの両方をサポートする。
その結果、オブジェクトベースの手法は、よりコヒーレントなマップを生成しながら、一般的なピクセル単位のモデルの精度を一致または超えることができることがわかった。
論文 参考訳(メタデータ) (2025-09-19T11:08:24Z) - CPR++: Object Localization via Single Coarse Point Supervision [55.8671776333499]
粗い点修正(CPR)は、アルゴリズムの観点からの意味的分散を緩和する最初の試みである。
CPRは、アノテートされた最初のポイントを置き換えるために、近隣地域のセマンティックセンターポイントを選択することで意味のばらつきを減らす。
CPR++は、スケール情報を取得し、グローバル領域における意味的分散をさらに低減することができる。
論文 参考訳(メタデータ) (2024-01-30T17:38:48Z) - Learning Continuous Implicit Field with Local Distance Indicator for
Arbitrary-Scale Point Cloud Upsampling [55.05706827963042]
点雲アップサンプリングは、疎点雲から密度が高く均一に分散した点集合を生成することを目的としている。
従来のメソッドは通常、スパースポイントクラウドをいくつかのローカルパッチ、アップサンプルパッチポイント、すべてのアップサンプルパッチにマージする。
そこで本研究では,点雲のアップサンプリングのために,局所的な先行者によって導かれる符号のない距離場を学習する手法を提案する。
論文 参考訳(メタデータ) (2023-12-23T01:52:14Z) - Background Activation Suppression for Weakly Supervised Object
Localization and Semantic Segmentation [84.62067728093358]
弱教師付きオブジェクトローカライゼーションとセマンティックセグメンテーションは、画像レベルのラベルのみを使用してオブジェクトをローカライズすることを目的としている。
画素レベルのローカライゼーションを実現するために,フォアグラウンド予測マップを生成することで,新たなパラダイムが誕生した。
本稿では,物体の局在化学習過程に関する2つの驚くべき実験結果を示す。
論文 参考訳(メタデータ) (2023-09-22T15:44:10Z) - Focus On Details: Online Multi-object Tracking with Diverse Fine-grained
Representation [6.664609484694491]
識別表現は、Multiple Object Tracking (MOT)において、各ターゲットにユニークな識別子を保持するために不可欠である
グローバル・ローカル・パースペクティブから包括的に外見を記述した多種多様なきめ細かな表現について検討する。
このきめ細かい表現は、高い特徴分解能と正確な意味情報を必要とする。
論文 参考訳(メタデータ) (2023-02-28T14:16:32Z) - Object Localization under Single Coarse Point Supervision [107.46800858130658]
本稿では,粗い点アノテーションを用いたPOL手法を提案する。
CPRは、ポイントバッグを構築し、セマンティック関連点を選択し、マルチインスタンス学習(MIL)を通してセマンティックセンターポイントを生成する。
このようにして、CPRは、粗い点監督の下で高性能オブジェクトローカライザのトレーニングを保証する、弱い制御された進化手順を定義する。
論文 参考訳(メタデータ) (2022-03-17T14:14:11Z) - Rethinking Counting and Localization in Crowds:A Purely Point-Based
Framework [59.578339075658995]
そこで本稿では,共同クラウドカウントと個別ローカライゼーションのための純粋にポイントベースのフレームワークを提案する。
我々は、P2PNet(Point to Point Network)と呼ばれる、このフレームワークの下で直感的なソリューションを設計する。
論文 参考訳(メタデータ) (2021-07-27T11:41:50Z) - Structure-Consistent Weakly Supervised Salient Object Detection with
Local Saliency Coherence [14.79639149658596]
本論文では,スクリブルアノテーションによる弱監督オブジェクト検出のための1ラウンドのエンドツーエンドトレーニング手法を提案する。
6つのベンチマークで最新のパフォーマンスを実現します。
論文 参考訳(メタデータ) (2020-12-08T12:49:40Z) - Local Context Attention for Salient Object Segmentation [5.542044768017415]
本研究では,一様表現型アーキテクチャで局所強化特徴写像を生成するための新しいローカルコンテキスト注意ネットワーク(LCANet)を提案する。
提案するネットワークでは,粗い予測と大域的コンテキストの間の相関特徴写像を計算し,アテンショナル・コリレーション・フィルタ (ACF) モジュールを導入している。
いくつかの有能なオブジェクトセグメンテーションデータセットに対して総合的な実験を行い、提案したLCANetの最先端手法に対する優れた性能を実証した。
論文 参考訳(メタデータ) (2020-09-24T09:20:06Z) - Rethinking Localization Map: Towards Accurate Object Perception with
Self-Enhancement Maps [78.2581910688094]
本研究は, カテゴリーラベルのみを監督として, 正確な対象位置分布マップと対象境界を抽出する, 新たな自己強調手法を提案する。
特に、提案されたセルフエンハンスメントマップは、ILSVRC上で54.88%の最先端のローカライゼーション精度を達成する。
論文 参考訳(メタデータ) (2020-06-09T12:35:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。