論文の概要: UniCounting: Instance-Aware Proposal Consolidation for Image-Query-Free Multi-Category Counting
- arxiv url: http://arxiv.org/abs/2610.08379v1
- Date: Tue, 06 Oct 2026 14:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.01939
- Title: UniCounting: Instance-Aware Proposal Consolidation for Image-Query-Free Multi-Category Counting
- Title(参考訳): UniCounting:イメージクエリフリーマルチカテゴリカウントのためのインスタンス対応提案の統合
- Abstract要約: 固定語彙画像クエリフリーマルチカテゴリカウントについて検討する。
各ラン毎に大域語彙が固定され、そのモデルはどのカテゴリが現れるかを知ることなく完全なカテゴリ数ベクトルを予測する。
オーバーコンプリートな提案セットに対して、インスタンス対応構造推論としてカウントするUniCountingを提案する。
- 参考スコア(独自算出の注目度): 19.461136904848992
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual counting is commonly formulated as counting a single specified target, with a model receiving an image-specific exemplar, text query, or target category and returning a single count. We instead study fixed-vocabulary image-query-free multi-category counting. A global vocabulary is fixed for each run, and, given only an RGB image, the model predicts a complete category--count vector without being told which categories appear. We present UniCounting, which casts counting as instance-aware structural inference over an over-complete proposal set. Generic segmenters produce duplicate masks, partial views, and proposals from neighboring instances; semantic scores can name them but cannot determine which denote the same object. Frozen SAM~2.1 generates masks, while frozen DINOv2 and OpenCLIP provide relation and category features. A 3,267-parameter category-shared relation head predicts same-instance affinities from instance-mask-derived supervision. Sparse graph construction, representative selection, labeling, and background-margin admission then convert each admitted component into one count with replayable group evidence. Only the relation head is trained, without count or density-map targets. On COCO clean500, UniCounting obtains lower point-estimate vector $\ell_1$ error and absent-class false mass than calibrated OWLv2-All80, with comparable micro presence F1. Under a matched decoder, the learned relation reduces both errors relative to mask containment, mask IoU, CLIP, and DINO, while revealing a fragmentation--merge trade-off. We also report transfer diagnostics on OmniCount-sub, FSC-147, and CARPK.
- Abstract(参考訳): ビジュアルカウントは、イメージ固有の例え、テキストクエリ、ターゲットカテゴリを受け取り、単一のカウントを返すモデルで、単一の指定されたターゲットをカウントする、という形式が一般的である。
代わりに、固定語彙画像クエリフリーマルチカテゴリカウントについて研究する。
ラン毎に大域語彙が固定され、RGB画像のみを与えられたモデルでは、どのカテゴリが現れるかを知ることなく、完全なカテゴリ数ベクトルを予測する。
オーバーコンプリートな提案セットに対して、インスタンス認識構造推論としてカウントするUniCountingを提案する。
ジェネリックセグメンタは、隣接するインスタンスから重複マスク、部分ビュー、提案を生成します。
凍ったSAM~2.1はマスクを生成し、凍結したDINOv2とOpenCLIPは関連性とカテゴリの特徴を提供する。
3,267パラメータのカテゴリ共有関係ヘッドは、インスタンスマスク由来の監視から同一のインスタンス親和性を予測する。
スパースグラフの構成、代表選択、ラベリング、バックグラウンドマージンの入力は、各々の受け入れた成分を再生可能なグループエビデンスで1つのカウントに変換する。
カウントや密度マップのターゲットを使わずに、リレーションヘッドのみをトレーニングする。
COCO clean500では、UniCountingは検定されたOWLv2-All80よりも低い点推定ベクトル$\ell_1$エラーと非クラス偽質量を得る。
一致したデコーダの下では、学習された関係は、マスク封じ込め、マスクIoU、CLIP、DINOに対するエラーを減らし、断片化とマージのトレードオフを明らかにする。
OmniCount-sub, FSC-147, CARPKの転移診断も報告した。
関連論文リスト
- Count Anything [41.17667085289094]
そこで,モデルが画像と自然言語クエリを入力として取り出し,対象点のインスタンスグラウンドセットを返却する。
CLOCに基づいてテキスト誘導オブジェクトカウントの一般化モデルであるCount Anythingを提案する。
論文 参考訳(メタデータ) (2026-05-29T05:08:31Z) - Count Anything at Any Granularity [55.70950689938894]
KubriCountは、これまでで最大で、最も包括的な注釈付きカウントデータセットである。
テキストと視覚的特徴を相補的なターゲット仕様として併用する多粒カウントモデルを訓練する。
HieraCountは、マルチグラデーションカウントの精度を大幅に改善し、現実のシナリオに対して堅牢に一般化する。
論文 参考訳(メタデータ) (2026-05-11T17:32:37Z) - LESS: Label-Efficient and Single-Stage Referring 3D Segmentation [55.06002976797879]
参照3Dは、クエリの文で記述された3Dポイントクラウドから、指定されたオブジェクトのすべてのポイントをセグメントする視覚言語タスクである。
本稿では,LESSと呼ばれるレファレンス3次元パイプラインを提案する。
ScanReferデータセット上での最先端のパフォーマンスは、バイナリラベルのみを使用して、以前の3.7% mIoUの手法を上回ります。
論文 参考訳(メタデータ) (2024-10-17T07:47:41Z) - OmniCount: Multi-label Object Counting with Semantic-Geometric Priors [52.28092505350977]
本稿では,オープン語彙フレームワークを用いた複数のオブジェクトカテゴリの同時カウントを実現するための,より実践的なアプローチを提案する。
我々のソリューションであるOmniCountは、事前訓練されたモデルから意味的および幾何学的な洞察(優先順位)を用いて、ユーザが指定した複数のカテゴリのオブジェクトをカウントすることで際立っている。
OmniCount-191の包括的な評価は、他の主要なベンチマークとともに、OmniCountの例外的なパフォーマンスを示し、既存のソリューションを大幅に上回っている。
論文 参考訳(メタデータ) (2024-03-08T16:38:11Z) - Point, Segment and Count: A Generalized Framework for Object Counting [40.192374437785155]
クラスに依存しないオブジェクトカウントは、例ボックスやクラス名に関して、イメージ内のすべてのオブジェクトをカウントすることを目的としている。
本稿では,検出に基づく少数ショットとゼロショットの両方のオブジェクトカウントのための一般化されたフレームワークを提案する。
PseCoは、少数ショット/ゼロショットオブジェクトカウント/検出の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-11-21T06:55:21Z) - Reflection Invariance Learning for Few-shot Semantic Segmentation [53.20466630330429]
Few-shot semantic segmentation (FSS) は、いくつかのアノテーション付きサポートイメージを持つクエリイメージにおいて、目に見えないクラスのオブジェクトをセグメントすることを目的としている。
本稿では,マルチビューマッチング方式でリフレクション不変性をマイニングするための,新しい数ショットセグメンテーションフレームワークを提案する。
PASCAL-$5textiti$とCOCO-$20textiti$データセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-06-01T15:14:58Z) - Matcher: Segment Anything with One Shot Using All-Purpose Feature
Matching [63.88319217738223]
市販の視覚基礎モデルを用いて様々な知覚課題に対処する新しい知覚パラダイムであるMatcherを提案する。
Matcherは、様々なセグメンテーションタスクにまたがる印象的な一般化パフォーマンスを、すべてトレーニングなしでデモする。
我々の結果は、野生の画像に適用されたMatcherのオープンワールドの一般性と柔軟性をさらに示すものである。
論文 参考訳(メタデータ) (2023-05-22T17:59:43Z) - SOLO: A Simple Framework for Instance Segmentation [84.00519148562606]
インスタンスカテゴリ"は、インスタンスの場所に応じて、インスタンス内の各ピクセルにカテゴリを割り当てる。
SOLO"は、強力なパフォーマンスを備えたインスタンスセグメンテーションのための、シンプルで、直接的で、高速なフレームワークです。
提案手法は, 高速化と精度の両面から, 実例分割の最先端結果を実現する。
論文 参考訳(メタデータ) (2021-06-30T09:56:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。