論文の概要: Count Anything
- arxiv url: http://arxiv.org/abs/2605.30846v1
- Date: Fri, 29 May 2026 05:08:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.396249
- Title: Count Anything
- Title(参考訳): Count (複数形 Counts)
- Abstract要約: そこで,モデルが画像と自然言語クエリを入力として取り出し,対象点のインスタンスグラウンドセットを返却する。
CLOCに基づいてテキスト誘導オブジェクトカウントの一般化モデルであるCount Anythingを提案する。
- 参考スコア(独自算出の注目度): 41.17667085289094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Object counting remains fragmented across domain-specific datasets and task formulations, despite rapid progress in generalist vision models. Existing counting models are often tailored to scenarios such as crowds, vehicles, cells, crops, or remote-sensing objects, and thus struggle to generalize across categories, visual domains, object scales, and density distributions. In this paper, we study text-guided object counting across domains, where a model takes an image and a natural-language query as input and returns an instance-grounded set of target points whose cardinality gives the count. This formulation unifies category-conditioned counting with interpretable spatial localization. To support this setting, we construct CLOC, a Cross-domain Large-scale Object Counting dataset that reorganizes diverse public data sources into a unified benchmark. CLOC covers six visual domains: General Scene, Remote Sensing, Histopathology, Cellular Microscopy, Agriculture, and Microbiology, with about 220K images, 619 categories, and 15M object instances. Based on CLOC, we propose Count Anything, a generalist model for text-guided object counting. Unlike density-map-based methods, which dominate counting models, Count Anything adopts discrete instance points and performs dual-granularity instance enumeration. A Region-level Sparse Counter provides object-level anchors for large and sparse targets, while a Pixel-level Dense Counter handles small, crowded, and weakly bounded targets via dense point prediction. A point-centric supervision strategy enables learning from heterogeneous annotations, and Complementary Count Fusion combines both counters in a parameter-free manner. Extensive experiments show that Count Anything achieves strong accuracy and multi-domain generalization, outperforming existing open-world counting methods. Code is available at: https://github.com/Mengqi-Lei/count-anything.
- Abstract(参考訳): 汎用的なビジョンモデルが急速に進歩しているにもかかわらず、オブジェクトカウントはドメイン固有のデータセットとタスクの定式化の間で断片化されている。
既存のカウントモデルは、しばしば群衆、車、細胞、作物、リモートセンシングオブジェクトなどのシナリオに合わせて調整され、それゆえ、カテゴリ、視覚領域、オブジェクトスケール、密度分布の一般化に苦慮する。
そこで本研究では,モデルが画像と自然言語クエリを入力として取り出し,濃度がカウントを与えるターゲットポイントのインスタンスグラウンドセットを返却する,ドメイン間のテキスト誘導対象数について検討する。
この定式化は、解釈可能な空間的局所化を伴う圏条件カウントを統一する。
この設定をサポートするために,多種多様な公開データソースを統一されたベンチマークに再構成するクロスドメイン大規模オブジェクトカウントデータセットであるCLOCを構築した。
CLOCは、一般的なシーン、リモートセンシング、病理、細胞顕微鏡、農業、微生物学の6つの視覚領域をカバーしており、約220Kの画像、619のカテゴリ、1500万のオブジェクトインスタンスがある。
CLOCに基づいてテキスト誘導オブジェクトカウントの一般化モデルであるCount Anythingを提案する。
カウントモデルを支配する密度マップベースの手法とは異なり、Count Anythingは個別のインスタンスポイントを採用し、二重粒度インスタンス列挙を行う。
リージョンレベルのスパースカウンタは、大きくスパースなターゲットに対してオブジェクトレベルのアンカーを提供し、PixelレベルのDenseカウンタは、密度の高いポイント予測を通じて、小さく、混雑し、弱い境界付けられたターゲットを処理する。
ポイント中心の監視戦略は異種アノテーションからの学習を可能にし、補数核融合は両カウンタをパラメータフリーで結合する。
大規模な実験により、Count Anythingは強力な精度とマルチドメインの一般化を実現し、既存のオープンワールドカウント法よりも優れていることが示された。
コードは、https://github.com/Mengqi-Lei/count-anything.comで入手できる。
関連論文リスト
- Count Anything at Any Granularity [55.70950689938894]
KubriCountは、これまでで最大で、最も包括的な注釈付きカウントデータセットである。
テキストと視覚的特徴を相補的なターゲット仕様として併用する多粒カウントモデルを訓練する。
HieraCountは、マルチグラデーションカウントの精度を大幅に改善し、現実のシナリオに対して堅牢に一般化する。
論文 参考訳(メタデータ) (2026-05-11T17:32:37Z) - Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting [59.37613121962146]
本稿では,クラスに依存しないオブジェクトカウントのためのMLLM駆動型弱教師付きフレームワークWS-COCを提案する。
WS-COCは、多くの最先端の完全に管理されたメソッドと一致し、また、アノテーションのコストを大幅に削減します。
論文 参考訳(メタデータ) (2026-02-13T09:58:35Z) - OmniCount: Multi-label Object Counting with Semantic-Geometric Priors [52.28092505350977]
本稿では,オープン語彙フレームワークを用いた複数のオブジェクトカテゴリの同時カウントを実現するための,より実践的なアプローチを提案する。
我々のソリューションであるOmniCountは、事前訓練されたモデルから意味的および幾何学的な洞察(優先順位)を用いて、ユーザが指定した複数のカテゴリのオブジェクトをカウントすることで際立っている。
OmniCount-191の包括的な評価は、他の主要なベンチマークとともに、OmniCountの例外的なパフォーマンスを示し、既存のソリューションを大幅に上回っている。
論文 参考訳(メタデータ) (2024-03-08T16:38:11Z) - AFreeCA: Annotation-Free Counting for All [17.581015609730017]
対象物に関連する特徴を学習するための教師なしソート手法を導入する。
また,画像を確実にカウント可能な被写体を含むパッチに分割する密度分類器誘導方式を提案する。
論文 参考訳(メタデータ) (2024-03-07T23:18:34Z) - Point, Segment and Count: A Generalized Framework for Object Counting [40.192374437785155]
クラスに依存しないオブジェクトカウントは、例ボックスやクラス名に関して、イメージ内のすべてのオブジェクトをカウントすることを目的としている。
本稿では,検出に基づく少数ショットとゼロショットの両方のオブジェクトカウントのための一般化されたフレームワークを提案する。
PseCoは、少数ショット/ゼロショットオブジェクトカウント/検出の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-11-21T06:55:21Z) - Zero-Shot Object Counting with Language-Vision Models [50.1159882903028]
クラスに依存しないオブジェクトカウントは、テスト時に任意のクラスのオブジェクトインスタンスをカウントすることを目的としている。
現在の手法では、新しいカテゴリではしばしば利用できない入力として、人間に注釈をつけた模範を必要とする。
テスト期間中にクラス名のみを利用できる新しい設定であるゼロショットオブジェクトカウント(ZSC)を提案する。
論文 参考訳(メタデータ) (2023-09-22T14:48:42Z) - Dilated-Scale-Aware Attention ConvNet For Multi-Class Object Counting [18.733301622920102]
多クラスオブジェクトカウントは、オブジェクトカウントタスクの適用範囲を広げる。
マルチターゲット検出タスクは、いくつかのシナリオでマルチクラスオブジェクトカウントを実現することができる。
ポイントレベルのアノテーションに基づく簡便かつ効率的なカウントネットワークを提案する。
論文 参考訳(メタデータ) (2020-12-15T08:38:28Z) - Rethinking Object Detection in Retail Stores [55.359582952686175]
そこで我々はLocountと略される新しいタスク、同時にオブジェクトのローカライゼーションとカウントを提案する。
Locountは、関心のあるオブジェクトのグループをインスタンス数でローカライズするアルゴリズムを必要とする。
大規模オブジェクトのローカライズと数えるデータセットを小売店で収集する。
論文 参考訳(メタデータ) (2020-03-18T14:01:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。