論文の概要: GKDT: General Keypoint Detection Transformer
- arxiv url: http://arxiv.org/abs/2607.00752v1
- Date: Wed, 01 Jul 2026 10:37:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.856564
- Title: GKDT: General Keypoint Detection Transformer
- Title(参考訳): GKDT: 一般的なキーポイント検出変換器
- Authors: Changsheng Lu, Yuxin Chen, Haokun Gui, Rong Wang, Jie Yang, Harry Yang, Anton van den Hengel, Jiaya Jia,
- Abstract要約: 本稿では,MegaKPTと呼ばれる大規模統合キーポイントデータセットを提案する。
データセットは、21の既存のデータセットから13万以上の多様なオブジェクトインスタンスで構成されている。
MegaKPTに基づいて,汎用キーポイント検出のためのシンプルで柔軟なDINOv3ベースのトランスフォーマモデルであるGKDTを開発した。
- 参考スコア(独自算出の注目度): 85.07219285562591
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: With the emergence of various pre-trained vision and language models, computer vision is shifting from narrow-domain to open-domain recognition. The construction of a more powerful yet general keypoint detection (GKD) model to support diverse tasks has become increasingly important in the field. To this end, we firstly present a large-scale unified keypoint dataset called MegaKPT. The dataset is composed of over 1.3 million diverse object instances from twenty-nine existing datasets, and enjoys high-quality unified annotations with keypoint text descriptions. Based on MegaKPT, we develop GKDT, a simple, flexible and powerful DINOv3 based Transformer model for General Keypoint Detection. Our GKDT supports visual prompts, text prompts, or both. To enhance model training, we also propose a suite of useful strategies such as mix-modal prompted training and dynamic importance sampling. By testing over 22 test sets with seen or unseen objects, our single GKDT model shows strong performance and generality in detecting keypoints on broad categories, with most categories over 90\% PCK@0.1 accuracy, offering high practical applicability to real-world problems. The dataset, models, and codes will be released at https://github.com/AlanLuSun/General-Keypoint-Detection.
- Abstract(参考訳): 様々な事前訓練されたビジョンと言語モデルが出現し、コンピュータビジョンは狭義のドメインからオープンなドメイン認識へとシフトしつつある。
多様なタスクをサポートするために、より強力で汎用的なキーポイント検出(GKD)モデルを構築することが、この分野においてますます重要になっている。
そこで我々はまず,MegaKPTと呼ばれる大規模統合キーポイントデータセットを提案する。
このデータセットは、21の既存データセットから13万以上の多様なオブジェクトインスタンスで構成され、キーポイントテキスト記述による高品質な統一アノテーションを享受している。
MegaKPTに基づいて,汎用キーポイント検出のためのシンプルで柔軟なDINOv3ベースのトランスフォーマモデルであるGKDTを開発した。
私たちのGKDTは、視覚的なプロンプト、テキストプロンプト、あるいは両方をサポートしています。
また、モデルトレーニングを強化するために、ミックスモーダルによるトレーニングや動的重要度サンプリングなどの有用な戦略も提案する。
対象物が見えない22以上のテストセットをテストすることで、我々の単一のGKDTモデルは、広範囲なカテゴリにおけるキーポイントの検出において、高いパフォーマンスと汎用性を示し、ほとんどのカテゴリは、90\% PCK@0.1の精度で、実世界の問題に高い実用性を提供する。
データセット、モデル、コードはhttps://github.com/AlanLuSun/General-Keypoint-Detectionでリリースされる。
関連論文リスト
- KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model [31.59640895434506]
キーポイントは、構造認識、ピクセルレベル、オブジェクトのコンパクトな表現として、きめ細かい画像解析、オブジェクトの検索、行動認識などのアプリケーションにおいて重要な役割を果たす。
本稿では,KptLLM++を提案する。KptLLM++は,汎用的なキーポイント理解のために設計された,新しいマルチモーダルな大規模言語モデルである。
さまざまなコンテキストにまたがるキーポイント検出を統一することにより、KptLLM++は、より効果的なヒューマンとAIのコラボレーションを促進する、高度なインターフェースとしての地位を確立している。
論文 参考訳(メタデータ) (2025-07-15T08:52:28Z) - Keypoint Abstraction using Large Models for Object-Relative Imitation Learning [78.92043196054071]
多様なタスクや環境にまたがる新しいオブジェクト構成やインスタンスへの一般化は、ロボット工学において重要な課題である。
キーポイントに基づく表現は、本質的なオブジェクトキャプチャ機能のための簡潔な表現として有効であることが証明されている。
本稿では,タスク関連およびクロスインスタンス整合性キーポイントの自動生成に,大規模な事前学習型視覚言語モデルを活用するフレームワークであるKALMを提案する。
論文 参考訳(メタデータ) (2024-10-30T17:37:31Z) - Plain-Det: A Plain Multi-Dataset Object Detector [22.848784430833835]
Plain-Detは、新しいデータセットに対応する柔軟性、さまざまなデータセットのパフォーマンス、トレーニング効率を提供する。
13の下流データセットに対して広範な実験を行い、Plain-Detは強力な一般化能力を示す。
論文 参考訳(メタデータ) (2024-07-14T05:18:06Z) - DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection [111.68263493302499]
DetCLIPv3は、オープンボキャブラリオブジェクト検出と階層ラベルの両方で優れた高性能検出器である。
DetCLIPv3は,1)Versatileモデルアーキテクチャ,2)高情報密度データ,3)効率的なトレーニング戦略の3つのコア設計によって特徴付けられる。
DetCLIPv3は、GLIPv2, GroundingDINO, DetCLIPv2をそれぞれ18.0/19.6/6 APで上回り、優れたオープン語彙検出性能を示す。
論文 参考訳(メタデータ) (2024-04-14T11:01:44Z) - X-Pose: Detecting Any Keypoints [28.274913140048003]
X-Poseは画像内の複数オブジェクトのキーポイント検出のための新しいフレームワークである。
UniKPTはキーポイント検出データセットの大規模なデータセットである。
X-Poseは、最先端の非プロンプタブル、視覚的プロンプトベース、テキスト的プロンプトベースメソッドに対する顕著な改善を実現している。
論文 参考訳(メタデータ) (2023-10-12T17:22:58Z) - Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching [74.75284453828017]
Open-Vocabulary Keypoint Detection (OVKD)タスクは、任意の種類のキーポイントを特定するためにテキストプロンプトを使用するように設計されている。
セマンティック・フェールマッチング(KDSM)を用いた開語彙キーポイント検出(Open-Vocabulary Keypoint Detection)という新しいフレームワークを開発した。
このフレームワークは視覚と言語モデルを組み合わせて、言語機能とローカルキーポイント視覚機能との相互作用を作成する。
論文 参考訳(メタデータ) (2023-10-08T07:42:41Z) - Pose for Everything: Towards Category-Agnostic Pose Estimation [93.07415325374761]
Category-Agnostic Pose Estimation (CAPE) は、キーポイント定義を持つ少数のサンプルのみを与えられた任意の種類のオブジェクトのポーズを検出することができるポーズ推定モデルを作成することを目的としている。
異なるキーポイント間のインタラクションと、サポートとクエリイメージの関係をキャプチャするために、トランスフォーマーベースのキーポイントインタラクションモジュール(KIM)を提案する。
また、20K以上のインスタンスを含む100のオブジェクトカテゴリの2次元ポーズデータセットであるMP-100データセットを導入し、CAPEアルゴリズムの開発に適している。
論文 参考訳(メタデータ) (2022-07-21T09:40:54Z) - Simple Cues Lead to a Strong Multi-Object Tracker [3.7189423451031356]
マルチオブジェクト追跡のための新しいタイプのトラッキング・バイ・ディテクト(TbD)を提案する。
単純な動作モデルと外観特徴を組み合わせることで,強い追跡結果が得られることを示す。
私たちのトラッカーは、MOT17、MOT20、BDD100k、DanceTrackの4つの公開データセットに一般化され、最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2022-06-09T17:55:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。