Fugu-MT 論文翻訳(概要): Toward Open Vocabulary Aerial Object Detection with CLIP-Activated Student-Teacher Learning

論文の概要: Toward Open Vocabulary Aerial Object Detection with CLIP-Activated Student-Teacher Learning

arxiv url: http://arxiv.org/abs/2311.11646v2
Date: Wed, 13 Mar 2024 13:42:38 GMT
ステータス: 翻訳完了
システム内更新日: 2024-03-14 17:58:23.349220
Title: Toward Open Vocabulary Aerial Object Detection with CLIP-Activated Student-Teacher Learning
Title（参考訳）: CLIPアクティベートによるオープンボキャブラリ空中物体検出に向けて学生教師の学習
Authors: Yan Li, Weiwei Guo, Xue Yang, Ning Liao, Dunyun He, Jiaqi Zhou, Wenxian Yu
Abstract要約: 本稿では,CLIP-activated students-Teacher Open-vocabulary Object DetectionフレームワークであるCastDetを提案する。我々のアプローチは、新しいオブジェクトの提案だけでなく、分類も促進します。実験の結果,CastDetはより優れた開語彙検出性能が得られた。
参考スコア（独自算出の注目度）: 14.35268391981271
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: An increasingly massive number of remote-sensing images spurs the development of extensible object detectors that can detect objects beyond training categories without costly collecting new labeled data. In this paper, we aim to develop open-vocabulary object detection (OVD) technique in aerial images that scales up object vocabulary size beyond training data. The fundamental challenges hinder open vocabulary object detection performance: the qualities of the class-agnostic region proposals and the pseudo-labels that can generalize well to novel object categories. To simultaneously generate high-quality proposals and pseudo-labels, we propose CastDet, a CLIP-activated student-teacher open-vocabulary object Detection framework. Our end-to-end framework following the student-teacher self-learning mechanism employs the RemoteCLIP model as an extra omniscient teacher with rich knowledge. By doing so, our approach boosts not only novel object proposals but also classification. Furthermore, we devise a dynamic label queue strategy to maintain high-quality pseudo labels during batch training. We conduct extensive experiments on multiple existing aerial object detection datasets, which are set up for the OVD task. Experimental results demonstrate our CastDet achieving superior open-vocabulary detection performance, e.g., reaching 40.5\% mAP, which outperforms previous methods Detic/ViLD by 23.7%/14.9% on the VisDroneZSD dataset. To our best knowledge, this is the first work to apply and develop the open-vocabulary object detection technique for aerial images.
Abstract（参考訳）: 膨大な量のリモートセンシング画像が、新たなラベル付きデータを集めることなく、トレーニングカテゴリを超えてオブジェクトを検出する拡張可能なオブジェクト検出器の開発を加速させる。本稿では,訓練データを超えるオブジェクトの語彙サイズを拡大する空画像におけるOVD(Open-vocabulary Object Detection)手法を提案する。オープンな語彙的オブジェクト検出性能を阻害する根本的な課題は、クラスに依存しない領域の提案と、新しいオブジェクトカテゴリによく適応できる擬似ラベルの質である。高品質な提案と擬似ラベルを同時に生成するために,CLIPをベースとしたオープン語彙オブジェクト検出フレームワークであるCastDetを提案する。学生-教師の自己学習メカニズムに従うエンドツーエンドのフレームワークは、RemoteCLIPモデルを用いて、豊富な知識を持つ全能教師として活用する。このアプローチは、新しいオブジェクトの提案だけでなく、分類も促進します。さらに、バッチトレーニング中に高品質な擬似ラベルを維持するための動的ラベル待ち行列戦略を考案する。我々は、OVDタスク用に設定された複数の既存の空中物体検出データセットについて広範な実験を行う。実験の結果、VesDroneZSDデータセットでは、Detic/ViLDを23.7%/14.9%上回る40.5\% mAPに達した。我々の知る限り、これは航空画像にオープン語彙オブジェクト検出技術を適用し、開発する最初の試みである。

関連論文リスト

Exploiting Unlabeled Data with Multiple Expert Teachers for Open Vocabulary Aerial Object Detection and Its Orientation Adaptation [58.37525311718006]
OVAD(Open-vocabulary Aero Object Detection)という,航空物体検出問題の新しい定式化を行った。本稿では,CLIP-activated students-Teacher DetectionフレームワークであるCastDetを提案する。本フレームワークは,ロバストなローカライズ教師といくつかのボックス選択戦略を統合し,新しいオブジェクトの高品質な提案を生成する。
論文参考訳（メタデータ） (2024-11-04T12:59:13Z)
Locate Anything on Earth: Advancing Open-Vocabulary Object Detection for Remote Sensing Community [50.16478515591924]
LAEタスクのための最初のオープンボキャブラリ基礎オブジェクト検出器であるLAE-DINOモデルを提案し,訓練する。我々は、確立されたリモートセンシングベンチマークDIOR、DOTAv2.0、および新たに発表された80クラスのLEE-80Cベンチマークについて実験を行った。その結果, LAE-1Mデータセットの利点と, LAE-DINO法の有効性が示された。
論文参考訳（メタデータ） (2024-08-17T06:24:43Z)
DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection [111.68263493302499]
DetCLIPv3は、オープンボキャブラリオブジェクト検出と階層ラベルの両方で優れた高性能検出器である。 DetCLIPv3は,1)Versatileモデルアーキテクチャ,2)高情報密度データ,3)効率的なトレーニング戦略の3つのコア設計によって特徴付けられる。 DetCLIPv3は、GLIPv2, GroundingDINO, DetCLIPv2をそれぞれ18.0/19.6/6 APで上回り、優れたオープン語彙検出性能を示す。
論文参考訳（メタデータ） (2024-04-14T11:01:44Z)
Generative Region-Language Pretraining for Open-Ended Object Detection [55.42484781608621]
我々は,高密度物体を検出し,その名前を自由形式の方法で生成できるGenerateUというフレームワークを提案する。本フレームワークはオープン語彙オブジェクト検出手法GLIPに匹敵する結果が得られる。
論文参考訳（メタデータ） (2024-03-15T10:52:39Z)
Exploring Robust Features for Few-Shot Object Detection in Satellite Imagery [17.156864650143678]
従来の2段階アーキテクチャに基づく数発の物体検出器を開発した。大規模な事前訓練モデルを使用して、クラス参照の埋め込みやプロトタイプを構築する。課題と稀なオブジェクトを含む2つのリモートセンシングデータセットの評価を行う。
論文参考訳（メタデータ） (2024-03-08T15:20:27Z)
Identification of Novel Classes for Improving Few-Shot Object Detection [12.013345715187285]
Few-shot Object Detection (FSOD) メソッドは、クラス毎に少数のトレーニングサンプルのみを使用して、堅牢なオブジェクト検出を実現することで、改善を提供する。我々は、FSOD性能を向上させるためのトレーニング中に、未ラベルの新規物体を正のサンプルとして検出し、利用するための半教師付きアルゴリズムを開発した。実験の結果,本手法は既存のSOTA FSOD法よりも有効であり,優れた結果が得られた。
論文参考訳（メタデータ） (2023-03-18T14:12:52Z)
Exploiting Unlabeled Data with Vision and Language Models for Object Detection [64.94365501586118]
堅牢で汎用的なオブジェクト検出フレームワークを構築するには、より大きなラベルスペースとより大きなトレーニングデータセットへのスケーリングが必要である。本稿では,近年の視覚と言語モデルで利用可能なリッチなセマンティクスを利用して,未ラベル画像中のオブジェクトのローカライズと分類を行う手法を提案する。生成した擬似ラベルの価値を,オープン語彙検出と半教師付きオブジェクト検出の2つのタスクで示す。
論文参考訳（メタデータ） (2022-07-18T21:47:15Z)
Bridging the Gap between Object and Image-level Representations for Open-Vocabulary Detection [54.96069171726668]
オープンボキャブラリ検出(OVD)で使用される2種類の弱いスーパービジョンには、事前訓練されたCLIPモデルと画像レベルの監視が含まれる。本稿では,CLIPモデルから言語埋め込みをオブジェクト中心でアライメントすることでこの問題に対処することを提案する。上記の2つの対物配向戦略の橋渡しを,新しい重み伝達関数を用いて行う。
論文参考訳（メタデータ） (2022-07-07T17:59:56Z)
PromptDet: Expand Your Detector Vocabulary with Uncurated Images [47.600059694034]
この作業の目的は、ゼロマニュアルアノテーションを使用して、新しい/見えないカテゴリに向けてオブジェクト検出器を拡張するスケーラブルなパイプラインを確立することである。本稿では,事前学習された視覚言語モデルのテキストエンコーダから生成された分類器を用いて,各ボックスの提案を分類する2段階のオープン語彙オブジェクト検出器を提案する。より広い範囲のオブジェクトを検出するための学習手順をスケールアップするために、利用可能なオンラインリソースを活用し、プロンプトを反復的に更新し、その後、ノイズの多い未修正画像の大規模なコーパス上に生成された擬似ラベルを用いて、提案した検出器を自己学習する。
論文参考訳（メタデータ） (2022-03-30T17:50:21Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。