論文の概要: UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation
- arxiv url: http://arxiv.org/abs/2607.08075v1
- Date: Thu, 09 Jul 2026 03:08:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.401298
- Title: UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation
- Title(参考訳): UAV-OVVIS:無人航空機にもオープンボキャブラリビデオインスタンスセグメンテーションが必要だ
- Authors: Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun,
- Abstract要約: オープン語彙クエリに基づいてUAVビデオのターゲットを検出するUAV-OVVIS(Open-Vocabulary Video Instance)を紹介する。
UAVシナリオにおけるインスタンスレベルのアノテーションの不足を考慮すると、トレーニング不要の統一フレームワークであるAeroTrackを提案する。
本稿では,AeroTrackがUAVシナリオにおける既存の一般的なビデオインスタンスセグメンテーション手法を大幅に上回っていることを示す。
- 参考スコア(独自算出の注目度): 19.37496936176316
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unmanned Aerial Vehicle (UAV) videos are widely used in traffic monitoring, urban management, and emergency rescue. However, existing UAV video perception mainly relies on box-level localization and trajectory association under predefined categories, making it difficult to simultaneously support flexible queries and fine-grained instance-level dynamic understanding in open scenarios. To this end, we introduce a new task, UAV Open-Vocabulary Video Instance Segmentation (UAV-OVVIS), which discovers targets in UAV videos according to open-vocabulary queries and outputs instance-level segmentation trajectories with globally consistent identities. Considering the scarcity of instance-level annotations in UAV scenarios, we propose AeroTrack, a training-free unified framework. AeroTrack centers on periodic open-vocabulary detection, short-segment mask propagation, and cross-segment identity unification, reusing existing visual foundation models to enable UAV-OVVIS. Based on this framework, we instantiate five AeroTrack variants and construct AeroVIS, an evaluation benchmark for UAV-OVVIS containing 9 UAV object categories and 8,279 trajectories. Experiments show that AeroTrack substantially outperforms existing general video instance segmentation methods in UAV scenarios and demonstrates strong open-vocabulary robustness and generalization. To support future research, we release AeroTrack and AeroVIS as a unified framework and benchmark for UAV-OVVIS.
- Abstract(参考訳): 無人航空機(UAV)のビデオは、交通監視、都市管理、緊急救助に広く利用されている。
しかし、既存のUAVビデオ認識は、主に予め定義されたカテゴリの下でのボックスレベルのローカライゼーションとトラジェクトリアソシエーションに依存しており、フレキシブルなクエリとオープンシナリオにおけるきめ細かいインスタンスレベルの動的理解を同時にサポートすることは困難である。
この目的のために、UAV-OVVIS(Open-Vocabulary Video Instance Segmentation)という新しいタスクを導入し、オープン語彙クエリに基づいてUAVビデオのターゲットを検出し、一貫したアイデンティティでインスタンスレベルのセグメンテーショントラジェクトリを出力する。
UAVシナリオにおけるインスタンスレベルのアノテーションの不足を考慮すると、トレーニング不要の統一フレームワークであるAeroTrackを提案する。
AeroTrackは、周期的なオープンボキャブラリ検出、ショートセグメントマスクの伝搬、クロスセグメントIDの統一を中心とし、既存の視覚基盤モデルを再利用してUAV-OVVISを可能にする。
この枠組みに基づいて,5種類のAeroTrack変異体をインスタンス化し,UAV-OVVISの評価ベンチマークであるAeroVISを構築した。
実験により、AeroTrackはUAVシナリオにおいて既存の一般的なビデオインスタンスセグメンテーション手法を大幅に上回っており、オープン語彙の堅牢性と一般化が強いことを示す。
今後の研究を支援するため,UAV-OVVISの統一フレームワークおよびベンチマークとしてAeroTrackとAeroVISをリリースする。
関連論文リスト
- How Far are Modern Trackers from UAV-Anti-UAV? A Million-Scale Benchmark and New Baseline [74.4054700050366]
無人航空機(UAV)は広範囲のアプリケーションを提供するが、安全性とプライバシー侵害のリスクも大きい。
現在の反UAV研究は、主に固定地上カメラで撮影したRGB、赤外線(IR)、またはRGB-IRビデオに焦点を当てている。
本稿では,UAV-Anti-UAVと呼ばれるマルチモーダル視覚追跡タスクを提案する。
論文 参考訳(メタデータ) (2025-12-08T10:19:54Z) - AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios [64.51320327698231]
UAVシナリオにおける最初の大規模RMOTベンチマークであるAerialMindを紹介する。
我々は、革新的な半自動協調型エージェントベースラベリングアシスタントフレームワークを開発した。
また,視覚言語表現学習を協調的に強化する新しい手法であるHawkEyeTrackを提案する。
論文 参考訳(メタデータ) (2025-11-26T04:44:27Z) - UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning [39.07541452390107]
無人航空機(UAV)は言語と対話するプラットフォームへと進化し、より直感的な人間とドローンの相互作用を可能にしている。
本研究では,この問題をFlying-on-a-Word(Flow)タスクとして形式化し,UAV模倣学習を効果的なアプローチとして導入する。
UAV-Flowは, 言語条件付き, きめ細かいUAV制御のための, 世界初の実世界のベンチマークである。
論文 参考訳(メタデータ) (2025-05-21T16:31:28Z) - Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching [57.4215496482743]
ビデオオブジェクトセグメンテーション(RVOS)の参照は、自然言語記述でガイドされたビデオ内のオブジェクトをセグメントすることを目的としている。
本稿では,トランスフォーマーベースモデルであるFS-RVOSを提案する。
実験の結果、FS-RVOSとFS-RVMOSは様々なベンチマークで最先端の手法より優れており、優れた堅牢性と精度を示している。
論文 参考訳(メタデータ) (2025-04-18T14:19:07Z) - AeroReformer: Aerial Referring Transformer for UAV-based Referring Image Segmentation [9.55871636831991]
本稿では,UAV参照画像セグメンテーション(UAV-RIS)のための新しいフレームワークを提案する。
AeroReformerは、効果的なクロスモーダル理解のためのVision-Language Cross-Attention Module (VLCAM)とローテーション対応のマルチスケール核融合デコーダを備えている。
新たに開発された2つのデータセットの実験は、既存の方法よりもAeroReformerの方が優れていることを示している。
論文 参考訳(メタデータ) (2025-02-23T18:49:00Z) - UAVDB: Point-Guided Masks for UAV Detection and Segmentation [0.03464344220266879]
UAVの検出とセグメンテーションのための新しいベンチマークデータセットであるUAVDBを提案する。
ポイント誘導の弱い監視パイプライン上に構築されている。
UAVDBは、可視オブジェクトからほぼ1ピクセルのインスタンスまで、さまざまなスケールでUAVをキャプチャする。
論文 参考訳(メタデータ) (2024-09-09T13:27:53Z) - CROVIA: Seeing Drone Scenes from Car Perspective via Cross-View
Adaptation [20.476683921252867]
道路車両の視界から得られた知識をUAVの視界に適応させる新しいCROVIA(Cross-View Adaptation)アプローチを提案する。
まず、ビュー間の幾何学的相関に基づいて、クロスビュー適応に対する新しい幾何学的制約を導入する。
第2に、画像空間からのクロスビュー相関を、ペアオンロードとUAVのビューデータを必要としないセグメンテーション空間に効果的に転送する。
論文 参考訳(メタデータ) (2023-04-14T15:20:40Z) - Learning to Compress Unmanned Aerial Vehicle (UAV) Captured Video:
Benchmark and Analysis [54.07535860237662]
本稿では,UAVビデオ符号化学習のための新しいタスクを提案し,そのようなタスクに対する包括的で体系的なベンチマークを構築する。
このベンチマークは、ドローンプラットフォームにおけるビデオコーディングの研究と開発を加速させるものと期待されている。
論文 参考訳(メタデータ) (2023-01-15T15:18:02Z) - Anti-UAV: A Large Multi-Modal Benchmark for UAV Tracking [59.06167734555191]
Unmanned Aerial Vehicle (UAV)は、商業とレクリエーションの両方に多くの応用を提供している。
我々は、UAVを追跡し、位置や軌道などの豊富な情報を提供するという課題を考察する。
300以上のビデオペアが580k以上の手動で注釈付きバウンディングボックスを含むデータセット、Anti-UAVを提案します。
論文 参考訳(メタデータ) (2021-01-21T07:00:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。