論文の概要: DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
- arxiv url: http://arxiv.org/abs/2607.00338v1
- Date: Wed, 01 Jul 2026 02:27:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.68232
- Title: DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
- Title(参考訳): DroneFINE: ドローン画像用ビジョンランゲージ検出器のドメイン認識パラメーター効率の良い微調整
- Abstract要約: DroneFINEは、VLMベースのドローン画像検出器用に設計された2つのドメイン対応補完モジュールからなる、新しいPEFTパラダイムである。
DroneFINEは既存のPEFTメソッドを著しく上回り、完全な微調整に匹敵するパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 50.96240625673857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Object detection for Unmanned Aerial Vehicles (UAVs) working in open and dynamic environments is a highly challenging task. While Vision-Language Models (VLMs) have offered a powerful solution for universal object detection, adapting them to UAV scenarios remains non-trivial due to a substantial domain gap between VLM pre-training data and aerial imagery. The prevailing Parameter-Efficient Fine-Tuning (PEFT) methods prove ineffective in bridging this gap, as VLMs' "natural-scene, foreground-dominant" visual priors misalign with the "bird's-eye-view, background-dominant, small-object" characteristics of UAV data. To address this issue, we propose DroneFINE, a novel PEFT paradigm comprising two domain-aware complementary modules tailored for VLM-based drone image detectors. Specifically, a data-dependent, foreground-aware, and multi-path adaptation mechanism named HyperAdapter is designed, which overcomes the static structural constraints of PEFT. In addition, a background suppression algorithm named SemanticGate is developed. It is a text-conditioned guidance strategy that employs background vocabulary to actively guide the model in suppressing responses from irrelevant regions. Extensive experiments on VisDrone and UAVDT demonstrate that DroneFINE significantly outperforms existing PEFT methods and achieves performance comparable to full fine-tuning while substantially reducing the number of trainable parameters.
- Abstract(参考訳): オープンでダイナミックな環境で作業する無人航空機(UAV)の物体検出は非常に難しい作業である。
VLM(Vision-Language Models)は、普遍的なオブジェクト検出のための強力なソリューションを提供しているが、VLM事前学習データと空中画像の間には領域ギャップがあるため、UAVシナリオへの適応は依然として容易ではない。
パラメータ効率の良いファインチューニング(PEFT)法はこのギャップを埋めるには有効ではなく、VLMの「自然の場面、前景に優る」視覚的先行はUAVデータの「鳥の目視、背景に優る、小さな物体」の特徴と不一致である。
この問題に対処するために,VLMをベースとしたドローン画像検出器に適した2つのドメイン対応補完モジュールからなる新しいPEFTパラダイムであるDroneFINEを提案する。
具体的には、PEFTの静的構造制約を克服する、HyperAdapterと呼ばれるデータ依存、フォアグラウンドアウェア、マルチパス適応機構を設計する。
また,SemanticGateというバックグラウンド抑圧アルゴリズムを開発した。
背景語彙を用いたテキスト条件付きガイダンス戦略であり,無関係領域からの応答を抑えるためにモデルを積極的に指導する。
VisDrone と UAVDT の大規模な実験により、DroneFINE は既存のPEFT法を著しく上回り、訓練可能なパラメータの数を著しく減らしながら、完全な微調整に匹敵する性能を達成した。
関連論文リスト
- DisDop: Distillation with Domain Priors for Open-Vocabulary Aerial Object Detection [75.11656789221072]
リモートセンシング基礎モデルからマルチレベルドメインを抽出する統合フレームワークであるDisDopを提案する。
DisDopは、オープンボキャブラリ空中検出ベンチマーク上で、最先端のパフォーマンスを新たに実現している。
論文 参考訳(メタデータ) (2026-05-23T16:01:20Z) - Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection [23.097895224926905]
無人航空機(UAV)に基づく物体検出は、限られた注釈付きトレーニングデータで動的に変化するシナリオに適用する場合、重要ではあるが困難な課題である。
UAVに基づくオブジェクト検出に適した新しいレイアウト・ツー・イメージ生成フレームワークであるUAVGenを提案する。
本手法は最先端の手法を著しく上回り、異なる検出器と統合した場合の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-04-03T11:00:24Z) - A Tri-Modal Dataset and a Baseline System for Tracking Unmanned Aerial Vehicles [74.8162337823142]
MM-UAVはMulti-Modal UAV Trackingの最初の大規模ベンチマークである。
データセットは30以上の挑戦的なシナリオにまたがっており、1,321の同期マルチモーダルシーケンスと280万以上の注釈付きフレームがある。
データセットを伴って、我々は新しいマルチモーダルマルチUAV追跡フレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-23T08:42:17Z) - Large Language Model-Empowered Decision Transformer for UAV-Enabled Data Collection [71.84636717632206]
空間分散デバイスからの信頼性とエネルギー効率のよいデータ収集のための無人航空機(UAV)は、IoT(Internet of Things)アプリケーションをサポートする上で大きな可能性を秘めている。
有効なUAV制御ポリシーを学習するための共同言語モデル(LLM)を提案する。
LLM-CRDTは、現在の最先端DTアプローチよりも最大36.7%高いエネルギー効率を達成し、オンラインおよびオフラインメソッドのベンチマークより優れている。
論文 参考訳(メタデータ) (2025-09-17T13:05:08Z) - Light-Weight Cross-Modal Enhancement Method with Benchmark Construction for UAV-based Open-Vocabulary Object Detection [6.443926939309045]
我々は,データセット構築とモデル革新を組み合わせた完全なUAV指向ソリューションを提案する。
まず, アノテーションの冗長性, 不整合性, 曖昧性を効率的に解決する改良されたUAV-Labelエンジンを設計する。
第2に,クロスアテンション,アダプティブ・ゲーティング,グローバルFILM変調を統合した高機能なデュアルパス融合設計であるクロスアテンション・ゲーテッド・エンハンスメント(CAGE)モジュールを導入する。
論文 参考訳(メタデータ) (2025-09-07T10:59:02Z) - VFM-Guided Semi-Supervised Detection Transformer under Source-Free Constraints for Remote Sensing Object Detection [9.029534000674388]
VG-DETRは、Vision Foundation Model(VFM)を「フリーランチ」方法でトレーニングパイプラインに統合する。
擬似ラベルの信頼性を評価するために,VFMのセマンティックな事前情報を利用した擬似ラベルマイニング手法を提案する。
さらに,デュアルレベルのVFM誘導アライメント手法を提案し,インスタンスレベルと画像レベルでのVFM埋め込みと検出器特性を一致させる。
論文 参考訳(メタデータ) (2025-08-15T02:35:56Z) - High-Frequency Semantics and Geometric Priors for End-to-End Detection Transformers in Challenging UAV Imagery [6.902247657565531]
本稿では,空中シーンに適したリアルタイム検出変換器であるHEDS-DETRを紹介する。
まず,高周波数拡張セマンティックスネットワーク(HFESNet)のバックボーンを提案する。
第2に、高分解能特徴を効率的に融合させることにより、情報損失に対処する。
第三に、2つの相乗的成分を用いてデコーダの安定性と位置決め精度を向上させる。
論文 参考訳(メタデータ) (2025-07-01T14:56:56Z) - AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection [49.81255045696323]
補助メタデータ駆動型赤外小型ターゲット検出器(AuxDet)について述べる。
AuxDetはメタデータセマンティクスと視覚的特徴を統合し、各サンプルに対する適応表現学習を導く。
挑戦的なWideIRSTD-Fullベンチマークの実験は、AuxDetが一貫して最先端のメソッドより優れていることを示した。
論文 参考訳(メタデータ) (2025-05-21T07:02:05Z) - Multi-Modality Driven LoRA for Adverse Condition Depth Estimation [61.525312117638116]
逆条件深さ推定のためのMulti-Modality Driven LoRA(MMD-LoRA)を提案する。
Prompt Driven Domain Alignment (PDDA) と Visual-Text Consistent Contrastive Learning (VTCCL) の2つのコアコンポーネントで構成されている。
nuScenesとOxford RobotCarデータセットの最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-12-28T14:23:58Z) - SGDViT: Saliency-Guided Dynamic Vision Transformer for UAV Tracking [12.447854608181833]
本研究は、UAV追跡のための新しいサリエンシ誘導動的視覚変換器(SGDViT)を提案する。
提案手法は,クロスコリレーション操作を洗練させるために,タスク固有の新たなオブジェクト・サリエンシ・マイニング・ネットワークを設計する。
軽量な塩分フィルタリング変換器は、さらに塩分情報を洗練し、外観情報に焦点を当てる。
論文 参考訳(メタデータ) (2023-03-08T05:01:00Z) - Adaptive Path Planning for UAVs for Multi-Resolution Semantic
Segmentation [28.104584236205405]
重要な課題は、大規模な環境で取得したデータの価値を最大化するミッションを計画することである。
これは例えば、農地のモニタリングに関係している。
本稿では,UAV経路に適応して高精細なセマンティックセマンティックセマンティクスを得るオンライン計画アルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-03-03T11:03:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。