論文の概要: Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models
- arxiv url: http://arxiv.org/abs/2607.02718v1
- Date: Thu, 02 Jul 2026 19:11:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.404342
- Title: Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models
- Title(参考訳): 基礎画像生成モデルを用いた空中物体検出装置の診断
- Abstract要約: 本稿では,テキスト誘導生成,属性制御編集,自動属性検証を組み合わせた航空ビュー車両検出のための総合診断フレームワークを提案する。
この結果から, 制御された合成探索により, 実領域の性能ギャップを予測し, 効率的なデータ収集を導出できることが示唆された。
提案された診断フレームワークはモジュール化されており、機能の発展に伴って、代替の生成モデルや視覚言語モデルを組み込むことができる。
- 参考スコア(独自算出の注目度): 45.7884146182982
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in large-scale image generative models enable photorealistic scene synthesis with controllable attributes. Beyond data augmentation, their potential as diagnostic tools for trained vision systems remains unexplored in the aerial and remote sensing domains. We introduce a synthetic diagnostic framework for aerial-view vehicle detection that combines text-guided generation, attribute-controlled editing, and automated attribute verification to construct a controllable synthetic testbed. This enables fine-grained evaluation of pretrained detectors under diverse scene types and environmental conditions that are difficult to isolate in real datasets. Across three detection architectures and three real aerial datasets, synthetic scene-wise performance trends closely match real-world weaknesses. Guided by these diagnostics, targeted supplementation with small real datasets from the identified weak categories yields improvements of up to 13% AP50 while requiring substantially fewer additional samples than non-targeted augmentation. Our results show that controlled synthetic probing can predict real-domain performance gaps and guide efficient data collection. The proposed diagnostic framework is modular and can incorporate alternative generative or vision-language models as capabilities evolve. Our code and datasets are available here: https://humansensinglab.github.io/AVODDiag/
- Abstract(参考訳): 大規模画像生成モデルの最近の進歩は、制御可能な属性による光リアルなシーン合成を可能にする。
データ拡張以外にも、訓練された視覚システムのための診断ツールとしてのポテンシャルは、空中およびリモートセンシング領域でまだ探索されていない。
本稿では, テキスト誘導生成, 属性制御編集, 自動属性検証を組み合わせることで, 制御可能な合成テストベッドを構築するための, 航空ビュー車両検出のための総合診断フレームワークを提案する。
これにより、様々なシーンタイプと実際のデータセットで分離が難しい環境条件下で、事前訓練された検出器のきめ細かい評価が可能になる。
3つの検出アーキテクチャと3つの実際の空中データセット、合成シーンワイドのパフォーマンストレンドは、現実世界の弱点と密接に一致している。
これらの診断によってガイドされ、特定された弱いカテゴリの小さなデータセットを対象とするサプリメントは、最大13%のAP50の改善をもたらし、非ターゲットの増量よりもはるかに少ない追加サンプルを必要とする。
この結果から, 制御された合成探索により, 実領域の性能ギャップを予測し, 効率的なデータ収集を導出できることが示唆された。
提案された診断フレームワークはモジュール化されており、機能の発展に伴って、代替の生成モデルや視覚言語モデルを組み込むことができる。
私たちのコードとデータセットはこちらで入手可能です。
関連論文リスト
- Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers [57.54843029965778]
制御可能な病理画像合成には、空間配置、組織形態、意味的詳細の信頼できる規制が必要である。
In-Context Diffusion Transformer (IC-DiT) は,空間レイアウト,テキスト記述,視覚的埋め込みを統合拡散変換器に組み込んだレイアウト認識生成モデルである。
IC-DiTは既存の方法よりも忠実度が高く、空間制御性が強く、診断の整合性が良くなる。
論文 参考訳(メタデータ) (2026-03-11T06:14:11Z) - Synth It Like KITTI: Synthetic Data Generation for Object Detection in Driving Scenarios [3.30184292168618]
本稿では,LiDAR点雲上での3次元物体検出のためのCARLAシミュレータに基づくデータセット生成パイプラインを提案する。
我々は、合成データに基づいてオブジェクト検出器を訓練し、KITTIデータセットに強力な一般化能力を示すことができる。
論文 参考訳(メタデータ) (2025-02-20T22:27:42Z) - Improving Object Detection by Modifying Synthetic Data with Explainable AI [3.0519884745675485]
本稿では,合成画像の設計効率を向上させるための新しい概念的アプローチを提案する。
XAI技術は、これらの画像を生成するために使用される3Dメッシュモデルを修正する、ループ中の人間プロセスを導く。
合成データは、トレーニング中に見えない方向の車両の検出を4.6%改善できることを示す。
論文 参考訳(メタデータ) (2024-12-02T13:24:43Z) - AeroGen: Enhancing Remote Sensing Object Detection with Diffusion-Driven Data Generation [43.583735469794675]
リモートセンシング画像オブジェクト検出(RSIOD)は、衛星や空中画像内の特定の物体を特定し、特定することを目的としている。
現在のRSIODデータセットにはラベル付きデータが不足しており、現在の検出アルゴリズムのパフォーマンスを著しく制限している。
本稿では,RSIODに適したレイアウト制御可能な拡散生成モデル(AeroGen)を提案する。
論文 参考訳(メタデータ) (2024-11-23T09:04:33Z) - DODA: Adapting Object Detectors to Dynamic Agricultural Environments in Real-Time with Diffusion [4.549305421261851]
DODAは拡散ベースのフレームワークで、検出器を2分で新しいドメインに適応できる。
DODA生成データに対する微調整検出を行うGlobal Wheat Head Detectionデータセットにおいて,DODAの有効性を示す。
論文 参考訳(メタデータ) (2024-03-27T08:16:33Z) - InstaGen: Enhancing Object Detection by Training on Synthetic Dataset [59.445498550159755]
本稿では,オブジェクト検出機能の向上,例えばカテゴリ拡大や検出性能の向上など,新たなパラダイムを提案する。
我々は、インスタンスレベルのグラウンドヘッドを事前訓練された生成拡散モデルに統合し、生成された画像のインスタンスをローカライズする機能で拡張する。
我々は、InstaGenと呼ばれる拡散モデルの強化版がデータシンセサイザーとして機能することを示すために、徹底的な実験を行う。
論文 参考訳(メタデータ) (2024-02-08T18:59:53Z) - UAV-Sim: NeRF-based Synthetic Data Generation for UAV-based Perception [62.71374902455154]
ニューラルレンダリングの最近の進歩を利用して、静的および動的ノベルビューUAVベースの画像レンダリングを改善する。
本研究では,主に実データと合成データのハイブリッドセットに基づいて最先端検出モデルが最適化された場合,性能が大幅に向上することを示す。
論文 参考訳(メタデータ) (2023-10-25T00:20:37Z) - Generative Modeling Helps Weak Supervision (and Vice Versa) [87.62271390571837]
本稿では,弱い監督と生成的敵ネットワークを融合したモデルを提案する。
弱い監督によるラベル推定と並行して、データの離散変数をキャプチャする。
これは、弱い教師付き合成画像と擬似ラベルによるデータ拡張を可能にする最初のアプローチである。
論文 参考訳(メタデータ) (2022-03-22T20:24:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。