論文の概要: Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection
- arxiv url: http://arxiv.org/abs/2608.07015v1
- Date: Fri, 07 Aug 2026 09:25:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.449239
- Title: Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection
- Title(参考訳): 視力・言語学習による眼科領域赤外小ターゲット検出の理解
- Authors: Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An,
- Abstract要約: 我々は、全ドメインIRST検出を理解駆動プロセスとして定式化するパラダイムを開発する。
我々は、OmniドメインIRST検出のための、最初の大規模で高度に多様な視覚言語データセットを構築した。
- 参考スコア(独自算出の注目度): 21.538754248164093
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omni-domain infrared small target (IRST) detection is crucial for infrared surveillance, yet remains challenging due to heterogeneous imaging domains and inconsistent target characteristics. Previous deep learning-based methods have been developed for visual-only paradigms and achieved promising performance on domain-specific tasks. However, existing methods follow the task-specific supervised learning paradigm. This paradigm simplifies the full-scene infrared observations to sparse target supervision, discarding the semantics that remain invariant across heterogeneous domains. Consequently, detection performance suffers substantially under domain shifts. To handle this issue, we introduce \textbf{``understand before detect''}, a paradigm that formulates omni-domain IRST detection as an understanding-driven process, where holistic infrared target understanding precedes precise detection. Building on this paradigm, we propose \textbf{JinSight}, which first develops holistic IRST understanding through language supervision and then transfers the learned cross-domain representations to precise small-target detection. By grounding infrared representations in language semantics, JinSight enables a single model to generalize across heterogeneous infrared domains. We then introduce Latent Semantic Interaction (LSI), which exchanges language-aligned global semantics with fine-grained spatial features in a compact low-rank space. To address the lack of multimodal omni-domain IRST benchmarks, we build \textbf{OmniIRST-VL}, the first large-scale, highly diverse vision--language dataset for omni-domain IRST detection. It comprises over 39k annotations across six complementary instruction tasks covering both scene-level understanding and target-centric reasoning.
- Abstract(参考訳): Omni-domain infrared small target (IRST) は、赤外線監視において重要であるが、不均一な画像領域と一貫性のないターゲット特性のため、依然として困難である。
これまで、ビジュアルのみのパラダイムのためにディープラーニングベースの手法が開発され、ドメイン固有のタスクで有望なパフォーマンスを実現してきた。
しかし、既存の手法はタスク固有の教師あり学習パラダイムに従う。
このパラダイムは、ヘテロジニアス領域で不変なセマンティクスを捨て、ターゲットの監督をスパースするために、フルシーンの赤外線観測を単純化する。
これにより、検出性能は領域シフトで著しく低下する。
この問題に対処するため,本研究では,全領域IRST検出を理解駆動プロセスとして定式化するパラダイムである‘textbf{```understand before detect'}を紹介した。
このパラダイムを基礎として,まず言語指導を通して包括的なIRST理解を開発し,次に学習したクロスドメイン表現を高精度な小ターゲット検出に転送する。
言語セマンティクスにおける赤外線表現を基盤にすることで、JinSightは異種赤外線ドメインをまたいだ1つのモデルを一般化することができる。
次に、Latent Semantic Interaction (LSI)を導入し、コンパクトな低ランク空間における言語対応のグローバルセマンティクスときめ細かい空間的特徴を交換する。
マルチモーダルなオムニドメインIRSTベンチマークの欠如に対処するため、オムニドメインIRST検出のための最初の大規模かつ高度に多様なビジョンデータセットである \textbf{OmniIRST-VL} を構築した。
シーンレベルの理解とターゲット中心の推論の両方をカバーする6つの補完的な命令タスクに39k以上のアノテーションが含まれている。
関連論文リスト
- OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - Rethinking Representations for Cross-Domain Infrared Small Target Detection: A Generalizable Perspective from the Frequency Domain [26.03122882760887]
クロスドメインIRSTDのための空間-スペクトル協調認識ネットワークを提案する。
我々は、一般化可能な目標認識を導出するための位相修正モジュール(PRM)を開発した。
我々は、位置情報を保持するために、スキップ接続に注意機構(OAM)を用いる。
論文 参考訳(メタデータ) (2026-04-02T11:54:28Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition [71.5328300638085]
Zero-shot Human-Object Interaction (HOI) は、画像中の人間と物体を特定し、その相互作用を認識することを目的としている。
2段階法を含む既存の手法は、特定の検出器との相互作用認識を密に結合する。
本稿では、オブジェクト検出をIRから分離し、マルチモーダル大言語モデル(MLLM)をゼロショットIRに活用する分離フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-16T19:01:31Z) - Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection [19.500762008628254]
OVAD(Open-Vocabulary Aerial Detection)とRSVG(Remote Sensing Visual Grounding)は,航空シーン理解のための2つの重要なパラダイムとして登場した。
両パラダイムを結合型アーキテクチャにブリッジする最初の統一フレームワークであるOTA-Detを提案する。
論文 参考訳(メタデータ) (2026-02-08T05:29:01Z) - Dual-Granularity Semantic Prompting for Language Guidance Infrared Small Target Detection [102.1314414263959]
限られた特徴表現と厳しい背景干渉のため、赤外線小目標検出は依然として困難である。
エンドツーエンドの言語プロンプト駆動フレームワークであるDGSPNetを提案する。
提案手法は検出精度を大幅に向上し、3つのベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-24T16:58:23Z) - AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection [49.81255045696323]
補助メタデータ駆動型赤外小型ターゲット検出器(AuxDet)について述べる。
AuxDetはメタデータセマンティクスと視覚的特徴を統合し、各サンプルに対する適応表現学習を導く。
挑戦的なWideIRSTD-Fullベンチマークの実験は、AuxDetが一貫して最先端のメソッドより優れていることを示した。
論文 参考訳(メタデータ) (2025-05-21T07:02:05Z) - Text-IRSTD: Leveraging Semantic Text to Promote Infrared Small Target Detection in Complex Scenes [3.399048100638418]
我々は,テキストIRSTDと呼ばれる赤外線小ターゲット検出のためのセマンティックテキストを活用した新しいアプローチを提案する。
テキストと画像間の情報融合を容易にするために, プログレッシブ・モーダル・セマンティック・インタラクション・デコーダ (PCSID) を提案する。
さらに,FZDTと呼ばれるファジィセマンティックテキストアノテーションを用いて,異なるシナリオの2,755個の赤外線画像からなる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2025-03-10T12:33:07Z) - CLIP the Gap: A Single Domain Generalization Approach for Object
Detection [60.20931827772482]
単一ドメインの一般化(Single Domain Generalization)は、単一のソースドメイン上でモデルをトレーニングすることで、目に見えないターゲットドメインに一般化する問題に取り組む。
本稿では、事前学習された視覚言語モデルを用いて、テキストプロンプトを介して意味領域の概念を導入することを提案する。
本手法は,検出器のバックボーンから抽出した特徴に作用する意味的拡張戦略と,テキストに基づく分類損失によって実現される。
論文 参考訳(メタデータ) (2023-01-13T12:01:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。