論文の概要: ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection
- arxiv url: http://arxiv.org/abs/2609.00853v1
- Date: Tue, 01 Sep 2026 07:48:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.441466
- Title: ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection
- Title(参考訳): ADGNet:赤外線小ターゲット検出のための非対称デュアルテキストガイドネットワーク
- Authors: Tongtong Wang, Mingzhu Xu, Chenglong Yu, Jing Wang, Xiaohui Lin, Weili Guan,
- Abstract要約: InfRared Small Target Detection (IRSTD) は難しい課題である。
現在のマルチモーダルメソッドでは、ターゲットとバックグラウンドの両方を単一のテキストプロンプトで記述している。
我々は、新しい非対称デュアルテキストガイドネットワーク(ADGNet)を提案する。
- 参考スコア(独自算出の注目度): 21.00991696055637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: InfRared Small Target Detection (IRSTD) is a challenging task. Relying solely on pixel-level information, vision-only methods struggle to distinguish targets from clutter. Current multimodal methods typically describe both targets and backgrounds with a single textual prompt. Such an approach lacks dedicated regional guidance and ignores infrared semantic asymmetry. Consequently, it provides insufficient background suppression information and introduces severe feature optimization conflicts, overwhelming small targets with noise. To address these issues, we propose a novel Asymmetric Dual-text Guided Network (ADGNet). Specifically, accounting for the infrared semantic asymmetry, we first design the Asymmetric Dual-text Prompt (ADP), comprising an image-agnostic abstract target prompt and an image-specific detailed background prompt. To leverage these prompts, we introduce an Asymmetric Dual-Branch Interaction (ADBI) module to separately guide visual features with their respective text priors, protecting targets from noise while suppressing background clutter. Subsequently, we introduce an Adaptive Feature Aggregation (AFA) module to dynamically fuse features from the two branches. Furthermore, we construct a multimodal Asymmetric Image-Text Infrared (AITIR) dataset by providing asymmetric text annotations for three public datasets (IRSTD-1K, NUDT-SIRST, and SIRST). Extensive experiments demonstrate that ADGNet outperforms 21 state-of-the-art (SOTA) methods. Code is available at https://github.com/iLearn-Lab/MM26-ADGNet.
- Abstract(参考訳): InfRared Small Target Detection (IRSTD) は難しい課題である。
ピクセルレベルの情報のみに頼って、視覚のみの手法は、ターゲットを散らかしと区別するのに苦労する。
現在のマルチモーダル法は、通常、ターゲットとバックグラウンドの両方を単一のテキストプロンプトで記述する。
このようなアプローチは、専用の地域誘導を欠き、赤外線セマンティック非対称性を無視している。
その結果、バックグラウンドの抑圧情報が不十分で、ノイズを伴う圧倒的な小さなターゲットである厳しい特徴最適化の競合が導入される。
これらの問題に対処するため、我々は新しい非対称デュアルテキストガイドネットワーク (ADGNet) を提案する。
具体的には、赤外線意味非対称性を考慮して、画像に依存しない抽象的ターゲットプロンプトと、画像固有の詳細な背景プロンプトからなる非対称デュアルテキストプロンプト(ADP)を最初に設計する。
これらのプロンプトを活用するために,非対称なデュアルブランチインタラクション (ADBI) モジュールを導入し,各テキスト先行で視覚的特徴を個別にガイドし,背景の乱れを抑えながら目標をノイズから保護する。
その後、アダプティブ・フィーチャー・アグリゲーション(AFA)モジュールを導入し、2つのブランチから動的に機能をフューズする。
さらに,3つの公開データセット(IRSTD-1K, NUDT-SIRST, SIRST)に対して非対称なテキストアノテーションを提供することにより,マルチモーダルな非対称画像テキスト赤外線(AITIR)データセットを構築する。
大規模な実験により、ADGNetは21の最先端(SOTA)メソッドより優れていることが示された。
コードはhttps://github.com/iLearn-Lab/MM26-ADGNetで入手できる。
関連論文リスト
- DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection [43.281292792735364]
InfRared Small Target Detection (IRSTD) はコンピュータビジョンにおける目立った課題である。
複数の一般化可能なテキストに基づく新しいDual-knowledge Guided Network(DGNet)を提案する。
論文 参考訳(メタデータ) (2026-09-01T03:44:47Z) - LV-OSD: Language-Vision-Complementary Open-Set Object Detection [35.3832220318018]
我々はLV-OSD(Language-visual-complementary Open-set Object Detection)の新たな問題を提案する。
フレキシブルテキストベースおよび/または画像ベースプロンプトを使用して、所望のオブジェクトカテゴリを指定する。
この設定は現実世界のアプリケーションではより一般的で実践的です。
論文 参考訳(メタデータ) (2026-05-27T10:17:56Z) - Dual-Granularity Semantic Prompting for Language Guidance Infrared Small Target Detection [102.1314414263959]
限られた特徴表現と厳しい背景干渉のため、赤外線小目標検出は依然として困難である。
エンドツーエンドの言語プロンプト駆動フレームワークであるDGSPNetを提案する。
提案手法は検出精度を大幅に向上し、3つのベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-24T16:58:23Z) - AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection [49.81255045696323]
補助メタデータ駆動型赤外小型ターゲット検出器(AuxDet)について述べる。
AuxDetはメタデータセマンティクスと視覚的特徴を統合し、各サンプルに対する適応表現学習を導く。
挑戦的なWideIRSTD-Fullベンチマークの実験は、AuxDetが一貫して最先端のメソッドより優れていることを示した。
論文 参考訳(メタデータ) (2025-05-21T07:02:05Z) - Text-IRSTD: Leveraging Semantic Text to Promote Infrared Small Target Detection in Complex Scenes [3.399048100638418]
我々は,テキストIRSTDと呼ばれる赤外線小ターゲット検出のためのセマンティックテキストを活用した新しいアプローチを提案する。
テキストと画像間の情報融合を容易にするために, プログレッシブ・モーダル・セマンティック・インタラクション・デコーダ (PCSID) を提案する。
さらに,FZDTと呼ばれるファジィセマンティックテキストアノテーションを用いて,異なるシナリオの2,755個の赤外線画像からなる新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2025-03-10T12:33:07Z) - CoreNet: Conflict Resolution Network for Point-Pixel Misalignment and Sub-Task Suppression of 3D LiDAR-Camera Object Detection [16.37397687985041]
現在の手法では2つの重要な矛盾を見落としている。
本稿では、上記の問題に対処するため、CoreNet(Conflict Resolution Network)という新しい手法を提案する。
大規模なnuScenesデータセットの実験は、提案したCoreNetの優位性を実証している。
論文 参考訳(メタデータ) (2025-01-11T14:08:40Z) - Sparse Auxiliary Networks for Unified Monocular Depth Prediction and
Completion [56.85837052421469]
コスト効率のよいセンサで得られたデータからシーン形状を推定することは、ロボットや自動運転車にとって鍵となる。
本稿では,1枚のRGB画像から,低コストな能動深度センサによるスパース計測により,深度を推定する問題について検討する。
sparse networks (sans) は,深さ予測と完了という2つのタスクをmonodepthネットワークで実行可能にする,新しいモジュールである。
論文 参考訳(メタデータ) (2021-03-30T21:22:26Z) - Self-Supervised Representation Learning for RGB-D Salient Object
Detection [93.17479956795862]
我々は、自己教師付き表現学習を用いて、クロスモーダルオートエンコーダと深さ-輪郭推定という2つのプレテキストタスクを設計する。
我々のプレテキストタスクは、ネットワークがリッチなセマンティックコンテキストをキャプチャする事前トレーニングを実行するのに、少数のRGB-Dデータセットしか必要としない。
RGB-D SODにおけるクロスモーダル核融合の固有の問題として,マルチパス核融合モジュールを提案する。
論文 参考訳(メタデータ) (2021-01-29T09:16:06Z) - Adaptive Context-Aware Multi-Modal Network for Depth Completion [107.15344488719322]
我々は,観測された空間コンテキストを捉えるために,グラフ伝搬を採用することを提案する。
次に、注意機構を伝搬に適用し、ネットワークが文脈情報を適応的にモデル化することを奨励する。
最後に、抽出したマルチモーダル特徴を効果的に活用するための対称ゲート融合戦略を導入する。
本稿では,Adaptive Context-Aware Multi-Modal Network (ACMNet) を2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2020-08-25T06:00:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。