論文の概要: DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection
- arxiv url: http://arxiv.org/abs/2609.00666v1
- Date: Tue, 01 Sep 2026 03:44:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.273876
- Title: DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection
- Title(参考訳): DGNet:赤外線小ターゲット検出のためのデュアル知識ガイドネットワーク
- Authors: Chenglong Yu, Mingzhu Xu, Jing Wang, Tongtong Wang, Pingping Miao, Liqiang Nie,
- Abstract要約: InfRared Small Target Detection (IRSTD) はコンピュータビジョンにおける目立った課題である。
複数の一般化可能なテキストに基づく新しいDual-knowledge Guided Network(DGNet)を提案する。
- 参考スコア(独自算出の注目度): 43.281292792735364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: InfRared Small Target Detection (IRSTD) is a prominent and challenging task in computer vision. In recent years, text-guided methods have significantly improved detection performance. However, they still suffer from two key limitations. First, a single text description simultaneously modeling both background and target leads to semantic entanglement, which contradicts the objective of background suppression and target enhancement. Second, reliance on image-specific textual prompts (requiring additional external models such as CLIP during inference) results in deployment constraints. To address these issues, we propose a novel Dual-knowledge Guided Network (DGNet) based on multiple generalizable texts. Specifically, we design a Prior-knowledge Wavelet Modulation (PWM) module, which leverages dual textual priors that separately characterize large-scale backgrounds and sparse targets to effectively disentangle and modulate entangled semantics in the frequency domain. Furthermore, we introduce a Consensus-knowledge Directional Alignment (CDA) loss, which models the initial state and the ideal target across samples as `complex background' and `bright target', respectively, thereby constructing a clear and unified directional optimization trajectory for the model. Extensive experiments on three public datasets demonstrate the superior performance of DGNet and the effectiveness of each component. The source code is available at https://github.com/iLearn-Lab/MM26-DGNet.
- Abstract(参考訳): InfRared Small Target Detection (IRSTD) はコンピュータビジョンにおける目立った課題である。
近年,テキスト誘導方式は検出性能を大幅に改善している。
しかし、それらは2つの重要な制限に悩まされている。
まず、背景と対象の両方を同時にモデル化した単一のテキスト記述により意味的絡み合いが生じ、背景の抑制や対象の強化の目的と矛盾する。
第二に、イメージ固有のテキストプロンプト(推論中にCLIPのような追加の外部モデルを必要とする)に依存すると、デプロイメントの制約が発生する。
これらの問題に対処するために,複数の一般化可能なテキストに基づく新しいDual-knowledge Guided Network (DGNet)を提案する。
具体的には、大規模背景とスパースターゲットを分離して特徴付け、周波数領域における絡み合ったセマンティクスを効果的に切り離し、変調する2つのテキスト先行処理を利用する事前知識ウェーブレット変調(PWM)モジュールを設計する。
さらに,サンプル間の初期状態と理想的目標を,それぞれ「複合背景」と「右目標」としてモデル化し,モデルに対する明確かつ統一的な方向性最適化軌道を構築するコンセンサス・知識指向アライメント(CDA)の損失を導入する。
3つの公開データセットに対する大規模な実験は、DGNetの優れた性能と各コンポーネントの有効性を示している。
ソースコードはhttps://github.com/iLearn-Lab/MM26-DGNetで入手できる。
関連論文リスト
- FSGNet: A Frequency-Aware and Semantic Guidance Network for Infrared Small Target Detection [9.669351353574323]
IRSTDは、複雑な背景から小さなターゲットを識別し、識別することを目的としている。
U-Netは、深い層から浅い層へ高レベルの機能を転送する際のセマンティックな劣化に悩まされている。
本稿では,周波数認識と意味誘導を組み込んだ軽量かつ効果的な検出フレームワークFSGNetを提案する。
論文 参考訳(メタデータ) (2026-03-26T12:38:29Z) - UDPNet: Unleashing Depth-based Priors for Robust Image Dehazing [77.10640210751981]
UDPNetは、大規模で事前訓練された深度推定モデルDepthAnything V2から深度に基づく事前情報を活用する一般的なフレームワークである。
提案手法は,様々なシナリオにまたがる深度認識デハージングのための新しいベンチマークを確立する。
論文 参考訳(メタデータ) (2026-01-11T13:29:02Z) - SFGNet: Semantic and Frequency Guided Network for Camouflaged Object Detection [2.8563206958455467]
SFGNet(Semantic and Frequency Guided Network)を提案する。
セマンティック・プロンプトと周波数領域の機能を組み込んでカモフラージュされたオブジェクトをキャプチャし、境界知覚を改善する。
3つのCODベンチマークデータセットで行った大規模な実験により、我々の手法は最先端のアプローチよりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-09-15T03:15:31Z) - CSPENet: Contour-Aware and Saliency Priors Embedding Network for Infrared Small Target Detection [4.731073701194089]
赤外線小目標検出(ISTD)は、幅広い民間・軍事用途において重要な役割を担っている。
既存の手法では, 密集した乱雑な環境下でのディムターゲットの局所化や輪郭情報の認識に欠陥がある。
本稿では,ISTDのためのcontour-aware and saliency priors embedded network (CSPENet)を提案する。
論文 参考訳(メタデータ) (2025-05-15T03:56:36Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Double-Dot Network for Antipodal Grasp Detection [20.21384585441404]
本稿では,Double-Dot Network (DD-Net) という,対足足歩行検出のための新しい深層学習手法を提案する。
これは、経験的にプリセットされたアンカーに依存しない最近のアンカーフリーなオブジェクト検出フレームワークに従っている。
このような指先をローカライズするために効果的なCNNアーキテクチャを導入し、改良のための補助センターの助けを借りて、把握候補を正確かつ堅牢に推測する。
論文 参考訳(メタデータ) (2021-08-03T14:21:17Z) - Adaptive Context-Aware Multi-Modal Network for Depth Completion [107.15344488719322]
我々は,観測された空間コンテキストを捉えるために,グラフ伝搬を採用することを提案する。
次に、注意機構を伝搬に適用し、ネットワークが文脈情報を適応的にモデル化することを奨励する。
最後に、抽出したマルチモーダル特徴を効果的に活用するための対称ゲート融合戦略を導入する。
本稿では,Adaptive Context-Aware Multi-Modal Network (ACMNet) を2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2020-08-25T06:00:06Z) - Suppress and Balance: A Simple Gated Network for Salient Object
Detection [89.88222217065858]
両問題を同時に解くための単純なゲートネットワーク(GateNet)を提案する。
多レベルゲートユニットの助けを借りて、エンコーダからの貴重なコンテキスト情報をデコーダに最適に送信することができる。
さらに,提案したFold-ASPP操作(Fold-ASPP)に基づくアトラス空間ピラミッドプーリングを用いて,様々なスケールのサリアンオブジェクトを正確に位置決めする。
論文 参考訳(メタデータ) (2020-07-16T02:00:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。