論文の概要: Cross-Modal Alignment and Fusion for RGB-D Transmission-Line Defect Detection
- arxiv url: http://arxiv.org/abs/2602.01696v1
- Date: Mon, 02 Feb 2026 06:11:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:33.945065
- Title: Cross-Modal Alignment and Fusion for RGB-D Transmission-Line Defect Detection
- Title(参考訳): RGB-D伝送線欠陥検出のためのクロスモーダルアライメントと核融合
- Abstract要約: 本稿では,RGBの外観と深度幾何学を原理化されたヒューズ・パラダイムを通じて統合したクロスモーダルアライメント・アンド・フュージョン・ネットワークであるCMAFNetを提案する。
CMAFNetは、辞書ベースの特徴浄化を行うセマンティック再構成モジュールで構成されている。
軽量な派生型は228 FPSで24.8% mAP50に達し、わずか4.9Mのパラメータしか持たない。
- 参考スコア(独自算出の注目度): 11.637942429146172
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transmission line defect detection remains challenging for automated UAV inspection due to the dominance of small-scale defects, complex backgrounds, and illumination variations. Existing RGB-based detectors, despite recent progress, struggle to distinguish geometrically subtle defects from visually similar background structures under limited chromatic contrast. This paper proposes CMAFNet, a Cross-Modal Alignment and Fusion Network that integrates RGB appearance and depth geometry through a principled purify-then-fuse paradigm. CMAFNet consists of a Semantic Recomposition Module that performs dictionary-based feature purification via a learned codebook to suppress modality-specific noise while preserving defect-discriminative information, and a Contextual Semantic Integration Framework that captures global spatial dependencies using partial-channel attention to enhance structural semantic reasoning. Position-wise normalization within the purification stage enforces explicit reconstruction-driven cross-modal alignment, ensuring statistical compatibility between heterogeneous features prior to fusion. Extensive experiments on the TLRGBD benchmark, where 94.5% of instances are small objects, demonstrate that CMAFNet achieves 32.2% mAP@50 and 12.5% APs, outperforming the strongest baseline by 9.8 and 4.0 percentage points, respectively. A lightweight variant reaches 24.8% mAP50 at 228 FPS with only 4.9M parameters, surpassing all YOLO-based detectors while matching transformer-based methods at substantially lower computational cost.
- Abstract(参考訳): 送電線欠陥検出は、小型の欠陥、複雑な背景、照明のバリエーションにより、自動UAV検査において依然として困難である。
既存のRGBベースの検出器は、最近の進歩にもかかわらず、幾何学的に微妙な欠陥を、色調のコントラストに制限された視覚的に類似した背景構造と区別するのに苦労している。
本稿では,RGBの外観と深度幾何を,原理的パーフェクト・アンフューズ・パラダイムを通じて統合する,クロスモーダルアライメント・フュージョン・ネットワークであるCMAFNetを提案する。
CMAFNetは、欠陥識別情報を保持しながら、モダリティ固有のノイズを抑えるための学習コードブックを介して辞書ベースの特徴浄化を行うセマンティック再構成モジュールと、部分チャネルアテンションを用いてグローバルな空間的依存関係をキャプチャして構造的セマンティック推論を強化するコンテキストセマンティック統合フレームワークから構成される。
浄化段階における位置ワイド正規化は、明示的な再構成駆動によるクロスモーダルアライメントを強制し、融合前の不均一な特徴間の統計的整合性を確保する。
TLRGBDベンチマークでは94.5%のインスタンスが小さなオブジェクトであり、CMAFNetは32.2%のmAP@50と12.5%のAPを達成し、それぞれ9.8と4.0で最強のベースラインを上回った。
軽量な派生型は228 FPSで24.8% mAP50に達し、4.9Mのパラメータしか持たない。
関連論文リスト
- Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation [38.070045759599225]
ゼロショット異常検出のためのプラグアンドプレイ補助条件拡張フレームワークを提案する。
本フレームワークは,RGB画像テキスト異常マッチング経路を保存し,RGB特徴改善のための条件信号として補助観測を用いる。
MVTec 3D-ADとEyecandiesの実験は、我々のフレームワークが複数のRGBベースのゼロショット異常検知器を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-08-14T05:33:45Z) - Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration [17.74037850404483]
そこで本研究では,極端から端へ可視光を指向する物体検出器を提案する。
提案されたJFRDetは、DroneVehicle Misaligned (DVMA)上で69.7%$mathrmmAP_50$を達成する。
論文 参考訳(メタデータ) (2026-08-11T09:02:37Z) - ASFR-Net: Adversarial Alignment and Spatio-Frequency Refinement Network for Heterogeneous Remote Sensing Image Change Detection [16.766607258562992]
リモートセンシング画像における異種変化検出のための新しい対向周波数ネットワーク(ASFR-Net)を提案する。
学習者(MIRLearn-er)は、バックボーンをガイドして固有のモダリティ不変の特徴を抽出し、主要なドメインギャップを効果的にブリッジする。
SFEMは、空間領域において識別が難しいセンサ固有のノイズやアーティファクトを特定し、抑制する。
VisNIR-HCDデータセットは、知覚的な視覚的類似性と非線形スペクトル反転から生じるユニークな科学的課題を示す。
論文 参考訳(メタデータ) (2026-07-08T08:52:59Z) - Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking [58.338848435042536]
RGB-Eventトラッキングは、イベントセンサからRGB外観テクスチャと高密度時間運動キューを融合することにより、ローカライズを改善する。
現実世界のシーンは、従来のマルチモーダル融合を妨げる多様な構造的な信号劣化に悩まされる。
本稿では,RGBイベント追跡に適した階層的摂動・検索フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T23:34:06Z) - CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection [22.190054508477704]
訓練データに制限があるため、わずかな撮影異常検出は依然として困難である。
CMDS-AD(Cross-Modal Dual-Stream Anomaly Detection framework)を提案する。
CMDS-ADは、MVTec 3D-ADで5.7%(I-AUROC)と2.0%(AUPRO)の絶対的なパフォーマンス向上を達成する。
論文 参考訳(メタデータ) (2026-06-18T14:36:02Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - Towards UAV Detection in the Real World: A New Multispectral Dataset UAVNet-MS and a New Method [80.50361258830928]
UAVNet-MSは、微小UAV検出のための最初のマルチスペクトルデータセットである。
本稿では、アレイ誘起パララックスと空間-スペクトル融合に対処するデュアルストリームベースラインであるMFDNetを提案する。
この研究は、基礎的なデータセット、強力なベースライン、マルチスペクトルUAV監視研究のためのベンチマークを提供する。
論文 参考訳(メタデータ) (2026-05-20T09:49:04Z) - Amped: Adaptive Multi-stage Non-edge Pruning for Edge Detection [53.59823657644554]
エッジ検出のための適応型多段非エッジプルーニングフレームワーク(Amped)を提案する。
Ampedは高信頼の非エッジトークンを識別し、可能な限り早く削除し、計算を大幅に削減する。
既存のエッジ検出ネットワークの構造的複雑さを軽減するため,Streamline Edge Detector(SED)と呼ばれる,シンプルながら高性能なTransformerベースのモデルを導入する。
論文 参考訳(メタデータ) (2026-03-29T12:26:35Z) - Halt the Hallucination: Decoupling Signal and Semantic OOD Detection Based on Cascaded Early Rejection [7.227431306238601]
粗い論理による異常検出のための階層的フィルタリングを実現するカスケード早期退避(CER)フレームワークを提案する。
実験の結果、CERは計算オーバーヘッドを32%削減するだけでなく、CIFAR-100ベンチマークの大幅な性能向上も達成している。
論文 参考訳(メタデータ) (2026-02-06T02:55:35Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data [0.0]
本稿では,現在のビジョンに基づくレール欠陥検出手法の限界に対処する。
本稿では,RGB-Dデータを利用した軽量ピラミッドクロスアテンションネットワーク(LPCANet)を提案する。
LPCANetは990万のパラメータ、2.50GのFLOP、162.60fpsの推論速度で最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-14T03:35:09Z) - Physics-Inspired Modeling and Content Adaptive Routing in an Infrared Gas Leak Detection Network [19.83756107644484]
赤外線ガス漏れを検出する物理エッジハイブリッドガスダイナミックルーティングネットワーク(PEG-DRNet)を提案する。
PEG-DRNetは、精度と計算効率の最良のバランスで、より優れた全体的な性能を達成する。
論文 参考訳(メタデータ) (2025-12-29T06:28:20Z) - MRS-YOLO Railroad Transmission Line Foreign Object Detection Based on Improved YOLO11 and Channel Pruning [2.6795746856835785]
YOLO11に基づく改良アルゴリズム MRS-YOLOを提案する。
MRS-YOLOアルゴリズムのmAP50とmAP50:95はそれぞれ94.8%と86.4%に改善されている。
論文 参考訳(メタデータ) (2025-10-12T11:38:09Z) - Unified Unsupervised Anomaly Detection via Matching Cost Filtering [113.43366521994396]
教師なし異常検出(UAD)は、通常のトレーニングデータのみを用いて画像レベルの異常と画素レベルの異常を識別することを目的としている。
UADモデルの異常コスト量を補正するための汎用的なポストホック精錬フレームワークであるUnified Cost Filtering (UCF) を提案する。
論文 参考訳(メタデータ) (2025-10-03T03:28:18Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - SPFFNet: Strip Perception and Feature Fusion Spatial Pyramid Pooling for Fabric Defect Detection [0.0]
YOLOv11に基づくファブリック欠陥検出モデルを提案する。
SPM(Strip Perception Module)を導入し,マルチスケールのコンボリューションにより機能キャプチャを改善する。
また,適応重み付き共振器(FECIoU)の新たな拡張完全交叉法を提案する。
論文 参考訳(メタデータ) (2025-02-03T15:33:11Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - Global Context Aggregation Network for Lightweight Saliency Detection of
Surface Defects [70.48554424894728]
我々は,エンコーダ・デコーダ構造上の表面欠陥を簡易に検出するためのGCANet(Global Context Aggregation Network)を開発した。
まず、軽量バックボーンの上部層に新しいトランスフォーマーエンコーダを導入し、DSA(Depth-wise Self-Attention)モジュールを通じてグローバルなコンテキスト情報をキャプチャする。
3つの公開欠陥データセットの実験結果から,提案したネットワークは,他の17の最先端手法と比較して,精度と実行効率のトレードオフを良好に達成できることが示された。
論文 参考訳(メタデータ) (2023-09-22T06:19:11Z) - G-DetKD: Towards General Distillation Framework for Object Detectors via
Contrastive and Semantic-guided Feature Imitation [49.421099172544196]
そこで本研究では,すべてのピラミッドレベルにまたがる特徴ペア間のソフトマッチングを自動的に行う,意味誘導型特徴模倣手法を提案する。
また,異なる特徴領域間の関係で符号化された情報を効果的に捉えるために,コントラスト蒸留を導入する。
本手法は,(1)フレームワークのコンポーネントを別々に使用した場合に,既存の検出KD技術よりも優れた性能を発揮する。
論文 参考訳(メタデータ) (2021-08-17T07:44:27Z) - Progressively Guided Alternate Refinement Network for RGB-D Salient
Object Detection [63.18846475183332]
我々は,RGB-Dの高次物体検出のための効率的かつコンパクトなディープネットワークを開発することを目指している。
そこで本研究では,改良のための改良ネットワークを提案する。
我々のモデルは、既存の最先端のアプローチよりも大きなマージンで優れています。
論文 参考訳(メタデータ) (2020-08-17T02:55:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。