論文の概要: Multimodal RGB-Infrared Combination for UAV-Based Wildfire Segmentation: A Comparative Study on FLAME3
- arxiv url: http://arxiv.org/abs/2609.01390v1
- Date: Tue, 01 Sep 2026 15:18:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.796082
- Title: Multimodal RGB-Infrared Combination for UAV-Based Wildfire Segmentation: A Comparative Study on FLAME3
- Title(参考訳): UAVをベースとした野火セグメンテーションのためのマルチモーダルRGB-赤外線合成 : FLAME3の比較検討
- Authors: Matheus F. Kovaleski, Luís Garrote, Cristiano Premebida, Jérôme Mendes, João Ruivo Paulo,
- Abstract要約: 無人航空機(UAV)は、消防活動のための有望なプラットフォームとして登場した。
深層学習の最近の進歩は、UAVベースの山火事監視システムの能力を大幅に向上させた。
本研究では,FLAME3データセット上での連成山火事セグメンテーションのためのRGB赤外線融合について検討する。
- 参考スコア(独自算出の注目度): 4.325251115902531
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unmanned Aerial Vehicles (UAVs) have emerged as a promising platform for firefighting operations due to their flexibility, low operational cost, and ability to acquire high-resolution imagery in locations that may be difficult or dangerous to access using conventional methods. Recent advances in deep learning have significantly improved the capabilities of UAV-based wildfire monitoring systems. The present work investigates RGB-infrared fusion for binary wildfire segmentation on the FLAME3 dataset. In this Study, RGB and Infrared baselines are compared with three representative fusion strategies across three segmentation architectures, including U-Net, DeepLabV3+, and SegFormer. The key motivation of this work is to analyze the contribution of each modality, evaluate the impact of fusion timing, and examine how different network architectures exploit multimodal information for UAV wildfire delineation. The findings indicate that thermal information plays a dominant role in UAV segmentation and that feature-level multimodal fusion combined with transformer-based architectures offers the most promising direction for future research.
- Abstract(参考訳): 無人航空機(UAV)は、その柔軟性、運用コストの低さ、そして従来の方法でアクセスするのが困難または危険である場所において高解像度の画像を取得する能力のために、消防活動のための有望なプラットフォームとして登場した。
深層学習の最近の進歩は、UAVベースの山火事監視システムの能力を大幅に向上させた。
本研究では,FLAME3データセット上での連成山火事セグメンテーションのためのRGB赤外線融合について検討する。
本研究では、U-Net、DeepLabV3+、SegFormerを含む3つのセグメンテーションアーキテクチャにおいて、RGBおよび赤外線ベースラインを3つの代表的な融合戦略と比較する。
この研究の主な動機は、各モードの寄与を分析し、融合タイミングの影響を評価し、異なるネットワークアーキテクチャがUAV山火事の除火のためにマルチモーダル情報をどのように活用するかを検討することである。
この結果は,UAVセグメンテーションにおいて熱情報が重要な役割を担い,トランスフォーマーアーキテクチャと機能レベルのマルチモーダル融合が今後の研究に最も有望な方向性をもたらすことを示唆している。
関連論文リスト
- Tri-Modal Fusion Transformers for UAV-based Object Detection [1.338174941551702]
本稿では、RGB、サーマル、イベントデータをデュアルストリーム階層型視覚変換器で処理するトリオモーダル・フレームワークを提案する。
10,489フレームのUAVデータセットを導入し,RGB-熱対流と24,223の注釈付き車両を同期・調整した。
論文 参考訳(メタデータ) (2026-04-17T18:35:06Z) - Seeing Heat with Color -- RGB-Only Wildfire Temperature Inference from SAM-Guided Multimodal Distillation using Radiometric Ground Truth [5.343932820859596]
本稿では,RGB入力のみを用いた画素レベルの山火事温度予測とセグメンテーションのための新しいフレームワークSAM-TIFFを紹介する。
対のRGB-サーマル画像とラジオメトリックのTIFF地上真実を訓練したマルチモーダル教師ネットワークは、知識を単調なRGB学生ネットワークに蒸留し、熱センサレス推論を可能にする。
提案手法は,RGB UAVデータから画素あたりの温度レグレッションを初めて行い,最近のFLAME 3データセットに強い一般化を示すものである。
論文 参考訳(メタデータ) (2025-05-03T00:23:11Z) - Multi-Domain Biometric Recognition using Body Embeddings [51.36007967653781]
身体埋め込みは中波長赤外線(MWIR)領域と長波長赤外線(LWIR)領域の顔埋め込みよりも優れていた。
我々は、IJB-MDFデータセット上でのベンチマーク結果を確立するために、ビジョントランスフォーマーアーキテクチャを活用している。
また, クロスエントロピーとトリプルト損失の単純な組み合わせで, VISデータにのみ事前訓練された体モデルを微調整することで, 最先端のmAPスコアが得られることを示す。
論文 参考訳(メタデータ) (2025-03-13T22:38:18Z) - Bringing RGB and IR Together: Hierarchical Multi-Modal Enhancement for Robust Transmission Line Detection [67.02804741856512]
高速かつ高精度なTL検出のために,RGBとIRデータを統合したHMMEN(Hierarchical Multi-Modal Enhancement Network)を提案する。
提案手法では,(1)階層的RGBおよびIR特徴写像を大まかに融合・拡張するMMEB,(2)デコーダ出力とIR特徴写像の不整合を変形可能な畳み込みを利用して補正するFAB,の2つの重要な構成要素を紹介する。
論文 参考訳(メタデータ) (2025-01-25T06:21:06Z) - Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection [70.84835546732738]
RGB-Thermal Salient Object Detectionは、目視と熱赤外画像のペア内の目立つ物体をピンポイントすることを目的としている。
従来のエンコーダ・デコーダアーキテクチャは、欠陥モードから生じるノイズに対する頑健さを十分に考慮していなかったかもしれない。
本稿では,Divide-and-Conquer戦略を用いた,堅牢なConfluent Triple-Flow NetworkであるConTriNetを提案する。
論文 参考訳(メタデータ) (2024-12-02T14:44:39Z) - Interactive Context-Aware Network for RGB-T Salient Object Detection [7.544240329265388]
ICANet(Interactive Context-Aware Network)と呼ばれる新しいネットワークを提案する。
ICANetには、クロスモーダルとクロススケールの融合を効果的に実行する3つのモジュールが含まれている。
実験により,我々のネットワークは最先端のRGB-T SOD法に対して良好に動作していることが示された。
論文 参考訳(メタデータ) (2022-11-11T10:04:36Z) - Target-aware Dual Adversarial Learning and a Multi-scenario
Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection [65.30079184700755]
本研究は、物体検出のために異なるように見える赤外線と可視画像の融合の問題に対処する。
従来のアプローチでは、2つのモダリティの根底にある共通点を発見し、反復最適化またはディープネットワークによって共通空間に融合する。
本稿では、融合と検出の連立問題に対する二段階最適化の定式化を提案し、その後、核融合と一般的に使用される検出ネットワークのためのターゲット認識デュアル逆学習(TarDAL)ネットワークに展開する。
論文 参考訳(メタデータ) (2022-03-30T11:44:56Z) - MBDF-Net: Multi-Branch Deep Fusion Network for 3D Object Detection [17.295359521427073]
3次元物体検出のためのMulti-Branch Deep Fusion Network (MBDF-Net)を提案する。
最初の段階では、マルチブランチ機能抽出ネットワークは、Adaptive Attention Fusionモジュールを使用して、単一モーダルなセマンティックな特徴からクロスモーダルな融合機能を生成する。
第2段階では、関心領域(RoI)をプールした核融合モジュールを用いて局所的な特徴を改良する。
論文 参考訳(メタデータ) (2021-08-29T15:40:15Z) - EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation [62.210091681352914]
自律運転やロボティクスなど,多くのアプリケーションを対象とした3次元セマンティックセマンティックセグメンテーションのためのマルチセンサフュージョンについて検討する。
本研究では,知覚認識型マルチセンサフュージョン(PMF)と呼ばれる協調融合方式について検討する。
本稿では,2つのモードから特徴を分離して抽出する2ストリームネットワークを提案する。
論文 参考訳(メタデータ) (2021-06-21T10:47:26Z) - Multimodal Object Detection via Bayesian Fusion [59.31437166291557]
我々は、RGBとサーマルカメラでマルチモーダルオブジェクト検出を研究します。後者は照明不良下ではるかに強力なオブジェクトシグネチャを提供することができます。
我々の重要な貢献は、異なるモードのボックス検出を融合する非学習遅延融合法である。
このアプローチは、整列(KAIST)と非整列(FLIR)のマルチモーダルセンサーデータを含むベンチマークに適用されます。
論文 参考訳(メタデータ) (2021-04-07T04:03:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。