論文の概要: A generalised pre-training strategy for deep learning networks in semantic segmentation of remotely sensed images
- arxiv url: http://arxiv.org/abs/2604.27704v1
- Date: Thu, 30 Apr 2026 10:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.049283
- Title: A generalised pre-training strategy for deep learning networks in semantic segmentation of remotely sensed images
- Title(参考訳): リモートセンシング画像のセマンティックセグメンテーションにおけるディープラーニングネットワークのための一般化事前学習戦略
- Authors: Yuan Fang, Yuanzhi Cai, Jagannath Aryal, Qinfeng Zhu, Hong Huang, Cheng Zhang, Lei Fan,
- Abstract要約: ディープラーニングモデルは一般的に、ドメイン固有のデータセットを微調整する前に、ImageNetのような大規模なイメージデータベースで事前トレーニングされる。
本研究では、事前学習データセットにおいて、モデルがドメイン固有の特徴を学習することを避けるために設計された、新しい単純な事前学習戦略を紹介する。
実験結果から,提案した事前学習戦略が4つのセマンティックセグメンテーションデータセットの最先端の精度に導いたことが示唆された。
- 参考スコア(独自算出の注目度): 15.913911645516668
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In the segmentation of remotely sensed images, deep learning models are typically pre-trained using large image databases like ImageNet before fine-tuned on domain-specific datasets. However, the performance of these fine-tuned models is often hindered by the large domain gaps (i.e., differences in scenes and modalities) between ImageNet's images and remotely sensed images being processed. Therefore, many researchers have undertaken efforts to establish large-scale domain-specific image datasets for pre-training, aiming to enhance model performance. However, establishing such datasets is often challenging, requiring significant effort, and these datasets often exhibit limited generaliza-bility to other application scenarios. To address these issues, this study introduces a novel yet simple pre-training strategy designed to guide a model away from learning domain-specific features in a pre-training dataset during pre-training, thereby improving the generalisation ability of the pre-trained model. To evaluate the strategy's effectiveness, deep learning models are pre-trained on ImageNet and subsequently fine-tuned on four semantic segmentation datasets with diverse scenes and modalities, including iSAID, MFNet, PST900 and Potsdam. Experimental results show that the proposed pre-training strategy led to state-of-the-art accuracies on all four datasets, namely 67.4% mIoU for iSAID, 56.9% mIoU for MFNet, 84.22% mIoU for PST900, 91.88% mF1 for Potsdam. This research lays the groundwork for developing a unified foundation model applicable to both computer vision and remote sensing applications.
- Abstract(参考訳): リモートセンシングされたイメージのセグメンテーションでは、ディープラーニングモデルは通常、ドメイン固有のデータセットを微調整する前に、ImageNetのような大きなイメージデータベースを使用して事前トレーニングされる。
しかし、これらの微調整されたモデルの性能は、ImageNetの画像とリモートセンシングされた画像の間の大きな領域ギャップ(シーンとモダリティの違い)によって妨げられることが多い。
そのため,多くの研究者が事前学習のための大規模ドメイン固有画像データセットの構築に取り組み,モデル性能の向上を目指している。
しかし、そのようなデータセットを確立することはしばしば困難であり、多大な労力を必要とする。
これらの課題に対処するため、本研究では、事前学習中の事前学習データセットにおいて、モデルがドメイン固有の特徴を学習することから遠ざかるために設計された、新しい単純な事前学習戦略を導入し、事前学習モデルの一般化能力を向上する。
戦略の有効性を評価するために、ディープラーニングモデルはImageNetで事前トレーニングされ、その後、iSAID、MFNet、PST900、Potsdamを含む様々なシーンとモダリティを持つ4つのセマンティックセグメンテーションデータセットで微調整される。
実験結果から、提案された事前学習戦略が4つのデータセットすべてに最先端の精度をもたらすことが示されている。すなわち、iSAIDは67.4% mIoU、MFNetは56.9% mIoU、PST900は84.22% mIoU、ポツダムは91.88% mF1である。
本研究は、コンピュータビジョンとリモートセンシングの両方に適用可能な統合基盤モデルを構築するための基礎研究である。
関連論文リスト
- DeepAndes: A Self-Supervised Vision Foundation Model for Multi-Spectral Remote Sensing Imagery of the Andes [9.910207380627492]
我々は,3千万個のマルチスペクトル衛星画像に基づいてトレーニングされた視覚基盤モデルであるDeepAndesを紹介する。
不均衡な画像分類、画像インスタンス検索、画素レベルのセマンティックセマンティックセグメンテーションタスクによる画像理解性能の評価を行った。
実験の結果,DeepAndesはF1スコア,平均精度,Diceスコアを数ショットの学習シナリオで達成できることがわかった。
論文 参考訳(メタデータ) (2025-04-28T23:15:09Z) - FoundIR: Unleashing Million-scale Training Data to Advance Foundation Models for Image Restoration [66.61201445650323]
既存の手法は現実のシナリオにおける一般化ボトルネックに悩まされる。
既存のトレーニングデータに対して,2つの大きなメリットがある,100万規模のデータセットをコントリビュートしています。
実世界のシナリオにおいて,より広範囲の復元作業に対処するために,ロバストなモデルFoundIRを提案する。
論文 参考訳(メタデータ) (2024-12-02T12:08:40Z) - DG-TTA: Out-of-domain Medical Image Segmentation through Augmentation and Descriptor-driven Domain Generalization and Test-Time Adaptation [43.842694540544194]
ドメイン外の画像に事前訓練された深層学習セグメンテーションモデルを適用すると、品質の不足を予測できる。
本研究では、拡張とともに強力な一般化記述子を用いて、ドメイン一般化事前学習とテスト時間適応を実現することを提案する。
論文 参考訳(メタデータ) (2023-12-11T10:26:21Z) - UniBoost: Unsupervised Unimodal Pre-training for Boosting Zero-shot
Vision-Language Tasks [60.46473247205654]
大規模で教師なしのユニモーダルモデルを事前学習として使用することにより、画像テキストペアモデルのゼロショット性能を向上させることができる。
実験の結果,単調な事前学習は最先端のCLIPモデルよりも優れていた。
論文 参考訳(メタデータ) (2023-06-07T18:26:22Z) - WEDGE: Web-Image Assisted Domain Generalization for Semantic
Segmentation [72.88657378658549]
本稿では,Web画像の多様性を一般化可能なセマンティックセグメンテーションに活用したWEb画像支援ドメインゲネラライゼーション手法を提案する。
また,ウェブクローラー画像のスタイルをトレーニング中のトレーニング画像に注入する手法を提案する。
論文 参考訳(メタデータ) (2021-09-29T05:19:58Z) - Benchmarking the Robustness of Instance Segmentation Models [7.1699725781322465]
本稿では,実世界の画像の破損や領域外画像の収集に関して,インスタンス分割モデルの包括的評価を行う。
グループ正規化は、画像の内容が同じだが、上に汚職が加えられている汚職間のネットワークの堅牢性を高める。
また、単段検出器はトレーニングサイズよりも画像解像度が大きくなるほど一般化しないことがわかった。
論文 参考訳(メタデータ) (2021-09-02T17:50:07Z) - Salient Objects in Clutter [130.63976772770368]
本稿では,既存の正当性オブジェクト検出(SOD)データセットの重大な設計バイアスを特定し,対処する。
この設計バイアスは、既存のデータセットで評価した場合、最先端のSODモデルのパフォーマンスの飽和につながった。
我々は,新しい高品質データセットを提案し,前回のsaliencyベンチマークを更新する。
論文 参考訳(メタデータ) (2021-05-07T03:49:26Z) - Multi-task pre-training of deep neural networks for digital pathology [8.74883469030132]
私たちはまず、多くのデジタル病理データセットを22の分類タスクと約900kの画像のプールに組み立て、変換しました。
特徴抽出器として使用されるモデルは、ImageNet事前訓練されたモデルよりも大幅に改善されるか、同等のパフォーマンスを提供するかを示す。
論文 参考訳(メタデータ) (2020-05-05T08:50:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。