論文の概要: Self-supervised training for high-resolution close-range multispectral remote sensing imagery
- arxiv url: http://arxiv.org/abs/2607.11366v1
- Date: Mon, 13 Jul 2026 10:31:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.436216
- Title: Self-supervised training for high-resolution close-range multispectral remote sensing imagery
- Title(参考訳): 高分解能近距離マルチスペクトルリモートセンシング画像のための自己教師付きトレーニング
- Abstract要約: 自己教師付き学習(SSL)は、近距離リモートセンシングにおけるアノテーションの労力を減らすための有望な方法である。
本研究は,cmスケールマルチスペクトルドローン画像を用いた精密農業のためのSSL事前訓練の評価を行った。
トランスフォーマーベースのエンコーダはMomentum Contrast v3とMasked Autoencodersで事前訓練された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Although self-supervised learning (SSL) offers a promising way to reduce annotation effort in close-range remote sensing, its effectiveness for high-resolution multispectral unmanned aerial vehicle (UAV) imagery remains underexplored due to limited data. This study evaluated SSL pretraining for precision agriculture using cm-scale multispectral drone imagery collected across multiple sensors, years, and regions. Transformer-based encoders were pretrained with Momentum Contrast v3 (MoCo-v3) and Masked Autoencoders on a harmonized dataset combining msuav500K with newly collected multi-year UAV imagery from agricultural fields in Finland. Pretraining used four spectral bands (Green, Red, Red-Edge, Near-Infrared) for cross-sensor compatibility. The models were evaluated on crop-weed semantic segmentation using the WeedMap dataset with 5--100% training data. The following two subsets served as downstream tasks: Task A (Germany, RedEdge-M), where all pretrained models were compared under partial and full fine-tuning, and Task B (Switzerland, Sequoia), where the best encoder from Task A was assessed. Our Swin Transformer pretrained with MoCo-v3 achieved the strongest performance on both tasks, surpassing the Swin Transformer model of Doornbos et al. pretrained on a pre-release of msuav500K. Our pretrained Swin Transformer further demonstrated cross-sensor and cross-region generalization. We additionally provide a public multi-year multispectral UAV dataset from Finland to support future research.
- Abstract(参考訳): 自己教師付き学習(SSL)は、近距離リモートセンシングにおけるアノテーションの労力を減らすための有望な方法であるが、高分解能マルチスペクトル無人航空機(UAV)画像に対する有効性は、限られたデータにより未探索のままである。
本研究は,複数のセンサ,年数,地域にわたって収集したcmスケールマルチスペクトルドローン画像を用いて,精密農業のためのSSL事前訓練の評価を行った。
Momentum Contrast v3 (MoCo-v3) と Masked Autoencoders は、msuav500K と新たに収集されたフィンランドの農業地帯のUAV画像を組み合わせた調和したデータセット上で、トランスフォーマーベースのエンコーダを事前訓練した。
Pretrainingは4つのスペクトルバンド(緑、赤、赤、近赤外線)をクロスセンサーの互換性のために使用した。
WeedMapデータセットを5~100%のトレーニングデータを用いて,作物雑草のセマンティックセマンティックセマンティクスを用いて評価した。
以下の2つのサブセットは、タスクA(ドイツ、RedEdge-M)とタスクAから最高のエンコーダを評価するタスクB(スイス、Sequoia)の下流タスクとして機能した。
MoCo-v3で事前学習したSwin Transformerは,msuav500Kのプレリリースで事前学習したDoornbosらのSwin Transformerモデルを上回っ,両タスクにおいて最強のパフォーマンスを達成した。
我々の事前学習したSwin Transformerはさらにクロスセンサとクロスリージョンの一般化を実証した。
また、フィンランドから多年間マルチスペクトルUAVデータセットを公開し、将来の研究を支援する。
関連論文リスト
- Crossmodal learning for Crop Canopy Trait Estimation [8.011752394739903]
本稿では,高解像度衛星画像にUAVレベルの視覚的ディテールを付加したクロスモーダル学習手法を提案する。
我々は、米国コーンベルトの5つの異なる場所にわたって84種類のハイブリッドトウモロコシ品種の複製されたプロットから収集された、ほぼ同一の衛星UAV画像対のデータセットを使用する。
その結果、衛星入力から生成されたUAVライクな表現は、収量や窒素予測を含む複数の下流タスクにおいて、実際の衛星画像よりも一貫して優れていた。
論文 参考訳(メタデータ) (2025-11-20T04:25:11Z) - Unified Human Localization and Trajectory Prediction with Monocular Vision [64.19384064365431]
MonoTransmotionはトランスフォーマーベースのフレームワークで、モノクロカメラのみを使用して、ローカライゼーションと予測タスクを共同で解決する。
両タスクを統合フレームワークで共同でトレーニングすることにより,ノイズの多い入力による実環境シナリオにおいて,我々の手法がより堅牢であることを示す。
論文 参考訳(メタデータ) (2025-03-05T14:18:39Z) - Enhancing kelp forest detection in remote sensing images using crowdsourced labels with Mixed Vision Transformers and ConvNeXt segmentation models [0.0]
本研究では,クラウドソースラベルと高度な人工知能モデルを統合することにより,高速かつ高精度なケルプキャノピー検出パイプラインを開発する。
この手法は高い検出率を達成し、ケルプキャノピーを含む4ピクセル中3ピクセルを正確に同定した。
この研究は、機械学習モデルとクラウドソーシングデータを組み合わせることで、効果的でスケーラブルな環境モニタリングを可能にする可能性をも示している。
論文 参考訳(メタデータ) (2025-01-23T12:12:31Z) - Domain Adaptive Detection of MAVs: A Benchmark and Noise Suppression Network [26.26788054611157]
MAV検出の方法は、トレーニングセットとテストセットが同じ分布を持つと仮定する。
提案したデータセットに基づいて,クロスドメインMAV検出のための新しいベンチマークを提案する。
擬似ラベルの枠組みと大規模から小規模の訓練手順に基づく騒音抑制ネットワーク(NSN)
論文 参考訳(メタデータ) (2024-03-25T12:07:24Z) - Rethinking Transformers Pre-training for Multi-Spectral Satellite
Imagery [78.43828998065071]
教師なし学習の最近の進歩は、下流タスクにおける有望な結果を達成するための大きな視覚モデルの可能性を示している。
このような事前学習技術は、大量の未学習データが利用可能であることから、リモートセンシング領域でも最近研究されている。
本稿では,マルチモーダルで効果的に活用されるマルチスケール情報の事前学習と活用について述べる。
論文 参考訳(メタデータ) (2024-03-08T16:18:04Z) - SVFormer: Semi-supervised Video Transformer for Action Recognition [88.52042032347173]
SVFormerは、未ラベルの動画サンプルに対処するために、安定した擬似ラベルフレームワークを採用する。
さらに,ビデオの複雑な時間変動をカバーするための時間ゆらぎを提案する。
特にSVFormerは、Kinetics-400の1%のラベル付け率でトレーニングエポックを減らし、最先端の技術を31.5%上回っている。
論文 参考訳(メタデータ) (2022-11-23T18:58:42Z) - An Empirical Study of Training End-to-End Vision-and-Language
Transformers [50.23532518166621]
我々はMETER(textbfMultimodal textbfEnd-to-end textbfTransformtextbfER)を提案する。
具体的には、視覚エンコーダ(例えば、CLIP-ViT、Swin変換器)、テキストエンコーダ(例えば、RoBERTa、DeBERTa)、マルチモーダルフュージョン(例えば、マージアテンション対共振器)である。
論文 参考訳(メタデータ) (2021-11-03T17:55:36Z) - Self-supervised Audiovisual Representation Learning for Remote Sensing Data [96.23611272637943]
遠隔センシングにおける深層ニューラルネットワークの事前学習のための自己教師型アプローチを提案する。
ジオタグ付きオーディオ記録とリモートセンシングの対応を利用して、これは完全にラベルなしの方法で行われる。
提案手法は,既存のリモートセンシング画像の事前学習方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2021-08-02T07:50:50Z) - Seasonal Contrast: Unsupervised Pre-Training from Uncurated Remote
Sensing Data [64.40187171234838]
季節的コントラスト(SeCo)は、リモートセンシング表現のドメイン内事前トレーニングにラベルのないデータを活用するための効果的なパイプラインである。
SeCoは、転送学習を容易にし、再リモートセンシングアプリケーションの急速な進歩を可能にするために公開されます。
論文 参考訳(メタデータ) (2021-03-30T18:26:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。