論文の概要: Exploring the Potential of Contrastive Language-Image Pre-training for Multi-Source Remote Sensing Data
- arxiv url: http://arxiv.org/abs/2609.03391v1
- Date: Thu, 03 Sep 2026 05:45:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.934697
- Title: Exploring the Potential of Contrastive Language-Image Pre-training for Multi-Source Remote Sensing Data
- Title(参考訳): マルチソースリモートセンシングデータのためのコントラスト言語画像事前学習の可能性を探る
- Abstract要約: 視覚言語モデリングのためのマルチソースセンサ入力をサポートする,エンドツーエンドのコントラスト学習フレームワークを提案する。
スペクトルコンテキスト対応マスクに基づくコントラスト学習方式を導入し、モダリティ固有の冗長な特徴を抑える。
マルチモーダルトレーニングを支援するため,最初の大規模リモートセンシング画像テキストコーパスであるOmniRS5Mを構築した。
- 参考スコア(独自算出の注目度): 12.302498570831538
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contrastive language-image learning (CLIP) has become a key paradigm for remote sensing vision-language understanding. However, existing remote sensing contrastive learning methods are mostly built on RGB-oriented CLIP architectures, making it difficult to exploit heterogeneous sensors such as SAR, multi-spectral imaging (MSI), and hyperspectral imaging (HSI). To address this limitation, we propose OmniRSCLIP, an end-to-end contrastive learning framework that supports multi-source sensor inputs for remote sensing vision-language modeling. The key idea is to extend CLIP beyond its fixed RGB input interface without breaking the pretrained visual knowledge. To this end, OmniRSCLIP introduces Spectral-Spatial Basis Decomposition (SSBD), which formulates arbitrary-channel adaptation as a basis recomposition problem: pretrained CLIP patch embeddings provide transferable spatial bases, while wavelength-conditioned coefficients span sensor-specific embedding kernels within a constrained visual prior space. This design avoids forcing heterogeneous sensors into a fixed-channel input space, while aligning them in a unified image-text semantic space. We further introduce a spectral-context-aware mask-based contrastive learning scheme to suppress modality-specific redundant features and enhance fine-grained image-text alignment. Finally, to support multi-modal training, we construct OmniRS5M, the first large-scale remote sensing image-text corpus covering RGB, SAR, MSI, and HSI. Experiments on retrieval, zero-shot classification, and semantic localization show that OmniRSCLIP preserves strong RGB-domain performance while effectively extending CLIP to heterogeneous remote sensing modalities.
- Abstract(参考訳): コントラスト言語画像学習(CLIP)は、リモートセンシング視覚言語理解において重要なパラダイムとなっている。
しかし、既存のリモートセンシングコントラスト学習手法は、主にRGB指向のCLIPアーキテクチャ上に構築されており、SAR、マルチスペクトルイメージング(MSI)、ハイパースペクトルイメージング(HSI)などの異種センサを利用するのが困難である。
この制限に対処するため、リモートセンシング視覚言語モデリングのためのマルチソースセンサ入力をサポートするエンドツーエンドのコントラスト学習フレームワークであるOmniRSCLIPを提案する。
鍵となるアイデアは、CLIPを、トレーニング済みの視覚的知識を壊さずに、その固定されたRGB入力インターフェースを超えて拡張することである。
この目的のために、OmniRSCLIPは、任意のチャネル適応を基底再合成問題として定式化したスペクトル-空間基底分解(SSBD)を導入している。
この設計は、不均一なセンサを固定チャネル入力空間に強制することを避け、それらを統一された画像テキスト意味空間に整列させる。
さらに、スペクトル対応マスクに基づくコントラスト学習方式を導入し、モダリティ固有の冗長な特徴を抑え、きめ細かい画像テキストアライメントを強化する。
最後に、マルチモーダルトレーニングをサポートするために、RGB、SAR、MSI、HSIをカバーする最初の大規模リモートセンシング画像テキストコーパスであるOmniRS5Mを構築した。
検索,ゼロショット分類,セマンティックローカライゼーションの実験により,OmniRSCLIPは強力なRGBドメイン性能を維持しつつ,CLIPを不均一なリモートセンシングモードに効果的に拡張することを示した。
関連論文リスト
- DPSF-Net: A Dual-Prior Spatial-Frequency Network for Real-World Remote Sensing Image Dehazing [1.0096416727161845]
実世界のRSIDのためのMCAF-Net上に構築された2重プリア空間周波数ネットワークDPSF-Netを提案する。
ネットワークは、ぼんやりしたRGBイメージとダークチャネル事前(DCP)マップをジョイント入力として使用し、物理的劣化の手がかりにより、エンドツーエンドの機能学習をガイドする。
実験により、DPSF-Netは現実世界のRRSHIDリモートセンシング画像デハージングベンチマークで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-09-07T03:00:10Z) - Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing [55.13802890769086]
我々は、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介する。
深いモーダルなシナジーを達成するため、Evitaはすべてのエンコーダ層に直接固有のコラーニングモジュール群を組み込む。
Evitaは、リアルタイムマルチモーダル認識において、より優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立する。
論文 参考訳(メタデータ) (2026-07-10T06:52:09Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - TAR: Text Semantic Assisted Cross-modal Image Registration Framework for Optical and SAR Images [48.9420428682499]
本稿では,光学およびSAR画像のためのテキストセマンティック支援型クロスモーダル画像登録フレームワークTARを提案する。
TARは、リモートセンシングシーンや土地被覆カテゴリからのテキストセマンティクスを活用して、モダリティギャップを緩和する。
いくつかの最先端手法よりも強いマッチング性能を実現し、大きな幾何学的変形の下では大きな利得が得られる。
論文 参考訳(メタデータ) (2026-05-12T12:50:36Z) - Deep Spatially-Regularized and Superpixel-Based Diffusion Learning for Unsupervised Hyperspectral Image Clustering [3.702642055407484]
ハイパースペクトル画像(HSI)クラスタリングのための教師なしフレームワークが提案されている。
拡散型クラスタリングを用いたマスク付き深層表現学習を提案する。
深部空間規則化スーパーピクセルベース拡散学習(DS2DL$)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-04-14T21:21:51Z) - Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - Hyperspectral Adapter for Semantic Segmentation with Vision Foundation Models [18.24287471339871]
ハイパースペクトルイメージング(HSI)は、多数の狭い波長帯にわたる密度のスペクトル測定とともに空間情報をキャプチャする。
本アーキテクチャでは、スペクトル変換器とスペクトル対応空間先行モジュールを組み込んで、豊富な空間スペクトル特徴を抽出する。
我々のアーキテクチャは、HSI入力を直接使用しながら、最先端のセマンティックセマンティックセマンティックセマンティクス性能を実現し、ビジョンベースとハイパースペクトルセマンティクスの両方のセマンティクス法より優れている。
論文 参考訳(メタデータ) (2025-09-24T13:32:07Z) - Annotation-Free Open-Vocabulary Segmentation for Remote-Sensing Images [51.74614065919118]
本稿では,アノテーションのないRS画像のオープン語彙セグメンテーションのための最初のフレームワークであるSegEarth-OVを紹介する。
粗い特徴から高分解能空間の詳細を頑健に復元する普遍的なアップサンプラーであるSimFeatUpを提案する。
また、パッチ機能から固有のグローバルコンテキストを抽出するための、シンプルで効果的なグローバルバイアス緩和操作も提示する。
論文 参考訳(メタデータ) (2025-08-25T14:22:57Z) - AuxDet: Auxiliary Metadata Matters for Omni-Domain Infrared Small Target Detection [49.81255045696323]
補助メタデータ駆動型赤外小型ターゲット検出器(AuxDet)について述べる。
AuxDetはメタデータセマンティクスと視覚的特徴を統合し、各サンプルに対する適応表現学習を導く。
挑戦的なWideIRSTD-Fullベンチマークの実験は、AuxDetが一貫して最先端のメソッドより優れていることを示した。
論文 参考訳(メタデータ) (2025-05-21T07:02:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。