論文の概要: Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift
- arxiv url: http://arxiv.org/abs/2604.08956v1
- Date: Fri, 10 Apr 2026 04:56:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-13 17:57:53.688154
- Title: Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift
- Title(参考訳): ドメインシフト下でのクラウドセグメンテーションのプロンプト性能
- Authors: Harshith Kethavath, Weiming Hu,
- Abstract要約: リモートセンシング画像に視覚言語モデルを適用することは、根本的な課題である。
ドメイン固有言語は、凍結モデル表現を特殊タスクへ導くことができるという仮定をテストする。
- 参考スコア(独自算出の注目度): 37.50182757790629
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting vision-language models to remote sensing imagery presents a fundamental challenge: both the visual and linguistic distributions of satellite data lie far outside natural image pretraining corpora. Despite this, prompting remains the dominant deployment paradigm, driven by the assumption that domain-specific language can guide frozen model representations toward specialized tasks. We test this assumption directly on a domain where the mismatch is prominent: cloud segmentation for satellite imagery. Using CLIPSeg on the CloudSEN12+ cloud segmentation benchmark, we evaluate 60 prompt variants spanning simple labels, domain terminology, appearance descriptors, and contextual cues, finding that every variant underperforms the zero-shot baseline (0.255 mIoU), with engineered prompts scoring as low as 0.07 mIoU. No amount of linguistic refinement bridges the gap between CLIP's natural image representations and satellite spectral imagery. In contrast, supervised fine-tuning with just 0.1% labeled data (~8 images) surpasses zero-shot performance overall, and 5-10% data recovers ~85% of maximum achievable mIoU. Full fine-tuning consistently outperforms low-rank adaptation by 0.03-0.09 mIoU, with the largest gaps for spectrally ambiguous classes, and at 0.5 to 1% labeled data, fine-tuning temporarily degrades performance on these classes before recovering, a supervision dip that aggregate mIoU can mask. For practitioners adapting vision-language models to specialized imagery, our results deliver a clear message: labeled data is not the expensive alternative to prompting; it is the worthwhile path.
- Abstract(参考訳): リモートセンシング画像への視覚言語モデルの適用は、衛星データの視覚的分布と言語的分布の両方が、自然画像事前学習コーパスのはるかに外にある、という根本的な課題を示す。
それにもかかわらず、ドメイン固有の言語は、凍結したモデル表現を特別なタスクへと導くことができるという仮定によって、プロンプトは依然として支配的なデプロイメントパラダイムのままである。
この仮定は、衛星画像のクラウドセグメンテーションという、ミスマッチが顕著な領域で直接テストする。
CloudSEN12+クラウドセグメンテーションベンチマークでCLIPSegを用いて、単純なラベル、ドメイン用語、外見記述子、コンテキストキューにまたがる60のプロンプト変種を評価し、各変種がゼロショットベースライン(0.255 mIoU)を過小評価し、エンジニアリングされたプロンプトが0.07 mIoUと評価された。
CLIPの自然な画像表現と衛星のスペクトル画像とのギャップを埋める言語的な洗練の量はない。
対照的に、0.1%のラベル付きデータ(~8画像)による教師付き微調整は、全体的なゼロショット性能を超え、5-10%のデータは最大達成可能なmIoUの約85%を回復する。
完全な微調整は0.03-0.09 mIoUの低ランク適応を一貫して上回り、スペクトル不明瞭なクラスでは最大のギャップがあり、0.5から1%のラベル付きデータでは、細調整は回復前にこれらのクラスのパフォーマンスを一時的に低下させ、mIoUを集計する監督ディップはマスクできる。
特殊画像に視覚言語モデルを適用する実践者にとって、私たちの結果は明確なメッセージを提供する。
関連論文リスト
- Do Open-Vocabulary Detectors Transfer to Aerial Imagery? A Comparative Evaluation [0.0]
Open-vocabulary Object Detection (OVD)は、視覚言語モデルによる新しいカテゴリのゼロショット認識を可能にする。
LAE-80C航空データセットを用いて,5つの最先端OVDモデルを評価する。
論文 参考訳(メタデータ) (2026-01-13T13:20:21Z) - A Simple Framework for Open-Vocabulary Zero-Shot Segmentation [50.58626342189163]
SimZSSはオープン語彙のZero-Shotセグメンテーションのためのフレームワークである。
テキストと言語知識の離散的な性質を利用して、字幕内の局所的な概念をピンポイントする。
SimZSSは,8つのベンチマークデータセットのうち7つについて,15分以内で最先端の結果を達成している。
論文 参考訳(メタデータ) (2024-06-23T11:57:08Z) - ReCLIP: Refine Contrastive Language Image Pre-Training with Source Free
Domain Adaptation [20.57370550156505]
ReCLIPは、ヴィジュアル言語モデルのための、ソースフリーなドメイン適応手法である。
ReCLIPは、22の画像分類ベンチマークにおいて、CLIPの平均エラー率を30.17%から25.06%に下げることを示した。
論文 参考訳(メタデータ) (2023-08-04T18:11:40Z) - Detecting Cloud Presence in Satellite Images Using the RGB-based CLIP
Vision-Language Model [0.0]
この研究は、雲によって影響を受ける衛星画像を特定するために、事前訓練されたCLIPビジョン言語モデルの能力を探求する。
このモデルを用いて雲の存在検知を行うためのいくつかの手法を提案し,評価した。
以上の結果から,CLIPモデルで学習した表現は,雲を含む衛星画像処理作業に有用であることが示唆された。
論文 参考訳(メタデータ) (2023-08-01T13:36:46Z) - UniBoost: Unsupervised Unimodal Pre-training for Boosting Zero-shot
Vision-Language Tasks [60.46473247205654]
大規模で教師なしのユニモーダルモデルを事前学習として使用することにより、画像テキストペアモデルのゼロショット性能を向上させることができる。
実験の結果,単調な事前学習は最先端のCLIPモデルよりも優れていた。
論文 参考訳(メタデータ) (2023-06-07T18:26:22Z) - Masked Unsupervised Self-training for Zero-shot Image Classification [98.23094305347709]
Masked Unsupervised Self-Training (MUST)は、疑似ラベルと生画像という2つの異なる、補完的な監督源を活用する新しいアプローチである。
MUSTはCLIPを大きなマージンで改善し、教師なしと教師なしの分類のパフォーマンスギャップを狭める。
論文 参考訳(メタデータ) (2022-06-07T02:03:06Z) - A Simple Baseline for Zero-shot Semantic Segmentation with Pre-trained
Vision-language Model [61.58071099082296]
オブジェクト検出やセマンティックセグメンテーションといった、より広範な視覚問題に対して、ゼロショット認識をどのようにうまく機能させるかは定かではない。
本稿では,既訓練の視覚言語モデルであるCLIPを用いて,ゼロショットセマンティックセマンティックセマンティックセマンティクスを構築することを目的とした。
実験結果から, この単純なフレームワークは, 従来の最先端をはるかに上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2021-12-29T18:56:18Z) - Supervision Exists Everywhere: A Data Efficient Contrastive
Language-Image Pre-training Paradigm [109.0573737034428]
大規模コントラスト言語-画像事前訓練(CLIP)は、その印象的なゼロショット認識能力と下流タスクへの優れた転送性により、前例のない注目を集めている。
本研究は,この制限を緩和する新たなトレーニングパラダイムであるData efficient CLIP (DeCLIP)を提案する。
画像とテキストのペア間の広範な監視を慎重に活用することにより、De-CLIPは汎用的な視覚的特徴をより効率的に学習できることを実証する。
論文 参考訳(メタデータ) (2021-10-11T12:17:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。