論文の概要: A Geometric-Transformation Feature-Adaptive Manifold Restoration Method for Open-Vocabulary Semantic Segmentation of Remote Sensing Images
- arxiv url: http://arxiv.org/abs/2610.04300v1
- Date: Sat, 03 Oct 2026 05:26:17 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:52:58.739009
- Title: A Geometric-Transformation Feature-Adaptive Manifold Restoration Method for Open-Vocabulary Semantic Segmentation of Remote Sensing Images
- Title(参考訳): リモートセンシング画像の開語彙セマンティックセマンティックセグメンテーションのための幾何学変換特徴適応マニフォールド復元法
- Abstract要約: 二次元群幾何変換に基づく特徴適応型多様体修復法を提案する。
提案手法は,8つのリモートセマンティックセマンティックセグメンテーションベンチマークにおいて平均55.6%のmIoUを実現する。
- 参考スコア(独自算出の注目度): 18.544095377112196
- License:
- Abstract: The semantic information of objects in remote sensing images is typically invariant to geometric transformations from the dihedral group D4. However, SAM3-based open-vocabulary semantic segmentation (OVSS) methods often exhibit inconsistent responses to different geometric transformations. To exploit this property and improve the stability of OVSS for remote sensing images, we propose a feature-adaptive manifold repair method based on dihedral-group geometric transformations. First, we introduce multi-scale harmonic-guided D4 view selection (MH-D4VS) to select complementary candidate views from a set of geometrically transformed views. Next, we propose original-view-anchored adaptive manifold repair (OAMR), which uses the original view as an anchor and reliable cross-view information to selectively repair locally unreliable visual features. Finally, we develop pixel decoder test-time adaptation (PD-TTA) for SAM3, which fine-tunes only the parameters of the GroupNorm layers online during inference, thereby enhancing the model's ability to adapt to sample-level distribution shifts. Experimental results show that the proposed method achieves an average mIoU of 55.6% across eight remote sensing semantic segmentation benchmarks and delivers consistent performance improvements under different SAM3-based inference frameworks.
- Abstract(参考訳): リモートセンシング画像におけるオブジェクトの意味情報は、典型的には二面体群D4からの幾何学的変換に不変である。
しかし、SAM3ベースのオープンボキャブラリセマンティックセグメンテーション(OVSS)法は、しばしば異なる幾何学的変換に対する矛盾した応答を示す。
この特性を利用して、リモートセンシング画像のOVSSの安定性を向上させるために、二面体群幾何変換に基づく特徴適応型多様体修復法を提案する。
まず、幾何学的に変換された一連のビューから補完的な候補ビューを選択するために、マルチスケールの高調波誘導D4ビューセレクション(MH-D4VS)を導入する。
次に、元のビューをアンカーとして、信頼性の高いクロスビュー情報として使用して、局所的に信頼できない視覚的特徴を選択的に修復するOAMRを提案する。
最後に, SAM3 の画素デコーダテスト時間適応 (PD-TTA) を開発し, 推論中に GroupNorm 層のパラメータのみを微調整することにより, サンプルレベルの分布シフトに適応するモデルの能力を向上させる。
実験の結果,提案手法は8つのリモートセマンティックセマンティックセグメンテーションベンチマークで平均55.6%のmIoUを実現し,SAM3ベースの推論フレームワークで一貫した性能向上を実現している。
関連論文リスト
- From Alignment to Fusion in 3D Vision-Language [30.65499823418563]
統一された3次元視覚言語システムは、相補的な幾何学、スケール、外観を組み合わせなければならない。
既存の方法は、独立してポイントクラウド、ボクセルグリッド、マルチビューイメージを処理していることが多い。
本稿では,三重対コサインアライメントを適用し,セグメントレベルの対応性を確立するアライメント・テーマ・フューズ・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-23T14:52:14Z) - SegMASt3R: Geometry Grounded Segment Matching [23.257530861472656]
我々は3次元基礎モデルの空間的理解を活用して,広義のセグメントマッチングに取り組む。
本稿では,これら3次元基礎モデルの帰納バイアスを利用して,最大180度の視点変化回転で画像対間のセグメントをマッチングするアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-10-06T17:31:32Z) - EVT: Efficient View Transformation for Multi-Modal 3D Object Detection [2.9848894641223302]
効率的なビュー変換(EVT)は、よく構造化されたBEV表現を構成する新しい3Dオブジェクト検出フレームワークである。
nuScenesテストセットでは、EVTはリアルタイムの推論速度で75.3% NDSの最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-11-16T06:11:10Z) - PreCM: The Padding-based Rotation Equivariant Convolution Mode for Semantic Segmentation [10.748412559871621]
本稿では、指向情報をより完全に活用することを目的とした、普遍的な畳み込みグループフレームワークを提案する。
次に、数学的にパディングベースの回転同変畳み込みモード(PreCM)を設計する。
意味的セグメンテーションタスクにおける画像回転の影響を定量的に評価するために,新たな評価指標である回転差(RD)を提案する。
論文 参考訳(メタデータ) (2024-11-03T16:26:55Z) - Learning Modulated Transformation in GANs [69.95217723100413]
生成逆数ネットワーク(GAN)のジェネレータに、変調変換モジュール(Modulated transformation module, MTM)と呼ばれるプラグアンドプレイモジュールを装備する。
MTMは、可変位置で畳み込み操作を適用可能な潜在符号の制御下で空間オフセットを予測する。
挑戦的なTaiChiデータセット上での人為的な生成に向けて、StyleGAN3のFIDを21.36から13.60に改善し、変調幾何変換の学習の有効性を実証した。
論文 参考訳(メタデータ) (2023-08-29T17:51:22Z) - DCN-T: Dual Context Network with Transformer for Hyperspectral Image
Classification [109.09061514799413]
複雑な撮像条件による空間変動のため,HSI分類は困難である。
本稿では,HSIを高品質な三スペクトル画像に変換する三スペクトル画像生成パイプラインを提案する。
提案手法は,HSI分類における最先端手法よりも優れている。
論文 参考訳(メタデータ) (2023-04-19T18:32:52Z) - Geometric-aware Pretraining for Vision-centric 3D Object Detection [77.7979088689944]
GAPretrainと呼ばれる新しい幾何学的事前学習フレームワークを提案する。
GAPretrainは、複数の最先端検出器に柔軟に適用可能なプラグアンドプレイソリューションとして機能する。
BEVFormer法を用いて, nuScenes val の 46.2 mAP と 55.5 NDS を実現し, それぞれ 2.7 と 2.1 点を得た。
論文 参考訳(メタデータ) (2023-04-06T14:33:05Z) - Invariant Deep Compressible Covariance Pooling for Aerial Scene
Categorization [80.55951673479237]
本研究では,空気シーン分類におけるニュアンス変動を解決するために,新しい不変な深部圧縮性共分散プール (IDCCP) を提案する。
本研究では,公開空間画像データセットに関する広範な実験を行い,最先端の手法と比較して,この手法の優位性を実証する。
論文 参考訳(メタデータ) (2020-11-11T11:13:07Z) - Semantic Change Detection with Asymmetric Siamese Networks [71.28665116793138]
2つの空中画像が与えられた場合、セマンティックチェンジ検出は、土地被覆のバリエーションを特定し、それらの変化タイプをピクセルワイド境界で識別することを目的としている。
この問題は、正確な都市計画や天然資源管理など、多くの地球ビジョンに関連するタスクにおいて不可欠である。
本研究では, 広く異なる構造を持つモジュールから得られた特徴対を用いて意味変化を同定し, 同定するための非対称システマネットワーク(ASN)を提案する。
論文 参考訳(メタデータ) (2020-10-12T13:26:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。