論文の概要: Axial-Relation Guided Fusion State Space Model for Optical-Elevation Sensing Image Segmentation
- arxiv url: http://arxiv.org/abs/2605.16768v1
- Date: Sat, 16 May 2026 02:42:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.012496
- Title: Axial-Relation Guided Fusion State Space Model for Optical-Elevation Sensing Image Segmentation
- Title(参考訳): 光高感度画像分割のための軸関係誘導核融合状態モデル
- Authors: Feng Gao, Zhilin Jin, Yanhai Gan, Junyu Dong, Qian Du,
- Abstract要約: Axial-Relation Guided Fusion Mambaは、リモートセンシング画像セグメンテーションのための状態空間モデルに基づくフレームワークである。
Axial-Relation Guided Fusion Moduleは、水平軸と垂直軸に沿ったグローバルな相互関係を明示的にモデル化するように設計されている。
我々のARG-Mambaは、良好な計算効率を維持しながら、常に最先端の手法より優れています。
- 参考スコア(独自算出の注目度): 44.46453475313092
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic segmentation of multi-source remote sensing images is a fundamental task for Earth observation applications. Existing methods often struggle with insufficient multi-scale context modeling and suboptimal cross-modal feature fusion, limiting their performance in complex high-resolution scenes. To this end, we propose Axial-Relation Guided Fusion Mamba (ARG-Mamba), a state space model-based framework for optical-elevation remote sensing image segmentation. Specifically, we introduce a Multi-Scale State Space Module to capture both fine-grained local details and global contextual dependencies with linear computational complexity. Moreover, an Axial-Relation Guided Fusion Module is designed to explicitly model global cross-modal correlations along horizontal and vertical axes, enabling efficient feature fusion between optical and elevation modalities. Extensive experiments conducted on the ISPRS Vaihingen and Potsdam datasets demonstrate that our ARG-Mamba consistently outperforms state-of-the-art methods while maintaining favorable computational efficiency. The code will be made publicly available at \url{https://github.com/oucailab/ARG-Mamba}.
- Abstract(参考訳): マルチソースリモートセンシング画像のセマンティックセグメンテーションは、地球観測の基本的な課題である。
既存の手法は、複雑な高解像度シーンにおける性能を制限し、マルチスケールのコンテキストモデリングと最適でない機能融合に苦慮することが多い。
そこで本稿では,光学的高次リモートセンシング画像セグメンテーションのための状態空間モデルに基づくフレームワークであるAxial-Relation Guided Fusion Mamba (ARG-Mamba)を提案する。
具体的には,局所的な微細な細部と,線形計算複雑性を伴う大域的コンテキスト依存性の両方をキャプチャするマルチスケール状態空間モジュールを提案する。
さらに,Axial-Relation Guided Fusion Moduleは,水平軸と垂直軸に沿った大域的クロスモーダル相関を明示的にモデル化し,光学的モードと高次モードの効率的な特徴融合を可能にするように設計されている。
ISPRS Vaihingen と Potsdam のデータセットで実施された大規模な実験により、我々のARG-Mamba は、計算効率を良好に保ちながら、最先端の手法を一貫して上回っていることが示された。
コードは \url{https://github.com/oucailab/ARG-Mamba} で公開されている。
関連論文リスト
- Interactive State Space Model with Cross-Modal Local Scanning for Depth Super-Resolution [26.94624454006905]
誘導深度超解像(GDSR)は、HR RGBガイダンスを用いてLR入力からHR深度マップを再構成する。
既存の手法は各モードを独立にモデル化するか、2次複雑さを持つ計算コストの高い注意機構に依存している。
本稿では,対話型状態空間モデルを中心とした新しいGDSRフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T10:45:36Z) - DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion [51.07069814578009]
マルチモーダル画像融合は、複数のソース画像から補完的な情報を統合して、リッチなコンテンツで高品質な融合画像を生成することを目的としている。
マルチモーダル画像融合のための差動駆動型チャネル空間空間モデルDIFF-MFを提案する。
本手法は,視覚的品質と定量的評価の両方において,既存の手法よりも優れている。
論文 参考訳(メタデータ) (2026-01-09T05:26:54Z) - CSFMamba: Cross State Fusion Mamba Operator for Multimodal Remote Sensing Image Classification [12.959829835589453]
我々はCross State Fusion Mamba (Camba) Networkを提案する。
具体的には、まず、マンバ構造のニーズに応じて、リモートセンシング画像情報の事前処理モジュールを設計する。
第二に、Mamba演算子に基づくクロスステートモジュールは、2つのモードの特徴を完全に融合するように創造的に設計されている。
論文 参考訳(メタデータ) (2025-08-31T03:08:34Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - HSRMamba: Contextual Spatial-Spectral State Space Model for Single Image Hyperspectral Super-Resolution [41.93421212397078]
Mambaは、その強力なグローバルモデリング能力と線形計算複雑性のために、視覚タスクにおいて例外的な性能を示した。
HSRMambaはハイパースペクトル画像超解像(HSISR)のための文脈空間スペクトルモデリング状態空間モデルである
論文 参考訳(メタデータ) (2025-01-30T17:10:53Z) - Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation [63.15257949821558]
Referring Remote Sensing Image (RRSIS)は、コンピュータビジョンと自然言語処理を組み合わせた新しい課題である。
従来の参照画像(RIS)アプローチは、空中画像に見られる複雑な空間スケールと向きによって妨げられている。
本稿ではRMSIN(Rotated Multi-Scale Interaction Network)を紹介する。
論文 参考訳(メタデータ) (2023-12-19T08:14:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。