論文の概要: Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models
- arxiv url: http://arxiv.org/abs/2606.25324v1
- Date: Wed, 24 Jun 2026 02:41:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.195276
- Title: Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models
- Title(参考訳): 線形時間空間蒸留ビジュアルファウンデーションモデルを用いた効率的なリモートセンシングインスタンス分割
- Authors: Qinzhe Yang, Keyan Chen, Jia Xu, Zhenwei Shi, Zhengxia Zou,
- Abstract要約: 線形計算複雑性を持つ新しいリモートセンシングインスタンスセグメンテーション手法であるRS4Dを紹介する。
本稿では,軽量SSMバックボーンの事前学習のための適応雑音とマスキング知識蒸留訓練法を提案する。
提案するSSMバックボーンは,VTベースのアプローチと比較して,パラメータの8倍,FLOPの9倍の削減を実現している。
- 参考スコア(独自算出の注目度): 32.823741317677744
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The computational complexity of Transformers scales quadratically with the number of tokens, which significantly constrains the efficiency of vision models, particularly recent ViT-based foundation models in dense prediction tasks. Instance segmentation, a typical dense visual prediction task in the remote sensing field, faces similar challenges. In this paper, inspired by the recent advances of knowledge distillation in large language models, we introduce RS4D - a new remote sensing instance segmentation method with linear computational complexity, which addresses the inefficiency of long sequence modeling through distilled state space modeling (SSM). We propose an adaptive noise and masking knowledge distillation training method for pre-training lightweight SSM backbones, which effectively compresses knowledge from the vast self-attention space into a compact, dense linear state space. We also design a remote sensing image instance segmentation architecture based on this lightweight visual encoder, where we explore variants of three different backbones and two segmentation heads. Extensive experiments are conducted on multiple benchmark datasets, including SSDD, WHU, and NWPU. Compared to ViT-based approaches, our proposed SSM backbone achieves an 8x reduction in parameters and a 9x reduction in FLOPs while maintaining comparable or superior accuracy to both ViT- and CNN-based instance segmentation methods. The implementation codes have been publicly available at https://github.com/QinzheYang/RS4D.
- Abstract(参考訳): トランスフォーマーの計算複雑性はトークンの数と2次的にスケールし、特に高密度予測タスクにおける最新のViTベースの基礎モデルにおいて、視覚モデルの効率を著しく制限する。
リモートセンシング分野における典型的な密集した視覚的予測タスクであるインスタンスセグメンテーションも同様の課題に直面している。
本稿では、大規模言語モデルにおける知識蒸留の最近の進歩に触発されて、線形計算複雑性を持つ新しいリモートセンシングインスタンスセグメンテーション手法RS4Dを紹介し、蒸留状態空間モデリング(SSM)による長いシーケンスモデリングの非効率性に対処する。
本研究では,軽量SSMバックボーンの適応雑音・マスキング知識蒸留訓練法を提案し,広大な自己保持空間からの知識をコンパクトで高密度な線形状態空間に効果的に圧縮する。
また、この軽量ビジュアルエンコーダに基づいて、リモートセンシング画像インスタンスセグメンテーションアーキテクチャを設計し、3つの異なるバックボーンと2つのセグメンテーションヘッドの変種を探索する。
SSDD、WHU、NWPUなど、複数のベンチマークデータセットで大規模な実験が行われている。
提案するSSMバックボーンは,VT法とCNN法に比較して,パラメータの8倍,FLOPの9倍の精度を実現した。
実装コードはhttps://github.com/QinzheYang/RS4Dで公開されている。
関連論文リスト
- GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence [50.10864740041483]
幾何学的視覚対応(GVC-Seg)による学習不要な3Dインスタンスセグメンテーション手法を提案する。
GVC-Segは3次元幾何学的手がかりと2次元視覚的手がかりの対応を利用して、信頼性バイアスを緩和する。
提案手法は,いくつかの挑戦的ベンチマークにおいて最先端の性能を実現するとともに,オープン語彙セマンティックセマンティックセマンティックスセグメンテーション設定に強い可能性を示す。
論文 参考訳(メタデータ) (2026-06-06T07:09:15Z) - Few-Shot Video Object Segmentation in X-Ray Angiography Using Local Matching and Spatio-Temporal Consistency Loss [13.850743997507488]
探索空間を最も近いピクセルに制限する局所マッチング戦略を用いた新しいFSVOSモデルを提案する。
具体的には、動的に異なるサンプリング領域を実現できる非パラメトリックサンプリング機構を実装した。
この研究は、幅広い臨床応用のための強化されたポテンシャルを提供する。
論文 参考訳(メタデータ) (2026-01-02T21:26:28Z) - RangeSAM: Leveraging Visual Foundation Models for Range-View repesented LiDAR segmentation [6.513648249086729]
本稿では,SAM2を3次元セグメンテーションに適応させる最初のレンジビューフレームワークを提案する。
提案手法は,2D中心パイプラインの速度,スケーラビリティ,デプロイメントの単純さを生かしながら,セマンティックKITTI上での競合性能を実現する。
論文 参考訳(メタデータ) (2025-09-19T11:33:10Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - Geometric Operator Learning with Optimal Transport [77.16909146519227]
複素測地上での偏微分方程式(PDE)に対する演算子学習に最適輸送(OT)を統合することを提案する。
表面に焦点を当てた3次元シミュレーションでは、OTベースのニューラルオペレーターが表面形状を2次元パラメータ化潜在空間に埋め込む。
ShapeNet-Car と DrivAerNet-Car を用いたレイノルズ平均化 Navier-Stokes 方程式 (RANS) を用いた実験により,提案手法は精度の向上と計算コストの削減を図った。
論文 参考訳(メタデータ) (2025-07-26T21:28:25Z) - Hi^2-GSLoc: Dual-Hierarchical Gaussian-Specific Visual Relocalization for Remote Sensing [6.997091164331322]
リモートセンシングやUAVアプリケーションには、視覚的再ローカライゼーションが不可欠である。
画像に基づく検索とポーズ回帰アプローチは精度に欠ける。
スパース・トゥ・デンス(sparse-to-dense)と粗粒度(arse-to-fine)のパラダイムに従う二重階層的再ローカライゼーションフレームワークである$mathrmHi2$-GSLocを紹介した。
論文 参考訳(メタデータ) (2025-07-21T14:47:56Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Learning Semantic Segmentation of Large-Scale Point Clouds with Random
Sampling [52.464516118826765]
我々はRandLA-Netを紹介した。RandLA-Netは、大規模ポイントクラウドのポイントごとの意味を推論する、効率的で軽量なニューラルネットワークアーキテクチャである。
我々のアプローチの鍵は、より複雑な点選択アプローチではなく、ランダムな点サンプリングを使用することである。
我々のRandLA-Netは、既存のアプローチよりも最大200倍高速な1回のパスで100万ポイントを処理できます。
論文 参考訳(メタデータ) (2021-07-06T05:08:34Z) - Unsupervised Learning Consensus Model for Dynamic Texture Videos
Segmentation [12.462608802359936]
動的テクスチャのセグメンテーションのための効果的な教師なし学習コンセンサスモデルを提案する。
提案モデルでは,分類対象画素の周辺部における再量子化局所2値パターン(LBP)ヒストグラムの値の集合を特徴として用いた。
挑戦的なSynthDBデータセットで実施された実験は、ULCMが大幅に高速で、コーディングが簡単で、単純で、パラメータが限られていることを示している。
論文 参考訳(メタデータ) (2020-06-29T16:40:59Z) - Spatial Pyramid Based Graph Reasoning for Semantic Segmentation [67.47159595239798]
セマンティックセグメンテーションタスクにグラフ畳み込みを適用し、改良されたラプラシアンを提案する。
グラフ推論は、空間ピラミッドとして構成された元の特徴空間で直接実行される。
計算とメモリのオーバーヘッドの利点で同等のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2020-03-23T12:28:07Z) - On the Texture Bias for Few-Shot CNN Segmentation [21.349705243254423]
畳み込みニューラルネットワーク(CNN)は、視覚認識タスクを実行するために形状によって駆動される。
最近の証拠は、CNNのテクスチャバイアスが、大きなラベル付きトレーニングデータセットで学習するときに、より高いパフォーマンスのモデルを提供することを示している。
本稿では,特徴空間内の高周波局所成分を減衰させるために,ガウス差分(DoG)の集合を統合する新しいアーキテクチャを提案する。
論文 参考訳(メタデータ) (2020-03-09T11:55:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。