論文の概要: Generalizing Geometry-Guided Mamba as a Plug-and-Play Context Module for CNN-based Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2606.08866v1
- Date: Sun, 07 Jun 2026 22:43:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:06.494404
- Title: Generalizing Geometry-Guided Mamba as a Plug-and-Play Context Module for CNN-based Semantic Segmentation
- Title(参考訳): CNNに基づくセマンティックセグメンテーションのためのプラグ・アンド・プレイコンテキストモジュールとしての幾何学誘導マンバの一般化
- Authors: Sheng-Wei Chan, Hsin-Jui Pan, Chun-Po Shen, Chia-Min Lin, Yung-Che Wang, Jen-Shiun Chiang,
- Abstract要約: 本稿では,DGM-Net から Directional Geometric Mamba を再検討し,それをプラグイン・アンド・プレイ・コンテキストアグリゲーションモジュールとして検討する。
鍵となる考え方は、幾何学的ガイダンスを選択的スキャンプロセスに注入し、長距離特徴伝搬を境界と遠心流のキューによって変調できるようにすることである。
Cityscapesの結果、mIoUは1024時間1024ドルの解像度で、適度な追加のGFLOPしか得られていない。
- 参考スコア(独自算出の注目度): 0.30786914102688595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: CNN-based semantic segmentation networks usually rely on context heads such as ASPP, PPM, or attention modules to enlarge the receptive field. These heads are effective but may introduce heavy computation, memory cost, or boundary leakage. This paper revisits Directional Geometric Mamba (G-Mamba) from DGM-Net and studies it as a plug-and-play context aggregation module rather than a complete new segmentation architecture. The key idea is to inject geometric guidance into the selective scan process, allowing long-range feature propagation to be modulated by boundary and centripetal-flow cues. We replace the original context heads of six representative CNN segmentation models, including DeepLabV3+, DANet, CCNet, PSPNet, PSANet, and OCRNet, while keeping the ResNet-101 backbone unchanged. Results on Cityscapes show consistent mIoU gains with only moderate extra GFLOPs at $1024\times1024$ resolution, suggesting that geometry-guided SSM modules can serve as practical alternatives or enhancements to conventional CNN context heads.
- Abstract(参考訳): CNNベースのセマンティックセグメンテーションネットワークは通常、受容領域を拡大するためにASPP、PPM、アテンションモジュールなどのコンテキストヘッドに依存する。
これらのヘッドは有効であるが、計算量、メモリコスト、バウンダリリークをもたらす可能性がある。
本稿では、DGM-Net から Directional Geometric Mamba (G-Mamba) を再検討し、完全に新しいセグメンテーションアーキテクチャではなく、プラグイン・アンド・プレイのコンテキストアグリゲーションモジュールとして研究する。
鍵となる考え方は、幾何学的ガイダンスを選択的スキャンプロセスに注入し、長距離特徴伝搬を境界と遠心流のキューによって変調できるようにすることである。
我々は、DeepLabV3+、DANet、CCNet、PSPNet、PSANet、OCRNetを含む6つの代表的CNNセグメンテーションモデルの元のコンテキストヘッドを置き換える。
Cityscapesの結果は、1024\times1024$の解像度で、適度な追加のGFLOPしか持たないmIoUゲインを示し、幾何学誘導SSMモジュールが従来のCNNコンテキストヘッドの実用的な代替や拡張として機能することを示唆している。
関連論文リスト
- ATV-Net: Adaptive Triple-View Network with Dynamic Feature Fusion [0.0]
本稿では,ResNet-101のバックボーンを強化する適応型トリプルビューネットワークであるATV-Netを提案する。
Cityscapesの検証セットの実験では、ATV-Netは80.31% mIoUを達成した。
論文 参考訳(メタデータ) (2026-05-25T12:52:01Z) - RPCANet++: Deep Interpretable Robust PCA for Sparse Object Segmentation [51.37553739930992]
RPCANet++は、RPCAの解釈可能性と効率的なディープアーキテクチャを融合したスパースオブジェクトセグメンテーションフレームワークである。
我々のアプローチは、緩やかなRPCAモデルを背景近似モジュール(BAM)、対象抽出モジュール(OEM)、画像復元モジュール(IRM)からなる構造化ネットワークに展開する。
さまざまなデータセットの実験では、RPCANet++がさまざまなイメージングシナリオの下で最先端のパフォーマンスを達成することが示されている。
論文 参考訳(メタデータ) (2025-08-06T08:19:37Z) - HAFormer: Unleashing the Power of Hierarchy-Aware Features for Lightweight Semantic Segmentation [11.334990474402915]
本稿では,CNNの階層的特徴抽出能力とTransformerのグローバル依存性モデリング機能を組み合わせたモデルであるHAFormerを紹介する。
HAFormerは計算オーバーヘッドを最小限に抑え、コンパクトなモデルサイズで高性能を実現する。
論文 参考訳(メタデータ) (2024-07-10T07:53:24Z) - CAMS: Convolution and Attention-Free Mamba-based Cardiac Image Segmentation [0.508267104652645]
畳み込みニューラルネットワーク(CNN)とトランスフォーマーベースの自己アテンションモデルは、医療画像セグメンテーションの標準となっている。
本稿では,CAMS-Netという,コンボリューションと自己意図のないマンバに基づくセマンティックネットワークを提案する。
我々のモデルは,CMRおよびM&Ms-2カードセグメンテーションデータセットにおける既存の最先端CNN,自己注意,およびMambaベースの手法よりも優れている。
論文 参考訳(メタデータ) (2024-06-09T13:53:05Z) - PointeNet: A Lightweight Framework for Effective and Efficient Point
Cloud Analysis [28.54939134635978]
PointeNetは、ポイントクラウド分析に特化したネットワークである。
本手法は,分類/分割ヘッドとシームレスに統合したり,市販の3Dオブジェクト検出ネットワークに埋め込んだりすることで,柔軟性を示す。
ModelNet40、ScanObjectNN、ShapeNet KITTI、およびシーンレベルのデータセットKITTIを含むオブジェクトレベルのデータセットの実験は、ポイントクラウド分析における最先端メソッドよりもPointeNetの方が優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2023-12-20T03:34:48Z) - Adaptive Context Selection for Polyp Segmentation [99.9959901908053]
本稿では,ローカルコンテキストアテンション(LCA)モジュール,グローバルコンテキストモジュール(GCM)モジュール,適応選択モジュール(ASM)モジュールで構成される適応コンテキスト選択に基づくエンコーダデコーダフレームワークを提案する。
LCAモジュールは、エンコーダ層からデコーダ層へローカルなコンテキスト機能を提供する。
GCMは、グローバルなコンテキストの特徴をさらに探求し、デコーダ層に送信することを目的としている。ASMは、チャンネルワイドアテンションを通じて、コンテキスト特徴の適応的選択と集約に使用される。
論文 参考訳(メタデータ) (2023-01-12T04:06:44Z) - Lightweight and Progressively-Scalable Networks for Semantic
Segmentation [100.63114424262234]
マルチスケール学習フレームワークは,セマンティックセグメンテーションを向上する有効なモデルのクラスと見なされてきた。
本稿では,畳み込みブロックの設計と,複数スケールにわたる相互作用の仕方について,徹底的に解析する。
我々は,軽量で拡張性の高いネットワーク(LPS-Net)を考案した。
論文 参考訳(メタデータ) (2022-07-27T16:00:28Z) - SemAffiNet: Semantic-Affine Transformation for Point Cloud Segmentation [94.11915008006483]
ポイントクラウドセマンティックセグメンテーションのためのSemAffiNetを提案する。
我々はScanNetV2とNYUv2データセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2022-05-26T17:00:23Z) - MSCFNet: A Lightweight Network With Multi-Scale Context Fusion for
Real-Time Semantic Segmentation [27.232578592161673]
マルチスケールコンテキスト融合スキーム(MSCFNet)を用いた新しい軽量ネットワークを考案する。
提案されたMSCFNetは1.15Mパラメータのみを含み、71.9%のMean IoUを実現し、1つのTitan XP GPU構成で50 FPS以上で実行できる。
論文 参考訳(メタデータ) (2021-03-24T08:28:26Z) - Local Memory Attention for Fast Video Semantic Segmentation [157.7618884769969]
既存の単一フレームセマンティックセグメンテーションモデルをビデオセマンティックセグメンテーションパイプラインに変換する新しいニューラルネットワークモジュールを提案する。
我々のアプローチは過去のフレームにおける意味情報の豊富な表現をメモリモジュールに集約する。
都市景観におけるセグメンテーション性能は,それぞれ1.7%,2.1%改善し,erfnetの推論時間は1.5msに抑えられた。
論文 参考訳(メタデータ) (2021-01-05T18:57:09Z) - Gated Path Selection Network for Semantic Segmentation [72.44994579325822]
我々は,適応的な受容場を学習することを目的とした,GPSNetという新しいネットワークを開発した。
GPSNetにおいて、我々はまず2次元のマルチスケールネットワーク、SuperNetを設計する。
望ましいセマンティックコンテキストを動的に選択するために、ゲート予測モジュールがさらに導入される。
論文 参考訳(メタデータ) (2020-01-19T12:32:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。