論文の概要: U$^2$Mamba: A Two-level Nested U-structure Mamba for Salient Object Detection
- arxiv url: http://arxiv.org/abs/2606.20282v1
- Date: Thu, 18 Jun 2026 14:24:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.912047
- Title: U$^2$Mamba: A Two-level Nested U-structure Mamba for Salient Object Detection
- Title(参考訳): U$2$Mamba: 有能な物体検出のための2レベルネストU構造マンバ
- Authors: Junhui Li, Jialu Li, Youshan Zhang,
- Abstract要約: 本稿では,有意な物体検出のための強力で革新的なU構造ネットワークであるU$2$Mambaを紹介する。
局所特徴抽出能力を向上させるためにモデル深度を向上させるマルチスケールマンバUブロック(MMUB)を提案する。
MMUBを組み込んだ新たに開発されたネスト型U構造により,浅層および深層からの様々な受容場をネットワークに統合できる。
- 参考スコア(独自算出の注目度): 21.847146735231917
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mamba-based models have emerged as a promising alternative for salient object detection (SOD), offering significant advantages in modeling long sequences. However, existing models often fail to explore contextual information and the depth of the entire architecture. This paper introduces U$^2$Mamba, a powerful and innovative U-structured network for salient object detection. We propose multiscale Mamba U-blocks (MMUBs) that enhance the model depth to improve local feature extraction capabilities. Our newly developed nested U-structure, incorporating MMUBs, enables the network to integrate various receptive fields from shallow and deep layers, thereby collecting richer contextual information and longer-range data without being constrained by resolution. Instead of using the traditional deep supervision scheme and top-level supervised training, we propose a hierarchical training supervision method where the loss is computed at each level during the training process. Extensive experiments demonstrate that U$^2$Mamba achieves highly competitive performance against state-of-the-art methods. The source code is available at \url{https://github.com/JL021/U2Mamba}.
- Abstract(参考訳): マンバベースのモデルは、有望なサルエントオブジェクト検出(SOD)の代替として登場し、長いシーケンスをモデル化する上で大きな利点を提供している。
しかし、既存のモデルは、しばしばコンテキスト情報とアーキテクチャ全体の深さを探索するのに失敗する。
本稿では,有意な物体検出のための強力で革新的なU構造ネットワークであるU$^2$Mambaを紹介する。
局所特徴抽出能力を向上させるためにモデル深度を向上させるマルチスケールマンバUブロック(MMUB)を提案する。
MMUBを組み込んだ新たに開発されたネスト型U構造により,ネットワークは浅い層と深い層から様々な受容場を統合でき,よりリッチなコンテキスト情報とより長い範囲のデータを,解像度に制約されることなく収集することができる。
従来型の深層監視スキームやトップレベルの指導訓練の代わりに,訓練過程において各レベルにおける損失を算出した階層的な訓練監督手法を提案する。
U$^2$Mambaは最先端の手法に対して高い競争力を発揮することを示した。
ソースコードは \url{https://github.com/JL021/U2Mamba} で入手できる。
関連論文リスト
- Beyond Mamba: Enhancing State-space Models with Deformable Dilated Convolutions for Multi-scale Traffic Object Detection [6.929321171294922]
本研究では,変形可能なDilated Convolutions Network (MDDCNet) を用いたMambaを提案する。
MDDCNetでは、連続するMambaブロックを持つよく設計されたハイブリッドバックボーンは、局所的な詳細からグローバルな意味論への階層的な特徴表現を可能にする。
The Channel-Enhanced Feed-Forward Network (CE-FFN) is developed to overcome the limited channel interaction capabilities of conventional feed-forward network。
論文 参考訳(メタデータ) (2026-04-09T09:43:00Z) - CSFMamba: Cross State Fusion Mamba Operator for Multimodal Remote Sensing Image Classification [12.959829835589453]
我々はCross State Fusion Mamba (Camba) Networkを提案する。
具体的には、まず、マンバ構造のニーズに応じて、リモートセンシング画像情報の事前処理モジュールを設計する。
第二に、Mamba演算子に基づくクロスステートモジュールは、2つのモードの特徴を完全に融合するように創造的に設計されている。
論文 参考訳(メタデータ) (2025-08-31T03:08:34Z) - HSA-Net: Hierarchical and Structure-Aware Framework for Efficient and Scalable Molecular Language Modeling [7.26697833663902]
階層的特徴投影と融合を可能にする2つのモジュールを持つ新しいフレームワークである階層型・構造対応ネットワーク(HSA-Net)を提案する。
複数レベルの特徴を適応的にマージするために,アグリゲーションの特徴に基づいて,融合の専門家を柔軟に選択するSource-Aware Fusion (SAF) モジュールを設計する。
我々のHSA-Netフレームワークは、現在最先端(SOTA)手法よりも定量的に質的に優れていることを示した。
論文 参考訳(メタデータ) (2025-08-10T15:22:42Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba [66.80624029365448]
本稿では,Transformer事前学習知識の再利用を容易にするクロスアーキテクチャな知識伝達パラダイムであるTransMambaを提案する。
本稿では,マンバをベースとしたモデルのトレーニングを高速化する2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-21T01:22:01Z) - MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt [60.10555128510744]
ReID(Multi-modal object Re-IDentification)は、異なるモダリティから補完的な画像情報を活用することで、特定のオブジェクトを検索することを目的としている。
近年、CLIPのような大規模事前学習モデルでは、従来のシングルモーダルオブジェクトReIDタスクで顕著なパフォーマンスを示している。
マルチモーダルオブジェクトReIDのための新しいフレームワークであるMambaProを紹介する。
論文 参考訳(メタデータ) (2024-12-14T06:33:53Z) - MobileMamba: Lightweight Multi-Receptive Visual Mamba Network [51.33486891724516]
従来の軽量モデルの研究は、主にCNNとTransformerベースの設計に重点を置いてきた。
効率と性能のバランスをとるMobileMambaフレームワークを提案する。
MobileMambaはTop-1で83.6%を達成し、既存の最先端の手法を上回っている。
論文 参考訳(メタデータ) (2024-11-24T18:01:05Z) - Mamba YOLO: A Simple Baseline for Object Detection with State Space Model [10.44725284994877]
YOLOシリーズは、リアルタイムオブジェクト検出のための新しいベンチマークを設定した。
トランスフォーマーベースの構造が、最も強力なソリューションとして登場した。
しかし、自己注意機構の二次的な複雑さは計算負担を増加させる。
簡単なが効果的なベースラインアプローチであるYolo Mambaを紹介する。
論文 参考訳(メタデータ) (2024-06-09T15:56:19Z) - MambaDepth: Enhancing Long-range Dependency for Self-Supervised Fine-Structured Monocular Depth Estimation [0.0]
MambaDepthは自己監督深度推定に適した多目的ネットワークである。
MambaDepthは、自己教師付き深さ推定におけるU-Netの有効性と、Mambaの高度な能力を組み合わせる。
MambaDepthは、Make3DやCityscapesといった他のデータセットよりも優れた一般化能力を示している。
論文 参考訳(メタデータ) (2024-06-06T22:08:48Z) - Adaptive Context-Aware Multi-Modal Network for Depth Completion [107.15344488719322]
我々は,観測された空間コンテキストを捉えるために,グラフ伝搬を採用することを提案する。
次に、注意機構を伝搬に適用し、ネットワークが文脈情報を適応的にモデル化することを奨励する。
最後に、抽出したマルチモーダル特徴を効果的に活用するための対称ゲート融合戦略を導入する。
本稿では,Adaptive Context-Aware Multi-Modal Network (ACMNet) を2つのベンチマークで評価した。
論文 参考訳(メタデータ) (2020-08-25T06:00:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。