論文の概要: LiAuto-MindViT: A Hybrid Vision Backbone with Adaptive Bidirectional Mamba
- arxiv url: http://arxiv.org/abs/2609.24337v2
- Date: Tue, 22 Sep 2026 06:49:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.978541
- Title: LiAuto-MindViT: A Hybrid Vision Backbone with Adaptive Bidirectional Mamba
- Title(参考訳): LiAuto-MindViT: 適応型双方向マンバを備えたハイブリッドビジョンバックボーン
- Abstract要約: LiAuto-MindViTは、CNN、Mamba、Transformersの強みをシナジするハイブリッドビジョンバックボーンである。
我々の設計の中核は、一方向SSMの方向性バイアスを取り除くアダプティブ双方向マンバ(ABM)である。
- 参考スコア(独自算出の注目度): 47.72780696711231
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Mamba-based models have shown strong potential for long sequence modeling, adapting them to vision is challenging due to the requirement of local neighborhood correlations and multi-directional spatial contexts for visual understanding. In this paper, we present LiAuto-MindViT, a novel hybrid vision backbone that synergizes the strengths of CNNs, Mamba, and Transformers. The core of our design is the Adaptive Bidirectional Mamba (ABM), which eliminates the directional bias of unidirectional SSMs through bidirectional selective scanning with learnable alpha blending, enabling content-adaptive directional fusion without the overhead of exhaustive multi-path routing. To further accelerate inference, we propose a deployment-friendly Reparameterized ConvSE (RepConvSE) module that leverages structural reparameterization to reduce latency and memory access overhead. Extensive experiments demonstrate that LiAuto-MindViT achieves state-of-the-art performance on image classification, object detection, and semantic segmentation while enabling efficient inference through reparameterization.
- Abstract(参考訳): マンバをベースとしたモデルは、長周期モデリングの強い可能性を示しているが、局所的な近傍相関や視覚理解のための多方向空間コンテキストを必要とするため、それらを視覚に適応させることは困難である。
本稿では,CNN,マンバ,トランスフォーマーの強度を相乗化するハイブリッドビジョンバックボーンLiAuto-MindViTを提案する。
我々の設計の核となるのはAdaptive Bidirectional Mamba (ABM) であり、これは学習可能なアルファブレンディングによる双方向選択的走査によって一方向SSMの指向性バイアスを排除し、徹底的なマルチパスルーティングのオーバーヘッドを伴わずにコンテンツ適応型指向性融合を可能にする。
さらに推論を高速化するために、構造的再パラメータ化を利用してレイテンシとメモリアクセスオーバーヘッドを低減する、デプロイメントフレンドリーなReparameterized ConvSE(RepConvSE)モジュールを提案する。
大規模な実験により、LiAuto-MindViTは画像分類、オブジェクト検出、セマンティックセグメンテーションにおける最先端のパフォーマンスを実現し、再パラメータ化による効率的な推論を可能にした。
関連論文リスト
- 0.5\%>100\%: Bidirectional Reciprocal Learning for Referring Image Segmentation [60.19375952029603]
Bidirectional Reciprocal Learning (BRL) は、階層的な双方向情報の流れを促進するアダプタベースのPEFTフレームワークである。
BRLは最先端のパフォーマンスを実現し、バックボーンパラメータの更新は0.5%未満である。
論文 参考訳(メタデータ) (2026-09-21T12:48:34Z) - DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving [47.573692944838115]
DriveMambaは、効率的なE2E-ADのためのタスク中心のスケーラブルパラダイムである。
シーケンシャルなタスク関係モデリング、暗黙の対応学習、長期の時間的融合を単一ステージのUnified Mambaデコーダに統合する。
nuScenesとBench2Driveデータセットで実施された大規模な実験は、DriveMambaの優位性、一般化性、および大幅な効率性を実証している。
論文 参考訳(メタデータ) (2026-02-09T11:48:29Z) - From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion [91.35078719566472]
VLM(Vision-Language Models)は、粗い非対称接続を使用することで、深刻な視覚的特徴のボトルネックを生み出す。
CLI(Cross-Layer Injection)は,2つのモダリティの間に動的に多対多の橋を架ける,斬新で軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-01-15T18:59:10Z) - Exploring Non-Local Spatial-Angular Correlations with a Hybrid Mamba-Transformer Framework for Light Field Super-Resolution [68.54692184478462]
マンバ法は光画像超解像の計算コストと性能を最適化する大きな可能性を示している。
本稿では,より効率的かつ正確な特徴抽出を実現するために,Subspace Simple Mamba Block (SSMB) を設計したSubspace Simple Scanning (Sub-SS) 戦略を提案する。
また,空間角・異質情報の保存における状態空間の制限に対処する二段階モデリング手法を提案する。
論文 参考訳(メタデータ) (2025-09-05T05:50:38Z) - MVNet: Hyperspectral Remote Sensing Image Classification Based on Hybrid Mamba-Transformer Vision Backbone Architecture [12.168520751389622]
ハイパースペクトル画像(HSI)分類は、高次元データ、限られたトレーニングサンプル、スペクトル冗長性といった課題に直面している。
本稿では,3D-CNNの局所特徴抽出,Transformerのグローバルモデリング,Mambaの線形シーケンスモデリング機能を統合した新しいMVNetネットワークアーキテクチャを提案する。
IN、UP、KSCデータセットでは、MVNetは分類精度と計算効率の両方で主流のハイパースペクトル画像分類法より優れている。
論文 参考訳(メタデータ) (2025-07-06T14:52:26Z) - Cross Paradigm Representation and Alignment Transformer for Image Deraining [40.66823807648992]
クロスパラダイム表現・アライメント変換器(CPRAformer)を提案する。
その中心となる考え方は階層的な表現とアライメントであり、両方のパラダイムの強みを活用して画像再構成を支援する。
トランスフォーマーブロックでは,スパースプロンプトチャネル自己アテンション(SPC-SA)と空間画素改善自己アテンション(SPR-SA)の2種類の自己アテンションを使用する。
論文 参考訳(メタデータ) (2025-04-23T06:44:46Z) - Detail Matters: Mamba-Inspired Joint Unfolding Network for Snapshot Spectral Compressive Imaging [40.80197280147993]
本研究では,HSI再建の非線形および不適切な特徴を克服するために,マンバインスパイアされたジョイント・アンフォールディング・ネットワーク(MiJUN)を提案する。
本稿では,初期最適化段階への依存を減らすために,高速化された展開ネットワーク方式を提案する。
テンソルモード-$k$展開をMambaネットワークに統合することにより,Mambaによる走査戦略を洗練する。
論文 参考訳(メタデータ) (2025-01-02T13:56:23Z) - Unifying Dimensions: A Linear Adaptive Approach to Lightweight Image Super-Resolution [6.857919231112562]
ウィンドウベーストランスは超高解像度タスクにおいて優れた性能を示した。
畳み込みニューラルネットワークよりも計算複雑性と推論レイテンシが高い。
線形適応ミキサーネットワーク(LAMNet)という,畳み込みに基づくトランスフォーマーフレームワークを構築する。
論文 参考訳(メタデータ) (2024-09-26T07:24:09Z) - Pruning Self-attentions into Convolutional Layers in Single Path [89.55361659622305]
ビジョントランスフォーマー(ViT)は、様々なコンピュータビジョンタスクに対して印象的なパフォーマンスを実現している。
トレーニング済みのViTを効率よく自動圧縮するSPViT(Single-Path Vision Transformer pruning)を提案する。
われわれのSPViTはDeiT-Bで52.0%のFLOPをトリミングできる。
論文 参考訳(メタデータ) (2021-11-23T11:35:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。