論文の概要: A Hybrid Mamba for Audio-Visual Navigation
- arxiv url: http://arxiv.org/abs/2607.13110v1
- Date: Tue, 14 Jul 2026 11:55:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.53574
- Title: A Hybrid Mamba for Audio-Visual Navigation
- Title(参考訳): オーディオ・ビジュアルナビゲーションのためのハイブリッドマンバ
- Abstract要約: 本稿では,Samba(オーディオ・ビジュアル・ナビゲーション用ハイブリッド・マンバ)を提案する。
適応的な選択可能なマンバ状態(M-SE)を使用して、時間的アグリゲーションのために従来のGRUを置き換える。
実験により、サンバは音の聞こえない音源や見えない場面に対向する際、例外的な一般化性能を示すことが示された。
- 参考スコア(独自算出の注目度): 4.982871532367105
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Since the paradigm centered on convolutional neural networks and recurrent architectures was established in 2020, the fundamental backbone networks for audio-visual navigation have undergone no essential changes for more than five years, making them inadequate to support efficient representation of dynamic multimodal sequences. This paper proposes Samba(A Hybrid Mamba for Audio-Visual Navigation). It uses the adaptive selection-enabled Mamba State Encoder (M-SE) to replace conventional GRUs for temporal aggregation, and constructs an Audio Mamba Encoder (AME) to remedy the limitations of convolutional operators in capturing global time-frequency dependencies in spectrograms. Experiments demonstrate that Samba exhibits exceptional generalization performance when facing unheard sound sources and unseen scenes. On the Matterport3D dataset, it improves the navigation success rate (SR) by 11.3\% compared with existing state-of-the-art models, and the performance gain is even more pronounced on the Replica dataset, which features finer scene structures. Such modernized architectural reconstruction unlocks stronger embodied representation capabilities at a lower computational cost, thereby providing a highly robust technical pathway for paradigm evolution in the field of audio-visual navigation.
- Abstract(参考訳): 畳み込みニューラルネットワークと繰り返しアーキテクチャを中心としたパラダイムが2020年に確立されて以来、オーディオ視覚ナビゲーションの基本的なバックボーンネットワークは5年以上も重要な変更を経ていないため、動的マルチモーダルシーケンスの効率的な表現を支援するには不十分である。
本稿では,Samba (A Hybrid Mamba for Audio-Visual Navigation)を提案する。
適応的な選択可能なMamba State Encoder (M-SE) を使用して、時間的アグリゲーションのために従来のGRUを置き換えるとともに、Audio Mamba Encoder (AME) を構築して、スペクトログラムにおけるグローバルな時間周波数依存性のキャプチャにおける畳み込み演算子の制限を修復する。
実験により、サンバは音の聞こえない音源や見えないシーンに直面するとき、例外的な一般化性能を示すことが示された。
Matterport3Dデータセットでは、既存の最先端モデルと比較して、ナビゲーション成功率(SR)を11.3倍改善し、より微細なシーン構造を備えたReplicaデータセットでは、パフォーマンス向上がさらに顕著になる。
このような近代化されたアーキテクチャ再構築は、より強力なエンボディド表現能力を低い計算コストで解放し、オーディオ視覚ナビゲーションの分野でのパラダイム進化のための非常に堅牢な技術パスを提供する。
関連論文リスト
- TSkel-Mamba: Temporal Dynamic Modeling via State Space Model for Human Skeleton-based Action Recognition [59.99922360648663]
TSkel-Mambaは、空間力学と時間力学の両方を効果的に捉えるハイブリッドトランスフォーマー-Mambaフレームワークである。
MTIモジュールはマルチスケールのCycle演算子を使用して、チャネル間の時間的相互作用をキャプチャする。
論文 参考訳(メタデータ) (2025-12-12T11:55:16Z) - Traffic Image Restoration under Adverse Weather via Frequency-Aware Mamba [37.901352525347214]
本稿では,周波数対応マンバ(FAMamba)を提案する。このフレームワークは,周波数誘導とシーケンスモデリングを統合し,効率的な画像復元を実現する。
本アーキテクチャは,(1)双方向2次元周波数適応走査による局所的相互作用を強化するDual-Branch Feature extract Block (DFEB) と,(2)ウェーブレットに基づく高周波数残差学習によりテクスチャの詳細を洗練するPreside-Guided Block (PGB) の2つのキーコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-12-03T14:50:20Z) - Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation [3.3359927518257866]
効率的な音声視覚ナビゲーションのための動的マルチターゲットフュージョン(DMTF-AVN)を提案する。
提案手法では,マルチターゲットアーキテクチャと改良されたTransformer機構を組み合わせることで,クロスモーダル情報をフィルタし,選択的にフューズする。
ReplicaとMatterport3Dデータセットの実験により、DMTF-AVNは、成功率(SR)、パス効率(SPL)、シーン適応(SNA)において、既存の手法よりも優れた、最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2025-09-23T09:31:00Z) - MambaOutRS: A Hybrid CNN-Fourier Architecture for Remote Sensing Image Classification [4.14360329494344]
リモートセンシング画像分類のための新しいハイブリッド畳み込みアーキテクチャであるMambaOutRSを紹介する。
MambaOutRSは、局所的な特徴抽出のためにスタック化されたGated CNNブロック上に構築され、新しいFourier Filter Gate (FFG)モジュールが導入されている。
論文 参考訳(メタデータ) (2025-06-24T12:20:11Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - EventMamba: Enhancing Spatio-Temporal Locality with State Space Models for Event-Based Video Reconstruction [66.84997711357101]
EventMambaは、イベントベースのビデオ再構成タスク用に設計された、特殊なモデルである。
EventMambaは、Transformerベースの方法と比較して、優れた視覚的品質を提供しながら、スピードを著しく向上させる。
論文 参考訳(メタデータ) (2025-03-25T14:46:45Z) - TransMamba: Fast Universal Architecture Adaption from Transformers to Mamba [66.80624029365448]
本稿では,Transformer事前学習知識の再利用を容易にするクロスアーキテクチャな知識伝達パラダイムであるTransMambaを提案する。
本稿では,マンバをベースとしたモデルのトレーニングを高速化する2段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-21T01:22:01Z) - Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement [54.427965535613886]
Mambaは、新しいステートスペースモデル(SSM)として、自然言語処理やコンピュータビジョンに広く応用されている。
本稿では,MambaとU-Net for SEタスクを統合する革新的なアーキテクチャであるMamba-SEUNetを紹介する。
論文 参考訳(メタデータ) (2024-12-21T13:43:51Z) - MobileMamba: Lightweight Multi-Receptive Visual Mamba Network [51.33486891724516]
従来の軽量モデルの研究は、主にCNNとTransformerベースの設計に重点を置いてきた。
効率と性能のバランスをとるMobileMambaフレームワークを提案する。
MobileMambaはTop-1で83.6%を達成し、既存の最先端の手法を上回っている。
論文 参考訳(メタデータ) (2024-11-24T18:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。