論文の概要: SG-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement
- arxiv url: http://arxiv.org/abs/2609.18009v2
- Date: Fri, 18 Sep 2026 09:06:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.696112
- Title: SG-Mamba: Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement
- Title(参考訳): SG-Mamba:Sparse Graph-Guided Mamba for Audio-Visual Speech Enhancement
- Abstract要約: 軽量音声視覚音声強調(AVSE)モデルは、計算効率とモード間のアライメント精度の間に重要なトレードオフに直面している。
Sparse Graph-Guided Mambaは、疎不均一グラフと線形複雑度Mambaバックボーンを統合する軽量なAVSEフレームワークである。
SG-Mambaは、強力な軽量ベースラインに対して競争力または優れた性能を達成し、ノイズのみの条件下では13.091dBのSI-SDRに達する。
- 参考スコア(独自算出の注目度): 23.64245781018391
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lightweight audio-visual speech enhancement (AVSE) models face a critical trade-off between computational efficiency and cross-modal alignment accuracy. While simple concatenation lacks relational expressiveness, dense cross-attention incurs computational overhead and is prone to unreliable cross-modal correspondence under strong acoustic interference. We propose Sparse Graph-Guided Mamba (SG-Mamba), a lightweight AVSE framework that integrates a sparse heterogeneous graph with a linear-complexity Mamba backbone. The graph explicitly models modality-specific relations through content-adaptive attention and cross-frame audio-visual connections, while Mamba captures long-range temporal context. We further introduce an audio skip connection to preserve spectral detail without sacrificing noise suppression. Evaluated on LRS3, SG-Mamba achieves competitive or superior performance against strong lightweight baselines and reaches 13.091 dB SI-SDR under noise-only condition. It also remains robust in cluttered multi-speaker conditions with a competitive cost of 3.45 G MACs (or 6.90 G FLOPs). Results on VoxCeleb2 further suggest that explicit structural priors improve robustness, generalizability, and computational efficiency in lightweight AVSE.
- Abstract(参考訳): 軽量音声視覚音声強調(AVSE)モデルは、計算効率とモード間のアライメント精度の間に重要なトレードオフに直面している。
単純な結合は関係表現性に欠けるが、密接な相互注意は計算上のオーバーヘッドを生じさせ、強い音響干渉下では信頼できない相互モーダル対応を引き起こす。
Sparse Graph-Guided Mamba (SG-Mamba) は、疎不均一グラフと線形複雑マンバのバックボーンを統合する軽量なAVSEフレームワークである。
このグラフは、コンテンツ適応型注意とクロスフレームオーディオ・ビジュアル接続を通じて、モダリティ固有の関係を明示的にモデル化し、Mambaは長距離の時間的コンテキストをキャプチャする。
さらに、ノイズ抑制を犠牲にすることなくスペクトルの詳細を保存するために、オーディオスキップ接続を導入する。
LRS3に基づいて評価すると、SG-Mambaは強力な軽量ベースラインに対して競争力または優れた性能を達成し、ノイズのみの条件下では13.091dBのSI-SDRに達する。
また、競争コストは3.45 G MACs(または6.90 G FLOPs)である。
VoxCeleb2の結果は、軽量AVSEにおいて、明示的な構造的先行が堅牢性、一般化可能性、計算効率を向上させることを示唆している。
関連論文リスト
- Asymmetric Cross-Modal Fine-Grained Visual Categorization: ACF-Net and the BirdPro Benchmark [30.481875920258165]
ACF-Netは、非対称な視覚的微粒な学習のための新しい光フロー誘導フレームワークである。
ACAFは、弱いマッチングのオーディオビデオ対の下でのモダリティの信頼性を推定し、カテゴリレベルの認識を改善するために不確実性を考慮した適応融合を行う。
BirdProは、非対称なクロスモーダルFGVCの研究をサポートする新しい鳥指向オーディオ視覚ベンチマークである。
論文 参考訳(メタデータ) (2026-08-26T08:30:01Z) - Representation-Regularized Convolutional Audio Transformer for Audio Understanding [53.092757178419355]
スクラッチからのブートストラップ表現は計算に高価で、しばしば収束するために広範囲のトレーニングを必要とします。
本稿では,これらの課題に対処するための統合フレームワークであるConvolutional Audio Transformer (CAT)を提案する。
論文 参考訳(メタデータ) (2026-01-29T12:16:19Z) - BSMamba: Brightness and Semantic Modeling for Long-Range Interaction in Low-Light Image Enhancement [3.3392058493559693]
現在の低照度画像強調法(LLIE)は、セマンティック一貫性、細部、計算効率を保ちながら、輝度を同時に改善する上で重要な制限に直面している。
BSMamba は,Brightness Mamba と Semantic Mamba の2つの特別に設計されたコンポーネントからなる新しい視覚的マンバアーキテクチャである。
BSMambaは、セマンティック一貫性を維持しながらLLIEで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-23T07:04:34Z) - Mixture-of-Mamba: Enhancing Multi-Modal State-Space Models with Modality-Aware Sparsity [56.0251572416922]
状態空間モデル(SSM)は、シーケンシャルモデリングのためのトランスフォーマーの効率的な代替手段として登場した。
本稿では,Mambaブロックのモダリティ特異的パラメータ化により,モダリティを意識した疎結合を実現する新しいSSMアーキテクチャを提案する。
マルチモーダル事前学習環境におけるMixture-of-Mambaの評価を行った。
論文 参考訳(メタデータ) (2025-01-27T18:35:05Z) - AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation [62.682428307810525]
音声・視覚的セグメンテーションタスクに対処する選択状態空間モデルであるAVS-Mambaを導入する。
我々のフレームワークはビデオ理解とクロスモーダル学習の2つの重要な要素を取り入れている。
提案手法は, AVSBench-object と AVS-semantic のデータセット上で, 最新の結果を実現する。
論文 参考訳(メタデータ) (2025-01-14T03:20:20Z) - Mamba-SEUNet: Mamba UNet for Monaural Speech Enhancement [54.427965535613886]
Mambaは、新しいステートスペースモデル(SSM)として、自然言語処理やコンピュータビジョンに広く応用されている。
本稿では,MambaとU-Net for SEタスクを統合する革新的なアーキテクチャであるMamba-SEUNetを紹介する。
論文 参考訳(メタデータ) (2024-12-21T13:43:51Z) - TinyViM: Frequency Decoupling for Tiny Hybrid Vision Mamba [11.176993272867396]
Mambaはその線形複雑性のためにコンピュータビジョンに大きな可能性を示している。
既存の軽量なMambaベースのバックボーンは、ConvolutionやTransformerベースのメソッドにマッチするパフォーマンスを示すことはできない。
モバイルフレンドリーなコンボリューションと効率的なLaplaceミキサーを組み合わせることで、TinyViMと呼ばれる小さなハイブリッドビジョンを構築できる。
論文 参考訳(メタデータ) (2024-11-26T14:34:36Z) - An Investigation of Incorporating Mamba for Speech Enhancement [64.59903328820624]
本研究の目的は、最近提案された、注意のないスケーラブルな状態空間モデル(SSM)であるMambaを用いて、音声強調(SE)タスクを実現することである。
私たちはMambaを使って,基本,先進,因果,非因果といった,さまざまな構成のレグレッションベースのSEモデル(SEMamba)をデプロイしています。
SEMambaはVoiceBank-DEMANDデータセットで3.55のPESQを獲得し、高度な非因果構成を持つ。
論文 参考訳(メタデータ) (2024-05-10T16:18:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。