論文の概要: NeuralMUSIC: A Hybrid Neural-Subspace Framework for Robot Sound Source Localization
- arxiv url: http://arxiv.org/abs/2606.18664v1
- Date: Wed, 17 Jun 2026 04:03:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-18 17:16:50.99635
- Title: NeuralMUSIC: A Hybrid Neural-Subspace Framework for Robot Sound Source Localization
- Title(参考訳): NeuralMUSIC: ロボット音源定位のためのハイブリッドニューラルネットワークサブスペースフレームワーク
- Authors: Yizhuo Yang, Junqiao Fan, Shenghai Yuan, Lihua Xie,
- Abstract要約: 我々は,ロボット音源定位のためのハイブリッドニューラルネットワークサブスペースフレームワークであるNeuralMUSICを提案する。
NeuralMUSICは、堅牢性とクロスドメインの一般化を改善しながら、競合するローカライゼーションの精度を達成する。
- 参考スコア(独自算出の注目度): 34.77198437195362
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable sound source localization is fundamental to robot audition, enabling autonomous robots to perceive spatial cues and operate effectively in dynamic environments. Classical methods such as Multiple Signal Classification (MUSIC) offer strong theoretical foundations but degrade under low signal-to-noise ratios. While deep learning-based approaches achieve promising performance, they often struggle with limited generalization across conditions. To address these challenges, we propose NeuralMUSIC, a hybrid neural-subspace framework for robotic sound source localization. Specifically, a neural network first estimates the spatial covariance matrix from multichannel microphone observations. The predicted covariance is then integrated into a classical MUSIC pipeline with eigenvalue decomposition (EVD) and pseudo-spectrum computation, followed by a Frequency Attention Fusion (FAF) module to produce the final DOA estimates. To improve data efficiency, we further introduce a Self-supervised Spatial Correlation Learning (SSCL) strategy that leverages unlabeled acoustic data to capture spatial structure. Extensive experiments across different robotic tasks demonstrate that NeuralMUSIC achieves competitive localization accuracy while exhibiting improved robustness and cross-domain generalization.
- Abstract(参考訳): 信頼性の高い音源定位はロボットのオーディションの基本であり、自律型ロボットは空間的手がかりを知覚し、動的環境で効果的に操作することができる。
多重信号分類(MUSIC)のような古典的な手法は、強い理論的基礎を提供するが、低信号-雑音比で劣化する。
ディープラーニングベースのアプローチは有望なパフォーマンスを達成する一方で、条件を越えた限定的な一般化に苦慮することが多い。
これらの課題に対処するために,ロボット音源定位のためのハイブリッドニューラルネットワークサブスペースフレームワークであるNeuralMUSICを提案する。
具体的には、ニューラルネットワークがまず、マルチチャネルマイクロホン観測から空間共分散行列を推定する。
予測された共分散は、固有値分解(EVD)と擬スペクトル計算を備えた古典的MUSICパイプラインに統合され、続いて周波数注意融合(FAF)モジュールが最終的なDOA推定を生成する。
データ効率を向上させるために、未ラベル音響データを利用して空間構造をキャプチャする自己教師付き空間相関学習(SSCL)戦略を導入する。
様々なロボットタスクにわたる大規模な実験により、NeuralMUSICは、堅牢性とクロスドメインの一般化を改善しながら、競争力のあるローカライゼーションの精度を達成している。
関連論文リスト
- ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation [55.467742403416175]
本稿では,大規模モーションキャプチャをヒューマノイドに変換する物理駆動型ニューラルネットワークを提案する。
我々は高密度参照とスパースタスク仕様の両方をサポートする統合マルチモーダルコントローラを学習する。
その結果,ULTRAは自我中心の知覚から,自律的,目標条件付き全体ロコ操作に一般化することが示された。
論文 参考訳(メタデータ) (2026-03-03T18:59:29Z) - Spiking Neural-Invariant Kalman Fusion for Accurate Localization Using Low-Cost IMUs [6.989460681111542]
スパイキングニューラルネットワーク(SNN)と不変拡張カルマンフィルタ(InEKF)を組み合わせた脳誘発状態推定フレームワークを提案する。
提案手法は,センサノイズに対する強い堅牢性を示し,実世界の移動ロボット応用の可能性を明らかにする。
論文 参考訳(メタデータ) (2026-01-13T06:12:12Z) - Neuromorphic Wireless Split Computing with Resonate-and-Fire Neurons [69.73249913506042]
本稿では、共振器(RF)ニューロンを用いて時間領域信号を直接処理する無線スプリットコンピューティングアーキテクチャについて検討する。
可変周波数で共鳴することにより、RFニューロンは低スパイク活性を維持しながら時間局在スペクトル特徴を抽出する。
実験の結果,提案したRF-SNNアーキテクチャは従来のLIF-SNNやANNと同等の精度を達成できることがわかった。
論文 参考訳(メタデータ) (2025-06-24T21:14:59Z) - Adaptive Control Attention Network for Underwater Acoustic Localization and Domain Adaptation [8.017203108408973]
海洋における音源の局所化は、環境の複雑でダイナミックな性質のために難しい課題である。
本研究では,移動音源と受信機の距離を正確に予測するマルチブランチネットワークアーキテクチャを提案する。
提案手法は,SOTA(State-of-the-art)アプローチに類似した設定で優れる。
論文 参考訳(メタデータ) (2025-06-20T18:13:30Z) - A Synergistic Framework of Nonlinear Acoustic Computing and Reinforcement Learning for Real-World Human-Robot Interaction [15.759904937490832]
本稿では, 非線形音響計算と強化学習を統合し, 複雑な雑音と残響下での人間とロボットの相互作用を強化する新しい枠組みを提案する。
提案システムは,AIハードウェア,ロボット,マシンオーディション,人工オーディション,ブレイン・マシン・インタフェースの幅広い応用可能性を示す。
論文 参考訳(メタデータ) (2025-05-04T06:03:12Z) - Credit Assignment in Neural Networks through Deep Feedback Control [59.14935871979047]
ディープフィードバックコントロール(Deep Feedback Control, DFC)は、フィードバックコントローラを使用して、望ましい出力ターゲットにマッチするディープニューラルネットワークを駆動し、クレジット割り当てに制御信号を使用する新しい学習方法である。
学習規則は空間と時間において完全に局所的であり、幅広い接続パターンに対するガウス・ニュートンの最適化を近似する。
さらに,DFCと皮質錐体ニューロンのマルチコンパートメントモデルと,局所的な電圧依存性のシナプス可塑性規則を関連づける。
論文 参考訳(メタデータ) (2021-06-15T05:30:17Z) - PILOT: Introducing Transformers for Probabilistic Sound Event
Localization [107.78964411642401]
本稿では,受信したマルチチャンネル音声信号の時間的依存性を自己アテンション機構によってキャプチャする,トランスフォーマーに基づく新しい音声イベント定位フレームワークを提案する。
このフレームワークは, 公開されている3つの音声イベントローカライズデータセットを用いて評価し, 局所化誤差と事象検出精度の点で最先端の手法と比較した。
論文 参考訳(メタデータ) (2021-06-07T18:29:19Z) - Multi-Tones' Phase Coding (MTPC) of Interaural Time Difference by
Spiking Neural Network [68.43026108936029]
雑音の多い実環境下での正確な音像定位のための純粋スパイクニューラルネットワーク(SNN)に基づく計算モデルを提案する。
このアルゴリズムを,マイクロホンアレイを用いたリアルタイムロボットシステムに実装する。
実験の結果, 平均誤差方位は13度であり, 音源定位に対する他の生物学的に妥当なニューロモルフィックアプローチの精度を上回っていることがわかった。
論文 参考訳(メタデータ) (2020-07-07T08:22:56Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。