論文の概要: CNN Models for Microphone Array Covariance Matrix Upsampling and Acoustic Imaging
- arxiv url: http://arxiv.org/abs/2607.01295v1
- Date: Wed, 01 Jul 2026 13:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.526117
- Title: CNN Models for Microphone Array Covariance Matrix Upsampling and Acoustic Imaging
- Title(参考訳): マイクロホンアレイ共分散マトリックスアップサンプリングと音響イメージングのためのCNNモデル
- Abstract要約: 事実上四面体4マイクロホンアレイを球状32マイクロホンアレイにアップサンプリングすることはディープラーニング技術を用いる。
実世界のSTARSS23データセットを用いた音響画像の共分散アップサンプリングについて,5つのニューラルネットワークアーキテクチャについて検討した。
その結果、全てのモデルにおいて、RMSEが0.548であり、最も優れたアーキテクチャが0.432であるランダムゲスベースラインよりも優れた結果が得られた。
- 参考スコア(独自算出の注目度): 25.465068576945953
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Acoustic imaging visualization is a core methodology in acoustics, enabling spatial analysis of sound sources and acoustic scenes. However, limited sensor availability in practical systems motivate approaches that enhance spatial resolution without increasing the hardware complexity. In this paper, we focus on upsampling virtually a tetrahedral 4-microphone array to a spherical 32-microphone array by estimating the covariance matrices of the channels employing deep learning techniques. Five neural network architectures are investigated for covariance upsampling for acoustic imaging using the real-world STARSS23 dataset. These models are developed to estimate a 32-microphone, time-frequency covariance matrix from a 4-microphone input covariance representation. The proposed architectures are based on 2D convolutional layers to capture the underlying spatial-spectral structure of covariance matrices, and are further enhanced with frequency dynamic convolution to model their frequency-dependent properties. The proposed architectures are evaluated in terms of root mean square error (RMSE) and using delay-and-sum beamforming acoustic imaging. Quantitative results show that all models outperform a random-guess baseline, which yields an RMSE of 0.548, with the best-performing architecture achieving an RMSE of 0.432. We analyze qualitatively the performance of the proposed models through beamforming heatmap visualizations derived from the 4-channel input covariance, the 32-channel ground truth, and the predicted 32-channel covariance matrices. These results demonstrate that covariance upsampling significantly enhances the effective performance of the 4-channel microphone array, producing sound maps that closely resemble those obtained with the 32-channel array.
- Abstract(参考訳): 音響画像の可視化は音響学における中核的な手法であり、音源と音響シーンの空間的解析を可能にする。
しかし、実用システムにおけるセンサの可用性の制限は、ハードウェアの複雑さを増大させることなく空間分解能を高めるアプローチを動機付けている。
本稿では,深層学習技術を用いてチャネルの共分散行列を推定することにより,仮想的に四面体4マイクロホンアレーを球状32マイクロホンアレーにアップサンプリングすることに焦点を当てる。
実世界のSTARSS23データセットを用いた音響画像の共分散アップサンプリングについて,5つのニューラルネットワークアーキテクチャについて検討した。
これらのモデルは、4マイクロホン入力共分散表現から32マイクロホン時間周波数共分散行列を推定するために開発された。
提案アーキテクチャは,共分散行列の基底となる空間スペクトル構造を捉えるために2次元畳み込み層に基づいており,周波数依存特性をモデル化するために周波数動的畳み込みによりさらに拡張されている。
提案手法は, ルート平均二乗誤差 (RMSE) と遅延ビームフォーミング・アコースティック・イメージングを用いて評価する。
定量的結果から、全てのモデルにおいて、RMSEが0.548であり、最も優れたアーキテクチャが0.432であるランダムガウスベースラインよりも優れた結果が得られた。
提案モデルの性能を、4チャネル入力共分散、32チャネル基底真理、予測32チャネル共分散行列から導かれるビームフォーミング・ヒートマップの可視化により定性的に解析する。
これらの結果から,共分散アップサンプリングは4チャンネルマイクロホンアレーの有効性能を著しく向上させ,32チャンネルアレーとよく似た音響マップを生成することを示した。
関連論文リスト
- BenthicDINO: Physics-Informed Self-Distillation for View-Invariant Side-Scan Sonar Representations [0.0]
本稿では,データ効率を最大化するために,ConvNeXt-v2-Tinyバックボーンを用いてDINOv3アーキテクチャ上に構築した物理インフォームド自己蒸留フレームワークを提案する。
本研究では,4つのネットワークステージにまたがる,密集した階層的特徴融合戦略を提案する。
論文 参考訳(メタデータ) (2026-08-24T13:11:22Z) - GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis [94.20462261657525]
GrainGSは階層的なアンカー足場とガウス単位の変形を組み合わせた動的フレームワークである。
高いリコンストラクション品質、リアルタイムの新規ビュー合成、コンパクトストレージを実現している。
論文 参考訳(メタデータ) (2026-07-23T15:52:35Z) - PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation [57.864929968616586]
Video-to-Audio (V2A) の生成には、4つの重要な知覚次元のバランスが必要である。
私たちは、強化学習をV2A世代に統合する最初のフレームワークであるPrismAudioを紹介します。
論文 参考訳(メタデータ) (2025-11-24T07:11:12Z) - SCas4D: Structural Cascaded Optimization for Boosting Persistent 4D Novel View Synthesis [53.10680153186481]
SCas4Dは3次元ガウススプラッティングにおける構造パターンを動的シーンに活用するカスケード最適化フレームワークである。
SCas4Dは、粗い部分レベルから細い点レベルへの変形を段階的に精製することにより、時間フレーム当たり100イテレーション以内の収束を実現する。
このアプローチはまた、自己教師付きオブジェクトセグメンテーション、新しいビュー合成、および高密度点追跡タスクにおける効果を示す。
論文 参考訳(メタデータ) (2025-10-08T06:39:33Z) - InJecteD: Analyzing Trajectories and Drift Dynamics in Denoising Diffusion Probabilistic Models for 2D Point Cloud Generation [48.55037712252843]
InJecteDは拡散確率モデル(DDPM)を解釈するフレームワーク
このフレームワークをDatasaurus Dozen bullseye, dino, circleの3つのデータセットに適用する。
提案手法は, 変位, 速度, クラスタリング, ドリフト場力学などの軌道特性を定量的に評価する。
論文 参考訳(メタデータ) (2025-09-09T14:53:19Z) - Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation [21.46605047406198]
Aesthetic-4Kデータセットは、超高解像度画像合成に関する包括的な研究のためにキュレートされている。
Diffusion-4Kは超高解像度画像の直接生成のための革新的なフレームワークである。
論文 参考訳(メタデータ) (2025-06-02T05:19:40Z) - Benchmarking 3D multi-coil NC-PDNet MRI reconstruction [2.5195203844628558]
入力チャネル数が異なる圧縮データに基づいてトレーニングされた非カルテシアンプリマルデュアルネットワーク(NC-PDNet)は、1mm等方性32チャネル全体脳3D再構成に対して平均PSNR42.98dBを達成する。
推測時間は4.95秒,GPUメモリ使用量は5.49GBであり,臨床研究への応用に有意な可能性を示唆している。
論文 参考訳(メタデータ) (2024-11-08T09:14:36Z) - Joint Beam Search Integrating CTC, Attention, and Transducer Decoders [53.297697898510194]
4つのデコーダが同一のエンコーダを共有するような共同モデリング手法を提案する。
4Dモデルは共同で訓練され、モデルの正規化とモデルの堅牢性を最大化する。
さらに,3つのデコーダを組み合わせることで,新しい3つのビーム探索アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-05T05:18:20Z) - Probabilistic-based Feature Embedding of 4-D Light Fields for
Compressive Imaging and Denoising [62.347491141163225]
4次元光電場(LF)は、効率的で効果的な機能埋め込みを実現する上で大きな課題となる。
様々な低次元畳み込みパターンを組み立てることで特徴埋め込みアーキテクチャを学習する確率論的特徴埋め込み(PFE)を提案する。
実世界および合成4次元LF画像において,本手法の有意な優位性を実証した。
論文 参考訳(メタデータ) (2023-06-15T03:46:40Z) - Adversarial Audio Synthesis with Complex-valued Polynomial Networks [60.231877895663956]
音声における時間周波数(TF)表現は、実数値ネットワークとしてますますモデル化されている。
我々は,このような複雑な数値表現を自然な方法で統合するAPOLLOと呼ばれる複雑な数値ネットワークを導入する。
APOLLOは、音声生成におけるSC09の最先端拡散モデルよりも17.5%$改善され、8.2%ドルとなる。
論文 参考訳(メタデータ) (2022-06-14T12:58:59Z) - XCycles Backprojection Acoustic Super-Resolution [4.022090911982323]
本研究では,音響画像の超解像問題に対する新しいバックプロジェクションモデルアーキテクチャを提案する。
低分解能空間と高分解能空間の両方で符号化された特徴の残差誤差補正を再現するために、各サイクルにおける反復補正手順を使用する。
また、データ取得時に発生するサブサンプリングエラーを大幅に削減した。
論文 参考訳(メタデータ) (2021-05-19T13:43:15Z) - An ensemble classifier for vibration-based quality monitoring [0.0]
本稿では, 証拠のデンプスター・シェーファー理論に基づく新しいアンサンブル分類器を開発する。
提案フレームワークの有効性は、15UCIおよびKEEL機械学習データセットに適用することで検証される。
論文 参考訳(メタデータ) (2020-07-17T07:23:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。