論文の概要: Weakly Guided and Autoregressive Beamformer Parameterization for Generalizable Moving Speaker Extraction in Higher-Order Ambisonics
- arxiv url: http://arxiv.org/abs/2607.04471v1
- Date: Sun, 05 Jul 2026 19:32:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.94509
- Title: Weakly Guided and Autoregressive Beamformer Parameterization for Generalizable Moving Speaker Extraction in Higher-Order Ambisonics
- Title(参考訳): 高次アンビニクスにおける一般化可能な移動話者抽出のための弱導波・自己回帰ビームフォーマパラメータ化
- Authors: Jakob Kienegger, Tal Peer, Sina Khanagha, Timo Gerkmann,
- Abstract要約: 線形空間フィルタ(ビーコン)は、堅牢で一般化可能で解釈可能な音声強調を可能にする。
現代のビームフォーマはしばしばディープニューラルネットワークによってパラメータ化され、その性能は動的シナリオで劣化する。
本稿では,データ駆動型ビームフォーミングパイプラインを提案する。
- 参考スコア(独自算出の注目度): 26.916336572507692
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Linear spatial filters (beamformers) enable robust, generalizable and interpretable speech enhancement with performance guarantees under ideal parameterization. Modern beamformers are often parameterized by deep neural networks, whose performance degrades in dynamic scenarios with multiple moving speakers of unknown directions. We propose a data-driven beamforming pipeline, which only requires an estimate of the target's initial direction. Building on a higher-order ambisonics representation, we show that neural temporal-spectral processing can be decoupled from linear spatial processing, and thereby achieve generalizable and array-agnostic enhancement. By incorporating autoregression into a frame-wise causal framework, we maintain consistent performance throughout fast speaker motion and long recordings. Evaluation on synthetic data demonstrates robust enhancement under challenging conditions with closely spaced and crossing speakers. Real-world recordings in a dynamic office meeting scenario complement these findings and show generalizability across varying ambisonics orders.
- Abstract(参考訳): 線形空間フィルタ(ビーンフォーマー)は、理想的なパラメータ化の下での性能保証により、頑健で、一般化可能で、解釈可能な音声強調を可能にする。
現代のビームフォーマは、しばしば深層ニューラルネットワークによってパラメータ化され、その性能は、未知の方向を持つ複数の移動話者を持つ動的なシナリオで劣化する。
本稿では,データ駆動型ビームフォーミングパイプラインを提案する。
高次アンビソニクス表現に基づいて、線形空間処理からニューラル・テンポラル・スペクトル処理を分離できることを示し、一般化可能かつアレイ非依存的な拡張を実現する。
フレーム単位の因果関係に自己回帰を組み込むことで、高速な話者の動きと長時間の録音を通して一貫した性能を維持することができる。
合成データの評価は、密接な空間と交差する話者を持つ難易度条件下での頑健な強化を示す。
動的オフィスミーティングのシナリオにおける実世界の録音は、これらの発見を補完し、様々なアンビソニクスの順序にまたがる一般化性を示す。
関連論文リスト
- Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis [11.116469047991798]
Flow Matching (FM)は、音声生成の強力なパラダイムとして登場したが、高い推論と遅延に制約されている。
本稿では,2つの相補的戦略によって生成効率とロバスト性を向上させる統一的なガイダンスフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-01T03:02:31Z) - Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers [28.32055656460997]
本研究では,拡張信号を軽量な追跡アルゴリズムに組み込む戦略について検討し,深部空間フィルタを自己回帰的に誘導する手法を提案する。
その結果, 自動回帰化はベイジアントラッカーの精度を著しく向上させ, 計算オーバーヘッドの増大を伴わずとも, 優れた向上をもたらすことがわかった。
論文 参考訳(メタデータ) (2026-03-24T21:19:45Z) - Adaptive Rotary Steering with Joint Autoregression for Robust Extraction of Closely Moving Speakers in Dynamic Scenarios [28.32055656460997]
Ambisonicsにおける深部空間フィルタリングの最近の進歩は、静止多話者シナリオにおいて強い性能を示す。
我々は,この回転ステアリングを,目標の初期方向を条件としたインターリーブ付きトラッキングアルゴリズムを用いて自動化することを提案する。
付近の話者や交差する話者にとって、ロバストな追跡は難しくなり、空間的手がかりは強化にはあまり効果がない。
論文 参考訳(メタデータ) (2026-01-18T10:38:49Z) - Towards Arbitrary Motion Completing via Hierarchical Continuous Representation [64.6525112550758]
Inlicit Representations(INR)に基づくNAMEと呼ばれる新しいパラメトリックアクティベーションによる階層的暗黙表現フレームワークを提案する。
本手法では,複数の時間スケールで動作列から特徴を抽出し,複雑な時間パターンを効果的に捕捉する階層的時間符号化機構を提案する。
論文 参考訳(メタデータ) (2025-12-24T14:07:04Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。