論文の概要: Reconstructing the Vocal Tract with Differentiable Acoustic Simulation
- arxiv url: http://arxiv.org/abs/2609.36737v1
- Date: Tue, 29 Sep 2026 05:11:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.202804
- Title: Reconstructing the Vocal Tract with Differentiable Acoustic Simulation
- Title(参考訳): 微分音響シミュレーションによる声道再建
- Abstract要約: 声道の音響シミュレータとして,微分可能,GPUによる音響シミュレータを提案する。
微分可能シミュレータは、声道の音を伝搬させることで音声を合成する。
シミュレータは微分可能であるため、他のディープラーニングパイプラインと容易に統合できる。
- 参考スコア(独自算出の注目度): 17.749575661509407
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The vocal tract is the region of the human body responsible for filtering one's voice to create speech. In this paper, we present a differentiable and GPU accelerated acoustic simulator for the vocal tract. The differentiable simulator synthesizes speech by propagating sound along an acoustic tube model of the vocal tract, and via its gradients, can solve the inverse problem: reconstructing the shape of the vocal tract solely from the sound it produces. Although the inverse mapping between geometry and sound is notoriously non-convex, we discover that gradient descent succeeds with three technical contributions: (1) we design a frequency domain formulation of the vocal tract's fluid dynamics that is 70x more GPU parallelizable than finite differences in time, (2) we integrate a differentiable model for turbulence to synthesize consonants, and (3) similar to prior work in implicit neural representations (INRs) and neural fields, we find that parameterizing the geometry with a neural network accelerates convergence and escapes local minima that trap discrete representations. Because the simulator is differentiable, it is readily integrated with other deep learning pipelines to enable novel linguistics and medical imaging applications. (1) We demonstrate self-supervised autoencoding of vocal tract shapes across 11 languages, and (2) we couple our simulator with a generative model of MRI (magnetic resonance imaging) images to reconstruct one's moving vocal tract from only their speech without paired data.
- Abstract(参考訳): 声道は人体の領域であり、声をフィルタリングして音声を生成する。
本稿では,声道の音響シミュレータとして,微分可能,GPUによる音響シミュレータを提案する。
微分可能シミュレータは、声道の音響管モデルに沿って音を伝搬させることにより音声を合成し、その勾配により、声道の形状をその声道からのみ再構成する逆問題を解くことができる。
幾何と音の逆写像は非凸的に悪名高いが,(1)声道の流体力学の周波数領域の定式化は時間的差より70倍多いGPUの並列化が可能であること,(2)共振器を合成するために乱流の微分可能なモデルを統合すること,(3)暗黙的ニューラル表現(INR)やニューラルフィールドにおける先行研究と同様に,ニューラルネットワークを用いた幾何のパラメータ化が収束を加速し,離散表現を阻害する局所ミニマから逃れること,の3つの技術的寄与が得られた。
シミュレータは微分可能であるため、他のディープラーニングパイプラインと容易に統合して、新しい言語学や医療画像の応用を可能にする。
1)11言語にまたがる声道形状の自己教師的自己エンコーディングを実証し,(2)MRI(MRI)画像の生成モデルと組み合わせて音声のみから音声のみを再構成する。
関連論文リスト
- Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI [11.821666867155445]
本研究では,訓練中に音響・音韻の監督を行う3段階の枠組みを提案する。
視覚的エンコーダと音響的エンコーダは、二重レベルのクロスモーダルコントラスト事前訓練によって整列される。
学習された表現は、クロスアテンションデコーダを通じて融合され、効果的にマルチモーダルな知識を単一モーダル推論パイプラインに転送する。
論文 参考訳(メタデータ) (2026-05-18T14:26:17Z) - Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition [30.3773200520904]
音声感情認識(SER)は、社会ロボティクスやロボット心理学的診断などのヒューマノイドロボットのタスクに不可欠である。
大規模なデータセットでトレーニングされた既存のディープモデルは、ほとんど解釈できないままである。
生理的インフォームド音声スペクトル表現学習法であるPhyloSERを提案する。
論文 参考訳(メタデータ) (2026-02-03T03:55:50Z) - GaussianSpeech: Audio-Driven Gaussian Avatars [76.10163891172192]
本稿では,3次元頭部アバターの高忠実度アニメーションシーケンスを音声音声から合成する手法であるGaussianSpeechを紹介する。
本稿では,表情に依存した色を生成するコンパクトで効率的な3DGSベースのアバター表現を提案する。
論文 参考訳(メタデータ) (2024-11-27T18:54:08Z) - Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion [85.54515118077825]
本稿では, 常微分方程式に基づく線形拡散モデル(LinDiff)を提案する。
計算複雑性を低減するため、LinDiffでは、入力信号を小さなパッチに分割するパッチベースの処理アプローチを採用している。
我々のモデルは、より高速な合成速度で自己回帰モデルに匹敵する品質の音声を合成することができる。
論文 参考訳(メタデータ) (2023-06-09T07:02:43Z) - Make-A-Voice: Unified Voice Synthesis With Discrete Representation [77.3998611565557]
Make-A-Voiceは、個別表現から音声信号を合成・操作するための統合されたフレームワークである。
我々は,Make-A-Voiceは,競合するベースラインモデルと比較して,音質とスタイルの類似性が優れていることを示す。
論文 参考訳(メタデータ) (2023-05-30T17:59:26Z) - Synthesizing audio from tongue motion during speech using tagged MRI via
transformer [13.442093381065268]
本稿では,4次元運動場に固有の予測情報を2次元分光法を用いて探索する,効率的な変形デコーダ変換ネットワークを提案する。
我々の枠組みは、これらの2つのモダリティ間の関係の理解を改善し、言語障害の治療の進展を知らせる可能性を秘めている。
論文 参考訳(メタデータ) (2023-02-14T17:27:55Z) - Silent Speech and Emotion Recognition from Vocal Tract Shape Dynamics in
Real-Time MRI [9.614694312155798]
本稿では,音声合成中の声道形状の可変長列における音響情報を理解する,ディープニューラルネットワークに基づく学習フレームワークを提案する。
提案するフレームワークは、畳み込み、繰り返しネットワーク、接続性時間的分類損失から成り、完全にエンドツーエンドに訓練されている。
我々の知る限りでは、この研究は、rtMRIビデオで捉えた個人の動脈の動きに基づいて、音声文全体の認識を示す最初の研究である。
論文 参考訳(メタデータ) (2021-06-16T11:20:02Z) - Many-to-Many Voice Transformer Network [55.17770019619078]
本稿では,S2S学習フレームワークに基づく音声変換(VC)手法を提案する。
これにより、音声特性、ピッチ輪郭、入力音声の持続時間の同時変換が可能となる。
論文 参考訳(メタデータ) (2020-05-18T04:02:08Z) - Learning Joint Articulatory-Acoustic Representations with Normalizing
Flows [7.183132975698293]
可逆ニューラルネットワークモデルを用いて母音の調音領域と音響領域の結合潜時表現を求める。
提案手法は調音から音響へのマッピングと音響から調音へのマッピングの両方を実現し,両領域の同時符号化の実現に成功していることを示す。
論文 参考訳(メタデータ) (2020-05-16T04:34:36Z) - Temporal-Spatial Neural Filter: Direction Informed End-to-End
Multi-channel Target Speech Separation [66.46123655365113]
ターゲット音声分離とは、混合信号からターゲット話者の音声を抽出することを指す。
主な課題は、複雑な音響環境とリアルタイム処理の要件である。
複数話者混合から対象音声波形を直接推定する時間空間ニューラルフィルタを提案する。
論文 参考訳(メタデータ) (2020-01-02T11:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。