論文の概要: PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
- arxiv url: http://arxiv.org/abs/2608.29549v1
- Date: Sun, 30 Aug 2026 04:37:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.994989
- Title: PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
- Title(参考訳): PhysWave:制御可能な空間オーディオ生成のための物理誘導潜在拡散モデル
- Abstract要約: 制御可能なテキスト対FOA生成のための物理誘導遅延拡散モデルであるPhysWaveを提案する。
PhysWaveは、共有されたウェイポイント・キャプション表現を通じて自然言語と軌道制御を統一する。
その結果,PhysWaveは競合音質を維持しつつ,空間的に一貫したFOA音声を生成することができた。
- 参考スコア(独自算出の注目度): 11.945977059126008
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-spatial audio generation, such as text-to-First-Order Ambisonics (FOA), provides a convenient way to create spatial audio for billion-dollar gaming and film industries. However, existing text-to-FOA methods are largely data-driven and may produce audio that violates acoustic relations between source direction and distance. They also separate descriptive and parametric control, forcing users to trade usability for precision. In this paper, we present PhysWave, a physics-guided latent diffusion model for controllable text-to-FOA generation. PhysWave unifies natural-language and trajectory control through a shared waypoint-caption representation, and augments diffusion training with two differentiable acoustic priors: spherical-harmonic direction consistency and inverse-square distance consistency. To support dynamic spatial generation, we further construct a 300K-clip FOA dataset with diverse sound categories and source trajectories. Extensive results show that the proposed priors help PhysWave generate spatially consistent FOA audio while maintaining competitive audio quality. Further analyses show that these physics priors improve spatial consistency during training and can also be used as inference-time guidance for training-free spatial refinement.
- Abstract(参考訳): テキスト・ツー・スペース・オーディオ・ジェネレーション、例えばテキスト・ツー・ファースト・オーダー・アンビニクス(FOA)は、数十億ドル規模のゲームや映画産業のための空間オーディオを作成するのに便利な手段を提供する。
しかし、既存のテキスト・トゥ・FOA法は、主にデータ駆動であり、音源方向と距離の音響的関係に反する音声を生成する可能性がある。
また、説明的かつパラメトリックなコントロールも分離し、ユーザーは正確性のためにユーザビリティを交換せざるを得なくなった。
本稿では,制御可能なテキスト対FOA生成のための物理誘導潜在拡散モデルであるPhysWaveを提案する。
PhysWaveは、共通のウェイポイントキャプション表現を通じて自然言語と軌跡制御を統一し、球面-高調波方向の整合性と逆二乗距離の整合性という2つの異なる音響的先行条件で拡散訓練を強化する。
動的空間生成を支援するため,様々な音響カテゴリと音源軌跡を持つ300KクリップFOAデータセットを構築した。
その結果,PhysWaveは競合音質を維持しつつ,空間的に一貫したFOA音声を生成することができた。
さらなる分析により、これらの物理学はトレーニング中の空間的整合性を向上し、トレーニング不要な空間的洗練のための推論時ガイダンスとしても使用できることが示された。
関連論文リスト
- Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources [57.68713138159972]
本稿では,ソーストラジェクトリとともにイベントセマンティクスを学習する時間分解型オーディオエンコーダを提案する。
実験により、この表現は意味的局所化を改善し、空間的および局所化指向のトレードオフよりも強い推論をもたらすことが示された。
論文 参考訳(メタデータ) (2026-06-12T05:58:31Z) - BareWave: Waveform-Native Flow-Matching Text-to-Speech [76.5390412686083]
フローマッチングTTSにおける直接テキスト・ツー・ウェーブ生成のための,完全な波形ネイティブフレームワークであるBareWaveを提案する。
我々は、トレーニング時表現アライメント、ステージドノイズスケジューリング、速度認識の知覚アライメントを組み合わせたダイレクトテキスト・ツー・ウェーブ・トレーニング・フレームワークを開発した。
ゼロショット音声クローニングの実験では、完全な波形ネイティブな推論パスの下で、強い知性、話者類似性、自然性が達成できることが示されている。
論文 参考訳(メタデータ) (2026-06-08T05:36:42Z) - UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions [55.622295453533475]
音声,音楽,音響効果を合成できる統合フローマッチングフレームワークUniSonateを紹介する。
本研究では,非構造環境音を時間潜在空間に投影する動的トークン注入機構を提案する。
実験により、UniSonateは、命令ベースのTSとTTMで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-04-24T04:26:04Z) - PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation [63.3417467957431]
テキスト・ツー・オーディオ・ビデオ(T2AV)生成は、現実的なオーディオ・ビジュアルコンテンツを要求する幅広いアプリケーションを支える。
我々は,既存のT2AVモデルの音波物理接地能力を評価するために設計された,難易度の高い音波物理感度ベンチマークであるPhyAVBenchを紹介する。
主に音声とビデオの同期に焦点を当てた以前のベンチマークとは異なり、PhyAVBenchは、音生成の基礎となる物理的メカニズムに対するモデルの理解を明確に評価している。
論文 参考訳(メタデータ) (2025-12-30T05:22:31Z) - Generating Moving 3D Soundscapes with Latent Diffusion Models [4.792255437561157]
本稿では,移動音源を明示的に制御したアンビニクス音声を生成するためのフレームワークであるSonicMotionを紹介する。
SonicMotionは、最先端のテキスト音声システムに匹敵する最先端のセマンティックアライメントと知覚品質を実現する。
論文 参考訳(メタデータ) (2025-07-09T22:31:06Z) - Adaptive Control Attention Network for Underwater Acoustic Localization and Domain Adaptation [8.017203108408973]
海洋における音源の局所化は、環境の複雑でダイナミックな性質のために難しい課題である。
本研究では,移動音源と受信機の距離を正確に予測するマルチブランチネットワークアーキテクチャを提案する。
提案手法は,SOTA(State-of-the-art)アプローチに類似した設定で優れる。
論文 参考訳(メタデータ) (2025-06-20T18:13:30Z) - DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model [46.60765174200236]
本稿では,DualSpec というテキスト・音声生成フレームワークを提案する。
まず、音響イベントオーディオから潜時音響表現を抽出するための変分オートエンコーダ(VAE)を訓練する。
最後に、空間音響生成のための潜在音響表現とテキスト特徴から拡散モデルを訓練する。
論文 参考訳(メタデータ) (2025-02-26T09:01:59Z) - ImmerseDiffusion: A Generative Spatial Audio Latent Diffusion Model [2.2927722373373247]
ImmerseDiffusionは音の空間的・時間的・環境的条件を条件とした3次元没入型音像を生成する。
論文 参考訳(メタデータ) (2024-10-19T02:28:53Z) - DiffAR: Denoising Diffusion Autoregressive Model for Raw Speech Waveform
Generation [25.968115316199246]
本研究では,生音声波形を生成する拡散確率的エンドツーエンドモデルを提案する。
我々のモデルは自己回帰的であり、重なり合うフレームを生成し、各フレームは以前に生成されたフレームの一部に条件付けされる。
実験により,提案モデルが他の最先端のニューラル音声生成システムと比較して,高品質な音声を生成することが示された。
論文 参考訳(メタデータ) (2023-10-02T17:42:22Z) - Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation [72.7915031238824]
大規模な拡散モデルは、テキスト・トゥ・オーディオ(T2A)合成タスクで成功している。
意味的不一致や時間的一貫性の低下といった共通の問題に悩まされることが多い。
我々は,Make-an-Audioの成功に基づいて,潜伏拡散に基づくT2A法であるMake-an-Audio 2を提案する。
論文 参考訳(メタデータ) (2023-05-29T10:41:28Z) - Data Fusion for Audiovisual Speaker Localization: Extending Dynamic
Stream Weights to the Spatial Domain [103.3388198420822]
複数の話者の位置を推定することは、自動音声認識や話者ダイアリゼーションなどのタスクに役立ちます。
本稿では,個別の動的ストリーム重みを特定領域に割り当てることにより,話者定位のための新しい音声視覚データ融合フレームワークを提案する。
オーディオ・ヴィジュアル・レコードを用いた性能評価は,全てのベースラインモデルより優れた融合手法により,有望な結果をもたらす。
論文 参考訳(メタデータ) (2021-02-23T09:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。