論文の概要: WorldSonus: Bringing Sound to Worlds
- arxiv url: http://arxiv.org/abs/2610.08760v1
- Date: Tue, 06 Oct 2026 17:50:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.156839
- Title: WorldSonus: Bringing Sound to Worlds
- Title(参考訳): WorldSonus: 音を世界に届ける
- Abstract要約: WorldSonusは、世界モデルにおけるリアルタイム空間音合成のために設計されたインタラクティブなビデオ音声合成フレームワークである。
リアルタイム生成のために、WorldSonusはストリーミング因果自己回帰拡散アーキテクチャを採用し、オーディオチャンクを0.41の低リアルタイム係数(RTF)で合成する。
対話型制御には、チャンクインデックス付きプロンプトスケジューリングを備えた音声中心のキャプションパイプラインを組み込み、生成時の音事象の動的操作を可能にする。
- 参考スコア(独自算出の注目度): 40.95922882675974
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Recent advances in world models have enabled increasingly realistic visual synthesis. However, these generated environments remain largely silent. Bringing sound to world models poses three core challenges: real-time generation to keep pace with interactive video streams, interactive control to respond to mid-stream sound instructions, and spatially aligned stereo to reflect scene geometry and camera motion. To address these demands, we introduce WorldSonus, an interactive video-to-audio framework designed for real-time spatial sound synthesis in world models. For real-time generation, WorldSonus employs a streaming causal autoregressive diffusion architecture that synthesizes audio chunks at a low real-time factor (RTF) of 0.41. For interactive control, we incorporate an audio-centric captioning pipeline with chunk-indexed prompt scheduling, enabling dynamic manipulation of sound events during generation. For spatial alignment, we leverage high-quality stereo supervision curated from diverse stereo and ambisonic data. Extensive experiments demonstrate that while tailored for world models, WorldSonus generalizes effectively to open-domain video-to-audio benchmarks, matching or outperforming state-of-the-art bidirectional models in both acoustic quality and spatial alignment. Project page: https://noizai.github.io/WorldSonus/
- Abstract(参考訳): 近年の世界モデルの進歩は、より現実的な視覚合成を可能にしている。
しかし、これらの環境は依然としてほとんど静かである。
インタラクティブなビデオストリームのペースを維持するためのリアルタイム生成、中流音の指示に応答するためのインタラクティブ制御、シーンの幾何学とカメラの動きを反映する空間的に整列されたステレオである。
これらの要求に対処するために,世界モデルにおけるリアルタイム空間音合成のためのインタラクティブなビデオ・オーディオ・フレームワークであるWorldSonusを紹介した。
リアルタイム生成のために、WorldSonusはストリーミング因果自己回帰拡散アーキテクチャを採用し、オーディオチャンクを0.41の低リアルタイム係数(RTF)で合成する。
対話型制御には、チャンクインデックス付きプロンプトスケジューリングを備えた音声中心のキャプションパイプラインを組み込み、生成時の音事象の動的操作を可能にする。
空間的アライメントには,多様なステレオおよびアンビソニックデータから算出した高品質なステレオ監視を利用する。
広汎な実験により、WorldSonusは世界モデルに適した一方で、音響的品質と空間的アライメントの両方において、最先端の双方向モデルをマッチングまたは性能良く、オープンドメインのビデオ・オーディオ・ベンチマークに効果的に一般化することを示した。
プロジェクトページ:https://noizai.github.io/WorldSonus/
関連論文リスト
- Audible World Models: Spatially Aware Sound Generation for 3D Worlds [10.246138787861524]
我々は、音を生成された世界状態に組み込むフレームワークであるAudible World Modelsを紹介する。
本システムはパノラマ3Dプロキシを構築し,それを意味層に分離し,音生成対象と環境背景領域を識別し,各サウンドラベルに対してドライオーディオを合成する。
その後、これらの音源を再構成された幾何学に固定し、幾何学的音響伝搬を用いてリスナーに依存した空間音響を描画する。
論文 参考訳(メタデータ) (2026-09-29T19:37:16Z) - HelixWorld: A Real-time Interactive Audio-Visual World Model [80.08063153528869]
HelixWorldはリアルタイムの対話型オーディオ・ビジュアル・ワールドモデルで、視覚シーンとカメラ地上の空間ステレオサウンドがユーザーインタラクションの下で共存する。
低遅延因果的相互作用を可能にするため,教師を数ステップのストリーミング学習生にオンラインでのトラジェクトリー蒸留損失を通じて蒸留する。
実験によると、HelixWorldは最先端のサイレントワールドモデルと視覚的忠実度と応答性で一致している。
論文 参考訳(メタデータ) (2026-09-29T17:51:41Z) - OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text [46.65856772563035]
ユニバーサル・ホロスティック・オーディオ・ジェネレーション(UniHAGen)を提案する。
UniHAGenは、オンスクリーンとオフスクリーンの両方のサウンドを含む包括的な聴覚シーンを生成するタスクである。
ビデオとテキストに条件付きフローマッチングベースの拡散フレームワークであるOmniSonicを紹介する。
論文 参考訳(メタデータ) (2026-04-06T01:43:00Z) - ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation [32.24603883810094]
ステレオオーディオを空間的コンテキストで制御することは、高いデータコストと不安定な生成モデルのために依然として困難である。
まず,大規模・シミュレーションベース・GPT支援型データセットBEWO-1Mの構築を行った。
空間誘導を利用してテキストから没入型かつ制御可能な空間音声を生成する。
論文 参考訳(メタデータ) (2024-10-14T16:18:29Z) - AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene
Synthesis [61.07542274267568]
我々は,マルチモーダル学習のための,現実の映像シーン合成という新たな課題と,その一級のNeRFベースのアプローチについて検討する。
音声伝搬の事前知識をNeRFに統合する音響認識型音声生成モジュールを提案する。
本稿では,音源に対する視野方向を表す座標変換モジュールを提案する。
論文 参考訳(メタデータ) (2023-02-04T04:17:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。