論文の概要: Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds
- arxiv url: http://arxiv.org/abs/2608.00463v1
- Date: Sat, 01 Aug 2026 06:04:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.680848
- Title: Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds
- Title(参考訳): Scene2Sound:3Dガウス世界のための音環境生成
- Abstract要約: 3D Gaussian Splatting(3DGS)は、撮影または生成された画像を自由に探索できる3Dワールドシミュレーションに変える。
既存の音声生成手法は、単一の画像や視点で条件付けされているため、その音はその観測と結びついており、リスナーが動いている間は、その音は一定に保たない。
本研究では,空間的に一貫した音環境を与えられた3DGS世界に対して聴覚的接地により生成するタスクを紹介する。
この基盤の上に構築されたトレーニング不要のフレームワークであるScene2Soundを紹介します。
- 参考スコア(独自算出の注目度): 51.55297978842271
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D Gaussian Splatting (3DGS) turns captured or generated imagery into photorealistic 3D world simulations that users can freely explore, yet these worlds remain silent. Because existing audio generation methods condition on a single image or viewpoint, their sound is tied to that observation and cannot stay consistent while a listener moves. We introduce the task of generating a spatially consistent soundscape for a given 3DGS world through auditory grounding, identifying which objects in the world should emit sound and anchoring each to a persistent 3D position, and present Scene2Sound, a training-free framework built on this grounding. From the input world alone, our pipeline selects viewpoints that jointly cover the scene, identifies sound-emitting objects with a vision-language model, and associates the multi-view detections into 3D instances through Gaussian set matching, which measures the overlap between the Gaussian sets that render each detection. Each source then receives generated audio that a standard object-based audio engine spatializes in real time at arbitrary listener poses. We further propose two spatial-consistency metrics, one testing whether rendered audio responds consistently to listener motion and one testing whether the claimed sources are supported by views held out from their placement. On a curated set of generated 3DGS worlds and on 3DGS scenes generated from real-world 360-degree captures, Scene2Sound preserves the audio quality of strong per-viewpoint baselines while remaining spatially consistent where per-viewpoint and single-panorama pipelines do not, and a user study confirms the perceptual benefit. Project page: https://masaki-lmd.github.io/scene2sound/.
- Abstract(参考訳): 3D Gaussian Splatting(3DGS)は、撮影または生成された画像を、ユーザーが自由に探索できるフォトリアリスティックな3Dワールドシミュレーションに変える。
既存の音声生成手法は、単一の画像や視点で条件付けされているため、その音はその観測と結びついており、リスナーが動いている間は、その音は一定に保たない。
本研究では,空間的に一貫した音環境を聴覚的接地により生成し,どのオブジェクトが音を発し,各オブジェクトを持続的な3D位置に固定すべきかを同定し,この接地上に構築されたトレーニングフリーフレームワークであるScene2Soundを紹介する。
入力の世界だけで、パイプラインはシーンを共同でカバーする視点を選択し、視覚言語モデルで音源を識別し、マルチビュー検出をガウス集合マッチングを通じて3Dインスタンスに関連付け、各検出をレンダリングするガウス集合間の重なりを測定する。
それぞれのソースは生成された音声を受信し、標準のオブジェクトベースオーディオエンジンが任意のリスナーポーズでリアルタイムで空間化する。
さらに,2つの空間的整合性尺度を提案し,その1つは音色が聴取者の動きに一貫して反応するかどうか,もう1つはその位置から持たれるビューによって主張される音源が支持されているかどうかを検証した。
実世界の360度撮影から生成された3DGSワールドと3DGSシーンのキュレートされたセットでは、Scene2Soundは、ビューポイント当たりの強いベースラインの音質を保ちながら、ビューポイントあたりのパイプラインとシングルパノラマパイプラインがそうでない場所を空間的に一貫したままに保ち、ユーザスタディは知覚上のメリットを確認する。
プロジェクトページ:https://masaki-lmd.github.io/scene2sound/。
関連論文リスト
- SonoWorld: From One Image to a 3D Audio-Visual Scene [29.64658395133738]
本稿では,1枚の画像から3次元映像を生成するImage2AVSceneを紹介する。
私たちは、この問題に最初に取り組むフレームワークであるSanoWorldを紹介します。
また,1ショットの音響学習と空間的音源分離への応用を実演する。
論文 参考訳(メタデータ) (2026-03-30T17:57:47Z) - Visual Acoustic Fields [39.43953430861896]
本研究では,3次元空間内の音や視覚信号をブリッジするフレームワークであるVisual Acoustic Fieldsを提案する。
提案手法は,音生成と音像定位という2つの重要なモジュールを特徴とする。
私たちの知る限りでは、これが3Dコンテキストで視覚信号と音響信号を接続する最初のデータセットです。
論文 参考訳(メタデータ) (2025-03-31T16:16:10Z) - SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera [61.642416712939095]
SoundLoc3Dはタスクをセット予測問題として扱い、セットの各要素は潜在的な音源に対応する。
大規模シミュレーションデータセットにおけるSoundLoc3Dの有効性と優位性を示す。
論文 参考訳(メタデータ) (2024-12-22T05:04:17Z) - 3D Audio-Visual Segmentation [52.34970001474347]
ロボット工学やAR/VR/MRに様々な応用がある。
本稿では,事前学習した2次元オーディオ視覚基盤モデルから,使用可能な知識を統合することで特徴付ける新しいアプローチであるEchoSegnetを提案する。
実験により、EchoSegnetは、私たちの新しいベンチマークで、3D空間の音声オブジェクトを効果的にセグメント化できることが実証された。
論文 参考訳(メタデータ) (2024-11-04T16:30:14Z) - AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis [62.33446681243413]
ビュー音響合成は、音源が3Dシーンで出力するモノのオーディオを考慮し、任意の視点でオーディオを描画することを目的としている。
既存の手法では、音声合成の条件として視覚的手がかりを利用するため、NeRFベースの暗黙モデルが提案されている。
本研究では,シーン環境全体を特徴付ける新しいオーディオ・ビジュアル・ガウス・スプレイティング(AV-GS)モデルを提案する。
AV-GSが実世界のRWASやシミュレーションベースのSoundSpacesデータセットの既存の代替品よりも優れていることを検証する。
論文 参考訳(メタデータ) (2024-06-13T08:34:12Z) - SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning [127.1119359047849]
SoundSpaces 2.0は3D環境のためのオンザフライ幾何ベースのオーディオレンダリングのためのプラットフォームである。
任意のマイク位置から取得した任意の音に対して、非常にリアルな音響を生成する。
SoundSpaces 2.0は、視聴と聴取の両方が可能な知覚システムのより広範な研究を促進するために公開されている。
論文 参考訳(メタデータ) (2022-06-16T17:17:44Z) - Learning to Set Waypoints for Audio-Visual Navigation [89.42192208471735]
音声視覚ナビゲーションでは、エージェントが視覚と音の両方を使って複雑な3D環境をインテリジェントに移動し、音源を見つける。
既存のモデルは、エージェント動作の一定の粒度で動作することを学び、オーディオ観測の単純な再帰的な集約に依存する。
本稿では,2つの重要な要素を持つ音声視覚ナビゲーションに対する強化学習手法を提案する。
論文 参考訳(メタデータ) (2020-08-21T18:00:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。