論文の概要: AudioWorldSim: Realistic Binaural Audio Datasets For World Models
- arxiv url: http://arxiv.org/abs/2608.21075v1
- Date: Fri, 21 Aug 2026 13:17:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.551695
- Title: AudioWorldSim: Realistic Binaural Audio Datasets For World Models
- Title(参考訳): リアルなバイノーラルオーディオデータセットAudioWorldSim
- Abstract要約: AudioWorldSimは、リアルなオーディオデータセットを生成するオープンソースプラットフォームである。
オーディオベースの機械学習の研究を進めるために設計されている。
- 参考スコア(独自算出の注目度): 2.725160922570703
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: This technical report presents AudioWorldSim, an open-source platform designed to generate realistic binaural audio datasets and advance research in audio-based machine learning, particularly world models. Built as a custom extension of Meta's SoundSpaces 2.0 platform, AudioWorldSim leverages their comprehensive acoustics framework, but focuses on the automatic rollout of random agent navigations, as well as implements crucial fixes to how continuous sound is composed. AudioWorldSim is made publicly available to the research community at https://github.com/Luizerko/AudioWorldSim to facilitate reproducibility.
- Abstract(参考訳): この技術レポートでは、AudioWorldSimというオープンソースのプラットフォームを紹介します。これは、現実的なバイノーラルなオーディオデータセットを生成し、オーディオベースの機械学習、特に世界モデルの研究を前進させるように設計されています。
MetaのSoundSpaces 2.0プラットフォームのカスタム拡張として構築されたAudioWorldSimは、同社の包括的な音響フレームワークを活用している。
AudioWorldSimは、再現性を促進するために、https://github.com/Luizerko/AudioWorldSimのリサーチコミュニティで公開されている。
関連論文リスト
- Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing [63.573256490583724]
Audio-Omniは、一般的な音、音楽、音声ドメイン間で生成と編集を統合する最初のエンドツーエンドフレームワークである。
高次推論のための凍結型マルチモーダル大言語モデルと高忠実度合成のためのトレーニング可能な拡散変換器を併用する。
AudioEditは100万以上の精巧にキュレートされた編集ペアからなる大規模なデータセットである。
論文 参考訳(メタデータ) (2026-04-12T16:08:20Z) - Woosh: A Sound Effects Foundation Model [58.759449707459474]
ソニーAIが公開しているサウンドエフェクト基礎モデルであるWooshを紹介します。
音響効果に最適化されているため,(1)高品質なオーディオエンコーダ/デコーダモデル,(2)コンディショニングのためのテキスト・オーディオアライメントモデルを提供する。
拡張されたテキスト・トゥ・オーディオモデルやビデオ・トゥ・オーディオモデルもこのリリースに含まれており、低リソースの操作と高速な推論が可能になっている。
論文 参考訳(メタデータ) (2026-04-02T11:49:00Z) - DreamAudio: Customized Text-to-Audio Generation with Diffusion Models [38.963121219471354]
我々はDreamAudio for customd text-to-audio generation (CTTA)を提案する。
本稿では,ユーザが提供する音声生成のための参照概念から,モデルが聴覚情報を識別できるようにするための新しいフレームワークを提案する。
パーソナライズされた音声イベントを含む参照音声サンプルがいくつかあるので,本システムはこれらのイベントを含む新しいオーディオサンプルを生成することができる。
論文 参考訳(メタデータ) (2025-09-07T12:06:21Z) - Evaluation of Deep Audio Representations for Hearables [1.5646349560044959]
このデータセットは、30秒ごとに1,158曲のオーディオトラックを含み、空間的にプロプライエタリなモノローグと、日々の音響シーンの高品質な録音を混合して作成されている。
本ベンチマークでは,音声シーンの一般的な文脈,音声ソース,技術的音響特性を評価する8つのタスクを網羅する。
この優位性は、様々なオーディオコレクションで訓練されたモデルの利点を強調し、聴取可能なステアリングに必要な環境特性の符号化を含む幅広い聴覚タスクに適用可能であることを確認する。
論文 参考訳(メタデータ) (2025-02-10T16:51:11Z) - Both Ears Wide Open: Towards Language-Driven Spatial Audio Generation [32.24603883810094]
ステレオオーディオを空間的コンテキストで制御することは、高いデータコストと不安定な生成モデルのために依然として困難である。
まず,大規模・シミュレーションベース・GPT支援型データセットBEWO-1Mの構築を行った。
空間誘導を利用してテキストから没入型かつ制御可能な空間音声を生成する。
論文 参考訳(メタデータ) (2024-10-14T16:18:29Z) - Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark [65.79402756995084]
Real Acoustic Fields (RAF)は、複数のモードから実際の音響室データをキャプチャする新しいデータセットである。
RAFは密集した室内音響データを提供する最初のデータセットである。
論文 参考訳(メタデータ) (2024-03-27T17:59:56Z) - Self-Supervised Visual Acoustic Matching [63.492168778869726]
音響マッチングは、ターゲットの音響環境に録音されたかのように、音声クリップを再合成することを目的としている。
そこで本研究では,対象のシーン画像と音声のみを含む,視覚的音響マッチングのための自己教師型アプローチを提案する。
提案手法は,条件付きGANフレームワークと新しいメトリクスを用いて,室内音響をアンタングル化し,音をターゲット環境に再合成する方法を共同で学習する。
論文 参考訳(メタデータ) (2023-07-27T17:59:59Z) - AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene
Synthesis [61.07542274267568]
我々は,マルチモーダル学習のための,現実の映像シーン合成という新たな課題と,その一級のNeRFベースのアプローチについて検討する。
音声伝搬の事前知識をNeRFに統合する音響認識型音声生成モジュールを提案する。
本稿では,音源に対する視野方向を表す座標変換モジュールを提案する。
論文 参考訳(メタデータ) (2023-02-04T04:17:19Z) - SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning [127.1119359047849]
SoundSpaces 2.0は3D環境のためのオンザフライ幾何ベースのオーディオレンダリングのためのプラットフォームである。
任意のマイク位置から取得した任意の音に対して、非常にリアルな音響を生成する。
SoundSpaces 2.0は、視聴と聴取の両方が可能な知覚システムのより広範な研究を促進するために公開されている。
論文 参考訳(メタデータ) (2022-06-16T17:17:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。