論文の概要: Objects as Audio-Visual Modal Sound Fields
- arxiv url: http://arxiv.org/abs/2608.05145v1
- Date: Wed, 05 Aug 2026 17:59:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.076239
- Title: Objects as Audio-Visual Modal Sound Fields
- Title(参考訳): モーダル音場としての物体
- Authors: Zisen Shao, Zihao Wei, Derong Jin, Ruohan Gao,
- Abstract要約: 多視点画像から再構成した新しいオブジェクトレベルの音響表現であるAV-MSF(Audio-Visual Modal Sound Field)を紹介する。
AV-MSFは、高密度な3D視覚機能と統合された3Dガウススプラッティング上に構築され、より強力な幾何学的認識を提供する。
2つの実世界のデータセットの実験により、AV-MSFは最先端の衝撃音のレンダリングを実現し、物理ベースのベースラインとデータ駆動ベースラインの両方を上回ります。
- 参考スコア(独自算出の注目度): 16.406367189902344
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While modern 3D reconstruction excels at modeling object geometry and appearance, it largely ignores the rich acoustic cues revealed through physical interaction. Object impact sounds convey material, stiffness, and structural properties that complement vision, yet existing impact sound modeling approaches either rely on expensive physics-based simulation or require large datasets to generalize in a purely data-driven manner. We introduce Audio-Visual Modal Sound Field (AV-MSF), a novel object-level acoustic representation reconstructed from multi-view images and only a few impact sound recordings. AV-MSF builds on 3D Gaussian Splatting integrated with dense 3D visual feature to provide a strong geometry-aware prior, and represents the impact sound field using compact, physically meaningful modal parameters, enabling robust few-shot reconstruction. Experiments on two real-world datasets show that AV-MSF achieves state-of-the-art impact sound rendering, outperforming both physics-based and data-driven baselines. Furthermore, we demonstrate downstream applications enabled by our representation, including contact localization and object sound editing.
- Abstract(参考訳): 現代の3D再構成は、物体の形状や外観をモデル化する上で優れているが、物理的相互作用によって明らかにされた豊かな音響的手がかりをほとんど無視する。
物体衝撃音は、視覚を補完する物質、硬さ、構造特性を伝達するが、既存の衝撃音モデリングアプローチは、高価な物理に基づくシミュレーションに依存するか、純粋にデータ駆動の方法で一般化するために大規模なデータセットを必要とする。
マルチビュー画像から再構成された新しいオブジェクトレベルの音響表現で,若干の衝撃音しか記録できないAV-MSF(Audio-Visual Modal Sound Field)を紹介する。
AV-MSFは、高密度な3次元視覚特徴と統合された3次元ガウススプラッティングの上に構築され、強力な幾何学的認識を提供するとともに、コンパクトで物理的に意味のあるモーダルパラメータを用いて衝撃音場を表現し、ロバストな数ショット再構成を可能にする。
2つの実世界のデータセットの実験により、AV-MSFは最先端の衝撃音のレンダリングを実現し、物理ベースのベースラインとデータ駆動ベースラインの両方を上回ります。
さらに,接触局所化やオブジェクト音声編集など,表現によって可能となるダウンストリームアプリケーションのデモを行う。
関連論文リスト
- PAVAS: Physics-Aware Video-to-Audio Synthesis [58.746986798623084]
本稿では、物理推論を潜伏拡散に基づくV2A生成に組み込む手法であるPAVAS(Physical-Aware Video-to-Audio Synthesis)を提案する。
PAVASは物理的に可塑性かつ知覚的にコヒーレントな音声を生成し、定量評価と定性評価の両方において既存のV2Aモデルより優れていることを示す。
論文 参考訳(メタデータ) (2025-12-09T06:28:50Z) - Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound [5.591620304505415]
この研究は、AVWM (Audio-Visual World Models) のための最初の公式なフレームワークを提示する。
マルチモーダル環境シミュレーションを、部分的に観察可能な決定プロセスとして定式化し、音声・視覚的観察、きめ細かいアクション、タスク報酬を提供する。
本稿では,視覚学習と聴覚学習のバランスをとる新しいモダリティ・エキスパート・アーキテクチャを用いたオーディオ・ビジュアル・コンディショナル・トランスフォーマーを提案する。
論文 参考訳(メタデータ) (2025-11-30T13:11:56Z) - Visual Acoustic Fields [39.43953430861896]
本研究では,3次元空間内の音や視覚信号をブリッジするフレームワークであるVisual Acoustic Fieldsを提案する。
提案手法は,音生成と音像定位という2つの重要なモジュールを特徴とする。
私たちの知る限りでは、これが3Dコンテキストで視覚信号と音響信号を接続する最初のデータセットです。
論文 参考訳(メタデータ) (2025-03-31T16:16:10Z) - Modeling and Driving Human Body Soundfields through Acoustic Primitives [79.38642644610592]
本研究では,人体が生成する全3次元音場をレンダリングし,高品質な空間オーディオ生成を実現するフレームワークを提案する。
我々は,3次元空間の任意の点において,全音響シーンを効率よく,正確にレンダリングできることを実証した。
我々の音響プリミティブは、従来の手法に比べて、音場表現が桁違い小さくなり、近接場レンダリングの欠陥を克服する。
論文 参考訳(メタデータ) (2024-07-18T01:05:13Z) - AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis [62.33446681243413]
ビュー音響合成は、音源が3Dシーンで出力するモノのオーディオを考慮し、任意の視点でオーディオを描画することを目的としている。
既存の手法では、音声合成の条件として視覚的手がかりを利用するため、NeRFベースの暗黙モデルが提案されている。
本研究では,シーン環境全体を特徴付ける新しいオーディオ・ビジュアル・ガウス・スプレイティング(AV-GS)モデルを提案する。
AV-GSが実世界のRWASやシミュレーションベースのSoundSpacesデータセットの既存の代替品よりも優れていることを検証する。
論文 参考訳(メタデータ) (2024-06-13T08:34:12Z) - Improving Audio-Visual Segmentation with Bidirectional Generation [40.78395709407226]
音声・視覚的セグメンテーションのための双方向生成フレームワークを提案する。
この枠組みは、物体の視覚的特徴と関連する音との堅牢な相関関係を確立する。
また、時間力学を扱う暗黙の体積運動推定モジュールも導入する。
論文 参考訳(メタデータ) (2023-08-16T11:20:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。