論文の概要: OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents
- arxiv url: http://arxiv.org/abs/2609.23407v2
- Date: Wed, 23 Sep 2026 05:35:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.665777
- Title: OmniEcho: Audio-Visual Spatial Understanding for Omni-Modal Embodied Agents
- Title(参考訳): OmniEcho:OmniModal Embodied Agentsのためのオーディオ・ビジュアル空間理解
- Abstract要約: textbf OmniEchoBenchは空間的音声視覚知覚と音声視覚言語ナビゲーションのためのベンチマークである。
実際の空間的オーディオ映像シーン197件、質問応答ペア2,972件、一階アンビソニクス(FOA)オーディオ付きナビゲーションサンプル900件からなる。
音声誘導ナビゲーションでは、OmniEchoは従来の視覚言語ナビゲーションに近いパフォーマンスレベルに達する。
- 参考スコア(独自算出の注目度): 32.82868873992346
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Humans can effortlessly localize the direction of a sound source and integrate it with visual cues for reasoning, yet this remains challenging for embodied agents. In particular, it is still unclear how to effectively evaluate and model spatial audio understanding in embodied settings. To address this gap, we introduce \textbf{OmniEchoBench}, a unified benchmark for spatial audio-visual perception and audio-vision-language navigation. OmniEchoBench comprises six tasks over 197 real-world spatial audio-visual scenes, 2,972 question-answer pairs, and 900 navigation samples with first-order ambisonics (FOA) audio collected from 30 real-world environments. To enable scalable training supervision, we develop a controllable rendering pipeline for spatial audio. It preserves geometric consistency among sound sources, visual observations, and agent trajectories. Building on this, we propose \textbf{OmniEcho}, a spatially aware omni-modal model. It introduces an FOA spatial encoder alongside a pretrained semantic audio pathway. Extensive experiments show that OmniEcho achieves state-of-the-art performance on spatial audio-visual perception. For our sound-guided navigation, OmniEcho reaches a performance level close to that of traditional vision-language navigation. These results demonstrate that spatial audio can serve as a valuable signal for embodied scene reasoning and navigation, while also highlighting fine-grained spatial localization and distance estimation as important open challenges. Our code and data will be available in https://github.com/PKU-VaLuE-Lab/OmniEcho/tree/main
- Abstract(参考訳): 人間は、音源の方向を力ずくでローカライズし、推論のための視覚的手がかりと統合することができる。
特に,具体的環境下で空間的音声理解を効果的に評価し,モデル化する方法はいまだ不明である。
このギャップに対処するために,空間的音声・視覚知覚と音声・視覚言語ナビゲーションのための統一ベンチマークである \textbf{OmniEchoBench} を導入する。
OmniEchoBenchは、現実世界の空間的オーディオ映像シーン197件、質問応答ペア2,972件、および30の現実世界環境から収集された1次アンビソニクス(FOA)オーディオを用いた900件のナビゲーションサンプルからなる。
拡張性のあるトレーニング管理を実現するため,空間オーディオのための制御可能なレンダリングパイプラインを開発した。
音源、視覚的観察、エージェント・トラジェクトリー間の幾何的整合性を保つ。
これに基づいて,空間的に認識されるオムニモーダルモデルである「textbf{OmniEcho}」を提案する。
FOA空間エンコーダと事前訓練されたセマンティックオーディオパスを導入する。
広汎な実験により,OmniEchoは空間的聴覚・視覚知覚において最先端の性能を発揮することが示された。
音声誘導ナビゲーションでは、OmniEchoは従来の視覚言語ナビゲーションに近いパフォーマンスレベルに達する。
これらの結果から,空間音声はシーン推論とナビゲーションの具体化に有用な信号であり,空間的局所化と距離推定が重要な課題であることが示された。
私たちのコードとデータはhttps://github.com/PKU-VaLuE-Lab/OmniEcho/tree/mainで公開されます。
関連論文リスト
- Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding [58.490304707575596]
本稿では,SO-Encoderを実装し,既存の大規模言語モデルに第1次アンビニクス(FOA)空間オーディオを注入する軽量な手法を提案する。
実験の結果,空間音響理解タスクにおいて,既存のオープンソースのLarge Audio-Language Models (LALM) とOmni LLMモデルよりも優れていることがわかった。
論文 参考訳(メタデータ) (2026-06-09T11:50:06Z) - Semantic Audio-Visual Navigation in Continuous Environments [20.046962371381763]
音響視覚ナビゲーションにより、エンボディエージェントは聴覚と視覚の両方の手がかりを利用することで、音を放出するターゲットに向かって移動することができる。
SAVNCE(Audio-Visual Navigation in Continuous Environments)を導入し、エージェントは3次元空間で自由に動き、時間的・空間的に整合したオーディオ視覚ストリームを知覚することができる。
本研究では,空間的および意味的な目標表現を共同で符号化し,過去のコンテキストを自己運動の手がかりと統合し,メモリ拡張された目標推論を可能にするマルチモーダルトランスフォーマーモデルMAGNetを提案する。
論文 参考訳(メタデータ) (2026-03-20T05:49:50Z) - SpatialV2A: Visual-Guided High-fidelity Spatial Audio Generation [15.901895888187711]
BinauralVGSoundは、空間的に認識されたビデオ・オーディオ生成をサポートするために設計された、最初の大規模ビデオ・バイオーラルオーディオデータセットである。
このフレームワークには視覚誘導型音響空間化モジュールが組み込まれており、生成したオーディオが現実的な空間特性と層状空間深さを示すことを保証する。
論文 参考訳(メタデータ) (2026-01-21T14:14:37Z) - AV-GS: Learning Material and Geometry Aware Priors for Novel View Acoustic Synthesis [62.33446681243413]
ビュー音響合成は、音源が3Dシーンで出力するモノのオーディオを考慮し、任意の視点でオーディオを描画することを目的としている。
既存の手法では、音声合成の条件として視覚的手がかりを利用するため、NeRFベースの暗黙モデルが提案されている。
本研究では,シーン環境全体を特徴付ける新しいオーディオ・ビジュアル・ガウス・スプレイティング(AV-GS)モデルを提案する。
AV-GSが実世界のRWASやシミュレーションベースのSoundSpacesデータセットの既存の代替品よりも優れていることを検証する。
論文 参考訳(メタデータ) (2024-06-13T08:34:12Z) - BAT: Learning to Reason about Spatial Sounds with Large Language Models [45.757161909533714]
本稿では,空間的シーン解析モデルの音知覚能力と大規模言語モデル(LLM)の自然言語推論能力を組み合わせたBATを提案する。
実験では,空間音知覚と推論の両方において,BATの優れた性能を示す。
論文 参考訳(メタデータ) (2024-02-02T17:34:53Z) - Audio-Visual Spatial Integration and Recursive Attention for Robust
Sound Source Localization [13.278494654137138]
人間は、音源を見つけるための空間的手がかりとして、オーディオと視覚の両方のモダリティを利用する。
両モードの空間的手がかりを統合した音声・視覚空間統合ネットワークを提案する。
提案手法はより堅牢な音源定位を実現する。
論文 参考訳(メタデータ) (2023-08-11T11:57:58Z) - SoundSpaces 2.0: A Simulation Platform for Visual-Acoustic Learning [127.1119359047849]
SoundSpaces 2.0は3D環境のためのオンザフライ幾何ベースのオーディオレンダリングのためのプラットフォームである。
任意のマイク位置から取得した任意の音に対して、非常にリアルな音響を生成する。
SoundSpaces 2.0は、視聴と聴取の両方が可能な知覚システムのより広範な研究を促進するために公開されている。
論文 参考訳(メタデータ) (2022-06-16T17:17:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。