論文の概要: CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation
- arxiv url: http://arxiv.org/abs/2609.17420v1
- Date: Sat, 25 Jul 2026 03:36:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.541913
- Title: CTAN: Cycle-Temporal Attention Network for Embodied Audio-Visual Navigation
- Title(参考訳): CTAN:Embodied Audio-Visual NavigationのためのCycle-Temporal Attention Network
- Abstract要約: この研究は、アクティブなセマンティック・エンハンスド・フュージョンのために設計されたフレームワークであるCycle-Temporal Attention Network (CTAN)を提示する。
提案手法は,成功率(SR),経路長重み付き成功率(SPL),シーンナビゲーション精度(SNA)の観点から,従来の音声視覚ナビゲーション手法よりも優れた性能を実現する。
- 参考スコア(独自算出の注目度): 4.024922311680863
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Audio-visual embodied navigation equips robots with the capability to infer the locations of sound sources by integrating visual inputs and acoustic information (e.g., depth observations and binaural audio cues). The core challenge lies in establishing effective semantic interactions across heterogeneous modalities (which exhibit distinct feature distributions). Existing feature fusion strategies, however, often rely on simple multimodal aggregation and therefore fail to capture the underlying geometric and semantic relationships, leading to information degradation in complex environments. To overcome these limitations, this work presents the Cycle-Temporal Attention Network (CTAN), a framework designed for active semantic-enhanced fusion (rather than straightforward multimodal combination). Specifically, the proposed Audio-Visual Reconstruction Cross-Attention (AVRCA) module employs a bidirectional cycle-consistency constraint (between visual and acoustic representations) to reinforce the spatial semantic attributes of both modalities, thereby facilitating more robust cross-modal interaction. Additionally, we design a Temporal Cross-Modal Memory (TCMM) mechanism to dynamically integrate real-time enhanced multimodal features with historical context, reducing performance drops caused by auditory dead zones. Experimental results obtained on the Replica and Matterport3D benchmarks indicate that the proposed approach achieves superior performance over previous audio-visual navigation methods in terms of success rate (SR), success weighted by path length (SPL), and scene navigation accuracy (SNA).
- Abstract(参考訳): 視覚的ナビゲーションは、視覚入力と音響情報(例えば、深度観察とバイノーラルオーディオキュー)を統合することで、音源の位置を推測する能力を持つ。
中心となる課題は、異種多様性(特徴分布が異なる)にまたがる効果的な意味的相互作用を確立することである。
しかし、既存の特徴融合戦略は、しばしば単純なマルチモーダルアグリゲーションに依存し、従って、基礎となる幾何学的および意味的な関係を捉えることができず、複雑な環境における情報劣化につながる。
これらの制限を克服するために、本研究では、(単純なマルチモーダル結合ではなく)アクティブなセマンティック・エンハンスド・フュージョンのために設計されたフレームワークであるCycle-Temporal Attention Network (CTAN)を提示する。
具体的には、AVRCA(Audio-Visual Reconstruction Cross-Attention)モジュールは、両モードの空間的意味特性を強化するために、双方向のサイクル整合性制約(視覚的および音響的表現)を用いて、より堅牢なクロスモーダル相互作用を促進する。
さらに、時間的クロスモーダルメモリ(TCMM)機構を設計し、時間的拡張マルチモーダル特徴と歴史的文脈を動的に統合し、聴覚的デッドゾーンによる性能低下を低減する。
Replica と Matterport3D ベンチマークで得られた実験結果から,提案手法は従来の音声視覚ナビゲーション手法よりも,成功率 (SR), 経路長重み付き成功 (SPL), シーンナビゲーション精度 (SNA) の面で優れていたことが示唆された。
関連論文リスト
- Residual Cross-Modal Fusion Networks for Audio-Visual Navigation [17.19858148800535]
本稿では、補間モデリングと微粒化アライメントを実現するために、音声と視覚ストリーム間の残差相互作用を導入するクロスモーダル残差融合ネットワークを提案する。
ReplicaとMatterport3Dデータセットの実験では、CRFNは最先端の核融合ベースラインを著しく上回り、より強力なクロスドメインの一般化を実現している。
論文 参考訳(メタデータ) (2026-01-11T12:11:36Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - Frequency-Domain Decomposition and Recomposition for Robust Audio-Visual Segmentation [60.9960601057956]
本稿では2つの主要なモジュールからなる周波数対応オーディオ・ビジュアルコンポスタ(FAVS)フレームワークを紹介する。
FAVSフレームワークは、3つのベンチマークデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-09-23T12:33:48Z) - AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition [2.4842074869626396]
双方向モダリティ向上に基づく新しいAVSRフレームワークAD-AVSRを提案する。
具体的には、まず、複数の視点から音声表現を豊かにするための音声二重ストリーム符号化方式を導入する。
我々は、無関係または弱相関のオーディオ視覚対をフィルタリングするために閾値に基づく選択機構を採用する。
論文 参考訳(メタデータ) (2025-08-11T04:23:08Z) - AVadCLIP: Audio-Visual Collaboration for Robust Video Anomaly Detection [57.649223695021114]
本稿では,ロバストなビデオ異常検出に音声と視覚の協調を利用する,弱教師付きフレームワークを提案する。
本フレームワークは,複数のベンチマークにおいて優れた性能を示し,オーディオ統合により異常検出精度が大幅に向上する。
論文 参考訳(メタデータ) (2025-04-06T13:59:16Z) - Locality-aware Cross-modal Correspondence Learning for Dense Audio-Visual Events Localization [50.122441710500055]
オーディオ・ビジュアル・イベント(DAVE)のための局所性を考慮したクロスモーダル対応学習フレームワークLoCoについて述べる。
LoCo は局所対応特徴 (LCF) 変調を適用し、モダリティ共有セマンティクスに焦点を合わせるために単調エンコーダを強制する。
さらに、データ駆動方式で注意領域を動的に調整するローカル適応クロスモーダル(LAC)インタラクションをカスタマイズする。
論文 参考訳(メタデータ) (2024-09-12T11:54:25Z) - Joint Multimodal Transformer for Emotion Recognition in the Wild [49.735299182004404]
マルチモーダル感情認識(MMER)システムは、通常、単調なシステムよりも優れている。
本稿では,キーベースのクロスアテンションと融合するために,ジョイントマルチモーダルトランス (JMT) を利用するMMER法を提案する。
論文 参考訳(メタデータ) (2024-03-15T17:23:38Z) - Improving Audio-Visual Segmentation with Bidirectional Generation [40.78395709407226]
音声・視覚的セグメンテーションのための双方向生成フレームワークを提案する。
この枠組みは、物体の視覚的特徴と関連する音との堅牢な相関関係を確立する。
また、時間力学を扱う暗黙の体積運動推定モジュールも導入する。
論文 参考訳(メタデータ) (2023-08-16T11:20:23Z) - Multi-Modal Perception Attention Network with Self-Supervised Learning
for Audio-Visual Speaker Tracking [18.225204270240734]
音声と視覚の両方を用いた話者追跡のための新しいマルチモーダル・パーセプション・トラッカー(MPT)を提案する。
MPTは標準データセットと排他データセットでそれぞれ98.6%と78.3%のトラッキング精度を達成した。
論文 参考訳(メタデータ) (2021-12-14T14:14:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。