論文の概要: ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion
- arxiv url: http://arxiv.org/abs/2609.26648v2
- Date: Thu, 24 Sep 2026 11:09:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.325021
- Title: ROAM-ASD: Robust Open-World Active Speaker Detection with Flexible Multimodal Fusion
- Title(参考訳): ROAM-ASD:フレキシブルマルチモーダルフュージョンを用いたロバストオープンワールドアクティブスピーカ検出
- Abstract要約: ROAM-ASDは、音声、フルフェイス、きめ細かい口の表現を共同でモデル化する堅牢なフレームワークである。
5つのアクティブな話者検出ベンチマークで最先端のパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 23.43222157376115
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Active speaker detection (ASD) requires reliable association between visible faces and acoustic speech, yet existing systems often degrade under challenging domains or incomplete observations. We introduce ROAM-ASD, a robust audiovisual framework that jointly models audio, full-face, and fine-grained mouth representations. A unified joint self-attention mechanism processes all input streams together with modality-agnostic query tokens, enabling direct interaction among available modality inputs. Modality dropout further improves robustness when input streams are unavailable. ROAM-ASD achieves state-of-the-art performance across five ASD benchmarks: 98.8% mAP on WASD, 87.9% on UniTalk, 96.5% on AVA, 99.3% on ASW, and 98.2% on Talkies, improving over previous best systems by 5.1, 4.7, 0.9, 1.0, and 2.1 mAP points, respectively. ROAM-ASD also substantially improves zero-shot cross-dataset generalization and remains robust to missing observations.
- Abstract(参考訳): アクティブ話者検出(ASD)は、可視顔と音響音声の信頼性の高い関連性を必要とするが、既存のシステムは、しばしば挑戦的な領域や不完全な観察の下で劣化する。
ROAM-ASDは, 音声, 顔, 口のきめ細やかな表現を共同でモデル化する, 頑健な音響視覚フレームワークである。
統合された結合自己保持機構は、すべての入力ストリームをモダリティに依存しないクエリトークンと共に処理し、利用可能なモダリティ入力間の直接相互作用を可能にする。
モダリティのドロップアウトは、入力ストリームが利用できないときの堅牢性をさらに向上する。
ROAM-ASDは、WASD の98.8% mAP、UniTalk の87.9%、AVA の96.5%、ASW の99.3%、Talkies の98.2%の5.1、4.7、0.9、1.0、および2.1 mAP の5つのベンチマークで最先端のパフォーマンスを達成している。
ROAM-ASDはまた、ゼロショットのクロスデータセットの一般化を著しく改善し、観測の欠如に対して頑健である。
関連論文リスト
- GateFusion: Hierarchical Gated Cross-Modal Fusion for Active Speaker Detection [19.80016468034245]
GateFusionは、強力な事前訓練された単調エンコーダと階層型Gated Fusion Decoder(HiGate)を組み合わせた新しいアーキテクチャである。
HiGateは、Transformerのバックボーンの複数の層で、1つのモードからもう1つのモードにコンテキスト特徴を適応的に注入することで、プログレッシブで多次元の融合を可能にする。
論文 参考訳(メタデータ) (2025-12-17T18:56:52Z) - ASDA: Audio Spectrogram Differential Attention Mechanism for Self-Supervised Representation Learning [57.67273340380651]
実験の結果,ASDAモデルは複数のベンチマークでSOTA(State-of-the-art)性能を達成できた。
これらの結果は、ASDAの音声タスクにおける有効性を強調し、より広範なアプリケーションへの道を開いた。
論文 参考訳(メタデータ) (2025-07-03T14:29:43Z) - EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss [8.320201598083022]
エゴセントリックビデオにおけるアクティブな話者検出(ASD)は、不安定な視点、動きのぼやけ、オフスクリーン音声源などによる固有の課題を提示する。
本稿では,部分的に凍結したWhisperオーディオエンコーダと,微調整されたAV-HuBERTビジュアルバックボーンを統合する効果的なモデルであるPAIR-Netを紹介する。
実世界の自我中心の条件下では,事前学習音声の付加価値とアライメントに基づくアライメント・ベース・フュージョンが重要である。
論文 参考訳(メタデータ) (2025-06-02T20:49:52Z) - DeepSound-V1: Start to Think Step-by-Step in the Audio Generation from Videos [4.452513686760606]
マルチモーダル大言語モデル(MLLM)の内部連鎖(CoT)を利用したビデオから音声を生成するフレームワークを提案する。
対応するマルチモーダル推論データセットを構築し、音声生成における初期推論の学習を容易にする。
実験では,提案手法が生成した音声の不一致(発声)の低減に有効であることを示す。
論文 参考訳(メタデータ) (2025-03-28T07:56:19Z) - MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition [62.89464258519723]
異なるレベルのオーディオ/視覚エンコーダに融合することで、各モードの表現を促進する多層クロスアテンション融合に基づくAVSR手法を提案する。
提案手法は第1位システムを超え,新たなSOTA cpCERの29.13%をこのデータセット上に構築する。
論文 参考訳(メタデータ) (2024-01-07T08:59:32Z) - Exploring Self-supervised Pre-trained ASR Models For Dysarthric and
Elderly Speech Recognition [57.31233839489528]
本稿では,TDNN と Conformer ASR システムにドメイン適応型SSL事前訓練モデルを統合する手法について検討する。
論文 参考訳(メタデータ) (2023-02-28T13:39:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。