論文の概要: AVSRBench: A Multi-Condition AVSR Benchmark
- arxiv url: http://arxiv.org/abs/2609.10366v1
- Date: Wed, 09 Sep 2026 15:58:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.099766
- Title: AVSRBench: A Multi-Condition AVSR Benchmark
- Title(参考訳): AVSRBench: マルチコンディションAVSRベンチマーク
- Authors: Rishabh Jain, Naomi Harte,
- Abstract要約: 映像のみのパフォーマンスは,放送領域を超えて急速に低下していることがわかった。
視覚的理解は90のプロファイルビューで著しく低下する。
話者調音は、小さなカメラシフトよりも重要なものである。
- 参考スコア(独自算出の注目度): 14.788453263873444
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While AVSR has achieved sub-1% word error rates on the standard LRS3 benchmark, its reliance on broadcast speech obscures whether this reflects true generalization or just domain adaptation. To investigate this gap, we evaluate three AVSR architectures across six conditions: controlled broadcast speech, fixed-grammar utterances, hyper-articulated Lombard speech, read speech from professional lipspeakers and non-professional speakers, and spontaneous multi-party video conversations. We find that visual-only performance deteriorates rapidly beyond broadcast domains, and audio-video fusion mainly benefits Lombard speech environments. Visual understanding degrades sharply at 90° profile views, with multimodal systems relying largely on acoustic fallback. Additionally, speaker articulation proves more critical than minor camera shifts, and LLM-based architectures suffer from poor out-of-domain generalization. Our work highlights a significant generalization gap in current AVSR research. To address this, we also introduce RoomReader-AV as a new benchmark for AVSR and release a unified data preprocessing pipeline to make comprehensive multi-condition evaluation accessible.
- Abstract(参考訳): AVSRは標準のLSS3ベンチマークで1%以下のワードエラー率を達成したが、放送音声への依存は、それが真の一般化を反映しているか、単にドメイン適応を反映しているかを曖昧にしている。
このギャップを解明するために、制御された放送音声、固定文法発話、高調波ロンバルド音声、プロの唇スピーカーと非プロの話者からの読み上げ音声、自発的なマルチパーティビデオ会話の3つの条件にわたるAVSRアーキテクチャを評価した。
映像のみの性能は放送領域を超えて急速に低下し,音声とビデオの融合はLombard音声環境に大きく影響している。
視覚的理解は90°のプロファイルビューで著しく低下し、マルチモーダルシステムは音響的なフォールバックに大きく依存する。
さらに、話者調音は小さなカメラシフトよりも重要であり、LLMベースのアーキテクチャはドメイン外一般化の貧弱さに悩まされている。
我々の研究は、現在のAVSR研究における大きな一般化のギャップを浮き彫りにしている。
また、AVSRの新しいベンチマークとしてRoomReader-AVを導入し、総合的なマルチ条件評価を可能にする統一データ前処理パイプラインをリリースする。
関連論文リスト
- Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition [13.444822626621706]
カンドールLR(Candor-LR)は、CANDORコーパスの1,656の自然なダイアドビデオ会議から派生した対話型ベンチマークである。
当社のカスタムデータ準備パイプラインでは,それぞれ713.5,10.1,60.1時間のトレーニング,検証,テストデータを取得しています。
論文 参考訳(メタデータ) (2026-09-09T16:14:29Z) - Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses [71.34350093068473]
本稿では,音声視覚音声認識(AVSR)における生成誤り訂正(GER)フレームワークの新たなパラダイムを提案する。
我々のフレームワークであるDualHypは、独立した自動音声認識(ASR)モデルと視覚音声認識(VSR)モデルから独立したN-best仮説を構成するために、大規模言語モデル(LLM)を強制する。
我々のフレームワークは、標準のASRベースラインよりもLRS2ベンチマークで57.7%のエラー率を獲得していますが、シングルストリームのGERアプローチでは10%のゲインしか達成できません。
論文 参考訳(メタデータ) (2025-10-15T08:27:16Z) - Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations [5.130705720747573]
本稿では,リアルタイム音声-視覚音声強調(AVSE)システムであるRAVENを提案する。
干渉する話者と背景雑音を抑えながら、画面上のターゲットスピーカを分離し、強化する。
我々の知る限り、これはリアルタイムAVSEシステムの最初のオープンソース実装である。
論文 参考訳(メタデータ) (2025-07-29T02:38:56Z) - Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition [39.206005299985605]
「我々はAVSRのための新しいGERパラダイム、AVGERを提案し、それを聴いて再び見るという概念に従っている。」
AVGERは、現在の主流のAVSRシステムと比較して、ワードエラー率(WER)を24%削減できる。
論文 参考訳(メタデータ) (2025-01-03T10:51:14Z) - Large Language Models are Strong Audio-Visual Speech Recognition Learners [53.142635674428874]
マルチモーダル・大規模言語モデル(MLLM)は,近年,多モーダル理解能力の強化により,研究の焦点となっている。
本稿では,Llama-AVSRを提案する。
我々は,最大公的なAVSRベンチマークであるLSS3に対する提案手法を評価し,WERが0.79%,AVSRが0.77%であるASRとAVSRのタスクに対して,新しい最先端の結果が得られることを示した。
論文 参考訳(メタデータ) (2024-09-18T21:17:27Z) - AV-RIR: Audio-Visual Room Impulse Response Estimation [49.469389715876915]
室内インパルス応答(RIR)の正確な推定は,音声処理やAR/VR応用において重要である。
本稿では,与えられた残響音声信号と対応する環境の視覚的手がかりからRIRを正確に推定する,新しいマルチモーダルマルチタスク学習手法であるAV-RIRを提案する。
論文 参考訳(メタデータ) (2023-11-30T22:58:30Z) - Cross-Modal Global Interaction and Local Alignment for Audio-Visual
Speech Recognition [21.477900473255264]
音声・視覚音声認識(AVSR)のための多言語間相互作用と局所アライメント(GILA)アプローチを提案する。
具体的には、A-Vの相補関係をモダリティレベルで捉えるためのグローバル相互作用モデルと、フレームレベルでのA-Vの時間的一貫性をモデル化するための局所アライメントアプローチを設計する。
我々のGILAは、公開ベンチマークのLSS3とLSS2で教師付き学習状況よりも優れています。
論文 参考訳(メタデータ) (2023-05-16T06:41:25Z) - Jointly Learning Visual and Auditory Speech Representations from Raw
Data [108.68531445641769]
RAVEnは視覚と聴覚の表現を協調的に学習する自己教師型マルチモーダルアプローチである。
我々の設計は、ビデオとオーディオの固有の違いによって駆動される非対称なw.r.t.である。
RAVEnは視覚音声認識における全自己指導手法を超越している。
論文 参考訳(メタデータ) (2022-12-12T21:04:06Z) - Discriminative Multi-modality Speech Recognition [17.296404414250553]
視覚は、しばしば音声音声認識(ASR)の相補的モダリティとして使用される。
本稿では,2段階音声認識モデルを提案する。
第1段階では、対象の音声を、対応する唇の動きの視覚情報から助けを借りて背景雑音から分離し、モデル「リスト」を明確にする。
第2段階では、音声モダリティは視覚的モダリティを再び組み合わせて、MSRサブネットワークによる音声の理解を深め、認識率をさらに向上させる。
論文 参考訳(メタデータ) (2020-05-12T07:56:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。