論文の概要: VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness
- arxiv url: http://arxiv.org/abs/2607.08112v1
- Date: Thu, 09 Jul 2026 04:54:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.416095
- Title: VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness
- Title(参考訳): VSRo-200:スーパービジョンとマルチモーダルロバストネスを学習するためのルーマニアの視覚音声認識データセット
- Abstract要約: ルーマニア語で視覚音声認識のための大規模なデータセットであるVSRo-200を紹介する。
全てのサンプルは、微調整されたルーマニアのASRモデルによって生成された擬似ラベルで注釈付けされる。
100時間のサブセットは人間によって書き起こされ、監督品質の制御された分析を可能にする。
- 参考スコア(独自算出の注目度): 42.17343824099138
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce VSRo-200, the first large-scale dataset for visual speech recognition (lip reading) in Romanian, comprising 200 hours of real-world podcast videos. All samples are annotated with pseudo-labels generated by a fine-tuned Romanian ASR model, while a subset of 100 hours is additionally transcribed by humans, enabling controlled analysis of supervision quality under a unified framework. Building on this dataset, we establish a benchmark for visual speech recognition in low-resource settings. We systematically study the impact of supervision quality, showing that while human annotations provide better performance at fixed data scales, pseudo-labels enable continued improvements through scalability. We further evaluate robustness under domain shift using curated out-of-distribution (OOD) test sets, and analyze audio-visual speech recognition (AVSR) under noisy conditions, where multimodal fusion significantly improves robustness compared to audio-only models. Finally, we demonstrate that representations learned on VSRo-200 transfer effectively to the LRRo benchmark for isolated word recognition, substantially outperforming previously reported results. Overall, VSRo-200 provides a new testbed for studying supervision, domain generalization, and multimodal fusion in low-resource visual speech recognition.
- Abstract(参考訳): 我々は,ルーマニア語で最初の視覚音声認識のための大規模データセットであるVSRo-200を紹介した。
すべてのサンプルは、微調整されたルーマニアのASRモデルによって生成された擬似ラベルで注釈付けされ、また100時間のサブセットは、人間によって追加的に転写され、統一された枠組みの下で監督品質の制御分析を可能にする。
このデータセットに基づいて,低リソース環境下での視覚音声認識のためのベンチマークを構築した。
我々は、人間のアノテーションが固定されたデータスケールでより良いパフォーマンスを提供する一方で、擬似ラベルは拡張性を通じて継続的な改善を可能にすることを示すため、監督品質の影響を体系的に研究する。
さらに,時間外分布(OOD)テストセットを用いて領域シフト下でのロバスト性を評価し,雑音下での音声視覚音声認識(AVSR)の解析を行い,マルチモーダル融合は音声のみのモデルと比較してロバスト性を大幅に改善する。
最後に,VSRo-200で学習した表現をLRRoベンチマークに効果的に適用し,従来報告した結果よりもかなり優れていたことを示す。
全体として、VSRo-200は、低リソースの音声認識における監督、領域一般化、マルチモーダル融合を研究するための新しいテストベッドを提供する。
関連論文リスト
- RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks [42.17343824099138]
我々は、自動音声認識(ASR)における一般化を改善するために設計されたルーマニア語音声データセットであるRO-N3WSを紹介する。
RO-N3WSは、放送ニュース、文学的オーディオブック、映画対話、子供の物語、会話ポッドキャストのスピーチから収集された126時間以上の音声を収録する。
我々は、ゼロショットと微調整の両方で最先端のASRシステムを評価し、表現型TSモデルで生成された合成データを用いて制御された比較を行う。
論文 参考訳(メタデータ) (2026-03-02T20:14:31Z) - A SUPERB-Style Benchmark of Self-Supervised Speech Models for Audio Deepfake Detection [2.432576583937997]
Spoof-SUPERBはオーディオディープフェイク検出のためのベンチマークである。
生成性,差別性,およびスペクトログラムに基づくアーキテクチャにまたがる20のSSLモデルを評価する。
論文 参考訳(メタデータ) (2026-03-02T05:45:55Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer [59.57249127943914]
本稿では,複数の改良を加えた多言語音声認識モデルを提案する。
我々は、6つの異なる言語に対する音声視覚訓練データの量を増やし、重複しない多言語データセットの自動書き起こしを生成する。
提案モデルでは, LRS3データセット上での新たな最先端性能を実現し, WERは0.8%に達した。
論文 参考訳(メタデータ) (2024-03-14T01:16:32Z) - AV-RIR: Audio-Visual Room Impulse Response Estimation [49.469389715876915]
室内インパルス応答(RIR)の正確な推定は,音声処理やAR/VR応用において重要である。
本稿では,与えられた残響音声信号と対応する環境の視覚的手がかりからRIRを正確に推定する,新しいマルチモーダルマルチタスク学習手法であるAV-RIRを提案する。
論文 参考訳(メタデータ) (2023-11-30T22:58:30Z) - VILAS: Exploring the Effects of Vision and Language Context in Automatic
Speech Recognition [18.19998336526969]
ViLaS(Vision and Language into Automatic Speech Recognition)は、CIF(Continuous Integration-and-fire)機構に基づく新しいマルチモーダルASRモデルである。
視覚と言語を統合することの効果を探るため、中国語と英語の両バージョンでマルチモーダルコンテキストキューを備えたマルチモーダルASRデータセットであるVSDialを開発した。
論文 参考訳(メタデータ) (2023-05-31T16:01:20Z) - CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command
Recognition [91.33781557979819]
新しいデータセットであるCantonese In-car Audio-Visual Speech Recognition (CI-AVSR)を導入する。
カントン語話者30人が記録した200の車載コマンドの4,984サンプル(8.3時間)で構成されている。
当社のデータセットのクリーンバージョンと拡張バージョンの両方について、詳細な統計情報を提供しています。
論文 参考訳(メタデータ) (2022-01-11T06:32:12Z) - An Exploration of Self-Supervised Pretrained Representations for
End-to-End Speech Recognition [98.70304981174748]
本稿では,事前訓練された音声表現の一般応用,高度なエンドツーエンド自動音声認識(E2E-ASR)モデルに焦点をあてる。
いくつかの事前訓練された音声表現を選択し、E2E-ASRのための様々なオープンソースおよび公開コーパスの実験結果を示す。
論文 参考訳(メタデータ) (2021-10-09T15:06:09Z) - Rethinking Evaluation in ASR: Are Our Models Robust Enough? [30.114009549372923]
一般に、残響と付加音の増補により、ドメイン間の一般化性能が向上することを示す。
ベンチマークを十分に使うと、平均単語誤り率(WER)のパフォーマンスが実世界のノイズの多いデータのパフォーマンスに良いプロキシを提供することを示した。
論文 参考訳(メタデータ) (2020-10-22T14:01:32Z) - Deep Speaker Embeddings for Far-Field Speaker Recognition on Short
Utterances [53.063441357826484]
深層話者埋め込みに基づく話者認識システムは,制御条件下での大幅な性能向上を実現している。
制御されていない雑音環境下での短い発話に対する話者検証は、最も困難で要求の高いタスクの1つである。
本稿では,a)環境騒音の有無による遠距離話者検証システムの品質向上,b)短時間発話におけるシステム品質劣化の低減という2つの目標を達成するためのアプローチを提案する。
論文 参考訳(メタデータ) (2020-02-14T13:34:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。