論文の概要: Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge
- arxiv url: http://arxiv.org/abs/2609.23462v2
- Date: Wed, 23 Sep 2026 07:05:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.666772
- Title: Long-Tail Rebalancing for Non-Verbal Vocalization-Aware ASR: A Track 1 System for the NVVSpeech Challenge
- Title(参考訳): NVVSpeech チャレンジのためのトラック1システム
- Abstract要約: 非言語発声(NVV)は重要なパラ言語情報を持っている。
ISCSLP NVVSpeech Challengeは、語彙内容と16のNVVカテゴリーを共同で転写する必要がある。
本稿では,データ中心のNVV対応ASRパイプラインについて,データ間のラベル調和と2段階サンプリングスケジュールに基づく。
- 参考スコア(独自算出の注目度): 12.418031577475448
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Non-verbal vocalizations (NVVs) carry important paralinguistic information but are often omitted by conventional automatic speech recognition (ASR) systems. The ISCSLP NVVSpeech Challenge requires joint transcription of lexical content and 16 NVV categories under limited and highly imbalanced supervision. We present a data-centric NVV-aware ASR pipeline based on cross-dataset label harmonization and a two-stage sampling schedule. We map heterogeneous source labels to the official taxonomy and exclude samples without a reliable mapping. Our schedule first uses square-root category sampling to moderate the long-tailed distribution and then applies uniform-category fine-tuning. On a fixed local validation split, square-root category sampling performs best among the tested single-stage settings. The final two-stage system obtains an official score of 63.86 and ranks fourth in Track 1.
- Abstract(参考訳): 非言語発声(NVV)は、重要なパラ言語情報を持っているが、従来の自動音声認識(ASR)システムでは省略されることが多い。
ISCSLP NVVSpeech Challengeは、限定的でバランスの取れない監督の下で、語彙内容と16のNVVカテゴリーを共同で転写する必要がある。
本稿では,データ中心のNVV対応ASRパイプラインについて,データ間のラベル調和と2段階サンプリングスケジュールに基づく。
異質なソースラベルを公式分類にマッピングし、信頼できるマッピングなしでサンプルを除外する。
我々のスケジュールは、まず正方形のカテゴリサンプリングを用いて、長い尾の分布を適度に調整し、一様カテゴリーの微調整を施す。
固定された局所検証分割では、立方根カテゴリサンプリングがテストされた単一ステージ設定の中で最高に機能する。
最終2段は63.86で、トラック1では4位である。
関連論文リスト
- Modeling, Scaling, and Decoding: Optimizing Controllable Speech Generation with Nonverbal Vocalizations [13.518435276876973]
我々は、連続音声の潜時をモデル化し、16のターゲットNVVカテゴリを専用のTo-kenとしてエンコードし、音声の中間発声を発話境界から区別するために停止予測を適用する、NVV対応のDiTARシステムを開発した。
公式の重み付きバイリンガルスコアは62.786で、マンダリンでは第1位、英語では第2位、ISCSLP 2026 NVVSpeech Challengeでは第2位となっている。
論文 参考訳(メタデータ) (2026-09-13T01:48:37Z) - Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation [1.0323063834827415]
最先端のテキストから音楽への生成システムは、膨大なプロプライエタリなデータセットと産業規模の計算に依存している。
本稿では、パイプライン全体を通して直接監視信号として、音声キャプチャアライメントスコアを扱うテキストスコア認識トレーニングを提案する。
論文 参考訳(メタデータ) (2026-06-05T15:24:36Z) - Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation [0.05219568203653524]
ASRアクセント適応のためのマルチモーダル整合性誘導型参照フリーデータ選択パイプラインを提案する。
パイプラインは、共有埋め込み空間における音声テキストアライメントと予測された単語エラー率の2つの基準自由信号を用いて、各仮説をスコアする。
単純なパーセンタイルベースの選択規則は、ノイズ発声を排除しながら微調整のための信頼できる擬似ラベルを保持する。
論文 参考訳(メタデータ) (2026-02-03T21:35:58Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Unsupervised Speech Recognition with N-Skipgram and Positional Unigram
Matching [67.98016412551245]
本稿では,新しいASRシステムであるESPUMを紹介する。
このシステムは、少数のサンプルから収集された位置ユニグラム統計と合わせて、低階N-スキップグラム(最大N=3)のパワーを利用する。
本モデルは,ASRと音素セグメンテーションにおける競合性能を示す。
論文 参考訳(メタデータ) (2023-10-03T19:05:32Z) - Balanced Classification: A Unified Framework for Long-Tailed Object
Detection [74.94216414011326]
従来の検出器は、分類バイアスによる長期データを扱う際の性能劣化に悩まされる。
本稿では,カテゴリ分布の格差に起因する不平等の適応的是正を可能にする,BAlanced CLassification (BACL) と呼ばれる統一フレームワークを提案する。
BACLは、さまざまなバックボーンとアーキテクチャを持つさまざまなデータセット間で、一貫してパフォーマンス改善を実現している。
論文 参考訳(メタデータ) (2023-08-04T09:11:07Z) - Transcription free filler word detection with Neural semi-CRFs [17.096140717566957]
uh" や "um" のような非言語的なフィラー語は、自然発声において一般的であり、ためらいや不確実性を表現する指標として機能する。
特定の非言語的なフィラー語を検出するためのこれまでの研究は、確立された商用自動音声認識(ASR)システムからの転写に大きく依存している。
本研究では,ASRシステムに依存しないフィラー語検出システムについて検討する。
論文 参考訳(メタデータ) (2023-03-11T18:17:03Z) - Automated classification of pre-defined movement patterns: A comparison
between GNSS and UWB technology [55.41644538483948]
リアルタイム位置情報システム(RTLS)は、人間の動きパターンからデータを収集することができる。
本研究の目的は、小さな領域における人間の動きパターンを分類する自動化された枠組みを設計し、評価することである。
論文 参考訳(メタデータ) (2023-03-10T14:46:42Z) - S3: Supervised Self-supervised Learning under Label Noise [53.02249460567745]
本稿では,ラベルノイズの存在下での分類の問題に対処する。
提案手法の核心は,サンプルのアノテートラベルと特徴空間内のその近傍のラベルの分布との整合性に依存するサンプル選択機構である。
提案手法は,CIFARCIFAR100とWebVisionやANIMAL-10Nなどの実環境ノイズデータセットの両方で,従来の手法をはるかに上回っている。
論文 参考訳(メタデータ) (2021-11-22T15:49:20Z) - Semi-Supervised Speech Recognition via Graph-based Temporal
Classification [59.58318952000571]
半教師付き学習は自己学習による自動音声認識において有望な結果を示した。
このアプローチの有効性は、主に擬似ラベルの精度に依存する。
N-bestリストの別のASR仮説は、ラベルなしの発話に対してより正確なラベルを提供することができる。
論文 参考訳(メタデータ) (2020-10-29T14:56:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。