論文の概要: A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition
- arxiv url: http://arxiv.org/abs/2609.30160v1
- Date: Thu, 24 Sep 2026 17:17:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.154931
- Title: A Training Criterion with Token-Level Tolerance to Transcription Ambiguity for Automatic Speech Recognition
- Title(参考訳): 自動音声認識における音素レベル不明瞭度に耐性のある訓練基準
- Abstract要約: Omni-temporal Classification (OTC)は、接続性時間分類グラフにワイルドカードパスを追加することでノイズを許容する。
ワイルドカードの弧をトークンの粒度に移動するので、残りの単語が管理されている間は、サポートされていないトークンをバイパスすることができる。
トークンレベルのモデルでは,CTCよりもワイルドカード・バイパスの確率が有意に高いことを示す。
- 参考スコア(独自算出の注目度): 21.592555573372056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition is typically trained assuming that the reference transcript is the only valid labeling of an utterance, yet even nominally verbatim transcripts contain localized differences in pronunciation, spelling, or lexical realization that the acoustics do not uniquely determine. Omni-temporal Classification (OTC) tolerates such noise by adding wildcard paths to the connectionist temporal classification (CTC) alignment graph, but its word-level arcs are too coarse, since bypassing one unsupported token discards supervision for the whole word. We move wildcard arcs to token granularity so unsupported tokens can be bypassed while the rest of the word stays supervised, and we combine token- and word-level arcs as complementary escape paths. Across 19 languages and three corpora, token-level OTC improves over CTC on all 25 tasks. We also replace epoch-indexed relaxation of the wildcard weights with a predictive-entropy-indexed schedule, which performs comparably while reducing dependence on training length. Combining this schedule with the hybrid graph gives the lowest mean word error rate (WER) on every corpus and a 9.45% average relative WER reduction over CTC. Independent validator transcriptions show that token-level models place significantly more wildcard-bypass probability than CTC on disputed characters, indicating that token-level tolerance targets localized transcript ambiguity.
- Abstract(参考訳): 音声認識は通常、参照文字が発話の唯一の有効なラベル付けであると仮定して訓練されるが、名目上は発音、綴り、語彙的実現の局所的な違いを含む。
オムニ時間分類(Omni-temporal Classification、OTC)は、接続性時間分類(CTC)アライメントグラフにワイルドカードパスを追加することで、そのようなノイズを許容するが、単語単位の弧が粗い。
我々はワイルドカードの弧をトークンの粒度に移動するので、単語の残りが管理されている間は、隠蔽トークンをバイパスすることができ、トークンとワードレベルの弧を補完的なエスケープパスとして組み合わせる。
19言語と3つのコーパス、トークンレベルのOCCは、25のタスクすべてにおいてCTCよりも改善されている。
また,ワイルドカード重量のエポックインデクシングを予測エントロピーインデクシングスケジュールに置き換えた。
このスケジュールとハイブリッドグラフを組み合わせることで、各コーパスにおける平均単語誤り率(WER)が低く、CTCよりも平均で9.45%減少する。
独立したバリケーター転写は、トークンレベルのモデルが、紛争文字のCTCよりもワイルドカードバイパス確率が著しく高く、トークンレベルの寛容が局所的な転写の曖昧さを標的としていることを示している。
関連論文リスト
- Decoding silent reading from non-invasive EEG [0.0]
ドライエレクトロド脳波の393ランにわたる濃密にサンプリングされた1人の参加者から記録された24万ワードのオープンボキャブラリ解析を行った。
復号化は偶然よりも確実に行われ、中頻度で稀な単語に拡張され、飽和の兆候のないトレーニングデータボリュームで対数的にスケールされた。
これらの結果から,オープン語彙の単語レベル情報はサイレントリーディング中に脳波から復元可能であり,復号化は飽和ではなくデータ制限であることがわかった。
論文 参考訳(メタデータ) (2026-08-20T15:41:05Z) - Content is What Remains: Invariant Speech Tokenization from Parallel Utterances [8.166364251367627]
PINTはSSLエンコーダを微調整し、並列発話におけるアライメント損失と、この共有残基を蒸留するために拡張する。
ASRテキストとは異なり、PINTトークンはフレームレベルの時間的グラウンドを保持し、オーディオコーデックのドロップインセマンティックターゲットとして機能する。
論文 参考訳(メタデータ) (2026-07-21T12:19:38Z) - Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing [8.921166277011347]
モデルが既に両方のスタイルを符号化していることを示し、その課題はアクティベーションを制御することである。
パラレルな冗長/意図された転写文字ペアで訓練されたカバレッジ対応デコーダタスクトークンを用いて、ドイツの拡散F1を10%から79%ゼロショットに引き上げる。
完全な英語のみの微調整は、動詞の精度、拡散検出、および両方の言語にわたる意図されたモードの品質において、すべてのベースラインを超えている。
論文 参考訳(メタデータ) (2026-07-21T10:19:17Z) - Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition [61.39209522608919]
統一音声認識は、音声、視覚、および聴覚の音声認識のための単一のモデルを訓練するための半教師付きフレームワークとして登場した。
そこでは,CTCの擬似ラベルをアテンションターゲットを生成するためにデコーダに入力するCTC駆動型教師強制方式を提案する。
CTCとCTC駆動のアテンション擬似ラベルは同じ長さであるため、デコーダは両方を同時に予測できる。
論文 参考訳(メタデータ) (2026-02-22T19:38:21Z) - DYNAC: Dynamic Vocabulary based Non-Autoregressive Contextualization for Speech Recognition [40.3155669350442]
CB (Contextual biasing) は、まれなフレーズと見えないフレーズの自動音声認識を改善する。
近年、動的語彙を導入し、文脈句を自己回帰(AR)モデルで拡張可能なトークンとして表現している。
本稿では動的語彙を中間層に統合する自己条件付きCTC法であるDYNACを提案する。
論文 参考訳(メタデータ) (2025-05-31T06:53:25Z) - Is Less More? Exploring Token Condensation as Training-free Test-time Adaptation [43.09801987385207]
対照的に、CLIP(Contrastive Language- Image Pretraining)は、一般化可能な画像表現の学習において優れているが、特定のデータセットのゼロショット推論では不足することが多い。
テスト時間適応(TTA)は、正規化レイヤやコンテキストプロンプトなどのコンポーネントを調整することでこの問題を軽減するが、通常は大きなバッチサイズと広範な拡張を必要とする。
本稿では,TCA(Token Condensation as Adaptation)を提案する。
論文 参考訳(メタデータ) (2024-10-16T07:13:35Z) - Alternative Pseudo-Labeling for Semi-Supervised Automatic Speech
Recognition [49.42732949233184]
ラベル付きデータが不十分な場合、擬似ラベル技術による半教師付き学習は自動音声認識の性能を大幅に向上させることができる。
損失関数のグラウンドトルースとしてノイズラベルを取ると、最適以下の性能が得られる。
そこで我々は,ノイズの多い擬似ラベル問題に対処するために,代替擬似ラベル方式という新しい枠組みを提案する。
論文 参考訳(メタデータ) (2023-08-12T12:13:52Z) - Cross-domain Speech Recognition with Unsupervised Character-level
Distribution Matching [60.8427677151492]
2つの領域における各文字間の微粒化適応を行うための文字レベルの分布マッチング手法であるCMatchを提案する。
Libri-Adaptデータセットを用いた実験の結果,提案手法はクロスデバイスとクロス環境の両方で14.39%,16.50%の単語誤り率(WER)を低減できることがわかった。
論文 参考訳(メタデータ) (2021-04-15T14:36:54Z) - Fast End-to-End Speech Recognition via a Non-Autoregressive Model and
Cross-Modal Knowledge Transferring from BERT [72.93855288283059]
LASO (Listen Attentively, and Spell Once) と呼ばれる非自動回帰音声認識モデルを提案する。
モデルは、エンコーダ、デコーダ、および位置依存集合体(PDS)からなる。
論文 参考訳(メタデータ) (2021-02-15T15:18:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。