論文の概要: Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation Services
- arxiv url: http://arxiv.org/abs/2609.09889v1
- Date: Wed, 09 Sep 2026 08:45:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.956234
- Title: Leveraging Fine-grained Error Correction in Korean Speech Recognition for Consultation Services
- Title(参考訳): コンサルテーションサービスのための韓国語音声認識におけるきめ細かい誤り補正の活用
- Abstract要約: 本稿では,対話レベルのASR誤り訂正のための韓国初の大規模ベンチマークデータセットであるDasanCallDialを紹介する。
本研究では,韓国語音声認識テキストのテキストのみによる後編集フレームワークであるDe Detector-Gated Contextual Span Correction (DCSC)を提案する。
- 参考スコア(独自算出の注目度): 13.918566708247518
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Automatic Speech Recognition (ASR) technology is fundamental to customer service automation and large-scale transcription. However, even advanced ASR models exhibit inevitable errors in complex real-world environments such as call center conversations. When privacy restrictions preclude audio access, error correction must rely on text-based post-editing. Existing text-only approaches face significant challenges in low-resource languages, mainly due to a critical scarcity of annotated corpora and tailored correction methodologies. For Korean, this resource gap is particularly pronounced, as existing resources are predominantly designed for ASR training rather than text-based error correction. To address this, we introduce DasanCallDial, the first large-scale Korean benchmark dataset specifically curated for dialogue-level ASR error correction. Derived from genuine call center interactions, it comprises 1,974 dialogues with 115,460 utterances. Leveraging this resource, we propose Detector-Gated Contextual Span Correction (DCSC), a text-only post-editing framework for error-sparse Korean speech recognition transcripts. DCSC combines an encoder-based detector that first performs token-level error detection, followed by a language model-based corrector trained to rectify fine-grained span-level errors. Additionally, we employ dialogue-level context augmentation to enable the model to leverage discourse history for disambiguation. By employing multi-level granularity, our method achieves state-of-the-art performance, effectively overcoming the limitations of general LLMs in low-resource settings.
- Abstract(参考訳): ASR(Automatic Speech Recognition)技術は、カスタマーサービスの自動化と大規模な転写に欠かせない技術である。
しかし、高度なASRモデルでさえ、コールセンターの会話のような複雑な現実世界環境では避けられないエラーを示す。
プライバシー制限がオーディオアクセスを妨げる場合、エラー訂正はテキストベースの後編集に頼らなければならない。
既存のテキストのみのアプローチは、アノテートコーパスの欠如と調整された修正手法が主な原因で、低リソース言語において重大な課題に直面している。
韓国では、このリソースギャップは特に顕著であり、既存のリソースは主にテキストベースの誤り訂正ではなく、ASRトレーニング用に設計されている。
そこで本研究では,対話レベルのASR誤り訂正に特化した韓国初の大規模ベンチマークデータセットであるDasanCallDialを紹介する。
本物のコールセンターの対話から派生したもので、115,460発の対話を含む1,974発である。
本手法を応用して,韓国語音声認識文書のテキストのみによる後編集フレームワークであるDe Detector-Gated Contextual Span Correction (DCSC)を提案する。
DCSCは、まずトークンレベルのエラー検出を行うエンコーダベースの検出器と、さらに粒度の細かいスパンレベルのエラーを修正できるように訓練された言語モデルベースの修正器を組み合わせる。
さらに,談話履歴を曖昧さに活用するために,対話レベルの文脈拡張を用いる。
マルチレベルの粒度を用いることで,低リソース環境下でのLLMの限界を克服し,最先端の性能を実現する。
関連論文リスト
- Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation [53.844308305341166]
単一パスのASRフロントエンドと意味的訂正,意図のルーティング,推論に基づく編集を組み合わせた閉ループフレームワークである textbfAgentic ASR を提案する。
複数言語、名前付き集中型、コードスイッチングベンチマークの実験は、反復的相互作用が意味的誤りを一貫して減少させることを示している。
論文 参考訳(メタデータ) (2026-05-28T06:23:31Z) - Graph-Based Phonetic Error Correction of Noisy ASR [15.765749498997442]
本稿では,音声グラフモデリングと文脈言語理解を組み合わせた構造化ASR補正フレームワークを提案する。
グラフニューラルネットワーク(GNN)は、まず、フラグ付きトークンに対して、音響的に検証可能な候補近傍を構築する。
その後、マスク付き言語モデル(MLM)が局所的な文脈スコアリングを提供し、命令調整型大規模言語モデル(LLM)が最終的な文脈認識の再ランク付けを行う。
論文 参考訳(メタデータ) (2026-04-29T13:57:11Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Towards Unsupervised Speech Recognition at the Syllable-Level [95.54031547995874]
マスク付き言語モデリングに基づく音節レベルのUASRフレームワークを提案する。
我々は,従来の手法では特に難しい言語であるマンダリンを効果的に一般化する。
論文 参考訳(メタデータ) (2025-10-04T02:56:33Z) - LLM-based Generative Error Correction for Rare Words with Synthetic Data and Phonetic Context [4.444835399672951]
稀な単語を対象とし,音声情報を組み込んだ新しいGER手法を提案する。
実験結果から,本手法は稀な単語の訂正を改善するだけでなく,WERとCERを低減させることがわかった。
論文 参考訳(メタデータ) (2025-05-23T02:54:52Z) - Chain of Correction for Full-text Speech Recognition with Large Language Models [21.37485126269991]
Chain of Correction (CoC) は、セグメンテーションごとにエラーセグメントを補正するマルチターンチャットフォーマットである。
実験により、CoCはフルテキストASR出力の修正において、ベースラインやベンチマークシステムよりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-04-02T09:06:23Z) - Full-text Error Correction for Chinese Speech Recognition with Large Language Model [11.287933170894311]
大言語モデル(LLM)は自動音声認識(ASR)における誤り訂正の可能性を示している
本稿では,より長い音声記録からASRシステムによって生成された全文における誤り訂正のためのLLMの有効性について検討する。
論文 参考訳(メタデータ) (2024-09-12T06:50:45Z) - Generative error correction for code-switching speech recognition using
large language models [49.06203730433107]
コードスイッチング(英: Code-switching, CS)とは、2つ以上の言語が同じ文内に混在する現象である。
本稿では,大規模言語モデル (LLM) と ASR が生成する仮説のリストを利用して,CS 問題に対処することを提案する。
論文 参考訳(メタデータ) (2023-10-17T14:49:48Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Integrated Semantic and Phonetic Post-correction for Chinese Speech
Recognition [1.2914521751805657]
提案手法は,中国語ASRの誤り率を軽減するために,誤りとその置換候補間の文脈的表現と音声情報を総合的に活用する手法である。
実世界の音声認識実験の結果,提案手法はベースラインモデルよりも明らかに低いことがわかった。
論文 参考訳(メタデータ) (2021-11-16T11:55:27Z) - Joint Contextual Modeling for ASR Correction and Language Understanding [60.230013453699975]
言語理解(LU)と協調してASR出力の文脈的言語補正を行うマルチタスクニューラルアプローチを提案する。
そこで本研究では,市販のASRおよびLUシステムの誤差率を,少量のドメイン内データを用いてトレーニングしたジョイントモデルと比較して14%削減できることを示した。
論文 参考訳(メタデータ) (2020-01-28T22:09:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。