論文の概要: Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications
- arxiv url: http://arxiv.org/abs/2608.24916v1
- Date: Mon, 03 Aug 2026 10:34:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 05:49:59.248276
- Title: Domain-Adaptive ASR for Telephony AI Agents: Fine-tuning Canary Flash Models for Enterprise Contact Center Applications
- Title(参考訳): テレフォニーAIエージェントのためのドメイン適応型ASR:エンタープライズコンタクトセンター応用のための微調整カナリアフラッシュモデル
- Authors: Chanameth Boonpramuk, Winn Voravuthikunchai, Songpol Bunyang,
- Abstract要約: 本稿では,オープンソースのNVIDIA Canary 180M FlashとNVIDIA Canary 1B Flashマルチタスクモデルを高速に微調整するためのBotnoi Groupの方法論と結果について述べる。
我々は、生音声ボットシステム記録から電話指向の微調整データセットを構築し、電話指向の強化による音声を誘導する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This technical report describes Botnoi Group's methodology and results for rapidly fine-tuning the open-source NVIDIA Canary 180M Flash and NVIDIA Canary 1B Flash multitask models for speech-to-text tasks using the NVIDIA NeMo framework, with a focus on telephony-grade audio. To support this adaptation, we construct a telephony-oriented fine-tuning dataset from live voicebot system recordings and prompted speech with telephony-oriented augmentation. We evaluate four targeted experiments-language adaptation (Thai), telephony robustness, domain-specific jargon (names and addresses), and latency-using character error rate (CER) for accuracy and real-time factor (RTFx) for inference speed. Results show that fine-tuning substantially improves recognition in noisy telephony environments, reducing CER from 23.31% to 9.04% on BOTNOI telephony data, and further improves business-critical names and addresses from 16.98% to 3.78% CER through domain-specific adaptation. Overall, our results show that domain-adaptive fine-tuning enhances business-critical terminology while preserving real-time responsiveness for production voicebot deployments.
- Abstract(参考訳): この技術レポートでは、NVIDIA NeMoフレームワークを使用して、オープンソースのNVIDIA Canary 180M FlashとNVIDIA Canary 1B Flashマルチタスクモデルを迅速に微調整するためのBotnoi Groupの方法論と結果について説明する。
この適応を支援するために、生音声ボットシステム記録から電話指向の微調整データセットを構築し、電話指向の強化による音声を誘導する。
提案手法は,Thai,Telephony robustness,Domain-specific jargon (names and address),CER (Lassency-using character error rate) の4つのターゲット言語適応(Thai)とリアルタイム因子(RTFx)の推論速度について検討した。
その結果、微細チューニングは、ノイズの多い電話環境における認識を大幅に改善し、CERを23.31%から9.04%に減らし、ビジネスクリティカルな名前や住所を16.98%から3.78%に改善した。
以上の結果から,ドメイン適応型微調整は,実運用用ボイスボットのリアルタイム応答性を保ちながら,ビジネスクリティカルな用語を促進することが示唆された。
関連論文リスト
- Real-Time Voicemail Detection in Telephony Audio Using Temporal Speech Activity Features [1.066048003460524]
本稿では,事前学習したニューラル音声活動検出器の音声活動パターンから15の時間的特徴を抽出する軽量なアプローチを提案する。
2つの評価セットで合計764の電話録音を行い、96.1%の精度で合成する。
論文 参考訳(メタデータ) (2026-04-02T17:43:24Z) - Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage [66.67531241554546]
従来のASR-LLM-TTSパイプラインに代わる強力な対話システムとして、エンドツーエンドの音声対話システムが登場している。
本稿では,音声入力システムに直接ツールの使用を拡張するための最初のアプローチを紹介する。
提案するStreaming Retrieval-Augmented Generation (Streaming RAG) は,ユーザ音声と並行してツールクエリを予測することにより,ユーザ知覚のレイテンシを低減する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T14:18:20Z) - Index-MSR: A high-efficiency multimodal fusion framework for speech recognition [7.677016652056559]
Index-MSRは効率的なマルチモーダル音声認識フレームワークである。
MFDは、ビデオからのテキスト関連情報を音声認識に効果的に組み込む。
Index-MSR はソータ精度を実現し,置換誤差を 2050% 削減した。
論文 参考訳(メタデータ) (2025-09-26T03:47:15Z) - Contrastive and Transfer Learning for Effective Audio Fingerprinting through a Real-World Evaluation Protocol [1.8842532732272859]
歌の識別の最近の進歩は、ディープニューラルネットワークを利用して生波形から直接コンパクトな音声指紋を学習している。
これらの手法は制御条件下では良好に動作しますが、ノイズの多い環境でモバイルデバイスを介してオーディオをキャプチャする現実のシナリオでは、その精度は大幅に低下します。
我々は同じ音声の3つの録音を生成し、それぞれが、モバイルデバイスのマイクを使って撮影されるノイズレベルを増大させる。
このプロトコルでは,2つの最新のCNNベースモデルに対して,以前報告したベンチマークと比較すると,大幅な性能低下がみられた。
論文 参考訳(メタデータ) (2025-07-08T15:13:26Z) - Fully Automated End-to-End Fake Audio Detection [57.78459588263812]
本稿では,完全自動エンドツーエンド音声検出手法を提案する。
まず、wav2vec事前学習モデルを用いて、音声の高レベル表現を得る。
ネットワーク構造には, Light-DARTS という異種アーキテクチャサーチ (DARTS) の修正版を用いる。
論文 参考訳(メタデータ) (2022-08-20T06:46:55Z) - CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command
Recognition [91.33781557979819]
新しいデータセットであるCantonese In-car Audio-Visual Speech Recognition (CI-AVSR)を導入する。
カントン語話者30人が記録した200の車載コマンドの4,984サンプル(8.3時間)で構成されている。
当社のデータセットのクリーンバージョンと拡張バージョンの両方について、詳細な統計情報を提供しています。
論文 参考訳(メタデータ) (2022-01-11T06:32:12Z) - EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy
Communication in Noisy Environments [43.05826988957987]
我々は、ARメガネ着用者の会話を改善するアルゴリズムのトレーニングとテストに有用な5時間以上のマルチモーダルデータを含むデータセットをリリースする。
ベースライン法に対して,音声の可聴性,品質,信号対雑音比の改善結果を提供し,全試験指標に比較して改善を示す。
論文 参考訳(メタデータ) (2021-07-09T02:00:47Z) - On Addressing Practical Challenges for RNN-Transduce [72.72132048437751]
オーディオデータを収集することなく、よく訓練されたRNN-Tモデルを新しいドメインに適応します。
復号時に計算された複数の特徴を利用して単語レベルの信頼度を求める。
提案手法では,平均で50ms以下の単語のタイミング差が得られる。
論文 参考訳(メタデータ) (2021-04-27T23:31:43Z) - Speaker Representation Learning using Global Context Guided Channel and
Time-Frequency Transformations [67.18006078950337]
グローバルな文脈情報を用いて、重要なチャネルを強化し、有意義な時間周波数位置を再検討する。
提案されたモジュールは、人気のあるResNetベースのモデルとともに、VoxCeleb1データセットで評価される。
論文 参考訳(メタデータ) (2020-09-02T01:07:29Z) - Deep Speaker Embeddings for Far-Field Speaker Recognition on Short
Utterances [53.063441357826484]
深層話者埋め込みに基づく話者認識システムは,制御条件下での大幅な性能向上を実現している。
制御されていない雑音環境下での短い発話に対する話者検証は、最も困難で要求の高いタスクの1つである。
本稿では,a)環境騒音の有無による遠距離話者検証システムの品質向上,b)短時間発話におけるシステム品質劣化の低減という2つの目標を達成するためのアプローチを提案する。
論文 参考訳(メタデータ) (2020-02-14T13:34:33Z) - Phoneme Boundary Detection using Learnable Segmental Features [31.203969460341817]
音素境界検出は様々な音声処理アプリケーションにおいて重要な第一歩となる。
本稿では,音素境界検出タスクのセグメント表現を学習するために,パラメータ化された構造的損失関数と結合したニューラルアーキテクチャを提案する。
論文 参考訳(メタデータ) (2020-02-11T14:03:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。