論文の概要: What Was That Again? Certified Robustness for Automatic Speech Recognition
- arxiv url: http://arxiv.org/abs/2606.27698v2
- Date: Tue, 30 Jun 2026 23:04:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.052601
- Title: What Was That Again? Certified Robustness for Automatic Speech Recognition
- Title(参考訳): それは何だったのか? 音声認識のためのロバスト性認定
- Abstract要約: 我々は、認証にインスパイアされたメカニズムを用いることで、WERを大幅に減少させ、リコールを増やし、信頼性とWERのスピアマン相関を低下させることができることを示した。
我々は、トークンの存在と敵の排除の両方を認証するために統計的に富を蓄積する2桁原子監査と、勝利シーケンスを選択するランクベーストーナメントという2つのゲート診断パイプラインを通してこれを達成している。
- 参考スコア(独自算出の注目度): 20.670396261503306
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Automatic Speech Recognition systems are notoriously both sensitive to adversarial and benign perturbations. While this has been repeatedly demonstrated using reference datasets, detecting such behaviors in deployed systems is incredibly challenging, due to the absence of oracle knowledge of the true transcription. We demonstrate that employing a certification-inspired mechanism can significantly decrease WER, increase recall, and decrease the Spearman correlation between confidence and WER. We achieve this through a dual-gate diagnostic pipeline: a Two-Sided Atomic Audit that accumulates statistical wealth to certify both token existence and adversarial exclusion, and a Rank-Based Tournament that selects the winning sequence. Our evaluations across four diverse architectures demonstrate up to a 55% relative reduction in Word Error Rate, while also providing granular word- and sentence-level certifications to enhance acoustic security.
- Abstract(参考訳): 自動音声認識システムは、敵対的かつ良心的な摂動に敏感である。
これは参照データセットを使って繰り返し実証されているが、真の転写に関するオラクルの知識がないため、デプロイされたシステムでそのような振る舞いを検出することは信じられないほど困難である。
我々は、認証にインスパイアされたメカニズムを用いることで、WERを大幅に減少させ、リコールを増やし、信頼性とWERのスピアマン相関を低下させることができることを示した。
我々は、トークンの存在と敵の排除の両方を認証するために統計的に富を蓄積する2桁原子監査と、勝利シーケンスを選択するランクベーストーナメントという2つのゲート診断パイプラインを通してこれを達成している。
4つの異なるアーキテクチャに対する評価では、単語誤り率を55%削減する一方、音の安全性を高めるために、粒度の細かい単語と文レベルの認証を提供する。
関連論文リスト
- Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition [7.1200667451435296]
本稿では,Whisper-Aware LLMについて紹介する。
本モデルは,音響信号の物理的欠陥を定量化する学習により,本質的な自己認識を発達させる。
このモデルでは、AISHELL6-Whisperに対して17%の相対的なCER削減が達成された。
論文 参考訳(メタデータ) (2026-08-11T12:02:55Z) - Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems [40.265250435329456]
本稿では,SDSにおけるロバスト性を根本的に再考する原因認識型エラー回復パラダイムを提案する。
従来の信頼度フィルタリングとは異なり、我々は小さな精度に焦点を絞った検出器群を導入している。
この微細な診断知能は、LLMがターゲットとするマルチターンの明確化戦略を編成する権限を与える。
論文 参考訳(メタデータ) (2026-05-25T03:57:38Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - SAFE-QAQ: End-to-End Slow-Thinking Audio-Text Fraud Detection via Reinforcement Learning [52.29460857893198]
既存の不正検出方法は、書き起こされたテキストに依存しており、ASRのエラーや、声調や環境条件のような重要な音響的手がかりが欠けている。
音声に基づくスロー思考詐欺検出のためのエンドツーエンド包括的フレームワークSAFE-QAQを提案する。
本フレームワークは,ライブコール中に動的リスクアセスメントフレームワークを導入し,不正の早期検出と防止を可能にする。
論文 参考訳(メタデータ) (2026-01-04T06:09:07Z) - Noise & pattern: identity-anchored Tikhonov regularization for robust structural anomaly detection [58.535473924035365]
異常検出は自動産業検査において重要な役割を担い、他の均一な視覚パターンの微妙な欠陥や稀な欠陥を識別することを目的としている。
自己教師型オートエンコーダを用いて, 破損した入力の修復を学習する構造的異常検出に取り組む。
構造欠陥を模倣した画像に人工的破壊を注入する汚職モデルを導入する。
論文 参考訳(メタデータ) (2025-11-10T15:48:50Z) - DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models [50.21378052667732]
我々は、ステップ内およびステップ間ダイナミクスという2つの異なる次元にわたるジェイルブレイク攻撃に対して、dLLM脆弱性の詳細な分析を行う。
デュアルステージアプローチによる脆弱性に対処する,トレーニング不要な防御フレームワークであるDiffuGuardを提案する。
論文 参考訳(メタデータ) (2025-09-29T05:17:10Z) - Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment [48.73836179661632]
信頼誘導対向アライメントは、識別的手がかりを消去することなく攻撃固有のアーティファクトを適応的に抑制する。
IB-CAANは、多くのベンチマークにおいて、ベースラインと最先端のパフォーマンスを一貫して上回る。
論文 参考訳(メタデータ) (2025-09-28T03:48:49Z) - Evaluating Identity Leakage in Speaker De-Identification Systems [1.7699344561127388]
話者識別は, 話者の身元を隠蔽し, 話者の身元を隠蔽することを目的としている。
3つの相補的誤り率で残差アイデンティティリークを定量化するベンチマークを導入する。
評価結果から,最先端話者識別システムはすべて識別情報を漏洩していることが明らかとなった。
論文 参考訳(メタデータ) (2025-08-19T17:20:25Z) - Mitigating Backdoor Triggered and Targeted Data Poisoning Attacks in Voice Authentication Systems [4.856070170902535]
本稿では,BTAとTDPAの両方を効果的に扱う統一防衛フレームワークを提案する。
筆者らのフレームワークは,ほぼリアルタイムにピッチアップとバックドアアタックを隠蔽する周波数集中検出機構を統合している。
我々の枠組みはTDPAの認識において、攻撃成功率を最大5~15%まで低下させ、リコールレートを最大9~5%まで維持する。
論文 参考訳(メタデータ) (2025-05-06T11:52:12Z) - Error Correction by Paying Attention to Both Acoustic and Confidence References for Automatic Speech Recognition [52.624909026294105]
本稿では,非自己回帰型音声誤り訂正法を提案する。
信頼モジュールは、N-best ASR仮説の各単語の不確実性を測定する。
提案方式は,ASRモデルと比較して誤差率を21%削減する。
論文 参考訳(メタデータ) (2024-06-29T17:56:28Z) - Certification of Speaker Recognition Models to Additive Perturbations [4.332441337407564]
対人攻撃に対する 話者認識システムの堅牢性は 重要な課題です
我々はまず,画像領域向けに開発された話者認識に頑健性認証技術を適用した。
論文 参考訳(メタデータ) (2024-04-29T15:23:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。