論文の概要: Generative Testing of Automated Speech Recognition Systems
- arxiv url: http://arxiv.org/abs/2607.09833v1
- Date: Fri, 10 Jul 2026 14:04:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.225013
- Title: Generative Testing of Automated Speech Recognition Systems
- Title(参考訳): 自動音声認識システムの生成試験
- Abstract要約: GATAS(ブラックボックステスト)は,入力の失敗を発生させる手法である。
波形を直接摂動するのではなく、このアプローチは潜在表現を補間して転写エラーを誘発する。
その結果,GATASは98%の成功率であり,歪みは低く,知覚品質も高いことがわかった。
- 参考スコア(独自算出の注目度): 0.4914401344126589
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition (ASR) systems have achieved high accuracy with transformer-based models, enabling deployment in critical applications. However, they remain vulnerable to adversarial manipulation, particularly in black-box settings where attacks must preserve perceptual naturalness. This work introduces GATAS, a black-box testing approach that generates failure inducing inputs by operating in the phoneme-level latent space of a text- to-speech model. Instead of perturbing waveforms directly, the approach interpolates latent representations to induce transcription errors while remaining within the manifold of natural speech. The attack is formulated as a multi-objective optimization problem balancing semantic divergence and perceptual quality. Our empirical evaluation against both white-box and black-box baselines shows that GATAS achieves a 98% success rate while producing lower distortion and higher perceptual quality, as confirmed by human studies. Despite operating without gradient access, GATAS remains competitive against white-box methods, highlighting that representation and perceptual alignment are more critical than access to model internals. Overall, our results demonstrate that untargeted latent-space optimization enables the efficient generation of realistic and effective test cases for ASR systems.
- Abstract(参考訳): 自動音声認識(ASR)システムはトランスフォーマーベースのモデルで高い精度を実現し、重要なアプリケーションへの展開を可能にしている。
しかし、攻撃が知覚の自然性を維持する必要があるブラックボックス設定では、敵の操作に弱いままである。
本研究は,テキスト音声合成モデルの音素レベル潜在空間で動作させることにより,入力を誘導するブラックボックステスト手法であるGATASを導入する。
この手法は、波形を直接摂動するのではなく、潜在表現を補間し、自然な音声の多様体に留まりながら転写誤りを誘発する。
この攻撃は、意味的発散と知覚的品質のバランスをとる多目的最適化問題として定式化されている。
ブラックボックスベースラインとホワイトボックスベースラインとブラックボックスベースラインを比較検討した結果,GATASは低い歪みと高い知覚品質を生じながら98%の成功率を達成したことが確認された。
グラデーションアクセスなしで動作しているにもかかわらず、GATASはホワイトボックスメソッドと競合し続けており、モデル内部へのアクセスよりも表現と知覚アライメントが重要であることを強調している。
全体として,未目標の潜在空間最適化により,ASRシステムの現実的かつ効果的なテストケースを効率的に生成できることを示す。
関連論文リスト
- Robustifying Vision-Language Models via Test-Time Prompt Adaptation [23.05168102474528]
サンプルレベルの推定から分布レベルのアライメントに移行するテストtImeプロンプト・タダプテーションフレームワークであるRITAを提案する。
特に、RITAは、拡張視覚特徴の分布をテキストプロトタイプと整合させ、敵対的外乱を緩和し、モーダルな意味的不一致を是正するために最適なトランスポートを使用する。
論文 参考訳(メタデータ) (2026-07-10T14:19:42Z) - Probabilistic Verification of Voice Anti-Spoofing Models [39.67517262217587]
本稿では,音声アンチスプーフィングモデルの堅牢性を検証するための確率的フレームワークであるPV-VASMを提案する。
誤差確率の理論的上限を導出し,様々な実験条件で検証する。
論文 参考訳(メタデータ) (2026-03-11T12:40:24Z) - Scores Know Bobs Voice: Speaker Impersonation Attack [8.404098071525473]
本稿では,合成モデルの潜在空間とSRSの識別的特徴空間とを一致させる逆ベース生成攻撃フレームワークを提案する。
実験の結果,提案手法はクエリ効率を大幅に向上し,従来の手法に比べて平均10倍少ないクエリで競合攻撃の成功率を達成することができた。
論文 参考訳(メタデータ) (2026-03-03T09:20:48Z) - VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension [51.76841625486355]
Referring Expression (REC) は、自然言語クエリに対応する画像領域をローカライズすることを目的としている。
最近のニューロシンボリックRECアプローチは、大規模言語モデル(LLM)と視覚言語モデル(VLM)を利用して構成推論を行う。
推論ステップ内に軽量な演算子レベルの検証器を組み込む,ニューロシンボリックなフレームワークであるVIROを紹介する。
論文 参考訳(メタデータ) (2026-01-19T07:21:19Z) - SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection [55.54007781679915]
本稿では,多種多様な視覚的エンコーディングを効率よく融合させ,モデルの微粒化知覚を高めるSynergistic Semantic-Visual Prompting (SSVP)を提案する。
SSVPは、MVTec-AD上で93.0%のImage-AUROCと92.2%のPixel-AUROCで最先端のパフォーマンスを達成し、既存のゼロショットアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-14T04:42:19Z) - Decoding Deception: Understanding Automatic Speech Recognition Vulnerabilities in Evasion and Poisoning Attacks [0.0]
本稿では,コスト効率のよいホワイトボックス攻撃と,自動音声認識システムに対する非伝達性ブラックボックス攻撃について検討する。
本稿では, 摂動攻撃が最先端モデルの性能を低下させ, 音声信号の誤解釈につながることを示す。
論文 参考訳(メタデータ) (2025-09-26T08:42:59Z) - Improving Black-Box Generative Attacks via Generator Semantic Consistency [51.470649503929344]
ジェネレーティブアタックは テスト時に 1つのフォワードパスで 敵の例を生成する
初期ジェネレータの中間機能をEMA教師に整列させることで意味的整合性を実現する。
我々のアプローチは、ブラックボックス転送の一貫性を保ちながら、既存のジェネレーティブアタックにシームレスに統合することができる。
論文 参考訳(メタデータ) (2025-06-23T02:35:09Z) - Scalable and Effective Negative Sample Generation for Hyperedge Prediction [55.9298019975967]
ハイパーエッジ予測は、Webベースのアプリケーションにおける複雑なマルチエンタリティ相互作用を理解するために不可欠である。
従来の手法では、正と負のインスタンスの不均衡により、高品質な負のサンプルを生成するのが困難であることが多い。
本稿では,これらの課題に対処するために拡散モデルを利用するハイパーエッジ予測(SEHP)フレームワークのスケーラブルで効果的な負のサンプル生成について述べる。
論文 参考訳(メタデータ) (2024-11-19T09:16:25Z) - Interpretable Spectrum Transformation Attacks to Speaker Recognition [8.770780902627441]
ブラックボックスの被害者モデルに対する敵声の伝達性を改善するための一般的な枠組みが提案されている。
提案フレームワークは時間周波数領域で音声を動作させ,攻撃の解釈性,伝達性,非受容性を向上させる。
論文 参考訳(メタデータ) (2023-02-21T14:12:29Z) - Towards Robust Speech-to-Text Adversarial Attack [78.5097679815944]
本稿では,DeepSpeech,Kaldi,Lingvoなど,最先端の音声テキストシステムに対する新たな逆アルゴリズムを提案する。
本手法は, 逆最適化定式化の従来の歪み条件の拡張を開発することに基づいている。
元のサンプルと反対のサンプルの分布の差を測定するこの測定値の最小化は、正統な音声記録のサブスペースに非常に近い作成信号に寄与する。
論文 参考訳(メタデータ) (2021-03-15T01:51:41Z) - Unsupervised Domain Adaptation for Speech Recognition via Uncertainty
Driven Self-Training [55.824641135682725]
WSJ をソースドメインとし,TED-Lium 3 とSWITCHBOARD を併用したドメイン適応実験を行った。
論文 参考訳(メタデータ) (2020-11-26T18:51:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。