論文の概要: Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI
- arxiv url: http://arxiv.org/abs/2608.06141v1
- Date: Thu, 06 Aug 2026 15:10:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.939728
- Title: Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI
- Title(参考訳): 自動音声認識における言語ポリシーのデコロニゼーション--言語間競合型音声AIのためのフレームワーク
- Authors: Jay L. Cunningham, Mark Atta Mensah, Richard Martinez, Joao Vieira da Silva Neto, Efi Dawodu,
- Abstract要約: 低リソース,内在言語,非標準言語の持続的失敗は,技術的な誤りだけでなく,植民地言語の階層を再現する暗黙的な言語政策でもある,と我々は主張する。
本研究では,ASRとASRを介する音声インタフェースにおいて,3つのハーム(3M)分類法と言語多様性のための7層位置モデルを導入する。
- 参考スコア(独自算出の注目度): 4.893345190925178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper focuses on automatic speech recognition (ASR) and ASR-mediated voice interfaces that shape access to public services, healthcare, and education. We argue that persistent failures for low-resource, Indigenous, and non-standard language varieties are not only technical errors, but also implicit linguistic policies that reproduce colonial language hierarchies. Drawing on linguistic capital, raciolinguistic ideology, language policy research, and decolonial computing, we show how data, metrics, and model priors determine whose voices become machine-legible. We introduce the Three Harms (3M) taxonomy---Misrecognition, Misalignment, and Mistrust---and a seven-layer situatedness model for linguistic diversity in ASR and ASR-mediated voice interfaces. We then propose a participatory framework and minimum audit protocol for culturally competent ASR, positioning affected communities as co-designers, evaluators, and governance partners.
- Abstract(参考訳): 本稿では、公共サービス、医療、教育へのアクセスを形作る自動音声認識(ASR)とASRを利用した音声インタフェースに焦点を当てる。
低リソース,内在言語,非標準言語の持続的失敗は,技術的な誤りだけでなく,植民地言語の階層を再現する暗黙的な言語政策でもある,と我々は主張する。
言語資本、人種差別的イデオロギー、言語政策研究、デコロニアル・コンピューティングに基づいて、データ、メトリクス、モデルの優先順位が、どの声が機械言語になるかを決定する方法を示す。
本研究では,ASR と ASR を介する音声インタフェースにおける言語的多様性のための7層位置モデルとして,三つのハーム(3M)分類法(ミス認識,ミスアライメント,ミストラスト)を導入する。
次に、文化的に有能なASRのための参加型フレームワークと最小監査プロトコルを提案し、影響のあるコミュニティを共同設計者、評価者、ガバナンスパートナーとして位置づける。
関連論文リスト
- MUSCAT: MUltilingual, SCientific ConversATion Benchmark [60.87925076316812]
多言語音声技術の目標は、異なる言語を話す個人間のシームレスなコミュニケーションを容易にすることである。
この経験を生み出すためには、音声技術は、混合多言語入力、特定の語彙、コードスイッチングといったいくつかの課題に対処する必要がある。
本稿では,これらの課題に対処できるかどうかを問う,現在の音声認識(ASR)システムを評価するための新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2026-04-17T10:39:01Z) - Unheard in the Digital Age: Rethinking AI Bias and Speech Diversity [0.0]
言論は現代社会において最も目に見えないが見過ごされた包含と排除のベクトルの1つである。
本稿では、非定型音声の知覚を形作り、現在人工知能に符号化されている構造バイアスに焦点を当てる。
論文 参考訳(メタデータ) (2026-01-26T16:12:25Z) - WESR: Scaling and Evaluating Word-level Event-Speech Recognition [59.21814194620928]
音声は言語情報だけでなく、笑ったり泣いたりするような豊富な非言語的な音声イベントも伝達する。
我々は,21の発声イベントの分類を改良し,個別(スタンドアローン)と連続(音声と混合)に分類した。
改良された分類法に基づくWESR-Benchは,新しい位置認識プロトコルを備えた専門家アノテート評価セット(900以上の発話)である。
論文 参考訳(メタデータ) (2026-01-08T02:23:21Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - Fairness of Automatic Speech Recognition: Looking Through a Philosophical Lens [0.42970700836450487]
特定の言語品種の体系的誤認識は、技術的な制限以上のものであると論じる。
我々は、ASRバイアスと他のアルゴリズム的公正度とを区別する音声技術の3つのユニークな倫理的次元を同定する。
論文 参考訳(メタデータ) (2025-08-10T02:26:47Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。