論文の概要: Greater accessibility can amplify discrimination in generative AI
- arxiv url: http://arxiv.org/abs/2603.22260v1
- Date: Mon, 23 Mar 2026 17:47:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.826323
- Title: Greater accessibility can amplify discrimination in generative AI
- Title(参考訳): アクセシビリティ向上は、ジェネレーティブAIにおける差別を増幅する
- Authors: Carolin Holtermann, Minh Duc Bui, Kaitlyn Zhou, Valentin Hofmann, Katharina von der Wense, Anne Lauscher,
- Abstract要約: 音声対応大規模言語モデル (LLM) は, 体系的な性別差別を示す。
また、音声インタフェースは、パラ言語的手がかりに結びついた独自のバイアス機構を導入することも示している。
音声インタフェースを通じてアクセシビリティを拡大しようとする試みは、同時に差別のための新たな経路を生み出します。
- 参考スコア(独自算出の注目度): 45.665387036307926
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hundreds of millions of people rely on large language models (LLMs) for education, work, and even healthcare. Yet these models are known to reproduce and amplify social biases present in their training data. Moreover, text-based interfaces remain a barrier for many, for example, users with limited literacy, motor impairments, or mobile-only devices. Voice interaction promises to expand accessibility, but unlike text, speech carries identity cues that users cannot easily mask, raising concerns about whether accessibility gains may come at the cost of equitable treatment. Here we show that audio-enabled LLMs exhibit systematic gender discrimination, shifting responses toward gender-stereotyped adjectives and occupations solely on the basis of speaker voice, and amplifying bias beyond that observed in text-based interaction. Thus, voice interfaces do not merely extend text models to a new modality but introduce distinct bias mechanisms tied to paralinguistic cues. Complementary survey evidence ($n=1,000$) shows that infrequent chatbot users are most hesitant to undisclosed attribute inference and most likely to disengage when such practices are revealed. To demonstrate a potential mitigation strategy, we show that pitch manipulation can systematically regulate gender-discriminatory outputs. Overall, our findings reveal a critical tension in AI development: efforts to expand accessibility through voice interfaces simultaneously create new pathways for discrimination, demanding that fairness and accessibility be addressed in tandem.
- Abstract(参考訳): 何百万人もの人々が、教育、仕事、さらには医療のために大きな言語モデル(LLM)に依存しています。
しかし、これらのモデルは、トレーニングデータに存在する社会的バイアスを再現し、増幅することが知られている。
さらに、テキストベースのインターフェースは、リテラシーの制限、モーター障害、モバイル専用デバイスなどの多くのユーザにとって、依然として障壁となっている。
音声対話はアクセシビリティを拡大することを約束するが、テキストとは異なり、音声はユーザーが簡単にマスクできないアイデンティティーの手がかりを持ち、アクセシビリティ向上が公平な治療のコストで生じるのではないかという懸念を提起する。
ここでは、音声対応LLMが、組織的な性差別、ジェンダーのステレオタイプ化形容詞や職業への反応を、話者音声のみに基づいて示し、テキストベースインタラクションで観察される以上のバイアスを増幅することを示す。
このように、音声インタフェースは、テキストモデルを新しいモダリティに拡張するだけでなく、パラ言語的手がかりに結びついた独自のバイアス機構を導入する。
相補的な調査証拠(n=1,000$)は、チャットボットの利用者が、未公表の属性推定を最もいらいらし、そのような慣行が明らかにされた際には解禁される可能性が最も高いことを示している。
潜在的な緩和戦略を示すために、ピッチ操作は、性別差別出力を体系的に制御できることを示す。
音声インターフェースを通じてアクセシビリティを拡大する努力は、差別のための新しい経路を同時に作り、公正性とアクセシビリティに対処することを要求します。
関連論文リスト
- Unheard in the Digital Age: Rethinking AI Bias and Speech Diversity [0.0]
言論は現代社会において最も目に見えないが見過ごされた包含と排除のベクトルの1つである。
本稿では、非定型音声の知覚を形作り、現在人工知能に符号化されている構造バイアスに焦点を当てる。
論文 参考訳(メタデータ) (2026-01-26T16:12:25Z) - Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs [85.69785384599827]
人間と物体の相互作用(Human-object Interaction、HOI)の検出は、人と物体のペアとそれらの相互作用を局在させることを目的としている。
既存のメソッドはクローズドワールドの仮定の下で動作し、タスクを未定義の小さな動詞集合上の分類問題として扱う。
本稿では,閉集合分類タスクから開語彙生成問題へのHOI検出を再構成する新しい生成推論・ステアブル知覚フレームワークGRASP-HOを提案する。
論文 参考訳(メタデータ) (2025-12-19T14:41:50Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition [49.27067541740956]
モデルアーキテクチャの変更や人口統計情報への依存を伴わずにバイアスを緩和する信頼性指向音声強調脱バイアス手法であるCO-VADAを提案する。
CO-VADAはトレーニングデータに存在するバイアスパターンを反映したトレーニングサンプルを特定し、無関係な属性を変更してサンプルを生成するために音声変換を適用する。
我々のフレームワークは様々なSERモデルや音声変換ツールと互換性があり、SERシステムの公平性を改善するためのスケーラブルで実用的なソリューションとなっている。
論文 参考訳(メタデータ) (2025-06-06T13:25:56Z) - Towards Unsupervised Speech Recognition Without Pronunciation Models [57.222729245842054]
本稿では,ペア音声とテキストコーパスを使わずにASRシステムを開発するという課題に取り組む。
音声合成とテキスト・テキスト・マスクによるトークン埋込から教師なし音声認識が実現可能であることを実験的に実証した。
この革新的なモデルは、レキシコンフリー環境下での以前の教師なしASRモデルの性能を上回る。
論文 参考訳(メタデータ) (2024-06-12T16:30:58Z) - Speaker Normalization for Self-supervised Speech Emotion Recognition [16.044405846513495]
特徴表現から話者特性を正規化しながら、音声感情認識タスクを学習する勾配に基づく逆学習フレームワークを提案する。
提案手法は話者に依存しない設定と話者に依存しない設定の両方において有効であることを示すとともに,難易度の高いIEMOCAPデータセットに対する新しい最先端結果を得る。
論文 参考訳(メタデータ) (2022-02-02T19:30:47Z) - Improving Fairness in Speaker Recognition [4.94706680113206]
最先端の深層話者認識システムによって達成される性能の格差を調査します。
統計学的にバランスのとれたトレーニングセットで訓練されたモデルでは,異なるグループでより公平な行動を示すが,精度は高い。
論文 参考訳(メタデータ) (2021-04-29T01:08:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。