論文の概要: From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction
- arxiv url: http://arxiv.org/abs/2604.13067v1
- Date: Thu, 19 Mar 2026 21:12:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.653584
- Title: From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction
- Title(参考訳): 観察から経験へ:人間-AI音声対話における間欠的音声バイアスの対話的評価
- Authors: Shree Harsha Bokkahalli Satish, Maria Teleki, Christoph Minixhofer, Ondrej Klejch, Peter Bell, Éva Székely,
- Abstract要約: SpeechLLMsは音声から直接音声言語を処理するが、アクセントと声のアイデンティティーの手がかりはバイアスのある振る舞いにつながる可能性がある。
我々は,コヒーレントアウトプットにおけるコンテンツレベルのバイアスとサービス品質の格差を区別し,アクセントと知覚的性別の交叉効果を検討した。
- 参考スコア(独自算出の注目度): 25.529747060487363
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: SpeechLLMs process spoken language directly from audio, but accent and vocal identity cues can lead to biased behaviour. Current bias evaluations often miss how such bias manifests in end-to-end speech interactions and how users experience it. We distinguish quality-of-service disparities (e.g., off-topic or low-effort responses) from content-level bias in coherent outputs, and examine intersectional effects of accent and perceived gender. In this work, we explore a two-part evaluation approach: (1) a controlled test cohort spanning six accents and two gender presentations, analysed with judge-free prompt-response metrics, and (2) an interactive study design using voice conversion to let users experience identical content through different vocal identities. Across two studies (Interactive, N=24; Observational, N=19), we find that voice conversion increases trust and acceptability for benign responses and encourages perspective-taking, while automated analysis in search of quality-of-service disparities, reveals {accent x gender} disparities in alignment and verbosity across SpeechLLMs. These results highlight voice conversion for probing and experiencing intersectional voice bias while our evaluation suite provides richer bias evaluations for spoken conversational AI.
- Abstract(参考訳): SpeechLLMsは音声から直接音声言語を処理するが、アクセントと声のアイデンティティーの手がかりはバイアスのある振る舞いにつながる可能性がある。
現在のバイアス評価は、エンド・ツー・エンドの音声対話においてそのようなバイアスがどのように現れるか、ユーザがどのように経験するかを見逃すことが多い。
我々は、コヒーレントアウトプットにおけるコンテンツレベルの偏りと、サービス品質の格差(例えば、オフトピー、低フォート応答)を区別し、アクセントと知覚される性別の交叉効果を調べた。
本研究では,(1)6つのアクセントと2つのジェンダープレゼンテーションにまたがる制御されたテストコーホートと,(2)異なる声質で同一コンテンツを体験するための音声変換を用いた対話型学習設計について検討する。
2つの研究 (Interactive, N=24; Observational, N=19) において、音声変換は良性応答に対する信頼と受容性を高め、視点取りを促進する一方で、サービス品質の格差を探索する自動解析により、音声LLM間のアライメントと冗長性における {accent x gender} の相違を明らかにした。
これらの結果から,対話型AIに対してよりリッチなバイアス評価を行う一方で,対話型音声バイアスを探索し,経験するための音声変換が強調された。
関連論文リスト
- Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition [52.63676763985825]
トークンレベルの精度を超えた認識品質を評価するための意味認識評価指標を提案する。
我々は,人間のようなマルチターンインタラクションをシミュレートするエージェント・フレームワークを設計し,認識出力の反復的改善を可能にする。
対話型およびエージェント型ASRにおける今後の研究を促進するためのコードをリリースする。
論文 参考訳(メタデータ) (2026-04-10T09:02:42Z) - Predicting States of Understanding in Explanatory Interactions Using Cognitive Load-Related Linguistic Cues [4.351015250928505]
話者やリスナーが対話で示す言語的特徴と非言語的特徴が,聴取者の理解状態の予測にどのように寄与するかを検討する。
具体的には,認知的負荷に関連する3つの言語的手がかりについて検討し,聴取者の理解と相関して仮説を立てた。
論文 参考訳(メタデータ) (2026-03-20T15:58:54Z) - The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs [34.359037939013085]
音声大言語モデル(SpeechLLMs)は音声入力を直接処理し、アクセントや知覚性などの手がかりを保持する。
我々は,2,880の対話を用いた3つのSpeechLLMにおけるアクセントと性差の大規模交叉評価を行った。
論文 参考訳(メタデータ) (2026-03-15T16:54:36Z) - EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models [47.41816926003011]
音声言語モデル(SLM)は、音声言語理解において大きな進歩を遂げている。
SLMが非語彙的声道を完全に知覚できるかどうかは不明であるが、感情的・文脈的要因の双方に合致する共感に反応する。
共感的対話の認知過程をシミュレートする最初の相互関連型マルチレベルベンチマークであるEchoMindを提案する。
論文 参考訳(メタデータ) (2025-10-26T17:15:56Z) - Speak Your Mind: The Speech Continuation Task as a Probe of Voice-Based Model Bias [24.932603485660323]
音声継続 (SC) は、意味的文脈と話者識別を保ちながら、音声プロンプトのコヒーレントな拡張を生成するタスクである。
本研究は,性差と発声タイプが継続行動にどのように影響するかを調査し,SCにおけるバイアスの最初の体系的評価を行った。
論文 参考訳(メタデータ) (2025-09-26T08:43:25Z) - AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation [55.607230723223346]
本研究は,Large Audio Model (LAM) をAudioJudgeの裁判官として体系的に研究し,両課題に対処する統一評価フレームワークを提供することができるかどうかを検討する。
本稿では、発音、発話速度、話者識別、音声品質、自動ベンチマークのためのシステムレベルの人間の嗜好シミュレーションなど、音声特徴検出タスクにまたがるAudioJudgeについて検討する。
本稿では,多視点アンサンブルAudioJudgeを導入し,音声評価を語彙内容,音声品質,パラ言語特徴の専門判断者に分解し,人間の嗜好と最大0.91のスピアマン相関を達成させる手法を提案する。
論文 参考訳(メタデータ) (2025-07-17T00:39:18Z) - CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition [49.27067541740956]
モデルアーキテクチャの変更や人口統計情報への依存を伴わずにバイアスを緩和する信頼性指向音声強調脱バイアス手法であるCO-VADAを提案する。
CO-VADAはトレーニングデータに存在するバイアスパターンを反映したトレーニングサンプルを特定し、無関係な属性を変更してサンプルを生成するために音声変換を適用する。
我々のフレームワークは様々なSERモデルや音声変換ツールと互換性があり、SERシステムの公平性を改善するためのスケーラブルで実用的なソリューションとなっている。
論文 参考訳(メタデータ) (2025-06-06T13:25:56Z) - Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models [38.64792118903994]
SILLMのジェンダーバイアスを4つの意味的タスクで評価した。
分析の結果, バイアスレベルは言語に依存し, 評価方法によって異なることが明らかとなった。
論文 参考訳(メタデータ) (2024-07-09T15:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。