論文の概要: Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech Models
- arxiv url: http://arxiv.org/abs/2609.09263v1
- Date: Tue, 08 Sep 2026 17:58:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.748638
- Title: Voice or Stereotype? Disentangling Acoustic and Content-Based Gender in Speech-to-Speech Models
- Title(参考訳): 音声・ステレオタイプ : 音声音声合成モデルにおける音響・コンテンツベースジェンダーの分離
- Abstract要約: 音声合成(S2S)モデルがダビング、翻訳、音声エージェント内で動作するようになった。
テキストモデルとは異なり、スピーカーの声が聞こえる。
忠実なシステムは、話者を、通常言ったことを言う者ではなく、そのように聞こえる者として扱うべきである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-to-speech (S2S) models now run inside dubbing, translation, and voice agents. Unlike text models, they hear the speaker's voice, which carries the speaker's gender. A faithful system should treat a speaker as who they sound like, not as whoever usually says what they said. Testing this is harder than it looks, since most S2S models answer in a single, fixed output voice, hard-coded so it cannot drift toward a stereotype. Checking the output voice comes back clean even when the model is biased. We therefore ask two questions. When a model re-speaks the input, does the stereotype in the words shift the perceived gender of the output voice (voice rendering)? And when the model states the speaker's gender, does it follow the voice or the content (gender attribution)? We answer both with one controlled experiment crossing male and female voices with masculine-, neutral-, and feminine-stereotyped passages, on five open- and closed-source models in English, Spanish, and Mandarin. The rendered voice shows no stereotype drift. But every model decides the speaker's gender from the content, not the voice. Making the content one step more feminine (masculine -> neutral -> feminine) multiplies the odds of a "female" judgment by 1.7-24. When the content clashes with the voice, the worst model misgenders the speaker in 90% of cases. When they agree, it misgenders in only 2%. The bias thus hides in gender attribution, where fixed-voice evaluation cannot see, and where audits must look as S2S systems increasingly speak for real people.
- Abstract(参考訳): 音声合成(S2S)モデルがダビング、翻訳、音声エージェント内で動作するようになった。
テキストモデルとは異なり、スピーカーの声が聞こえる。
忠実なシステムは、話者を、通常言ったことを言う者ではなく、そのように聞こえる者として扱うべきである。
ほとんどのS2Sモデルは、1つの固定された出力音声で応答するので、ステレオタイプに向かってドリフトできない。
モデルにバイアスがかかっても、出力音声のチェックはクリーンに返ってくる。
したがって、我々は2つの質問をする。
モデルが入力を再度話すとき、単語のステレオタイプは出力音声の知覚性(音声の描画)を変えるのか?
そして、モデルが話者の性別を記述するとき、それは声または内容(性帰属)に従うか?
英語,スペイン語,マンダリンの5つのオープンソース・クローズド・ソース・モデルを用いて,男性,中性および女性ステレオタイプパスで男女の声を横断する1つの制御実験を行った。
レンダリングされた音声はステレオタイプのドリフトを示さない。
しかし、すべてのモデルは、声ではなく、コンテンツから話者の性別を決定する。
内容を1ステップずつ女性(男性 ->中性 ->女性)にすると、1.7-24の「女性」判定の確率が乗算される。
コンテンツが音声と衝突すると、最悪のモデルは90%のケースでスピーカーを誤認識する。
彼らが同意すると、それはわずか2%の未成年者でしかありません。
したがって、このバイアスは、固定投票の評価が見えない、そして監査が現実の人にとってのS2Sシステムのように見えなければならない、ジェンダーの属性に隠れている。
関連論文リスト
- Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation [25.126933196101703]
本稿では,STモデルを用いて3つの言語対にまたがる話者参照語に性別を割り当てるメカニズムについて検討する。
モデルは、訓練データから用語固有の性関係を再現するだけでなく、男性における有病率のより広範なパターンを学習する。
コントラスト的特徴属性をスペクトログラムに用いて, 性別の精度が高いモデルは, 以前は未知のメカニズムに依存していたことが明らかとなった。
論文 参考訳(メタデータ) (2025-11-26T15:48:04Z) - Who Gets the Mic? Investigating Gender Bias in the Speaker Assignment of a Speech-LLM [4.12691471378072]
本研究では,話者配置をバイアス調査の分析ツールとして活用する手法を提案する。
我々は、テキスト・トゥ・スペーチ(TTS)モデルであるBarkを評価し、テキスト・プロンプトのデフォルト話者代入を分析した。
バークの話者選択がジェンダー付き連想と体系的に一致している場合、トレーニングデータやモデルデザインのパターンを明らかにする可能性がある。
論文 参考訳(メタデータ) (2025-08-19T08:10:55Z) - EuroGEST: Investigating gender stereotypes in multilingual language models [58.871032460235575]
EuroGESTは、英語と29のヨーロッパ言語にまたがるLLMにおける性別ステレオタイプ推論を計測するためのデータセットである。
すべての言語で最強のステレオタイプは、女性が「美」、「共感」、そして「否定」であり、男性は「リーダー」、「強く、タフ」、そして「職業的」であることを示している。
論文 参考訳(メタデータ) (2025-06-04T11:58:18Z) - Addressing speaker gender bias in large scale speech translation systems [20.698663542717544]
本研究では,音声翻訳(ST)システムにおける話者性バイアスの問題に対処する。
我々は、話者の性別に基づいて翻訳をコスト効率よく修正するために、Large Language Models (LLMs) を用いている。
女性話者の翻訳能力は, ベースラインや大規模STシステムと比較して70%向上した。
論文 参考訳(メタデータ) (2025-01-10T14:20:46Z) - Gender Bias and Property Taxes [50.18156030818883]
我々は、10万人以上の不動産税告訴審理記録と2.7年以上の関連音声記録を分析した。
女性のアパレルは、聴聞会で男性アパレルよりも体系的に劣る。
我々の結果は、性別バイアスは、少なくとも部分的には、ABBパネリストの一部に関する無声の信念と認識によって引き起こされるという考え方と一致している。
論文 参考訳(メタデータ) (2024-12-17T07:14:23Z) - Beyond Binary Gender: Evaluating Gender-Inclusive Machine Translation with Ambiguous Attitude Words [85.48043537327258]
既存の機械翻訳の性別バイアス評価は主に男性と女性の性別に焦点を当てている。
本研究では,AmbGIMT (Gender-Inclusive Machine Translation with Ambiguous attitude words) のベンチマークを示す。
本研究では,感情的態度スコア(EAS)に基づく性別バイアス評価手法を提案する。
論文 参考訳(メタデータ) (2024-07-23T08:13:51Z) - Speech After Gender: A Trans-Feminine Perspective on Next Steps for Speech Science and Technology [1.7126708168238125]
トランスフェミニンの性別確認音声教師は、話者のアイデンティティに関する現在の理解を損なう音声に対して、ユニークな視点を持っている。
VVD(Versatile Voice dataset)は,ジェンダー付き軸に沿って声を変更する3人の話者の集合体である。
論文 参考訳(メタデータ) (2024-07-09T21:19:49Z) - How To Build Competitive Multi-gender Speech Translation Models For
Controlling Speaker Gender Translation [21.125217707038356]
発音性言語から文法性言語に翻訳する場合、生成された翻訳は、話者を参照する者を含む様々な単語に対して、明確なジェンダー代入を必要とする。
このような偏見や包括的行動を避けるために、話者の性別に関する外部から提供されたメタデータによって、話者関連表現の性別割当を導出すべきである。
本稿では、話者のジェンダーメタデータを単一の「マルチジェンダー」ニューラルSTモデルに統合し、維持しやすくすることで、同じ結果を達成することを目的とする。
論文 参考訳(メタデータ) (2023-10-23T17:21:32Z) - Will the Prince Get True Love's Kiss? On the Model Sensitivity to Gender Perturbation over Fairytale Texts [80.21033860436081]
本稿では, モデルが非現実的データ拡張を通じて, ジェンダーステレオタイプ摂動にどう反応するかを検討する。
実験結果から, 性別の摂動に直面すると, モデルの性能低下がわずかであることがわかった。
反現実的なトレーニングデータに基づいて微調整を行うと、モデルは反ステレオタイプな物語に対してより堅牢になる。
論文 参考訳(メタデータ) (2023-10-16T22:25:09Z) - Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale [58.46845567087977]
Voiceboxは、大規模音声のための最も多用途なテキスト誘導生成モデルである。
モノまたはクロスランガルのゼロショットテキスト音声合成、ノイズ除去、コンテンツ編集、スタイル変換、多様なサンプル生成に使用できる。
最先端のゼロショットTSモデルであるVALL-E(5.9%対1.9%のワードエラー率)とオーディオの類似性(0.580対0.681)は20倍高速である。
論文 参考訳(メタデータ) (2023-06-23T16:23:24Z) - Defending Your Voice: Adversarial Attack on Voice Conversion [70.19396655909455]
音声変換に対する対人攻撃を最初に行う試みについて報告する。
音声を守らなければならない話者の発話に、人間の騒音が知覚できないことを紹介する。
その結果, 変換された発話の話者特性は, 防御された話者と明らかに異なることがわかった。
論文 参考訳(メタデータ) (2020-05-18T14:51:54Z) - Multi-Dimensional Gender Bias Classification [67.65551687580552]
機械学習モデルは、性別に偏ったテキストでトレーニングする際に、社会的に望ましくないパターンを不注意に学習することができる。
本稿では,テキスト中の性バイアスを複数の実用的・意味的な次元に沿って分解する一般的な枠組みを提案する。
このきめ細かいフレームワークを用いて、8つの大規模データセットにジェンダー情報を自動的にアノテートする。
論文 参考訳(メタデータ) (2020-05-01T21:23:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。