論文の概要: VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
- arxiv url: http://arxiv.org/abs/2604.17248v1
- Date: Sun, 19 Apr 2026 04:22:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.416128
- Title: VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
- Title(参考訳): VIBE:実世界音声による大規模音声言語モデルの音声によるオープンエンドバイアス評価
- Authors: Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee,
- Abstract要約: LALM(Large Audio-Language Models)は、日々のアプリケーションにますます統合されているが、その生成バイアスは未発見のままである。
本研究では、実世界の人間記録を用いて、パーソナライズされたレコメンデーションなどのオープンなタスクを通じて生成バイアスを評価する枠組みを提案する。
ジェンダー・キューはアクセント・キューよりも大きな分布シフトを引き起こすことが多く、現在のLALMは社会的ステレオタイプを再現することを示している。
- 参考スコア(独自算出の注目度): 50.73412962989565
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large Audio-Language Models (LALMs) are increasingly integrated into daily applications, yet their generative biases remain underexplored. Existing speech fairness benchmarks rely on synthetic speech and Multiple-Choice Questions (MCQs), both offering a fragmented view of fairness. We propose VIBE, a framework that evaluates generative bias through open-ended tasks such as personalized recommendations, using real-world human recordings. Unlike MCQs, our method allows stereotypical associations to manifest organically without predefined options, making it easily extensible to new tasks. Evaluating 11 state-of-the-art LALMs reveals systematic biases in realistic scenarios. We find that gender cues often trigger larger distributional shifts than accent cues, indicating that current LALMs reproduce social stereotypes.
- Abstract(参考訳): LALM(Large Audio-Language Models)は、日々のアプリケーションにますます統合されているが、その生成バイアスは未発見のままである。
既存の音声公正度ベンチマークは、合成音声とマルチパス質問(MCQ)に依存しており、どちらも公平性の断片化されたビューを提供する。
本研究では、実世界の人間記録を用いて、パーソナライズされたレコメンデーションなどのオープンなタスクを通じて生成バイアスを評価するフレームワークVIBEを提案する。
MCQとは違って,本手法では,事前定義されたオプションを使わずに,ステレオタイプ的アソシエーションを有機的に表現することができ,新しいタスクに容易に拡張できる。
11の最先端のLALMを評価することで、現実的なシナリオにおける体系的なバイアスが明らかになる。
ジェンダー・キューはアクセント・キューよりも大きな分布シフトを引き起こすことが多く、現在のLALMは社会的ステレオタイプを再現することを示している。
関連論文リスト
- VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs [54.75016325571445]
音声大言語モデル (LLM) は, 音声の感情認識において, 生成インタフェースを介する大きな可能性を示す。
クローズドセットからオープンテキスト生成へのシフトは、ゼロショット性を導入し、プロンプトに非常に敏感な評価を与える。
本稿では,VoxEmoについて紹介する。VoxEmoは音声LLMのための15言語に35の感情コーパスを含む総合的なSERベンチマークである。
論文 参考訳(メタデータ) (2026-03-09T21:10:34Z) - Bi-directional Bias Attribution: Debiasing Large Language Models without Modifying Prompts [29.864293711943038]
本研究では, 言語モデルにおいて, ステレオタイプ誘導語を検出し, ニューロンレベルのバイアスをもたらすフレームワークを提案する。
本フレームワークはまず, 集団間の比較分析により, ステレオタイプ誘導形容詞と名詞を識別する。
3つの LLM 実験により,本手法はモデル全体の性能を保ちながらバイアスを効果的に低減することを示した。
論文 参考訳(メタデータ) (2026-02-04T10:27:36Z) - A Comprehensive Study of Implicit and Explicit Biases in Large Language Models [1.0555164678638427]
この研究は、生成的AIが増大する中で、大規模言語モデルにおけるバイアスに対処する必要があることを強調する。
我々は, StereoSet や CrowSPairs などのバイアス特異的ベンチマークを用いて,BERT や GPT 3.5 といった複数の生成モデルにおける様々なバイアスの存在を評価する。
その結果、微調整されたモデルでは性別バイアスに悩まされるが、人種バイアスの特定と回避には優れていた。
論文 参考訳(メタデータ) (2025-11-18T05:27:17Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild [40.210224623581155]
マルチモーダル大規模言語モデル (LLM) は直接音声対話の強力な機能を示している。
既存の評価手法は、しばしばテキストベースのベンチマークに適応し、音声の特徴や課題を見下ろしている。
本稿では,実践会話におけるエンドツーエンドの音声LLMを体系的に評価するために設計された,最初の総合的ベンチマークを紹介する。
論文 参考訳(メタデータ) (2025-06-27T03:18:45Z) - CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition [49.27067541740956]
モデルアーキテクチャの変更や人口統計情報への依存を伴わずにバイアスを緩和する信頼性指向音声強調脱バイアス手法であるCO-VADAを提案する。
CO-VADAはトレーニングデータに存在するバイアスパターンを反映したトレーニングサンプルを特定し、無関係な属性を変更してサンプルを生成するために音声変換を適用する。
我々のフレームワークは様々なSERモデルや音声変換ツールと互換性があり、SERシステムの公平性を改善するためのスケーラブルで実用的なソリューションとなっている。
論文 参考訳(メタデータ) (2025-06-06T13:25:56Z) - Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models [50.40276881893513]
本研究では,音声大言語モデル(SLLM)における社会的バイアスの評価を目的としたデータセットであるSpken Stereosetを紹介する。
多様な人口集団の発話に対して異なるモデルがどのように反応するかを調べることで、これらのバイアスを特定することを目指している。
これらの結果から,ほとんどのモデルではバイアスが最小であるが,ステレオタイプや反ステレオタイプ傾向がわずかにみられた。
論文 参考訳(メタデータ) (2024-08-14T16:55:06Z) - Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models [38.64792118903994]
SILLMのジェンダーバイアスを4つの意味的タスクで評価した。
分析の結果, バイアスレベルは言語に依存し, 評価方法によって異なることが明らかとなった。
論文 参考訳(メタデータ) (2024-07-09T15:35:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。