論文の概要: RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems
- arxiv url: http://arxiv.org/abs/2607.14846v1
- Date: Thu, 16 Jul 2026 11:15:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.081338
- Title: RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems
- Title(参考訳): RW-Voice-EQ Bench: 音声AIシステム評価のための実世界のベンチマーク
- Authors: David Ayllon, Alice Baird, Jeffrey Brooks, Franc Camps-Febrer, Jakub Piotr Cłapa, Theo Lebryk, Jens Madsen, Olya Ossipova, Sharath Rao, Hoon Shin, Tigran Soghbatyan, Georg Streich, Rashish Tandon, Panagiotis Tzirakis,
- Abstract要約: テキスト音声(TTS)、音声音声(STS)、音声理解(SU)、音声認識(ASR)による音声AI評価のための多次元ベンチマークであるReal World Voice EQ Benchを紹介する。
評価の結果, 性能は高次元比であることが示唆された。
- 参考スコア(独自算出の注目度): 5.434878413067881
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current voice AI benchmarks typically evaluate isolated capabilities such as speech intelligibility, word error rate, or text-based dialogue quality, but they rarely test whether systems harness the acoustic information that distinguishes spoken language from its textual representation. To this end, we introduce the Real World Voice EQ Bench, a multidimensional benchmark for evaluating voice AI across text-to-speech (TTS), speech-to-speech (STS), speech understanding (SU), and automatic speech recognition (ASR). Our evaluations indicate that performance is highly dimension-specific. For TTS, naturalness, expressiveness, identity stability, and reliability are largely independent evaluation dimensions. For STS, access to audio does not guarantee use of vocal affect, and some agents remain largely transcript-driven. For SU, models perform unevenly across paralinguistic tasks. For ASR, real world accent, emotion, noise, and conversational conditions expose failures that are not captured by established clean-speech benchmarks. Together, these results show that voice AI should be evaluated as a profile of acoustic, expressive, interactional, and robustness capabilities rather than by a single aggregate score.
- Abstract(参考訳): 現在の音声AIベンチマークは、通常、音声のインテリジェンス、単語エラー率、テキストベースの対話品質などの孤立した機能を評価するが、音声言語をそのテキスト表現と区別する音響情報を利用するかどうかをテストすることは滅多にない。
この目的のために、テキスト音声(TTS)、音声音声(STS)、音声理解(SU)、自動音声認識(ASR)で音声AIを評価するための多次元ベンチマークであるReal World Voice EQ Benchを紹介する。
評価の結果, 性能は高次元比であることが示唆された。
TTSにとって、自然性、表現性、アイデンティティ安定性、信頼性は、主に独立した評価次元である。
STSでは、音声へのアクセスは音声による影響を保証していない。
SU の場合、モデルはパラ言語的タスクに対して不均一に実行される。
ASRでは、現実世界のアクセント、感情、ノイズ、会話の条件が、確立されたクリーン音声ベンチマークでは捉えられない失敗を露呈する。
これらの結果から,音声AIは単一のスコアではなく,音響的,表現的,相互作用的,堅牢性のプロファイルとして評価されるべきであることが示唆された。
関連論文リスト
- SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models [9.873637206435967]
音声対音声言語モデルのストリーミングは、音声クエリに合成音声で直接答えることを目的としている。
標準的なベンチマークでは、これらのシステムが会話の中で自然に振る舞うかどうかを捉えていない。
本研究では,音声合成言語モデルにおける自然性評価のベンチマークであるSPEARBenchを紹介する。
論文 参考訳(メタデータ) (2026-07-06T17:42:59Z) - PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions [7.858383859663038]
この研究は、アクセント、自発性、およびドメイン固有の発話に起因する変動性に焦点を当てている。
特に,マルチアクセント音声データセットであるPAper Reading DAtaset(PAREDA)を紹介する。
我々は,アクセント混合の影響と発話速度の増加を解析し,PAREDA上でのSOTA ASRモデルの性能評価を行った。
論文 参考訳(メタデータ) (2026-05-18T05:10:26Z) - VoiceAgentBench: Are Voice Assistants ready for agentic tasks? [5.639970295197759]
本稿では,現実的な音声エージェント設定におけるSpeechLMの評価ベンチマークであるVoiceAgentBenchを紹介する。
インドの文脈に根ざした5,500以上の合成音声クエリで構成されている。
ツール選択の正確性、構造的整合性、ツールの実行の正しさを測定する。
論文 参考訳(メタデータ) (2025-10-09T09:11:38Z) - AHELM: A Holistic Evaluation of Audio-Language Models [78.20477815156484]
マルチモーダルオーディオ言語モデル(ALM)は、インターリーブされた音声とテキストを入力および出力テキストとして取り込む。
AHELMは、PARADEとCoRe-Benchと呼ばれる2つの新しい合成オーディオテキストデータセットを含む、さまざまなデータセットを集約するベンチマークである。
また、モデル間の等価比較を確保するために、プロンプト、推論パラメータ、評価指標を標準化する。
論文 参考訳(メタデータ) (2025-08-29T07:40:39Z) - Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio [52.859261069569165]
音声テキスト生成のための手話,唇の動き,音声の多様な組み合わせを扱える最初の統一フレームワークを提案する。
i)不均一な入力を効果的に処理できる統一されたモダリティ非依存アーキテクチャの設計、(ii)モダリティ間の過小評価された相乗効果の探索、特に手話理解における非手動的手がかりとしての唇運動の役割、(iii)個々のタスクに特化した最先端モデルと同等以上のパフォーマンスを達成すること、の3つの目的に焦点をあてる。
論文 参考訳(メタデータ) (2025-08-28T06:51:42Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - SpeechIQ: Speech Intelligence Quotient Across Cognitive Levels in Voice Understanding Large Language Models [76.07833875692722]
音声に基づくインテリジェンス・クオシエント(SIQ)は、人間の認知にインスパイアされた評価パイプラインの新たな形態であり、大きな言語モデルを理解するためのものである。
私たちのフレームワークは、認知原則を音声指向のベンチマークでブリッジする、第一種知能検査を表現しています。
論文 参考訳(メタデータ) (2025-07-25T15:12:06Z) - Where are we in audio deepfake detection? A systematic analysis over generative and detection models [59.09338266364506]
SONARはAI-Audio Detection FrameworkとBenchmarkの合成である。
最先端のAI合成聴覚コンテンツを識別するための総合的な評価を提供する。
従来のモデルベース検出システムと基礎モデルベース検出システムの両方で、AIオーディオ検出を均一にベンチマークする最初のフレームワークである。
論文 参考訳(メタデータ) (2024-10-06T01:03:42Z) - Topic Identification For Spontaneous Speech: Enriching Audio Features
With Embedded Linguistic Information [10.698093106994804]
音声からの従来の話題識別ソリューションは、音声認識システム(ASR)に依存して書き起こしを生成する。
テキストと音声を共同で活用する,音声のみとハイブリッド技術の比較を行った。
フィンランドの自然発話で評価されたモデルは、純粋な音声ベースのソリューションが、ASRコンポーネントが利用できない場合に実行可能な選択肢であることを示している。
論文 参考訳(メタデータ) (2023-07-21T09:30:46Z) - High-Quality Automatic Voice Over with Accurate Alignment: Supervision
through Self-Supervised Discrete Speech Units [69.06657692891447]
本稿では,自己教師付き離散音声単位予測の学習目的を活用した新しいAVO手法を提案する。
実験結果から,提案手法は有意な唇音声同期と高音質を実現することが示された。
論文 参考訳(メタデータ) (2023-06-29T15:02:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。