論文の概要: SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models
- arxiv url: http://arxiv.org/abs/2607.05365v1
- Date: Mon, 06 Jul 2026 17:42:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.269338
- Title: SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models
- Title(参考訳): SPEARBench: 音声合成言語モデルにおける自然性評価ベンチマーク
- Authors: Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez,
- Abstract要約: 音声対音声言語モデルのストリーミングは、音声クエリに合成音声で直接答えることを目的としている。
標準的なベンチマークでは、これらのシステムが会話の中で自然に振る舞うかどうかを捉えていない。
本研究では,音声合成言語モデルにおける自然性評価のベンチマークであるSPEARBenchを紹介する。
- 参考スコア(独自算出の注目度): 9.873637206435967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Streaming speech-to-speech language models aim to answer spoken queries directly with synthetic speech. However, standard speech and text benchmarks do not capture whether these systems behave naturally in conversations, where timing, turn-taking, prosody, interpersonal stance, language and dialect consistency, and relationship-aware appropriateness jointly shape perceived quality. We introduce SPEARBench, a benchmark for evaluating naturalness in speech-to-speech language models from question-answer interactions. SPEARBench constructs controlled dialogue prompts from the Seamless Interaction corpus, runs inference across multiple models, and evaluates generated answers using a multidimensional protocol that covers response latency, interruptions, speech quality, ASR robustness, language and dialect consistency, emotional naturalness, interpersonal stance, and explainable distributional baselines. The benchmark includes original human answers as a reference condition and reports results for several contemporary models. Results show that current models can achieve high signal-level quality and low ASR error while still differing from human conversational behavior in latency, overlap, dialect preservation, emotional adaptation, and interpersonal stance dynamics.
- Abstract(参考訳): 音声対音声言語モデルのストリーミングは、音声クエリに合成音声で直接答えることを目的としている。
しかし、標準的な音声とテキストのベンチマークは、これらのシステムが会話において自然に振る舞うかどうかを捉えていない。
本研究では,音声合成言語モデルにおける自然性評価のベンチマークであるSPEARBenchを紹介する。
SPEARBenchは、Seamless Interaction corpusから制御された対話プロンプトを構築し、複数のモデルにわたって推論を行い、応答遅延、中断、音声品質、ASRの堅牢性、言語と方言の一貫性、感情的自然性、対人的姿勢、説明可能な分布ベースラインをカバーする多次元プロトコルを用いて、生成された回答を評価する。
このベンチマークには、参照条件としてオリジナルの人間の回答が含まれており、いくつかの現代モデルの結果が報告されている。
その結果、現在のモデルでは、レイテンシ、オーバーラップ、方言の保存、感情適応、対人姿勢のダイナミクスといった人間の会話行動とは相変わらず、高い信号レベルの品質と低いASR誤差を達成できることがわかった。
関連論文リスト
- PAREDA: A Multi-Accent Speech Dataset of Natural Language Processing Research Discussions [7.858383859663038]
この研究は、アクセント、自発性、およびドメイン固有の発話に起因する変動性に焦点を当てている。
特に,マルチアクセント音声データセットであるPAper Reading DAtaset(PAREDA)を紹介する。
我々は,アクセント混合の影響と発話速度の増加を解析し,PAREDA上でのSOTA ASRモデルの性能評価を行った。
論文 参考訳(メタデータ) (2026-05-18T05:10:26Z) - On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction [12.216811577733125]
本稿では,E2E音声対話システムを評価するためのオープンソースのベンチマークであるAudio MultiChallengeを紹介する。
そこで我々は,中発音声の補聴とバックトラックに対する頑健さを検査する新軸音声編集手法を提案する。
47の話者と1,712のインスタンス固有のルーリックとの452の会話を、オーディオネイティブエージェントとヒューマンインザループパイプラインのハイブリッドを通じてキュレートする。
論文 参考訳(メタデータ) (2025-12-16T19:26:44Z) - SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models [60.72029578488467]
SpeechRは、大規模な音声言語モデルにおける音声に対する推論を評価するための統一的なベンチマークである。
事実検索、手続き推論、規範的判断の3つの重要な側面に沿ったモデルを評価する。
11個の最先端のLALMの評価は、高い転写精度が強い推論能力に変換されないことを示している。
論文 参考訳(メタデータ) (2025-08-04T03:28:04Z) - Aligning Spoken Dialogue Models from User Interactions [55.192134724622235]
本稿では,ユーザの対話からリアルタイム会話における音声対話モデルを改善するための新しい嗜好アライメントフレームワークを提案する。
AIフィードバックを付加した生のマルチターン音声会話から15万以上の好みペアのデータセットを作成する。
本研究は, 自然なリアルタイム音声対話システムにおいて重要な, 様々な力学におけるバランスの整合性の重要性を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-26T16:45:20Z) - Towards Efficient Speech-Text Jointly Decoding within One Speech Language Model [76.06585781346601]
音声言語モデル(Speech LMs)は、単一のモデル内でエンドツーエンドの音声テキストモデリングを可能にする。
音声テキストの共同復号パラダイムの選択は、性能、効率、アライメント品質において重要な役割を担っている。
論文 参考訳(メタデータ) (2025-06-04T23:53:49Z) - VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models [31.584937435966253]
音声対話能力を評価するためにVocalBenchを提案する。
4つのキーディメンションにわたる9,400の慎重にキュレートされたインスタンスで構成されている。
効果的な音声対話に不可欠な、幅広い基本的なスキルをカバーしている。
論文 参考訳(メタデータ) (2025-05-21T16:34:07Z) - Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities [93.09944267871163]
FullDuplexBenchは、重要なインタラクティブな振る舞いを体系的に評価するベンチマークである。
ベンチマークコードを公開することによって、音声対話モデリングの進歩と、より自然で魅力的なSDMの開発を目指しています。
論文 参考訳(メタデータ) (2025-03-06T18:59:16Z) - Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation [6.225927189801006]
本稿では,パジングパターンに関連する構文的手法と音響的手法の両方を包括的にモデル化する新しい枠組みを提案する。
注目に値することに、我々のフレームワークは、より拡張され複雑なドメイン外文(OOD)であっても、自然言語を一貫して生成する能力を持っている。
論文 参考訳(メタデータ) (2024-04-03T09:17:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。