論文の概要: STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity
- arxiv url: http://arxiv.org/abs/2606.25529v1
- Date: Wed, 24 Jun 2026 08:06:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.271949
- Title: STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity
- Title(参考訳): STEB: 音声から音声への翻訳表現度ベンチマーク
- Abstract要約: 音声音声翻訳(S2ST)は,語彙的意味だけでなく,表現的属性も保存すべきである。
中国語の32.6時間のベンチマークであるSTEB(Speech-to-Speech Translation Expressiveness Benchmark)を紹介する。
ケースドシステム,エンドツーエンドモデル,音声大言語モデルをカバーする6つのS2STシステムを評価する。
- 参考スコア(独自算出の注目度): 28.712261681696095
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech-to-speech translation (S2ST) should preserve not only lexical meaning, but also expressive attributes: emotion, scenario style (e.g., news reporting vs. dramatic dialogue), and nonverbal vocalizations (NVs). Moreover, collecting cross-lingual target speech that is both translation-faithful and expressively aligned with the source is difficult at scale, making reference-based evaluation impractical. We introduce STEB (Speech-to-Speech Translation Expressiveness Benchmark), a 32.6-hour Chinese--English benchmark that evaluates both standard dimensions (translation fidelity, speaker similarity, duration alignment) and expressiveness dimensions (emotion, scenario style, NV preservation). For expressiveness evaluation, STEB uses a caption-then-summarize framework that converts speech into structured expressive attributes and compares source and hypothesis attributes with an LLM judge. Human validation shows statistically significant correlations with listener judgments across all expressive dimensions. We evaluate six S2ST systems covering cascaded systems, end-to-end models, and speech large language models. Many systems, especially cascaded ones, achieve strong translation fidelity, but they still struggle with emotion preservation (best: 3.82/5) and NV preservation (best: 2.31/5). These results reveal a gap between semantic transfer and expressive transfer, identifying expressiveness preservation as an open challenge for S2ST. Audio samples are available at https://cmots.github.io/steb.github.io/.
- Abstract(参考訳): 音声から音声への翻訳(S2ST)は、語彙の意味だけでなく、感情、シナリオスタイル(例えば、ニュースレポーティングと劇的対話)、非言語発声(NV)といった表現的属性も保存すべきである。
さらに、翻訳に忠実で表現力のある言語間ターゲット音声の収集は大規模化が困難であり、参照に基づく評価は非現実的である。
そこで本研究では,STEB(Speech-to-Speech Translation Expressiveness Benchmark)の標準次元(翻訳忠実度,話者類似度,継続時間アライメント)と表現性次元(感情,シナリオスタイル,NV保存)を評価対象とする32.6時間中国語言語ベンチマークを紹介する。
表現性評価には、音声を構造化表現属性に変換し、ソース属性と仮説属性をLLM判定器と比較するキャプション-then-summarizeフレームワークを用いる。
人間の検証は、すべての表現的次元にわたる聴取者の判断と統計的に有意な相関を示す。
ケースドシステム,エンドツーエンドモデル,音声大言語モデルをカバーする6つのS2STシステムを評価する。
多くの系、特にカスケード化された系は強い翻訳忠実性を達成するが、感情保存(ベスト3.82/5)とNV保存(ベスト2.31/5)に苦慮している。
これらの結果から,意味伝達と表現的伝達のギャップが明らかとなり,表現性保存がS2STのオープンチャレンジであることが明らかとなった。
オーディオサンプルはhttps://cmots.github.io/steb.github.io/で入手できる。
関連論文リスト
- UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice [33.43869151508715]
表現型S2STのための新しい単一ステージフレームワークUniSSを紹介する。
提案手法は、注意深く設計された音声意味とスタイルモデリングを特徴とする。
我々は44.8k時間のデータからなる大規模で高品質な表現型S2STデータセットUniSTをリリースする。
論文 参考訳(メタデータ) (2025-09-25T13:30:46Z) - TransVIP: Speech to Speech Translation System with Voice and Isochrony Preservation [97.54885207518946]
カスケード方式で多様なデータセットを活用する新しいモデルフレームワークTransVIPを提案する。
本稿では、話者の音声特性と、翻訳過程における音源音声からの等時性を維持するために、2つの分離エンコーダを提案する。
フランス語と英語のペアに関する実験により、我々のモデルは、現在最先端の音声音声翻訳モデルよりも優れていることを示した。
論文 参考訳(メタデータ) (2024-05-28T04:11:37Z) - SeamlessM4T: Massively Multilingual & Multimodal Machine Translation [90.71078166159295]
音声から音声への翻訳,音声からテキストへの翻訳,テキストからテキストへの翻訳,最大100言語の自動音声認識をサポートする単一モデルSeamlessM4Tを紹介する。
我々は、音声とテキストの両方に英語を翻訳できる最初の多言語システムを開発した。
FLEURSでは、SeamlessM4Tが複数のターゲット言語への翻訳の新しい標準を設定し、音声からテキストへの直接翻訳において、以前のSOTAよりも20%BLEUの改善を実現している。
論文 参考訳(メタデータ) (2023-08-22T17:44:18Z) - A Holistic Cascade System, benchmark, and Human Evaluation Protocol for
Expressive Speech-to-Speech Translation [45.47457657122893]
表現型音声音声合成(S2ST)は,翻訳精度を維持しつつ,音源音声の韻律的属性を対象音声に伝達することを目的としている。
既存のS2STの研究は限定的であり、通常は一度に1つの表現性に焦点をあてる。
そこで本稿では,S2ST表現のための包括的カスケードシステムを提案する。
論文 参考訳(メタデータ) (2023-01-25T14:27:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。