論文の概要: English to Central Kurdish Speech Translation: Corpus Creation, Evaluation, and Orthographic Standardization
- arxiv url: http://arxiv.org/abs/2604.00613v1
- Date: Wed, 01 Apr 2026 08:14:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.904032
- Title: English to Central Kurdish Speech Translation: Corpus Creation, Evaluation, and Orthographic Standardization
- Title(参考訳): 英語から中央クルド語への音声翻訳:コーパス作成、評価、オーソグラフィ標準化
- Authors: Mohammad Mohammadamini, Daban Q. Jaff, Josep Crego, Marie Tahon, Antoine Laurent,
- Abstract要約: KUTEDは、Central Kurdishのための音声からテキストへの変換(S2TT)データセットである。
コーパスには91,000の文対が含まれており、170時間の英語音声、165万の英語トークン、140万の中央クルド人トークンが含まれている。
我々は、S2TTタスク上でKUTEDを評価し、正書法の変化がクルド語翻訳性能を著しく低下させ、非標準出力を生成することを発見した。
本稿では,性能向上とより一貫性のある翻訳を実現するための体系的なテキスト標準化手法を提案する。
- 参考スコア(独自算出の注目度): 9.645256465293025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present KUTED, a speech-to-text translation (S2TT) dataset for Central Kurdish, derived from TED and TEDx talks. The corpus comprises 91,000 sentence pairs, including 170 hours of English audio, 1.65 million English tokens, and 1.40 million Central Kurdish tokens. We evaluate KUTED on the S2TT task and find that orthographic variation significantly degrades Kurdish translation performance, producing nonstandard outputs. To address this, we propose a systematic text standardization approach that yields substantial performance gains and more consistent translations. On a test set separated from TED talks, a fine-tuned Seamless model achieves 15.18 BLEU, and we improve Seamless baseline by 3.0 BLEU on the FLEURS benchmark. We also train a Transformer model from scratch and evaluate a cascaded system that combines Seamless (ASR) with NLLB (MT).
- Abstract(参考訳): 本稿では、Central Kurdishのための音声テキスト翻訳(S2TT)データセットであるKUTEDについて述べる。
コーパスには91,000の文対が含まれており、170時間の英語音声、165万の英語トークン、140万の中央クルド人トークンが含まれている。
我々は、S2TTタスク上でKUTEDを評価し、正書法の変化がクルド語翻訳性能を著しく低下させ、非標準出力を生成することを発見した。
そこで本研究では,性能向上とより一貫性のある翻訳を実現するための,体系的なテキスト標準化手法を提案する。
TEDトークから分離したテストセットでは、微調整されたSeamlessモデルが15.18BLEUを達成するとともに、FLEURSベンチマークで3.0BLEUでSeamlessベースラインを改善する。
また,Transformerモデルをゼロからトレーニングし,Seamless(ASR)とNLLB(MT)を組み合わせたケースドシステムの評価を行う。
関連論文リスト
- FLEURS-Kobani: Extending the FLEURS Dataset for Northern Kurdish [0.8164433158925593]
我々は、FLEURSベンチマークの北クルド拡張であるFLEURS-Kobaniを紹介する。
データセットは、検証された発話5,162件で構成され、合計18時間24分である。
ベンチマークカバレッジを、リソース不足のクルド人にも拡張する。
論文 参考訳(メタデータ) (2026-03-31T15:40:01Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - SeamlessM4T: Massively Multilingual & Multimodal Machine Translation [90.71078166159295]
音声から音声への翻訳,音声からテキストへの翻訳,テキストからテキストへの翻訳,最大100言語の自動音声認識をサポートする単一モデルSeamlessM4Tを紹介する。
我々は、音声とテキストの両方に英語を翻訳できる最初の多言語システムを開発した。
FLEURSでは、SeamlessM4Tが複数のターゲット言語への翻訳の新しい標準を設定し、音声からテキストへの直接翻訳において、以前のSOTAよりも20%BLEUの改善を実現している。
論文 参考訳(メタデータ) (2023-08-22T17:44:18Z) - ON-TRAC Consortium Systems for the IWSLT 2022 Dialect and Low-resource
Speech Translation Tasks [8.651248939672769]
本稿では,IWSLT 2022の評価キャンペーンにおける2つの課題トラックに対して開発されたON-TRACコンソーシアム翻訳システムについて述べる。
ASRの大規模微調整wav2vec 2.0モデルを利用するカスケードモデルと比較した。
この結果から,小型のターゲットデータを用いた自己教師型モデルの方が,大規模な市販モデルに比べて低リソースのSTファインチューニングに有効であることが示唆された。
論文 参考訳(メタデータ) (2022-05-04T10:36:57Z) - CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus [57.641761472372814]
CoVoSTは11言語から英語への多言語による音声からテキストへの翻訳コーパスである。
11,000人以上の話者と60以上のアクセントで多様化した。
CoVoSTはCC0ライセンスでリリースされており、無料で利用できる。
論文 参考訳(メタデータ) (2020-02-04T14:35:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。