論文の概要: Machine Translation between English and Syriac (East Syriac Dialect) using Statistical Machine Learning
- arxiv url: http://arxiv.org/abs/2609.18529v1
- Date: Wed, 16 Sep 2026 11:58:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.788685
- Title: Machine Translation between English and Syriac (East Syriac Dialect) using Statistical Machine Learning
- Title(参考訳): 統計的機械学習を用いた英語とシリア語(東シリア語)の機械翻訳
- Abstract要約: ユネスコはアッシリア語を絶滅危惧言語とみなしている。
アッシリア語は世界中で話されているが、言語人口は定かではない(50,000人から1500,000人)。シリア語は自然言語処理(NLP)において最も研究されていない言語の一つである。
本研究は,モーゼスフレームワークを用いた英語-アッシリア語 MT のための最初のフレーズベース統計 MT (SMT) モデルを開発した。
- 参考スコア(独自算出の注目度): 1.3464152928754487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: UNESCO considers the Assyrian (Syriac) language an endangered language. Although Assyrians speak the language worldwide, the speaking population is uncertain (ranging from 500,000 to 1,500,000). Syriac is also one of the least studied languages in Natural Language Processing (NLP). Despite advances in Machine Translation (MT) over the past decade, the lack of publicly available corpora and the orthographic complexity of the Syriac script, specifically the Madnkhaya script, have left this language entirely ignored in the computational linguistics literature. This study develops the first phrase-based Statistical MT (SMT) model for English-to-Assyrian MT using the Moses framework. We created a dataset of 38,847 sentence pairs from the complete English and Syriac Bible, merging a pre-existing New Testament dataset with an Old Testament built from scratch through PDF extraction, using custom segmentation scripts and manual alignment review by three bilingual annotators. The Syriac side of the corpus undergoes diacritic removal and Byte-Pair Encoding tokenization to reduce orthographic sparsity before training. We trained and evaluated six models using different configurations and splitting-scheme ratios, language model order, distortion limits, and the inclusion of an Operation Sequence Model. The best-performing configuration achieves a word-level BLEU score of 23.54. Human evaluation by 11 native Assyrian speakers resulted in mean adequacy and fluency scores of 3.42 and 3.34 out of 5, respectively. These results are consistent with comparable low-resource SMT models trained on Biblical corpora for morphologically rich Semitic languages. The corpora, scripts, and trained model are publicly available, providing the research community with the first systematically curated English-Syriac dataset and a reproducible baseline for future MT and broader NLP work on this endangered language.
- Abstract(参考訳): ユネスコはアッシリア語を絶滅危惧言語とみなしている。
アッシリア語は世界中で話されているが、言語人口は不確実である(50万から1500万まで)。
シリア語はまた、自然言語処理(NLP)において最も研究されていない言語の一つである。
過去10年間の機械翻訳(MT)の進歩にもかかわらず、公用コーパスの欠如とシリア文字(特にマダンハヤ文字)の正書法的な複雑さは、この言語を計算言語学の文献で完全に無視している。
本研究は,モーゼスフレームワークを用いた英語-アッシリア語 MT のための最初のフレーズベース統計 MT (SMT) モデルを開発した。
既存のNew TestamentデータセットとPDF抽出を通じてスクラッチから構築されたOld Testamentデータセットを組み合わせ、カスタムセグメンテーションスクリプトと3つのバイリンガルアノテータによる手動アライメントレビューを使用して、完全な英語とシリア語聖書から38,847の文対のデータセットを作成しました。
コーパスのシリア側では、トレーニング前の正書法間隔を減らすために、ダイアクリティカルな除去とByte-Pair Encodingトークン化が実施されている。
我々は、異なる構成と分割スキーム比、言語モデルの順序、歪み制限、オペレーションシーケンスモデルを含む6つのモデルを訓練し、評価した。
最高性能のBLEUスコアは23.54である。
アッシリア語話者11名による人的評価の結果、平均精度は5点中3.42点と3.34点であった。
これらの結果は、形態学的にリッチなセマンティック言語のための聖書コーパスで訓練された低リソースSMTモデルと同等である。
コーパス、スクリプト、トレーニングされたモデルは公開されており、研究コミュニティに最初の体系化されたイングリッシュ・シリアックデータセットと、将来のMTのための再現可能なベースラインと、この絶滅危惧言語に関するより広範なNLP作業を提供する。
関連論文リスト
- DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing [0.0]
DATASHIは、Amazigh言語における計算リソースの重大なギャップを埋める、新しい並列英語タシュレイトコーパスである。
5000の文対を含み、1500文のサブセットがあり、専門家の標準化と非標準のユーザ生成バージョンがある。
論文 参考訳(メタデータ) (2026-03-23T04:46:59Z) - Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion [0.0]
本研究は、英語・英語翻訳における最先端多言語ニューラルマシン翻訳モデルの有効性を評価する。
我々はこのデータセット上でmT5多言語モデルとNLLB200モデルの両方を微調整した。
本研究は,低リソース言語のための実用的な機械翻訳ツールの開発の可能性を示すものである。
論文 参考訳(メタデータ) (2026-03-16T06:17:22Z) - ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining [0.0]
本稿では,KS-LIT-3Mについて紹介する。KS-LIT-3MはKashmiri上での事前学習用に特別に設計された3100万語(164万文字)のコーパスである。
データセットはCC-BY-4.0ライセンスでリリースされ、Kashmiri自然言語処理の研究を容易にする。
論文 参考訳(メタデータ) (2026-01-03T06:43:26Z) - Winning with Less for Low Resource Languages: Advantage of Cross-Lingual English_Persian Argument Mining Model over LLM Augmentation [0.12744523252873352]
本稿では,低リソース言語における議論マイニングのための言語間アプローチを活用することを目的とする。
我々は、高リソース言語として英語、低リソース言語としてペルシア語でモデルを検証した。
論文 参考訳(メタデータ) (2025-11-25T21:36:39Z) - LIMIT: Language Identification, Misidentification, and Translation using
Hierarchical Models in 350+ Languages [27.675441924635294]
現在のシステムは世界の7000の言語の大部分を正確に識別することはできない。
まず、350以上の言語で50Kの多言語・並列児童話のコーパスMCS-350をコンパイルする。
言語識別のための新しい誤予測分解階層モデル LIMIt を提案する。
論文 参考訳(メタデータ) (2023-05-23T17:15:43Z) - No Language Left Behind: Scaling Human-Centered Machine Translation [69.28110770760506]
低レベルの言語と高レベルの言語のパフォーマンスギャップを狭めるためのデータセットとモデルを作成します。
何千ものタスクをトレーニングしながらオーバーフィッティングに対処するために,複数のアーキテクチャとトレーニングの改善を提案する。
本モデルでは,従来の最先端技術と比較して,BLEUの44%の改善を実現している。
論文 参考訳(メタデータ) (2022-07-11T07:33:36Z) - Improving the Lexical Ability of Pretrained Language Models for
Unsupervised Neural Machine Translation [127.81351683335143]
クロスリンガルプリトレーニングは、2つの言語の語彙的表現と高レベル表現を整列させるモデルを必要とする。
これまでの研究では、これは表現が十分に整合していないためです。
本稿では,語彙レベルの情報で事前学習するバイリンガルマスク言語モデルを,型レベルのクロスリンガルサブワード埋め込みを用いて強化する。
論文 参考訳(メタデータ) (2021-03-18T21:17:58Z) - Cross-lingual Machine Reading Comprehension with Language Branch
Knowledge Distillation [105.41167108465085]
言語間機械読解(CLMRC)は、ローソース言語に大規模なデータセットがないため、依然として難しい問題である。
本稿では,Language Branch Machine Reading (LBMRC) という新しい拡張手法を提案する。
LBMRCは、個々の言語に精通したMultiple Machine Read comprehension (MRC)モデルを訓練する。
複数の言語分岐モデルから全ての対象言語に対する単一モデルへのアマルガメート知識の多言語蒸留アプローチを考案する。
論文 参考訳(メタデータ) (2020-10-27T13:12:17Z) - Pre-training Multilingual Neural Machine Translation by Leveraging
Alignment Information [72.2412707779571]
mRASPは、汎用多言語ニューラルマシン翻訳モデルを事前訓練するためのアプローチである。
我々は,低,中,豊かな資源を含む多種多様な環境における42の翻訳方向の実験を行い,エキゾチックな言語対への変換を行った。
論文 参考訳(メタデータ) (2020-10-07T03:57:54Z) - Reusing a Pretrained Language Model on Languages with Limited Corpora
for Unsupervised NMT [129.99918589405675]
本稿では,オープンソース言語上でのみ事前訓練されたLMを再利用する効果的な手法を提案する。
モノリンガルLMは両言語で微調整され、UNMTモデルの初期化に使用される。
我々のアプローチであるRE-LMは、英語・マケドニア語(En-Mk)と英語・アルバニア語(En-Sq)の競合言語間事前学習モデル(XLM)より優れています。
論文 参考訳(メタデータ) (2020-09-16T11:37:10Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。