論文の概要: Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
- arxiv url: http://arxiv.org/abs/2605.09092v1
- Date: Sat, 09 May 2026 17:57:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.517669
- Title: Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
- Title(参考訳): 並列語彙コーパスを用いたタジク・ペルシアン文字変換のための文字レベル変換器
- Abstract要約: 本研究は、タジク文字からペルシア文字(ペルソ・アラビア文字)への自動翻訳について述べる。
本稿では,52,152個のタジク語,ペルシャ語,短文の並列コーパスについて検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This study addresses automatic transliteration from Tajik (Cyrillic script) to Persian (Perso-Arabic script). We present a curated, lexicographically verified parallel corpus of 52,152 Tajik--Persian words and short phrases, compiled from printed dictionaries, encyclopedic sources, and manually verified online resources. To the best of our knowledge, this is one of the largest publicly available word-level corpora for Tajik--Persian transliteration. Using this corpus, we train a character-level sequence-to-sequence Transformer model and evaluate it using Character Error Rate (CER) and exact-match accuracy. The Transformer achieves a CER of 0.3216 and an exact-match accuracy of 0.3133, outperforming both dictionary-based rule-based and recurrent neural baselines. With beam search (k=3), performance further improves to CER 0.3182 and accuracy 0.3215. We describe the data collection and preprocessing pipeline, model architecture, and experimental protocol, and report a part-of-speech analysis showing performance differences across lexical categories. All preprocessing scripts, deterministic splits into training, validation, and test sets, and training configurations are released to support reproducibility and further research on Tajik and related Persian dialects. The corpus supports research in character-level transliteration, cross-script NLP, and lexicographic applications.
- Abstract(参考訳): 本研究では,タジク文字からペルシア文字(ペルソ・アラビア文字)への自動翻訳について述べる。
本稿では,印刷辞書,百科事典,手作業によるオンラインリソースから編集した,52,152個のタジク語・短文の並列コーパスについて述べる。
我々の知る限りでは、これはタジク語-ペルシャ語音訳のための最大公用単語レベルのコーパスの1つである。
このコーパスを用いて,文字レベルのシーケンス・ツー・シーケンス・トランスフォーマモデルを訓練し,文字誤り率(CER)と正確なマッチング精度を用いて評価する。
Transformer は CER が 0.3216 であり、精度は 0.3133 であり、辞書ベースの規則ベースと繰り返しの神経ベースラインの両方を上回っている。
ビームサーチ(k=3)により、CER 0.3182 と精度 0.3215 がさらに向上する。
本稿では,データ収集および前処理パイプライン,モデルアーキテクチャ,実験プロトコルについて述べる。
すべての前処理スクリプト、決定論的分割をトレーニング、検証、テストセットに分割し、再現性をサポートし、タジク語と関連ペルシア語の方言についてさらなる研究を行うためのトレーニング構成をリリースしている。
コーパスは文字レベルの翻訳、クロススクリプトNLP、レキソグラフィーの応用の研究を支援する。
関連論文リスト
- TajPersLexon: A Tajik-Persian Lexical Resource and Hybrid Model for Cross-Script Low-Resource NLP [0.0]
この研究はTajPersLexonを紹介した。Tajik-Persian並列語彙資源は40,112ワードとショートフレーズ対である。
i) 軽量ハイブリッドパイプライン, (ii) ニューラルシークエンス・ツー・シーケンスモデル, (iii) 検索手法の3つの手法を比較検討した。
評価の結果、この課題は基本的に解決可能であり、ニューラルネットワークと検索ベースラインが98-99%のトップ1精度を実現していることがわかった。
論文 参考訳(メタデータ) (2026-05-07T19:37:34Z) - Idiom Detection in Sorani Kurdish Texts [1.174020933567308]
本研究は,Sorani Kurdishにおける深層学習技術を用いたテキスト分類タスクとしてアプローチすることで,検出に対処する。
我々は、KuBERTベースのトランスフォーマーシーケンス分類、RCNN(Recurrent Convolutional Neural Network)、注意機構を備えたBiLSTMモデルという3つのディープラーニングモデルを開発し、評価した。
評価の結果,変圧器モデルである細調整BERTが他のモデルより一貫して優れており,精度は99%近くであった。
論文 参考訳(メタデータ) (2025-01-24T14:31:30Z) - T3L: Translate-and-Test Transfer Learning for Cross-Lingual Text
Classification [50.675552118811]
言語間テキスト分類は通常、様々な言語で事前訓練された大規模多言語言語モデル(LM)に基づいて構築される。
本稿では,古典的な「翻訳とテスト」パイプラインを再考し,翻訳と分類の段階を適切に分離することを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:33:22Z) - Multilingual Extraction and Categorization of Lexical Collocations with
Graph-aware Transformers [86.64972552583941]
我々は,グラフ対応トランスフォーマアーキテクチャにより拡張されたBERTに基づくシーケンスタグ付けモデルを提案し,コンテキストにおけるコロケーション認識の課題について評価した。
以上の結果から, モデルアーキテクチャにおける構文的依存関係を明示的に符号化することは有用であり, 英語, スペイン語, フランス語におけるコロケーションのタイプ化の差異について考察する。
論文 参考訳(メタデータ) (2022-05-23T16:47:37Z) - ChrEnTranslate: Cherokee-English Machine Translation Demo with Quality
Estimation and Corrective Feedback [70.5469946314539]
ChrEnTranslateは、英語と絶滅危惧言語チェロキーとの翻訳のためのオンライン機械翻訳デモシステムである。
統計モデルとニューラルネットワークモデルの両方をサポートし、信頼性をユーザに通知するための品質評価を提供する。
論文 参考訳(メタデータ) (2021-07-30T17:58:54Z) - Consecutive Decoding for Speech-to-text Translation [51.155661276936044]
COnSecutive Transcription and Translation (COSTT)は、音声からテキストへの翻訳に不可欠な手法である。
鍵となるアイデアは、ソースの書き起こしとターゲットの翻訳テキストを1つのデコーダで生成することである。
本手法は3つの主流データセットで検証する。
論文 参考訳(メタデータ) (2020-09-21T10:10:45Z) - 2kenize: Tying Subword Sequences for Chinese Script Conversion [54.33749520569979]
本稿では,2つのスクリプト間のマッピングと変換をあいまいにできるモデルを提案する。
提案手法は,従来の漢字変換手法よりも精度が6ポイント向上した。
論文 参考訳(メタデータ) (2020-05-07T10:53:05Z) - Multilingual Alignment of Contextual Word Representations [49.42244463346612]
BERTはXNLIのゼロショット性能をベースモデルに比べて大幅に改善した。
単語検索の文脈バージョンを導入し、下流のゼロショット転送とよく相関していることを示す。
これらの結果は、大規模多言語事前学習モデルの理解に有用な概念としてコンテキストアライメントをサポートする。
論文 参考訳(メタデータ) (2020-02-10T03:27:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。