論文の概要: Universal or Language-Family-Specific Script Unification for Cross-Lingual Transfer? A Case Study on Turkic Languages
- arxiv url: http://arxiv.org/abs/2608.09356v1
- Date: Mon, 10 Aug 2026 09:35:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.18658
- Title: Universal or Language-Family-Specific Script Unification for Cross-Lingual Transfer? A Case Study on Turkic Languages
- Title(参考訳): 言語間移動のための普遍的・言語固有のスクリプト統一 : テュルク語を事例として
- Authors: Zijie Zhang,
- Abstract要約: 汎用ウロマンロマニザと家族固有の共通テュルク文字(CTS)の2つのスクリプト統合手法を比較した。
我々は、11のテュルク語から翻訳されたウィキペディアコーパスで一致した高速テキストモデルをトレーニングし、エンティティ認識とUniversal Dependencies-of-speechタグをWikiANNで評価した。
- 参考スコア(独自算出の注目度): 1.2708506244327207
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Closely related languages written in different scripts expose little surface overlap to multilingual models, limiting cross-lingual transfer. We compare two approaches to script unification: the general-purpose uroman romanizer and the family-specific Common Turkic Script (CTS). We train matched fastText models on transliterated Wikipedia corpora from 11 Turkic languages and evaluate them on WikiANN named entity recognition and Universal Dependencies part-of-speech tagging. CTS and uroman show no significant difference on NER, while both substantially outperform the official monolingual fastText baselines. POS results reveal no universal winner: language-specific differences are associated with the cross-lingual character n-gram coverage induced by each representation, while within-language coverage becomes more important when target-language supervision is available. Although CANINE-c achieves higher overall POS averages, the substantially simpler fastText-based systems remain competitive on several treebanks. Overall, the effectiveness of script unification depends on the language, the induced subword overlap, and the available supervision.
- Abstract(参考訳): 異なるスクリプトで書かれた密接な関連言語は、多言語モデルと表面的な重複がほとんどなく、言語間転送が制限される。
我々は,汎用的なromanizerとファミリー固有のCommon Turkic Script(CTS)の2つのスクリプト統合手法を比較した。
我々は、11のテュルク語から翻訳されたウィキペディアコーパスで一致した高速テキストモデルをトレーニングし、エンティティ認識とUniversal Dependencies-of-speechタグをWikiANNで評価した。
CTSとuromanはNERに有意な差はないが、どちらも公式のモノリンガルのfastTextベースラインを大幅に上回っている。
言語固有の違いは、各表現によって誘導される言語間文字n-gramのカバレッジと関連付けられ、一方、言語内カバレッジは、ターゲット言語監視が利用可能になるとより重要になる。
CANINE-cはPOS平均を高くするが、より単純なfastTextベースのシステムはいくつかのツリーバンクで競争力を維持している。
全体として、スクリプト統合の有効性は、言語、誘導されたサブワードの重複、利用可能な監督に依存する。
関連論文リスト
- Tokenizing Crosslingual Homographs [8.254230288283258]
多言語言語モデルは、限られた数のトークン単位内で複数の言語を表現するために、共有サブワード語彙に依存している。
我々はこの制限を言語間ホモグラフと偽の友人を通して検討する。
そこで本稿では,共有語彙単語の初期文字を置き換える言語固有の文字を用いた,単純なトークン化レベル介入を提案する。
論文 参考訳(メタデータ) (2026-07-20T08:37:31Z) - Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment [50.27950279695363]
転送性能は、低リソースのターゲット言語が高リソースのソース言語とは異なるスクリプトで書かれている場合、しばしば妨げられる。
本論文は,この問題に対処するために翻訳を用いた最近の研究に触発されて,翻訳に基づくポストプレトレーニングアライメント(PPA)手法を提案する。
論文 参考訳(メタデータ) (2024-06-28T08:59:24Z) - MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling [70.34758460372629]
多様な言語にまたがる一貫した大きさのセグメントで同一情報をエンコードする新しいパラダイムを導入する。
MYTEは99の言語すべてに対して短いエンコーディングを生成する。
これにより、多言語LMの性能が向上し、多言語間でのパープレキシティギャップが減少する。
論文 参考訳(メタデータ) (2024-03-15T21:21:11Z) - Discovering Representation Sprachbund For Multilingual Pre-Training [139.05668687865688]
多言語事前学習モデルから言語表現を生成し、言語分析を行う。
すべての対象言語を複数のグループにクラスタリングし、表現のスプラックバンドとして各グループに名前を付ける。
言語間ベンチマークで実験を行い、強いベースラインと比較して大幅な改善が達成された。
論文 参考訳(メタデータ) (2021-09-01T09:32:06Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。