論文の概要: Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl
- arxiv url: http://arxiv.org/abs/2604.07015v1
- Date: Wed, 08 Apr 2026 12:34:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.520604
- Title: Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl
- Title(参考訳): 自然言語処理におけるコーパスの重複か重複か? : メキシコのナワトルを事例として
- Authors: Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garrido, Elvys Linhares-Pontes, Luis-Gil Moreno-Jiménez,
- Abstract要約: 我々は,200万人以上の人々が話していた,凝集性で多義語であるナワトルにおけるコーポラ拡大の影響について検討する。
目的は、コントロールされた方法で複製することで、限られた数のNawatlテキストを含む新しい$-yalliコーパスを拡張することである。
以上の結果より, 増増倍法を併用した場合, 増倍法のみを用いて行った場合に比べ, 適度な改善が得られた。
- 参考スコア(独自算出の注目度): 0.2944465286112758
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this article, we seek to answer the following question: could data duplication be useful in Natural Language Processing (NLP) for languages with limited computational resources? In this type of languages (or $π$-languages), corpora available for training Large Language Models are virtually non-existent. In particular, we will study the impact of corpora expansion in Nawatl, an agglutinative and polysynthetic $π$-language spoken by over 2 million people, with a large number of dialectal varieties. The aim is to expand the new $π$-yalli corpus, which contains a limited number of Nawatl texts, by duplicating it in a controlled way. In our experiments, we will use the incremental duplication technique. The aim is to learn embeddings that are well-suited to NLP tasks. Thus, static embeddings were trained and evaluated in a sentence-level semantic similarity task. Our results show a moderate improvement in performance when using incremental duplication compared to the results obtained using only the corpus without expansion. Furthermore, to our knowledge, this technique has not yet been used in the literature.
- Abstract(参考訳): 本稿では,計算資源が限られている言語に対して,データ重複は自然言語処理(NLP)において有用か?
このタイプの言語(または$π$-言語)では、大規模言語モデルの訓練に利用できるコーパスは事実上存在しない。
特に,200万人以上の人々が話し,多義語・多義語であるナワトルにおけるコーポラ拡大の影響について検討する。
目的は、限られた数のナワトル文字を含む新しい$π$-yalliコーパスを、制御された方法で複製することで拡張することである。
実験では、インクリメンタル複製技術を使用します。
目的は、NLPタスクに適した埋め込みを学ぶことである。
そこで,静的な埋め込みを文レベルの意味的類似性タスクで訓練し,評価した。
以上の結果より, 増増倍率を用いた場合, コーパスのみを用いた場合と比較して, 性能は適度に向上した。
さらに,本手法は文献にはまだ使われていない。
関連論文リスト
- Two CFG Nahuatl for automatic corpora expansion [0.22577070341971636]
この記事では、Nawatl Corporaの拡張のための2つのContext-Free Grammars(CFG)を紹介します。
ナベル語(Naavell)は、メキシコのアメリンダ語(英語版)の言語である。
目的は、かなりの数の構文的に有効な人工的なナワトル文を作ることである。
論文 参考訳(メタデータ) (2025-12-16T09:49:31Z) - A First Context-Free Grammar Applied to Nawatl Corpora Augmentation [0.21498988090998952]
Nawatl言語のための文脈自由文法(CFG)を導入する。
ナワトル語は、ほとんどデジタル資源を持たないアメリンディアン語である。
文法はナワトル語でコーパスを拡張するのに大いに役立ちます。
論文 参考訳(メタデータ) (2025-10-06T15:46:54Z) - $π$-yalli: un nouveau corpus pour le nahuatl [0.8247755416642547]
NAHU$2$プロジェクトは、機械学習に適応した$pi$-YALLIコーパスを構築することを目的とした、フランスとメキシコのコラボレーションである。
$pi$-YALLIコーパスは、Nahuatl言語のためのコンピュータリソースの開発に使用される。
論文 参考訳(メタデータ) (2024-12-20T12:03:10Z) - Efficient Continual Pre-training of LLMs for Low-resource Languages [45.44796295841526]
大規模コーパスからテキストのサブセットを選択するアルゴリズムを開発した。
さらなる改良を求めて,LLM語彙に含まれるトークンを選択する新しいアルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-12-13T16:13:35Z) - Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment [50.27950279695363]
転送性能は、低リソースのターゲット言語が高リソースのソース言語とは異なるスクリプトで書かれている場合、しばしば妨げられる。
本論文は,この問題に対処するために翻訳を用いた最近の研究に触発されて,翻訳に基づくポストプレトレーニングアライメント(PPA)手法を提案する。
論文 参考訳(メタデータ) (2024-06-28T08:59:24Z) - NusaWrites: Constructing High-Quality Corpora for Underrepresented and
Extremely Low-Resource Languages [54.808217147579036]
インドネシアの地方言語について事例研究を行う。
データセット構築におけるオンラインスクラップ,人文翻訳,および母語話者による段落作成の有効性を比較した。
本研究は,母語話者による段落作成によって生成されたデータセットが,語彙的多様性と文化的内容の点で優れた品質を示すことを示す。
論文 参考訳(メタデータ) (2023-09-19T14:42:33Z) - Romanization-based Large-scale Adaptation of Multilingual Language
Models [124.57923286144515]
大規模多言語事前学習言語モデル (mPLMs) は,NLPにおける多言語間移動のデファクトステートとなっている。
我々は、mPLMをローマン化および非ロマン化した14の低リソース言語コーパスに適用するためのデータとパラメータ効率の戦略を多数検討し、比較した。
以上の結果から, UROMAN をベースとしたトランスリテラルは,多くの言語で高い性能を達成できることがわかった。
論文 参考訳(メタデータ) (2023-04-18T09:58:34Z) - Analysing The Impact Of Linguistic Features On Cross-Lingual Transfer [3.299672391663527]
我々は、最先端の多言語モデルを分析し、言語間の良い伝達に何が影響するかを判断する。
また,特定の構文特徴を見ることは,構文的類似性の集合よりも,性能予測に2~4倍有益であることを示す。
論文 参考訳(メタデータ) (2021-05-12T21:22:58Z) - Emergent Communication Pretraining for Few-Shot Machine Translation [66.48990742411033]
我々は、参照ゲームからの創発的コミュニケーションを介してニューラルネットワークを事前訓練する。
私たちの重要な前提は、実世界の環境の粗悪な近似として、画像に基づくコミュニケーションを基盤にすることで、帰納的に自然言語学習のモデルに偏りが生じる、ということです。
論文 参考訳(メタデータ) (2020-11-02T10:57:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。