論文の概要: TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation
- arxiv url: http://arxiv.org/abs/2608.18655v2
- Date: Wed, 26 Aug 2026 08:38:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.740177
- Title: TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation
- Title(参考訳): TranslatePsy-AfriSLM:低リソース機械翻訳のための高品質データスケーリング
- Abstract要約: 我々は、19のサブサハラアフリカ言語のためのオープンソースの機械翻訳リソースであるTranslatePsy-AfriSLMを紹介した。
私たちの経験的研究は、品質推定の統一化は、品質を劣化させることなく、トレーニングトークンの最大96%を除去することを示している。
結果の混合データに基づいて微調整されたTranslatePsy-AfriSLMは、かなり大きなシステムより優れていた。
- 参考スコア(独自算出の注目度): 7.461390357831195
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid progress in Artificial Intelligence has largely bypassed African languages, creating a digital divide that limits AI adoption on the continent. Recent open-source LLMs systematically underperform on African language machine translation, while the lack of large-scale, high-quality, open-source parallel data has constrained the development of competitive small language models (SLMs). We introduce TranslatePsy-AfriSLM, a collection of open-source machine translation resources for 19 Sub-Saharan African languages, including curated parallel data, African-specialized synthetic data, and a family of fine-tuned SLMs. Our empirical study shows that unified quality-estimation filtering removes up to 96% of training tokens without degrading quality, and that filtered synthetic data dominates the quality-efficiency Pareto frontier. Fine-tuned on the resulting data mixture, TranslatePsy-AfriSLMs outperform substantially larger systems, including TranslateGemma-27B and Qwen3.5-122B-A10B, with as few as 0.8B parameters.
- Abstract(参考訳): 人工知能の急速な進歩は、主にアフリカの言語をバイパスし、大陸におけるAIの採用を制限するデジタルディビジョンを生み出した。
近年のオープンソースLLMは,大規模で高品質なオープンソース並列データがないため,競争力のある小言語モデル(SLM)の開発に制約が加えられている。
本研究では,19のサブサハラアフリカの言語を対象とした,並列処理されたデータ,アフリカ特化合成データ,微調整されたSLMのファミリを含む,オープンソースの機械翻訳リソースであるTranslatePsy-AfriSLMを紹介する。
実験により, 学習トークンの最大96%は品質を劣化させることなく除去され, フィルタされた合成データが品質効率の高いParetoフロンティアを支配していることがわかった。
得られたデータ混合物に基づいて微調整されたTranslatePsy-AfriSLMは、TranslateGemma-27BやQwen3.5-122B-A10Bなど、0.8Bのパラメータしか持たない、かなり大きなシステムで性能が向上した。
関連論文リスト
- BhashaSetu: A Data-Centric Approach to Low-Resource Machine Translation [1.2546133965241097]
BhashaSetuは言語的に豊かな英語である--低リソースニューラルネットワーク翻訳(NMT)における永続的なデータ制限に対処するパラレルデータセット
我々のデータセットは, ニュース, 政治, 医療, 文学, 文化など異質な情報源からの278万の文対からなる。
論文 参考訳(メタデータ) (2026-05-26T14:03:20Z) - Beyond Many-Shot Translation: Scaling In-Context Demonstrations For Low-Resource Machine Translation [49.82863380286994]
In-context Learningは、低リソース機械翻訳にLarge Language Modelsを適用する新しい方法を提供するかもしれない。
本研究では,Long-context モデルを用いた数千例のサンプルに対して,数ショット設定以上の低リソース機械翻訳ICLのスケーリングについて検討する。
JavaneseとSundaneseに関する我々の実験は、追加のコンテキストからのゲインがすばやく飽和し、最大コンテキストウィンドウの近くで分解可能であることを示している。
論文 参考訳(メタデータ) (2026-02-04T17:02:22Z) - Improving Indigenous Language Machine Translation with Synthetic Data and Language-Specific Preprocessing [5.781452568978427]
我々は,高容量多言語翻訳モデルを用いて合成文対を生成することで,アメリカ大陸の言語に対する並列データセットを拡張した。
グアラニ・スペイン語とケチュア・スペイン語の翻訳実験は、合成データ拡張による一貫したchrF++の改善を示している。
Aymaraの診断実験は、高度に凝集的な言語に対する一般的な前処理の限界を強調している。
論文 参考訳(メタデータ) (2026-01-06T16:06:42Z) - Scaling Low-Resource MT via Synthetic Data Generation with LLMs [17.430071094867532]
英語のEuroparlから文書レベルの合成コーパスを構築する。
効果的な訓練体制を同定し,その実践的応用について検討する。
合成並列データセットの公開リポジトリであるSynOPUSを紹介する。
論文 参考訳(メタデータ) (2025-05-20T14:31:54Z) - Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data [64.4458540273004]
言語モデル(LLM)の単言語データと本質的な多言語知識のみを活用するセルフプレイフレームワークを提案する。
実験により、このアプローチは大規模並列データに基づいて訓練されたモデルの性能と一致するだけでなく、非英語翻訳の方向でも優れていることが示された。
論文 参考訳(メタデータ) (2025-04-20T16:20:30Z) - Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu [53.437954702561065]
In-context machine translation (MT) with large language model (LLMs) は低リソースMTにおいて有望な手法である。
本研究は,辞書,文法書,検索した並列例などの資源の種類が翻訳性能に与える影響を系統的に検討する。
結果から,良質な辞書や優れた並列例は有用であり,文法はほとんど役に立たないことが明らかとなった。
論文 参考訳(メタデータ) (2025-02-17T14:53:49Z) - NusaMT-7B: Machine Translation for Low-Resource Indonesian Languages with Large Language Models [2.186901738997927]
本稿では,低リソースインドネシア語用機械翻訳モデルであるNusaMT-7Bを紹介する。
提案手法は, 単言語データ, Supervised Fine-Tuning (SFT) , 自己学習, LLMベースのデータクリーナーを併用し, 並列文のノイズを低減する。
この結果から,LLMの微調整により,低リソース言語への翻訳品質が向上し,言語保存や異文化間コミュニケーションに寄与することが示唆された。
論文 参考訳(メタデータ) (2024-10-10T11:33:25Z) - Quality or Quantity? On Data Scale and Diversity in Adapting Large Language Models for Low-Resource Translation [62.202893186343935]
低リソース言語に大規模言語モデルを適用するのに何が必要かについて検討する。
我々は、事前トレーニングとスーパーバイザードファインチューニング(SFT)の間に並列データが重要であることを示す。
2つの低リソース言語群にまたがる3つの LLM 実験により,本研究の一般化可能性を示す一貫した傾向が示された。
論文 参考訳(メタデータ) (2024-08-23T00:59:38Z) - Tencent's Multilingual Machine Translation System for WMT22 Large-Scale
African Languages [47.06332023467713]
本稿では,テンセントのWMT22における多言語機械翻訳システムについて述べる。
我々は,多言語ニューラルマシン翻訳(MNMT)モデルを開発するために,データ拡張,分散ロバストな最適化,言語ファミリグループ化を採用する。
論文 参考訳(メタデータ) (2022-10-18T07:22:29Z) - AfroMT: Pretraining Strategies and Reproducible Benchmarks for
Translation of 8 African Languages [94.75849612191546]
AfroMTは、広く話されている8つのアフリカ言語のための標準化され、クリーンで再現可能な機械翻訳ベンチマークである。
これらの言語の特徴を考慮に入れたシステム診断のための分析ツール群を開発した。
11言語での事前トレーニングでは,強いベースラインに対して最大2つのBLEUポイントのゲインが得られた。
論文 参考訳(メタデータ) (2021-09-10T07:45:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。