論文の概要: SozKZ: Training Efficient Small Language Models for Kazakh from Scratch
- arxiv url: http://arxiv.org/abs/2603.20854v1
- Date: Sat, 21 Mar 2026 15:23:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.121157
- Title: SozKZ: Training Efficient Small Language Models for Kazakh from Scratch
- Title(参考訳): SozKZ: ScratchからKazakhのための効率的な小言語モデルのトレーニング
- Authors: Saken Tukenov,
- Abstract要約: SozKZは、90億のカザフ文字のトークンをゼロからトレーニングしたLlama-architecture言語モデルのファミリーである。
MC QAの精度は22.8%から30.3%に向上した。
結果として、スクラッチからトレーニングされた小さな専用モデルが、低リソースの言語技術に実行可能なパスを提供することを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Kazakh, a Turkic language spoken by over 22 million people, remains underserved by existing multilingual language models, which allocate minimal capacity to low-resource languages and employ tokenizers ill-suited to agglutinative morphology. We present SozKZ, a family of Llama-architecture language models (50M-600M parameters) trained entirely from scratch on 9 billion tokens of Kazakh text with a dedicated 50K BPE tokenizer. We evaluate all models on three Kazakh benchmarks -- multiple-choice cultural QA, reading comprehension (Belebele), and topic classification (SIB-200) -- alongside five multilingual baselines ranging from 500M to 3B parameters. Our 600M model achieves 30.3% accuracy on Kazakh cultural QA, approaching the 32.0% of Llama-3.2-1B (2x larger), and 25.5% on SIB-200 topic classification, surpassing all evaluated multilingual models up to 2B parameters. We observe consistent scaling from 50M to 600M, with MC QA accuracy rising from 22.8% to 30.3%, suggesting that further scaling remains beneficial. These results demonstrate that small, dedicated models trained from scratch with a language-appropriate tokenizer offer a viable path for low-resource language technology, achieving competitive performance at a fraction of the computational cost. All models and the tokenizer are released under open licenses.
- Abstract(参考訳): トルコ語のカザフ語は、2200万人以上の人々が話しており、既存の多言語言語モデルでは守られていない。
我々はLlama-architecture言語モデル(50M-600Mパラメータ)のファミリーであるSozKZを紹介した。
我々は、500Mから3Bパラメータの5つの多言語ベースラインとともに、カザフ語ベンチマーク(マルチチョイス文化QA、読み理解(Belebele)、トピック分類(SIB-200))のすべてのモデルを評価する。
我々の600Mモデルはカザフスタンの文化的QAにおいて30.3%の精度を達成し、Llama-3.2-1B (2倍)の32.0%、SIB-200のトピック分類では25.5%に近づき、評価された多言語モデルの最大2Bパラメータを上回りました。
MC QAの精度は22.8%から30.3%に上昇し、5000万から6億ドルへと一貫したスケーリングが観察された。
これらの結果は、スクラッチから訓練された小さな専用モデルが、低リソースの言語技術に実行可能なパスを提供し、計算コストのごく一部で競争性能を達成していることを示している。
すべてのモデルとトークンライザは、オープンライセンスでリリースされている。
関連論文リスト
- UrduLM: A Resource-Efficient Monolingual Urdu Language Model [0.0]
世界中の2億3000万人が話すUrduには、トランスフォーマーベースの言語モデルがない。
本稿では,低リソース環境下で訓練されたUrdu単言語モデルであるUrduLMを提案する。
数ショットの評価では、UrduLMは最大30倍の大きさの多言語モデルと競合する性能を達成している。
論文 参考訳(メタデータ) (2026-01-25T02:49:09Z) - KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan [35.02482209366835]
KazMMLUは、カザフ語用に特別に設計された最初のMMLUスタイルのデータセットである。
STEM、人文科学、社会科学など、様々な教育レベルをカバーする23,000の質問が含まれている。
データセットには10,969のカザフスタン質問と12,031のロシア質問が含まれている。
論文 参考訳(メタデータ) (2025-02-18T12:48:37Z) - Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier [72.5652085347547]
8Bおよび32Bパラメータ多言語モデルの新世代であるAya Expanseモデルファミリを導入する。
Cohere For AIとCohereでの数年間の研究を活用することで、Aya Expanseは多言語パフォーマンスにおける新たな最先端技術を確立している。
Aya Expanse 8B と 32B が主要なオープンウェイトモデルより優れていることを示すために,23言語に翻訳された Arena-Hard-Auto データセットの評価を行った。
論文 参考訳(メタデータ) (2024-12-05T15:41:06Z) - Automatic Speech Recognition for the Ika Language [0.0]
IkaのNew Testament Bible Multilingualから収集した高品質な音声データセット上で、事前学習したwav2vec 2.0の大規模翻訳を行う。
この結果から,微調整による事前学習モデルでは単語誤り率(WER)が0.5377,文字誤り率(CER)が0.2651となり,学習時間は1時間を超えることがわかった。
論文 参考訳(メタデータ) (2024-10-01T11:56:42Z) - Cross-lingual transfer of multilingual models on low resource African Languages [0.20793001310272596]
単一の言語で訓練されたモノリンガルモデルは、ターゲット言語のニュアンスをよりよく捉えることができる。
AfriBERTは微調整後に最高88.3%の言語間精度を達成した。
BiGRUは83.3%の精度で最高のパフォーマンスのニューラルモデルとして登場した。
論文 参考訳(メタデータ) (2024-09-17T08:05:40Z) - Qwen2 Technical Report [141.0766756297144]
本稿では,我々の大規模言語モデルと大規模マルチモーダルモデルへの最新の追加であるQwen2シリーズを紹介する。
Qwen2は、前身のQwen1.5を含む、これまでのほとんどのオープンウェイトモデルを超え、プロプライエタリモデルと比較して競争力のある性能を示している。
Qwen2は、英語、中国語、スペイン語、フランス語、ドイツ語、アラビア語、ロシア語、韓国語、日本語、タイ語、ベトナム語など、約30の言語で熟練した堅牢な多言語機能を示している。
論文 参考訳(メタデータ) (2024-07-15T12:35:42Z) - ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic [51.922112625469836]
アラビア語における最初のマルチタスク言語理解ベンチマークである、データセット名を提案する。
我々のデータは、現代標準アラビア語(MSA)における40のタスクと14,575のマルチチョイス質問で構成されており、地域の母語話者と協調して慎重に構築されている。
35モデルについて評価した結果,特にオープンソースモデルにおいて,改善の余地がかなり高いことが判明した。
論文 参考訳(メタデータ) (2024-02-20T09:07:41Z) - Few-shot Learning with Multilingual Language Models [66.49496434282564]
多様な言語群をカバーするバランスの取れたコーパス上で,多言語の自動回帰言語モデルを訓練する。
私たちの最大のモデルは、20以上の代表言語で数ショットの学習において、新しい最先端の技術を定めています。
本稿では,モデルがどこで成功し,失敗するかを詳細に分析し,特に言語間の文脈内学習を可能にすることを示す。
論文 参考訳(メタデータ) (2021-12-20T16:52:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。