論文の概要: From Zero to Hero: An Open LLM Ecosystem for Armenian
- arxiv url: http://arxiv.org/abs/2609.03350v1
- Date: Thu, 03 Sep 2026 04:15:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.923364
- Title: From Zero to Hero: An Open LLM Ecosystem for Armenian
- Title(参考訳): ZeroからHeroへ:アルメニア人のためのオープンLLMエコシステム
- Abstract要約: アルメニアのLLMには、それを再現するために必要なデータとレシピはリリースされていない。
ArmWebは、アルメニアの437万件のニュース文書を広範囲に検証したコーパスである。
ArmSTEM (ArmSTEM) は、373Kの数学と科学の問題をステップバイステップで解決した英語とアルメニア語の並列コレクションである。
- 参考スコア(独自算出の注目度): 2.206341374616765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pretraining data for Armenian, a morphologically rich and low-resource language, is scarce, and no open Armenian LLM has been released with the data and recipe needed to reproduce it. To address this gap, we curate and release two datasets. ArmWeb is an extensively validated corpus of 4.37M Armenian news documents. ArmSTEM is a parallel English-Armenian collection of 373K math and science problems with step-by-step solutions, translated into Armenian and verified through both answer-preserving LLM judgment and human evaluation. Continued pretraining of Gemma-4-E4B on these datasets yields arm-gemma-e4b, which outperforms every existing open Armenian model as well as its unadapted base, and is the first open Armenian LLM with complete training data and recipe. Our ablations show that news-only continued pretraining improves fluency while eroding knowledge, a pattern we also observe in existing Armenian models, and that a small share of verified translated STEM data reverses the loss. We further find that the largest public Armenian corpora overlap web-derived evaluation panels heavily, including a train/test self-overlap inside FineWeb-2. We openly release all data, models, and code.
- Abstract(参考訳): 形態的に豊かで低リソースの言語であるアルメニア語の事前学習は不十分であり、それを再現するために必要なデータとレシピを備えたオープンなアルメニア語LLMはリリースされていない。
このギャップに対処するため、2つのデータセットをキュレートしてリリースします。
ArmWebは、アルメニアの437万件のニュース文書を広範囲に検証したコーパスである。
ArmSTEM (ArmSTEM) は、373Kの数学と科学の問題をステップバイステップで解き、アルメニア語に翻訳し、回答保存 LLM 判定と人的評価の両方を通じて検証する。
これらのデータセット上でGemma-4-E4Bの事前訓練を継続すると、アーム・ジェムマ・e4bが生成され、これは既存の全てのアルメニアのモデルと未適応のベースを上回り、完全なトレーニングデータとレシピを持つ最初のオープンアルメニアのLCMである。
我々は,ニュースのみの事前学習が知識を侵食しながら流速を向上し,既存のアルメニアのモデルでも観察できるパターンを示し,検証されたSTEMデータのごく一部が損失を逆転させることを示した。
さらに、最大のアルメニア人コーパスは、FineWeb-2内の列車/テストの自己オーバーラップを含む、Webから派生した評価パネルと重なり合うことが判明した。
すべてのデータ、モデル、コードを公開しています。
関連論文リスト
- Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press [0.0]
この論文は、フランスをデジタル化したアルメニアの新聞を、20世紀のパリのアルメニアの商業コミュニティのインタラクティブな地図に変えた。
各ページには、商業広告が配置され、読み込まれ、構造化されたレコードに解析され、ジオコードされ、地図上に置かれる。
西アルメニアは、オフ・ザ・シェルフレイアウトとOCRモデルによってアンダー・リソース化され、サポートされていない。
論文 参考訳(メタデータ) (2026-08-06T11:39:41Z) - GemMaroc: Unlocking Darija Proficiency in LLMs with Minimal Data [4.829481426528624]
オープンソースの大型言語モデル(LLMs)は依然としてモロッコのアラビア語(ダリヤ)を疎外している
我々は、厳格に品質を優先したアライメント戦略が、流線型Darijaを表面化できることを示します。
論文 参考訳(メタデータ) (2025-05-20T12:38:42Z) - Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh [57.002807772016524]
カザフスタンの主要な制度的・文化的知識をカバーする大規模な(10,600サンプル)命令追従データセットを導入,オープンソース化する。
データセット構築のためのオープンウェイトモデルとクローズドウェイトモデルを比較し,GPT-4oをバックボーンとして選択する。
データセット上の微調整Qwen、Falcon、Gemmaは、複数の選択タスクと生成タスクの両方において、一貫したパフォーマンス改善をもたらします。
論文 参考訳(メタデータ) (2025-02-19T11:44:27Z) - MMM: Multilingual Mutual Reinforcement Effect Mix Datasets & Test with Open-domain Information Extraction Large Language Models [9.974016461777579]
英語,日本語,中国語の21のサブデータセットを含むMultilingual MRE混合データセット(MMM)を提案する。
また,Large Language Models (LLM) を用いたデータセット翻訳手法を提案する。
オープンドメイン情報抽出大言語モデル(OIELLM)を学習するための統合入力出力フレームワークを開発する。
論文 参考訳(メタデータ) (2024-07-15T17:50:43Z) - Automatic Speech Recognition Advancements for Indigenous Languages of the Americas [0.0]
The Second Americas (Americas Natural Language Processing) Competition Track 1 of NeurIPS (Neural Information Processing Systems) 2022年、Cechua、Guarani、Brbri、Kotiria、Wa'ikhanaの5つの先住民言語の自動音声認識システムの訓練タスクを提案した。
対象言語毎の最先端のASRモデルの微調整について,データ拡張法に富んだ多種多様な情報源からの音声データの約36.65時間を用いて述べる。
私たちは各言語で最高のモデルをリリースし、Wa'ikhanaとKotiriaの最初のオープンなASRモデルをマークしています。
論文 参考訳(メタデータ) (2024-04-12T10:12:38Z) - ExaRanker-Open: Synthetic Explanation for IR using Open-Source LLMs [60.81649785463651]
ExaRanker-Openを導入し、オープンソース言語モデルを適用して、説明を生成する。
以上の結果から,LLMのサイズが大きくなるにつれて,説明の組み込みが神経ランク付けを継続的に促進することが明らかとなった。
論文 参考訳(メタデータ) (2024-02-09T11:23:14Z) - Zero-Shot Cross-Lingual Reranking with Large Language Models for
Low-Resource Languages [51.301942056881146]
アフリカ語における言語間情報検索システムにおいて,大規模言語モデル (LLM) がリランカーとしてどのように機能するかを検討する。
私たちの実装は、英語と4つのアフリカの言語(ハウサ語、ソマリ語、スワヒリ語、ヨルバ語)を対象としています。
我々は、英語のクェリとアフリカの言葉の文節による言語横断的な格付けについて検討する。
論文 参考訳(メタデータ) (2023-12-26T18:38:54Z) - Skywork: A More Open Bilingual Foundation Model [55.927396986873816]
英語と中国語の両方のテキストから引き出された3.2兆以上のトークンのコーパスをトレーニングした,大規模言語モデル(LLM)のファミリーであるSkywork-13Bを紹介する。
我々のモデルは,一般的なベンチマークに優れるだけでなく,さまざまなドメインにおける中国語のモデリングにおける芸術的パフォーマンスの即興性も達成できることを示す。
論文 参考訳(メタデータ) (2023-10-30T08:31:47Z) - CodeGen2: Lessons for Training LLMs on Programming and Natural Languages [116.74407069443895]
我々はエンコーダとデコーダベースのモデルを単一のプレフィックスLMに統一する。
学習方法は,「フリーランチ」仮説の主張を考察する。
データ配信においては,混合分布と多言語学習がモデル性能に及ぼす影響について検討した。
論文 参考訳(メタデータ) (2023-05-03T17:55:25Z) - ARPA: Armenian Paraphrase Detection Corpus and Models [0.0]
アルメニア語のためのセンテンシャルパラフレーズコーパスを生成するために半自動手法を用いる。
最初の文の収集はアルメニア語から英語に2度翻訳され、結果として語彙的には遠いが意味的に類似した文が対になる。
生成されたパラフレーズは手動でレビューされ、注釈付けされる。
論文 参考訳(メタデータ) (2020-09-26T14:56:57Z) - Reusing a Pretrained Language Model on Languages with Limited Corpora
for Unsupervised NMT [129.99918589405675]
本稿では,オープンソース言語上でのみ事前訓練されたLMを再利用する効果的な手法を提案する。
モノリンガルLMは両言語で微調整され、UNMTモデルの初期化に使用される。
我々のアプローチであるRE-LMは、英語・マケドニア語(En-Mk)と英語・アルバニア語(En-Sq)の競合言語間事前学習モデル(XLM)より優れています。
論文 参考訳(メタデータ) (2020-09-16T11:37:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。