論文の概要: Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer
- arxiv url: http://arxiv.org/abs/2608.30092v2
- Date: Tue, 01 Sep 2026 02:17:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.644152
- Title: Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer
- Title(参考訳): Arkios: Devanagari-Aware Tokenizerを使ったオープンなバイリンガル・イングリッシュ・ネパリ言語モデル
- Authors: Sajal Regmi, Siddhartha Pudasaini, Chetan Phakami Pun,
- Abstract要約: 我々は150Bのバイリンガル・イングリッシュ・ネパリ文字のトークンにスクラッチから事前訓練された高密度トランスフォーマーArkiosを提示する。
アルキオスは、訓練トークンの桁数が桁違いであるにもかかわらず、3つの比較可能な大きさのオープンモデル(Pythia-1.4B、TinyLlama-1.1B、OLMo-1B)を超える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Arkios, a 1.04B-parameter dense transformer pretrained from scratch on 150B tokens of bilingual English-Nepali text, using a custom single-file C/CUDA training stack and a Devanagari-aware byte-level BPE tokenizer built for this project. On ARC-Easy and ARC-Challenge, Arkios exceeds three comparably sized open models (Pythia-1.4B, TinyLlama-1.1B, OLMo-1B) despite an order of magnitude fewer training tokens, likely aided by a match between our educational-web-text pretraining data and ARC's grade-school-science format rather than a general capability advantage. We report full evaluation results under standard protocols, including a correction to an earlier partial-sample estimate, and findings specific to evaluating small models in a low-resource language: the standard multiple-choice-letter prompt format used by common evaluation harnesses places this model at chance on Nepali reading comprehension, and simultaneously at chance on English in the same format, which would lead a naive benchmark run to conclude the model has no Nepali ability when in fact it does. Concretely, both languages score at chance in the letter-choice format (0.240 Nepali, 0.236 English, against a chance baseline of 0.250), while scoring the answer text directly reveals genuine, English-favoring comprehension (0.306 Nepali, 0.387 English). We describe a manifest-conditioned tool-use contract introduced during instruction tuning, where tool calls are permitted only when a tool manifest is declared in context and suppressed otherwise, and report where that contract holds and where it does not. We release both the base and instruction-tuned model weights under Apache-2.0. The training code and a small privately-sourced portion of the Nepali pretraining corpus are not released; everything needed to reproduce the reported numbers from the released weights is included here.
- Abstract(参考訳): 本稿では,150Bのバイリンガル・イングリッシュ・ネパリ文字のトークンをスクラッチから事前学習した1.04BパラメータのArkiosについて,カスタムのシングルファイルC/CUDAトレーニングスタックと,このプロジェクト用に構築されたデバナガリ対応バイトレベルBPEトークンライザを用いて紹介する。
ARC-Easy と ARC-Challenge では、Arkios は、教育用ウェブテキスト事前学習データとARC の小学校理科の形式との整合により、教育用トークンの桁違いに少ないにもかかわらず、比較可能な大きさのオープンモデル(Pythia-1.4B, TinyLlama-1.1B, OLMo-1B)を3種類(Pythia-1.4B)を超えている。
従来の部分サンプル推定の補正や,低リソース言語での小型モデルの評価に特有な発見を含む,標準プロトコルによる完全な評価結果について報告する: 共通評価手法で使用される標準マルチチョイスレタープロンプトフォーマットは,このモデルをネパール語読解の機会に配置し,同時に英語を同じフォーマットで実行することで,ナイーブベンチマークが実行され,実際にそのモデルがネパール語能力を持たないと結論付ける。
具体的には、両方の言語は文字選択形式(0.240 ネパール語、0.236 英語、確率ベースライン0.250)で偶然に得点し、回答文は真に英語に好意的な理解(0.306 ネパール語、0.387 英語)を直接示している。
本稿では,ツールマニフェストがコンテキスト内で宣言され,他の方法で抑制された場合にのみ,ツールコールを許可する命令チューニング中に導入されたマニフェスト条件付きツール使用契約について述べる。
ベースモデルとインストラクションチューニングモデルの両方をApache-2.0でリリースしています。
ネパールの事前訓練コーパスの訓練コードと小規模な民間ソースは公開されておらず、公表された重量から報告された数字を再現するために必要なものはすべてここに含まれている。
関連論文リスト
- Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation [0.0]
Manac-1Bはブラジルのポルトガル語でトレーニングされた12億のパラメータからなるオープンデコーダのみのモデルです。
1つのハーネスでポルトガルの4つのベンチマークで9つのオープンベースラインに対してモデルを評価した。
論文 参考訳(メタデータ) (2026-08-31T01:00:14Z) - Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi [9.65814816271915]
LilMooは0.6ビリオンパラメータヒンディー語モデルである。
完全に透明で再現可能なパイプラインによって開発され、限られた計算環境向けに最適化されている。
総合的な評価スイート全体にわたって、LilMooは、相容れない大きさの多言語ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-03-03T20:31:25Z) - Towards Nepali-language LLMs: Efficient GPT training with a Nepali BPE tokenizer [0.0]
本研究は、GPT-3にインスパイアされた複数のトレーニング戦略を用いて訓練された、GPT-2に基づくネパール語モデルを提案する。
このモデルは3.168177のトレーニング損失、3.08 1982の検証損失、21.80の最終的な難しさを達成し、一貫性のあるネパールのニューススタイルのテキストを生成する能力を示した。
論文 参考訳(メタデータ) (2025-12-16T16:53:11Z) - mmBERT: A Modern Multilingual Encoder with Annealed Language Learning [57.58071656545661]
mmBERTは、多言語テキストの3Tトークンで事前訓練されたエンコーダのみの言語モデルである。
データに1700以上の低リソース言語を追加しています。
分類および検索タスクにおける従来のモデルよりも, mmBERTの方が優れていたことを示す。
論文 参考訳(メタデータ) (2025-09-08T17:08:42Z) - Pretraining Language Models to Ponder in Continuous Space [50.52734567589996]
単一のトークン生成ステップ内で,前処理を繰り返し呼び出すことによって,この思考プロセスを言語モデルに導入する。
人間のアノテーションを使わずに、自己教師付き学習を通じて、この方法でモデルを学習できることが示される。
論文 参考訳(メタデータ) (2025-05-27T03:47:33Z) - Development of Pre-Trained Transformer-based Models for the Nepali Language [0.0]
全世界で約3200万人が話しているネパール語は、この領域では著しく過小評価されている。
ネパール語コーパスの約2.4倍の27.5GBのテキストデータを収集した。
我々のモデルは、Nep-gLUEベンチマークで既存の最良のモデルよりも2ポイント優れ、95.60得点、テキスト生成タスクで既存のモデルよりも優れています。
論文 参考訳(メタデータ) (2024-11-24T06:38:24Z) - Paloma: A Benchmark for Evaluating Language Model Fit [112.481957296585]
言語モデル (LM) の評価では、トレーニングから切り離されたモノリシックなデータに難易度が報告されるのが一般的である。
Paloma(Perplexity Analysis for Language Model Assessment)は、546の英語およびコードドメインに適合するLMを測定するベンチマークである。
論文 参考訳(メタデータ) (2023-12-16T19:12:45Z) - Skywork: A More Open Bilingual Foundation Model [55.927396986873816]
英語と中国語の両方のテキストから引き出された3.2兆以上のトークンのコーパスをトレーニングした,大規模言語モデル(LLM)のファミリーであるSkywork-13Bを紹介する。
我々のモデルは,一般的なベンチマークに優れるだけでなく,さまざまなドメインにおける中国語のモデリングにおける芸術的パフォーマンスの即興性も達成できることを示す。
論文 参考訳(メタデータ) (2023-10-30T08:31:47Z) - Language Model Pre-Training with Sparse Latent Typing [66.75786739499604]
そこで本研究では,多種多様な潜在型を持つ文レベルのキーワードを疎に抽出することのできる,事前学習対象Sparse Latent Typingを提案する。
実験結果から,本モデルは外部知識を使わずに,自己教師型で解釈可能な潜在型カテゴリを学習できることが示唆された。
論文 参考訳(メタデータ) (2022-10-23T00:37:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。