論文の概要: SEA-LION-v4.8: A Technical Report
- arxiv url: http://arxiv.org/abs/2609.18310v2
- Date: Thu, 17 Sep 2026 04:30:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.712432
- Title: SEA-LION-v4.8: A Technical Report
- Title(参考訳): SEA-LION-v4.8テクニカルレポート
- Abstract要約: NVIDIA Nemotron 3 上に構築された 東南アジア言語 In One Network (SEA-LION) モデルである Nemotron-SEA-LION-v4.8 を紹介する。
ファミリーには30B-A3Bと120B-A12Bのモデルがあり、継続訓練されたベースチェックポイントと後訓練された派生型の両方がある。
東南アジア, 推論, コード, 多言語並列データを用いてモデルを適応し, その後, 教師付き微調整, オンラインオンラインオンライン蒸留を行った。
- 参考スコア(独自算出の注目度): 0.6686101870980781
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Nemotron-SEA-LION-v4.8, a family of Southeast Asian Languages In One Network (SEA-LION) models built upon NVIDIA Nemotron 3. The family includes 30B-A3B and 120B-A12B models, with both continued-pretrained base checkpoints and post-trained variants. We adapt the models using Southeast Asian, reasoning, code, and multilingual parallel data, followed by post-training with supervised fine-tuning and online on-policy distillation. On SEA-HELM, the 30B-A3B model improves the overall SEA score from 46.06 to 51.57, while the 120B-A12B model improves from 49.30 to 63.44. Across seven Southeast Asian languages, we observe broad capability gains with the 120B-A12B model showing broader and more consistent improvements across tasks.
- Abstract(参考訳): NVIDIA Nemotron 3 上に構築された 東南アジア言語 In One Network (SEA-LION) モデルである Nemotron-SEA-LION-v4.8 を紹介する。
ファミリーには30B-A3Bと120B-A12Bのモデルがあり、継続訓練されたベースチェックポイントと後訓練された派生型の両方がある。
東南アジア, 推論, コード, 多言語並列データを用いてモデルを適応し, その後, 教師付き微調整, オンラインオンラインオンライン蒸留を行った。
SEA-HELMでは、30B-A3Bモデルは全体のSEAスコアを46.06から51.57に改善し、120B-A12Bモデルは49.30から63.44に改善した。
東南アジアの7言語にまたがって120B-A12Bモデルでは,タスク間でより広範囲で一貫した改善が見られた。
関連論文リスト
- Polyglot-Lion: Efficient Multilingual ASR for Singapore via Balanced Fine-Tuning of Qwen3-ASR [1.7802147489386628]
本稿ではシンガポールの言語景観に合わせたコンパクトな多言語自動音声認識(ASR)モデルであるPolyglot-Lionを紹介する。
提案手法は,Qwen3-ASR-0.6BとQwen3-ASR-1.7Bを公開音声コーパスのみに微調整することで得られる。
4つの言語にまたがる12のベンチマークで、Polyglot-Lion-1.7Bは平均エラーレート14.85に達し、MERaLiON-2-10B-ASR (14.32)と競合する。
推論スループットはMERaLiONの0.10 s/sampleより約20倍速い
論文 参考訳(メタデータ) (2026-03-17T07:09:42Z) - Sailor2: Sailing in South-East Asia with Inclusive Multilingual LLMs [61.117234373024665]
Sailor2は、東南アジア(SEA)言語のための最先端の多言語言語モデルのファミリーであり、1B、8B、20Bサイズで利用可能である。
Sailor2は、中国語と英語の習熟を維持しながら、13のSEA言語をサポートするために500Bトークンを継続的に事前訓練している。
Sailor2-20Bモデルは、SEA言語間でGPT-4oに対して50-50の勝利率を達成する。
論文 参考訳(メタデータ) (2025-02-18T16:04:57Z) - Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier [72.5652085347547]
8Bおよび32Bパラメータ多言語モデルの新世代であるAya Expanseモデルファミリを導入する。
Cohere For AIとCohereでの数年間の研究を活用することで、Aya Expanseは多言語パフォーマンスにおける新たな最先端技術を確立している。
Aya Expanse 8B と 32B が主要なオープンウェイトモデルより優れていることを示すために,23言語に翻訳された Arena-Hard-Auto データセットの評価を行った。
論文 参考訳(メタデータ) (2024-12-05T15:41:06Z) - SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages [64.10040374077994]
SEACrowdは3つのモダリティにまたがる1000近い言語で標準化されたコーパスを統合する共同イニシアチブである。
私たちは、13のタスクにわたる36のネイティブ言語上のAIモデルの品質を評価し、SEAの現在のAI状況に関する貴重な洞察を提供する。
論文 参考訳(メタデータ) (2024-06-14T15:23:39Z) - Sailor: Open Language Models for South-East Asia [31.8422378772881]
Sailor(セイラー)は、東南アジア(SEA)言語向けに作られたオープン言語モデルである。
セイラーモデルは200Bから400Bのトークンを受け取り、主に英語、中国語、ベトナム語、タイ語、インドネシア語、マレー語、ラオス語をカバーしている。
論文 参考訳(メタデータ) (2024-04-04T17:31:32Z) - Nemotron-4 15B Technical Report [44.51049723484507]
ネモトロン415Bは8兆個のテキストトークンで訓練された多言語言語モデルである。
同様のサイズのモデルで最高の多言語機能を示し、さらに4倍以上のモデル、特に多言語タスクに特化しているモデルよりも優れています。
論文 参考訳(メタデータ) (2024-02-26T18:43:45Z) - SeaLLMs -- Large Language Models for Southeast Asia [76.50157503379086]
東南アジア(SEA)言語に焦点を当てた,革新的な言語モデルであるSeaLLMを紹介した。
SeaLLMはLlama-2モデルに基づいて構築され、さらに拡張語彙、特殊命令、アライメントチューニングによる事前訓練が継続されている。
包括的評価により,SeaLLM-13bモデルは言語タスクやアシスタントスタイルの指示追従能力に優れた性能を示した。
論文 参考訳(メタデータ) (2023-12-01T17:17:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。