論文の概要: The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese
- arxiv url: http://arxiv.org/abs/2607.10745v1
- Date: Sun, 12 Jul 2026 12:56:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.521446
- Title: The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese
- Title(参考訳): The First Chinese BabyLM Challenge: Training data- efficient and Cognitively plausible language model for Chinese
- Abstract要約: 本稿は2026年のNLPCCカンファレンスで開催される最初のChinaBabyLMチャレンジについて述べる。
この課題は、研究者が1億の中国のトークンでゼロから言語モデルをトレーニングし、NLU、認知アライメント、ハンジの知識の3つのトラックでモデルを評価することを求めている。
- 参考スコア(独自算出の注目度): 13.390702136725933
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper describes the first ChineseBabyLM challenge, which will be held in the 2026 NLPCC conference. The challenge calls for researchers to train language models from scratch with 100 million Chinese tokens and evaluates the models on 3 tracks of tasks: NLU, cognitive alignment and Hanzi knowledge. There is no restriction on tokenizer, model architecture and the number of training epochs. Details of the challenge can be found in https://chinese-babylm.github.io/.
- Abstract(参考訳): 本稿は2026年のNLPCCカンファレンスで開催される最初のChinaBabyLMチャレンジについて述べる。
この課題は、研究者が1億の中国のトークンでゼロから言語モデルをトレーニングし、NLU、認知アライメント、ハンジの知識の3つのトラックでモデルを評価することを求めている。
トークン化やモデルアーキテクチャ、トレーニングエポックの数に制限はありません。
この課題の詳細はhttps://chinese-babylm.github.io/.com/で確認できる。
関連論文リスト
- BabyLM Turns 4 and Goes Multilingual: Call for Papers for the 2026 BabyLM Workshop [73.0356575273869]
BabyLMの目的は、認知モデルと言語モデル事前学習の間の新しい研究関係を刺激することである。
今年は、英語、オランダ語、中国語に重点を置いた、新しいトラックで、これまでの英語のみの事前トレーニングデータセットを超えています。
ワークショップでは、トレーニング効率、小規模トレーニングデータセット、認知モデリング、モデル評価、アーキテクチャ革新などを含むBabyLMの全体的なテーマに関する論文を募集する。
論文 参考訳(メタデータ) (2026-02-23T18:02:23Z) - Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora [84.03928547166873]
子どもたちは1億ワード未満の入力から言語を習得できる。
大規模な言語モデルはデータ効率がはるかに低く、通常は3~4桁以上のデータを必要とするが、多くの評価において人間ほど性能は高くない。
BabyLM Challengeは、参加者が固定データ予算で言語モデルトレーニングを最適化するために競う共同作業である。
論文 参考訳(メタデータ) (2025-04-10T23:22:43Z) - Dynamic data sampler for cross-language transfer learning in large language models [34.464472766868106]
ChatFlowは、言語間移動に基づく大規模言語モデル(LLM)である。
我々は、LLaMA2モデルを継続的に訓練するために、中国語、英語、並列コーパスを組み合わせています。
実験により,本手法はモデル収束を加速し,優れた性能を実現することを示す。
論文 参考訳(メタデータ) (2024-05-17T08:40:51Z) - Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model [36.01840141194335]
2B大言語モデル(LLM)であるCT-LLMを導入する。
CT-LLMは、スクラッチから一意に開始され、中国語のテキストデータを組み込んで従来の手法から分岐する。
CT-LLMは中国語のタスクに優れており、SFTを通して英語で適応性を示す。
論文 参考訳(メタデータ) (2024-04-05T15:20:02Z) - YAYI 2: Multilingual Open-Source Large Language Models [53.92832054643197]
我々は,300億のパラメータを持つベースモデルとチャットモデルを含むYAYI 2を提案する。
YAYI 2は、トレーニング済みのデータ処理パイプラインによってフィルタされた2.65兆のトークンを含む多言語コーパス上で、スクラッチから事前トレーニングされる。
ベースモデルは、数百万の指示による教師付き微調整と、人間のフィードバックからの強化学習によって、人間の価値と整合する。
論文 参考訳(メタデータ) (2023-12-22T17:34:47Z) - Investigating Transfer Learning in Multilingual Pre-trained Language
Models through Chinese Natural Language Inference [11.096793445651313]
中国語と英語の自然言語推論(NLI)におけるXLM-Rの言語間移動能力について検討する。
言語移動をより深く理解するために、中国語の課題と敵対課題の4つのカテゴリを作成しました。
英語のNLIで訓練された言語間のモデルが、中国語のタスク間でうまく伝達されていることが分かりました。
論文 参考訳(メタデータ) (2021-06-07T22:00:18Z) - SHUOWEN-JIEZI: Linguistically Informed Tokenizers For Chinese Language
Model Pretraining [48.880840711568425]
事前学習された言語モデルの中国語トークン化に対する3つの要因の影響について検討する。
本稿では,発音に基づくトークン化システムであるSHUOWEN (Talk Word) と,グリフに基づくトークン化システムであるJIEZI (Solve Character) の3種類のトークン化手法を提案する。
SHUOWENとJIEZIは、一般的に従来のシングル文字トークンよりも優れた性能を持つ。
論文 参考訳(メタデータ) (2021-06-01T11:20:02Z) - CPM: A Large-scale Generative Chinese Pre-trained Language Model [76.65305358932393]
我々は,大規模な中国語学習データに基づく生成事前学習を備えた中国語事前学習言語モデル(CPM)をリリースする。
CPMは、数ショット(ゼロショットでも)学習の設定において、多くのNLPタスクで強力なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2020-12-01T11:32:56Z) - PuzzLing Machines: A Challenge on Learning From Small Data [64.513459448362]
我々は,高校生を対象としたLinguistic OlympiadsのRosetta StoneパズルからなるPuzzLing Machinesという,小さなデータから学ぶための課題を紹介した。
私たちのチャレンジには、81言語から幅広い言語現象をカバーする約100のパズルが含まれています。
単純な統計アルゴリズムと最先端のディープニューラルモデルの両方が、予想通り、この課題に対して不十分に実行可能であることを示す。
論文 参考訳(メタデータ) (2020-04-27T20:34:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。