論文の概要: Subword Segmental BabyLMs: Learning to Tokenise for Sample-Efficient Pretraining
- arxiv url: http://arxiv.org/abs/2609.01151v1
- Date: Tue, 01 Sep 2026 12:28:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.645829
- Title: Subword Segmental BabyLMs: Learning to Tokenise for Sample-Efficient Pretraining
- Title(参考訳): サブワードセグメンショナルベビーフィルム: サンプル効率の良い事前学習のためのトークン学習
- Authors: Francois Meyer,
- Abstract要約: 我々は2026年のBabyLM Challengeに応募し、新たに2つのサブワードセグメントLMを開発した。
SubSegGPTはデコーダのみのモデルで、自己回帰事前トレーニング中にトークン化を学ぶ。
SubSegDeBERTaはエンコーダベースのモデルで、マスク付き単語の生成とトークン化を共同で学習する。
- 参考スコア(独自算出の注目度): 5.465611192345226
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In the standard LM training pipeline, subword tokenisation is applied as a preprocessing step. Subword segmental language modelling is an alternative paradigm in which tokenisation is learned during training, allowing the model to discover subword units that optimise its training objective. In this paper, we present our submission to the 2026 BabyLM Challenge, for which we develop two new subword segmental LMs: SubSegGPT and SubSegDeBERTa. SubSegGPT is a decoder-only model that learns tokenisation during autoregressive pretraining. SubSegDeBERTa is an encoder-based model that jointly learns to generate and tokenise masked words. We train both for the Strict and Strict-small tracks. Our top submission to Strict is SubSegDeBERTa, which achieves notable gains in zero-shot evaluation. Our top submission to Strict-small is SubSegGPT, which outperforms tokenisation-based baselines. Our results show that learnable subword tokenisation can improve sample-efficiency for BabyLM pretraining. We analyse the subword learning dynamics of our models and find that tokenisation gradually converges on subword units that balance morphological alignment and fine-grained segmentation.
- Abstract(参考訳): 標準のLMトレーニングパイプラインでは、サブワードトークン化が前処理ステップとして適用される。
サブワードセグメント言語モデリングは、トレーニング中にトークン化を学習する代替パラダイムであり、モデルのトレーニング目標を最適化するサブワード単位を見つけることができる。
本稿では,2026年のBabyLM Challengeに応募し,SubSegGPTとSubSegDeBERTaという2つのサブワードセグメントLMを開発した。
SubSegGPTはデコーダのみのモデルで、自己回帰事前トレーニング中にトークン化を学ぶ。
SubSegDeBERTaはエンコーダベースのモデルで、マスク付き単語の生成とトークン化を共同で学習する。
我々は、ストリット線とストリット線の両方を訓練する。
Strictへの一番の投稿はSubSegDeBERTaで、ゼロショット評価で顕著な成果を上げています。
Strict-smallへの私たちの最上位の投稿はSubSegGPTで、トークン化ベースのベースラインを上回っています。
この結果から,学習可能なサブワードのトークン化により,BabyLM事前学習におけるサンプル効率が向上することが示唆された。
モデルのサブワード学習のダイナミクスを分析し、トークン化は、形態的アライメントときめ細かいセグメンテーションのバランスをとるサブワード単位に徐々に収束する。
関連論文リスト
- Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation [6.240815206375064]
代名詞のトークン化は、現代の大規模言語モデル(LLM)の重要な部分である。
本研究では,制御されたバイトレベルの事前学習パイプライン内で,サブワードトークン化の効果を分離する。
論文 参考訳(メタデータ) (2026-04-29T23:29:08Z) - StochasTok: Improving Fine-Grained Subword Understanding in LLMs [39.85256850592515]
サブワードレベルの理解は、多桁数字の理解、綴りミス、略語、韻律、言葉遊びなど、多くのタスクに不可欠である。
現在の大きな言語モデル(LLM)は、一見単純なサブワードレベルのタスクに苦しむことが多い。
我々はStochasTokを紹介した。StochasTokは、トレーニング中にトークンをランダムに分割し、LCMが"内部構造を見る"ことを可能にする、シンプルで効率的なトークン化スキームである。
論文 参考訳(メタデータ) (2025-06-02T13:51:11Z) - Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language Models [92.92512796044471]
本稿では,Large Language Models (LLMs) を用いた教師なし単語セグメンテーションの限界を探索する新しいフレームワークを提案する。
我々は,LLMの「理解」を評価するために,複数の言語にまたがる単語セグメンテーションを行うために,現在主流のLLMを使用している。
本研究では,文脈情報に基づく動的$n$-gramモデルの構築を可能にする,LACAと呼ばれる新しい教師なし手法を提案する。
論文 参考訳(メタデータ) (2025-05-26T07:48:15Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z) - Charformer: Fast Character Transformers via Gradient-based Subword
Tokenization [50.16128796194463]
モデルの一部としてサブワードトークン化をエンドツーエンドに学習する新しいモデル帰納バイアスを提案する。
文字から潜在単語表現を自動的に学習する,ソフトグラデーションベースのサブワードトークンモジュール(GBST)を導入する。
また、GBSTを統合し、バイトレベルで動作する深層トランスフォーマーモデルであるCharformerを紹介する。
論文 参考訳(メタデータ) (2021-06-23T22:24:14Z) - COCO-LM: Correcting and Contrasting Text Sequences for Language Model
Pretraining [59.169836983883656]
COCO-LMは、チャレンジングなエラーとテキストシーケンスの変換によって言語モデルを事前学習する新しい自己監視学習フレームワークです。
COCO-LMは、オリジナルのテキストシーケンスでマスク&予測トークンに補助言語モデルを採用しています。
分析の結果,coco-lmのアドバンテージは,困難なトレーニング信号,よりコンテキスト化されたトークン表現,正規化されたシーケンス表現であることがわかった。
論文 参考訳(メタデータ) (2021-02-16T22:24:29Z) - SLM: Learning a Discourse Language Representation with Sentence
Unshuffling [53.42814722621715]
談話言語表現を学習するための新しい事前学習目的である文レベル言語モデリングを導入する。
本モデルでは,この特徴により,従来のBERTの性能が大幅に向上することを示す。
論文 参考訳(メタデータ) (2020-10-30T13:33:41Z) - Char2Subword: Extending the Subword Embedding Space Using Robust
Character Compositionality [24.80654159288458]
本稿では,BERT のような事前学習モデルにおけるサブワード埋め込みテーブルを学習する文字ベースのサブワードモジュール (char2subword) を提案する。
私たちのモジュールは、ミススペル、単語のインフレクション、ケーシング、句読点などの文字レベルの変更に対して堅牢です。
我々は,mBERTにモジュールを組み込むことで,ソーシャルメディア言語コードスイッチング評価(LinCE)ベンチマークの性能が大幅に向上することを示した。
論文 参考訳(メタデータ) (2020-10-24T01:08:28Z) - Byte Pair Encoding is Suboptimal for Language Model Pretraining [49.30780227162387]
一グラムLMトークン化とバイトペア符号化(BPE)の違いを分析する。
その結果,一グラムのLMトークン化手法は,下流タスクと2つの言語でBPEと一致し,BPEより優れることがわかった。
我々は、将来の事前訓練されたLMの開発者が、より一般的なBPEよりもユニグラムのLMメソッドを採用することを期待する。
論文 参考訳(メタデータ) (2020-04-07T21:21:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。