論文の概要: In-Place Tokenizer Expansion for Pre-trained LLMs
- arxiv url: http://arxiv.org/abs/2607.15232v1
- Date: Thu, 16 Jul 2026 17:32:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.197047
- Title: In-Place Tokenizer Expansion for Pre-trained LLMs
- Title(参考訳): プレトレーニングLDMのインパストケナイザ拡張
- Abstract要約: モデルプロデューサが設計を制御する際に、事前訓練されたモデルのトークン化器をアップグレードするためのインプレースレシピを提案する。
2段階の適応、埋め込みのみのトレーニング、それからフルモデルの事前トレーニングが継続され、ソースチェックポイントの品質が回復する。
拡張されたトークンライザは、ヒンディー語とベトナム語を約2.4タイム、および2.6タイムでエンコードする。
- 参考スコア(独自算出の注目度): 47.56305202796458
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A tokenizer fixed at the start of pre-training allocates vocabulary in proportion to the pre-training corpus, reflecting the deployment priorities at that time. When those priorities shift, languages added later are split into many more tokens per word, which can raise latency, compute, and energy consumption for users of those languages. Cloud models can afford a broad vocabulary because the embedding and LM-head matrices are a small fraction of their parameters. On a compact model those matrices are a material share of per-token decode bandwidth, so on-device models ship small vocabularies and accept fragmentation outside a fixed language set. We present tokenizer expansion, an in-place recipe for upgrading a pre-trained model's tokenizer when the model producer controls its design. We continue the existing tokenizer's BPE merges on a multilingual corpus, so most source tokens carry over unchanged as single tokens and every new token has an exact decomposition into source tokens. We copy the carried-over embedding rows unchanged and initialize new rows as the mean of their source sub-token embeddings. A two-stage adaptation, embedding-only training then full-model continued pre-training, recovers source-checkpoint quality. We apply the recipe to a continued pre-trained checkpoint of LFM2-8B-A1B, an 8B-parameter Mixture-of-Experts model, to help produce LFM2.5-8B-A1B with a 128K tokenizer. The expanded tokenizer encodes Hindi and Vietnamese in roughly $2.4\times$ and $2.6\times$ fewer tokens than the source (up to $4.0\times$ on Thai). Combining these reductions with the measured per-token cost of the larger vocabulary, we estimate a $2.2$-$3.7\times$ per-character decode speedup for these languages across our reference devices. We release the model weights and the expanded tokenizer, and report the negative findings that shaped the recipe.
- Abstract(参考訳): 事前トレーニング開始時に固定されたトークンエーザは、事前トレーニングされたコーパスに比例して語彙を割り当て、その時点でのデプロイメントの優先順位を反映する。
これらの優先順位がずれると、後続の言語は1ワードあたりのトークンに分割されるため、これらの言語のユーザのレイテンシ、計算、エネルギー消費が増大する可能性がある。
埋め込み行列とLMヘッド行列はそのパラメータのごく一部であるため、クラウドモデルは広い語彙を持つことができる。
コンパクトモデルでは、これらの行列はトーケン単位のデコード帯域幅の材料シェアであり、オンデバイスモデルは小さな語彙を出荷し、固定された言語セットの外で断片化を受け入れる。
本稿では,モデルプロデューサが設計を制御する際に,事前学習したモデルのトークンライザをアップグレードするためのインプレースレシピであるトークンライザ拡張を提案する。
既存のトークンライザのBPEは、多言語コーパス上でマージされ続けているので、ほとんどのソーストークンは、単一のトークンとして変化せず、すべての新しいトークンは、ソーストークンに正確に分解される。
転送した埋め込み行をそのままコピーし、ソースのサブトークン埋め込みの平均として新しい行を初期化する。
2段階の適応、埋め込みのみのトレーニング、それからフルモデルの事前トレーニングが継続され、ソースチェックポイントの品質が回復する。
本手法は, LFM2.5-8B-A1Bを128Kトークン化剤で製造するために, 8Bパラメータ混合実験モデルである LFM2-8B-A1B の事前学習チェックポイントに応用する。
拡張されたトークンライザは、ヒンディー語とベトナム語を約2.4\times$と2.6\times$より少ないトークン(タイ語では4.0\times$まで)でエンコードする。
これらの削減と、より大きな語彙のトーケン毎のコストの計測を組み合わせることで、参照デバイス間での言語毎のデコードスピードアップを2.2$-3.7\times$2.2$と見積もる。
モデル重みと拡張トークン化剤を公表し、レシピを形作った負の発見を報告する。
関連論文リスト
- TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment [46.819665083185136]
非効率的なトークン化は長いトークンIDシーケンスをもたらし、大規模言語モデルのトレーニングと推論を遅くする。
TokAlign++という手法を導入し,より優れたトークンアライメントレキシコンを学習することで語彙適応性能を向上させる。
15言語での実験結果から,本手法は多言語テキスト圧縮率を向上し,バニラモデルの多言語能力の大部分を維持できることが示された。
論文 参考訳(メタデータ) (2026-05-13T12:23:24Z) - LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers [76.59130257385826]
BPE語彙の中間的なマージ残基は、マージ学習中にしばしば見られ、最終語彙に保持されるが、ほとんどは、トークン化剤の使用中にコーパスをトークン化するときに、さらにマージされる。
本稿では, この現象を, 一般的に使用されているトークン化剤にまたがって系統的に評価し, 残留トークンを除去する簡単な方法である LiteToken を紹介する。
実験によると、LiteTokenはトークンの断片化を減らし、パラメータを減らし、全体的なパフォーマンスを保ちながら、ノイズやスペル入力への堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-04T16:19:05Z) - Reducing Tokenization Premiums for Low-Resource Languages [5.02470728447561]
英語とは対照的に、低リソース言語は現代のLMにおいて相当なトークン化プレミアムに悩まされている。
このトークン化プレミアムは、APIとエネルギコストの増大と、これらの言語に対する効果的なコンテキストウィンドウの削減をもたらす。
マルチトークン文字を単一トークンに結合するトークン語彙へのポストホック付加による事前学習モデルにおけるトークン化プレミアムの削減機構を提案する。
論文 参考訳(メタデータ) (2026-01-19T19:08:58Z) - Sampling from Your Language Model One Byte at a Time [82.71473348639489]
トークン化は、PBP(Prompt Boundary Problem)として知られるモデル世代に歪みをもたらす可能性がある。
BPEトークン化器を用いて任意のオートレ LM を文字レベルまたはバイトレベル LM に変換する推論時間法を提案する。
提案手法は, PBPを効率的に解き, 異なるトークン化器で言語モデルの語彙を統一することができる。
論文 参考訳(メタデータ) (2025-06-17T02:37:04Z) - Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit [45.18582668677648]
大規模言語モデルにおいて,トークン化剤を移植するためのトレーニング不要な手法を提案する。
それぞれの語彙外トークンを,共有トークンの疎線形結合として近似する。
我々は,OMPがベースモデルの性能を最良にゼロショット保存できることを示す。
論文 参考訳(メタデータ) (2025-06-07T00:51:27Z) - TokAlign: Efficient Vocabulary Adaptation via Token Alignment [41.59130966729569]
トークン化は、大規模言語モデル(LLM)がテキストを処理するための基本的なステップである。
新しいドメインや言語では、トークン化の非効率性はLLMのトレーニングと生成を遅くする。
トークン共起ビューからLLMの語彙を置き換えるために,TokAlignという効率的な手法を提案する。
論文 参考訳(メタデータ) (2025-06-04T03:15:57Z) - Retrofitting Large Language Models with Dynamic Tokenization [3.608780819053423]
現在の言語モデル(LM)は固定された静的なサブワードトークン化器を使用する。
このデフォルトの選択は一般的に、特に英語以外の言語において、効率と言語能力の低下をもたらす。
入力テキストに基づいてトークン境界を動的に決定する手法として,動的トークン化を用いたLMの再構成を提案する。
論文 参考訳(メタデータ) (2024-11-27T17:51:58Z) - Beyond Next Token Prediction: Patch-Level Training for Large Language Models [69.67438563485887]
大規模言語モデル(LLM)に対するパッチレベルのトレーニングを導入する。
パッチレベルのトレーニングでは、言語モデルの短いパッチシーケンスをフィードし、次のパッチを予測するようにトレーニングします。
パッチレベルのトレーニングは、モデルのパフォーマンスを損なうことなく、全体のトレーニングコストを0.5$times$に削減できることを示す。
論文 参考訳(メタデータ) (2024-07-17T15:48:39Z) - Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal [58.29382184006158]
そこで本研究では,パラメータフリー,計算ライト,実装容易な修正による動的足場トークン除去機構を組み込んだScaffold-BPEを提案する。
言語モデリングや機械翻訳の広範な実験において、Scaffold-BPEはオリジナルのBPEよりも一貫して優れていた。
論文 参考訳(メタデータ) (2024-04-27T07:12:07Z) - Tokenization Is More Than Compression [14.939912120571728]
Byte-Pairのような既存のトークン化アプローチ。
(BPE)はデータ圧縮の分野に由来する。
PathPieceは、文書のテキストを与えられた語彙に対して最小のトークン数に分割する新しいトークンライザである。
論文 参考訳(メタデータ) (2024-02-28T14:52:15Z) - OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining [49.213120730582354]
言語モデルをスクラッチから事前学習する代わりに、既存の事前学習言語モデル(PLM)を語彙拡張と継続事前学習を通じて新しい言語に適応させることがより効率的な方法である。
我々は、新しいフレームワークを提案する: $textbfO$ne $textbfF$or $textbfA$ll。
論文 参考訳(メタデータ) (2023-11-15T10:40:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。