論文の概要: Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on Multilingual Tokenizer Fertility
- arxiv url: http://arxiv.org/abs/2608.26449v1
- Date: Wed, 26 Aug 2026 22:56:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.1983
- Title: Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on Multilingual Tokenizer Fertility
- Title(参考訳): 母音記号は文字ではない:マルチリンガル・トケナイザーの妊婦に対する事前学習
- Abstract要約: バグダスクリプトでは、母音は結合マークとして書かれており、このパターンは各母音記号でそれぞれの単語を分割する。
BPEはプレトーケン内でのみマージするため、これらの分割は語彙サイズやコーパス構成に関係なくトレーニングを通じて持続する。
平行コーパスから26の言語にまたがって、17のバグダのうち1つが影響を受けており、それらは1.47倍(チベット語)から9.02倍(タイ語)まで様々である。
5つの言語では、この文字クラスでのみ異なる一致するトークン化器ペアが予測フロアの2.2%以内に落ち、ネパール語では1語当たりのトークンが4.78、ネパール語では1.58である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Byte-level BPE tokenizers that use the HuggingFace ByteLevel pre-tokenizer inherit GPT-2's word regex, where a word is defined as \p{L}+, one or more Unicode letters. In abugida scripts, vowels are written as combining marks; this pattern therefore splits each word at every vowel sign. Since BPE merges only within a pre-token, those splits persist through training regardless of vocabulary size or corpus composition. We formalise this effect as a training-free lower bound on fertility. Across 26 languages from a parallel corpus, every one of the 17 abugidas is affected, ranging from 1.47x (Tibetan) to 9.02x (Thai), whereas Latin, Cyrillic, Hangul, and Han show exactly 1.00x. For 5 languages, matched tokenizer pairs that differ only in this character class fall within 2.2% of the predicted floor, scoring 4.78 versus 1.58 tokens per word on Nepali. When the Nepali share of the training corpus is swept from 5% to 95%, the broken tokenizer barely shifts at all (1.7%) while the fixed one shifts 33.9%, which separates a structural ceiling from a data shortage without needing to inspect any code. We train three 268M models that differ only in their tokenizer; the fixed variant achieves 4.43% lower held-out Nepali bits per byte at equal compute, and it still leads when given the same bytes with 1.59x the compute. A census of 3,479 HuggingFace repositories finds the letters-only word class present in 63.3% of the most-downloaded text-generation models, accounting for 72.5% of their downloads. GPT-4o's o200k pattern already uses a mark-aware word class, making the repair itself prior art. We quantify its value, show how to recognise its absence from symptoms alone, map which scripts it reaches, measure how widely it is deployed, and release a 65,536-entry Nepali-English tokenizer with a harness that regenerates every number here from public data on a laptop.
- Abstract(参考訳): HuggingFace ByteLevelプリトークンを使用するバイトレベルのBPEトークンは、GPT-2の単語regexを継承する。
バグダスクリプトでは、母音は結合マークとして書かれており、このパターンは各母音記号でそれぞれの単語を分割する。
BPEはプレトーケン内でのみマージするため、これらの分割は語彙サイズやコーパス構成に関係なくトレーニングを通じて持続する。
我々は、この効果を、出生率のトレーニング不要な下限として定式化する。
パラレルコーパスの26言語にまたがる17のバグダは、それぞれ1.47x(チベット語)から9.02x(タイ語)まで影響を受けており、一方ラテン語、キリル語、ハングル語、漢語は正確に1.00xである。
5つの言語では、この文字クラスでのみ異なる一致するトークン化器ペアが予測フロアの2.2%以内に落ち、ネパール語では1語当たりのトークンが4.78、ネパール語では1.58である。
トレーニングコーパスのネパールのシェアが5%から95%に減少すると、壊れたトークンライザはわずかに(1.7%)シフトし、固定されたトークンは33.9%シフトし、コードを調べることなく構造的な天井をデータ不足から切り離す。
固定変種は、同じ計算で1バイトあたり4.43%低いホールトアウトネパールビットを達成し、計算の1.59倍の同じバイトを与えられた時点でも導かれる。
3,479人のHuggingFaceリポジトリの国勢調査では、最もダウンロードされたテキスト生成モデルの63.3%に存在する文字のみの単語クラスが、ダウンロードの72.5%を占めている。
GPT-4oのo200kパターンはすでにマーク対応のワードクラスを使用しており、修理自体が先行技術になっている。
われわれはその価値を定量化し、症状がないことの認識方法を示し、どのスクリプトに到達したかをマップし、どのくらい広くデプロイされているかを測定し、ノートパソコン上の公開データから全ての番号を再生するハーネスを備えた65,536人のネパール英語のトークン化ツールをリリースする。
関連論文リスト
- Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Registered Negative Result [0.0]
一つの言語モデルが複数の語彙サイズで動作可能であることを示す。
コントロールトークンはアクティブサイズを示し、その埋め込みと出力ヘッドをスライスすることで任意のトレーニングされたサイズにデプロイされる。
キャップトークンも出力制限もないコントロールも同じように堅牢であり、条件付けよりも多粒度トレーニングに寄与する。
論文 参考訳(メタデータ) (2026-08-28T10:13:32Z) - A Glyph Is Not a Letter, a Token Is Not a Word, a Space Is Not a Space: What the Units of Voynichese Are Not [45.88028371034407]
我々は、Voynichの原稿(Beinecke MS 408)を、一致した散文、暗号、擬似テキスト制御、クワイアレベルの再サンプリングで分析する。
ヴォイニチェの順序はトークンの端とそれらの間のグレードされた境界に置かれる。
公表されたVoynich-imitating暗号と自己励磁テキスト生成器はどちらも、校正置換攻撃による低エントロピー、単位スケール、弱いトークンオーダー、ヌル結果を再現する。
論文 参考訳(メタデータ) (2026-08-17T20:05:12Z) - Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models [0.0]
オープンソースのThamizhiMorphアナライザとジェネレータを拡張したタミル形態解析システムを提案する。
本稿では,Sarvam-1,AI4Bharat IndicBERTv2,BrahmicTokenizer-131Kに基づくフラットな形態素トークン化器,信号保存語合成器,およびトークン化器を比較した。
明示的なタミル形態は、固定された小モデル予算の下での翻訳を改善する一方、階層的な構成は、シーケンスの長さと推定推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-08-02T11:07:53Z) - BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis [0.0]
本稿では、7つの言語にまたがるバランスのとれた741MBコーパスでトレーニングされたSentencePiece BPEトークンの集合であるBharaTIについて述べる。
v1(英語とサンスクリット語のみ)、v2(タミル語でバイトフォールバックをサポートする4言語サポート)、v3(フル7言語ネイティブサブワードカバレッジ)の3つの連続したトークン化バージョンについて説明する。
サブワードの肥大分析によると、v3はインド知識システム(IKS)の技術用語当たり平均2.6トークンであり、GPT-2のトークン化器では年間5.25トークン、多言語SentencePieceベースラインでは3.75トークンである。
論文 参考訳(メタデータ) (2026-07-25T18:23:06Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base [0.0]
BrahmicTokenizer-131Kは131,072バイトレベルのBPEトークンである。
131K語彙クラスのブラフミック圧縮ギャップを閉じる。
OpenAIのo200k_baseの英語、EU言語、コード圧縮を保存する。
論文 参考訳(メタデータ) (2026-05-28T05:29:12Z) - Separate Before You Compress: The WWHO Tokenization Architecture [0.0]
現在のLarge Language Models (LLM) は、主にBPE(Byte Pair Linguist)ベースのトークンライザを使用している。
WWHO(Where-What-How)とSGPE(Syllable Grapheme Pair Linguist)というアルゴリズムを提案する。
Sinhala と Devanagari (Hindi/Sanskrit) を非常に複雑な Abugida スクリプトとして使用し、クリーン化された30万文データセットで WWHO をトレーニングし、1,499,950文のテストセットで評価した。
論文 参考訳(メタデータ) (2026-03-26T10:56:48Z) - Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech [61.759910921200834]
言語間の文エンコーダは通常、数百の言語をカバーしている。
我々はOmniSONARを紹介した。OmniSONARは全言語、言語横断、言語横断の文埋め込みモデルである。
論文 参考訳(メタデータ) (2026-03-17T14:47:35Z) - LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers [76.59130257385826]
BPE語彙の中間的なマージ残基は、マージ学習中にしばしば見られ、最終語彙に保持されるが、ほとんどは、トークン化剤の使用中にコーパスをトークン化するときに、さらにマージされる。
本稿では, この現象を, 一般的に使用されているトークン化剤にまたがって系統的に評価し, 残留トークンを除去する簡単な方法である LiteToken を紹介する。
実験によると、LiteTokenはトークンの断片化を減らし、パラメータを減らし、全体的なパフォーマンスを保ちながら、ノイズやスペル入力への堅牢性を改善する。
論文 参考訳(メタデータ) (2026-02-04T16:19:05Z) - SuperBPE: Space Travel for Language Models [103.09169510391972]
我々は、単純なプリトークン化カリキュラムをバイトペア符号化(BPE)アルゴリズムに組み込んだ「スーパーワード」トークンライザ「SuperBPE」を導入する。
SuperBPEは、固定されたテキストを符号化し、平均してBPEよりもトークンが最大33%少ない。
我々のモデルは、30の下流タスクにわたるBPEベースラインに対して平均+4.0%の絶対的な改善を達成している。
論文 参考訳(メタデータ) (2025-03-17T17:53:23Z) - Batching BPE Tokenization Merges [55.2480439325792]
BatchBPEはByte PairアルゴリズムのPython実装である。
ベーシックラップトップ上で高品質なトークンをトレーニングするために使用される。
論文 参考訳(メタデータ) (2024-08-05T09:37:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。