論文の概要: Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to Reduce Cross-Script Token-Budget Disparities
- arxiv url: http://arxiv.org/abs/2610.01984v2
- Date: Fri, 02 Oct 2026 15:53:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.003246
- Title: Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to Reduce Cross-Script Token-Budget Disparities
- Title(参考訳): Universal Byte-Level Encoding: UTF-8/UTF-16 Routing to reduce the cross-Script Token-Budget Disparities
- Abstract要約: バイトコードレベルのバイトペア符号化(BBPE)は、Unicodeテキストをすべてカバーしているため、多言語大言語モデル(LLM)にとって魅力的である。
多くのスクリプトは英語よりも高いコストから始まる。
より高いフロアはトークン数を増やし、要求単位のコストを削減し、コンテキストを縮小することができる。
より効率的な英語トークンであるUniversal Byte-Level UBEを提案する。
- 参考スコア(独自算出の注目度): 2.7286395031146067
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Byte-level byte-pair encoding (BBPE) tokenizers are attractive for multilingual large language models (LLMs) because they cover all Unicode text. In UTF-8-based BBPE, however, many scripts start from a higher fallback cost than English: when no learned merges can be applied, a multibyte character requires multiple byte-derived symbols. We call this worst-case pre-merge cost the encoding floor. A higher floor can increase token counts and per-request cost and shrink usable context. Changing the text encoding can reduce this gap, but a single global encoding can make already-efficient English spans more expensive in mixed-script text. We propose Universal Byte-Level Encoding (UBE), a dual-alphabet tokenizer that keeps 1-2-byte UTF-8 characters on the UTF-8 path while routing 3-4-byte UTF-8 characters through UTF-16. This lowers the encoding floor for 3-byte Basic Multilingual Plane (BMP) characters in scripts with high token premiums (token counts relative to English) without raising it for already-efficient spans in mixed-script text. UBE changes only the byte representation presented to byte-pair encoding (BPE); the merge rule remains standard, and exact decoding is preserved. UBE also composes with alternative boundary policies and morphology-based representations. In a Unicode 17 audit, UBE exactly round-trips all Unicode scalar values and all inputs in the official normalization, grapheme-break, and emoji test suites. Across intrinsic evaluations, UBE lowers dispersion in English-normalized token-count ratios, reducing cross-lingual token-budget disparity. In multilingual language model (LM) experiments, UBE matches BBPE's LM quality. In the main multilingual settings, UBE reduces token counts most for high-premium scripts and slightly lowers English token counts, yielding more usable context under fixed token budgets and faster prompt processing in content-matched benchmarks.
- Abstract(参考訳): バイトコードレベルのバイトペア符号化(BBPE)は、Unicodeテキストをすべてカバーしているため、多言語大言語モデル(LLM)にとって魅力的である。
しかし、UTF-8ベースのBBPEでは、多くのスクリプトは英語よりも高いフォールバックコストから始まる。
この最悪のケースのプリマージは、エンコーディングフロアを犠牲にする。
より高いフロアはトークン数を増やし、要求毎のコストを削減し、使用可能なコンテキストを縮小することができる。
テキストエンコーディングの変更は、このギャップを減らすことができるが、単一のグローバルエンコーディングは、既に効率のよい英語を混合テキストでより高価なものにすることができる。
UTF-16を介して3~4バイトのUTF-8文字をルーティングしながら、1-2バイトのUTF-8文字をUTF-8経路に保持するデュアルアルファベットトークンであるUniversal Byte-Level Encoding (UBE)を提案する。
これにより、3バイトのBasic Multilingual Plane (BMP)文字のエンコーディングフロアを、既に効率のよい混合テキストのスパンを高くすることなく、高いトークンプレミアム(英語と比較して)を持つスクリプトで低くすることができる。
UBEはバイトペア符号化(BPE)に提示されるバイト表現だけを変更し、マージ規則は標準のままであり、正確な復号は保存される。
UBEは代替境界ポリシーや形態素に基づく表現も構成している。
Unicode 17の監査では、UBEはUnicodeスカラー値と公式正規化、Grapheme-break、絵文字テストスイートのすべての入力を正確にラウンドトリップする。
内在的評価全体では、UBEは英語の正規化トークン数比の分散を減少させ、言語間のトークン数と予算の格差を減少させる。
多言語言語モデル(LM)実験では、UBEはBBPEのLM品質と一致する。
メインの多言語設定では、UBEは高いプリミウムスクリプトのトークン数を減らし、英語のトークン数をわずかに減らし、固定されたトークン予算の下でより使いやすくなり、コンテントマッチングされたベンチマークで高速にプロンプト処理を行う。
関連論文リスト
- Token-Native Storage: Read and Write in your Agent's Language [0.0]
我々は、テキストのトークンネイティブ保存を、モデル独自のバイトペアエンコーディング(BPE)トークンIDとして論じる。
BPE番号トークンは周波数ではなく順にマージし、周波数ごとに再ランク付けすることで、通常の整数(ストリームvバイト)がエントロピーコーダの比率のほとんどを回復できる。
モデルはテキストではなくトークンIDを読み取るため、トークンネイティブストアは、読み取り毎に再起動するのではなく、IDを直接操作する。
論文 参考訳(メタデータ) (2026-08-03T15:20:36Z) - BBPE16: UTF-16-based byte-level byte-pair encoding for improved multilingual speech recognition [18.054653205555862]
Longer-8 を用いたバイトレベルの BPE (BBPE) は言語に依存しない設計と完全なカバレッジのために広く採用されている。
本稿では,Unicode-16ベースのBBPEトークンであるBBPE16を提案する。
論文 参考訳(メタデータ) (2026-02-02T06:56:27Z) - Back to Bytes: Revisiting Tokenization Through UTF-8 [25.766926865651936]
我々は,テキストの8-8エンコーディングに対応するIDに,テキストを正確にマッピングする最小限のバイトレベルトークンを提供する。
我々の実装は決してアウト・オブ・レンジIDを導入しない。
論文 参考訳(メタデータ) (2025-10-19T20:06:12Z) - Parity-Aware Byte-Pair Encoding: Improving Cross-lingual Fairness in Tokenization [53.22544362024936]
トークン化は、ほとんどのNLPパイプラインの最初の、そして最も精査されていないステップである。
トークンの学習のための標準的なアルゴリズムは、周波数ベースの目的に依存している。
本稿ではParity-aware Byte Pairを紹介する。
私たちは、パリティを意識したBPEが言語間でより公平なトークン数をもたらすことを実証的に見出した。
論文 参考訳(メタデータ) (2025-08-06T18:14:43Z) - BPE Stays on SCRIPT: Structured Encoding for Robust Multilingual Pretokenization [0.0]
SCRIPT (Script Category Representation in PreTokenization) は、Unicodeスクリプトとカテゴリプロパティに基づいた初期トークンを使用することで、バイト8変換をバイパスする新しい符号化方式である。
実験により,SCRIPT-BPEは,非ラテン文字言語に対する符号化に基づくペナルティを排除しながら,競合圧縮を実現することを示した。
論文 参考訳(メタデータ) (2025-05-30T15:12:41Z) - SuperBPE: Space Travel for Language Models [103.09169510391972]
我々は、単純なプリトークン化カリキュラムをバイトペア符号化(BPE)アルゴリズムに組み込んだ「スーパーワード」トークンライザ「SuperBPE」を導入する。
SuperBPEは、固定されたテキストを符号化し、平均してBPEよりもトークンが最大33%少ない。
我々のモデルは、30の下流タスクにわたるBPEベースラインに対して平均+4.0%の絶対的な改善を達成している。
論文 参考訳(メタデータ) (2025-03-17T17:53:23Z) - MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling [70.34758460372629]
多様な言語にまたがる一貫した大きさのセグメントで同一情報をエンコードする新しいパラダイムを導入する。
MYTEは99の言語すべてに対して短いエンコーディングを生成する。
これにより、多言語LMの性能が向上し、多言語間でのパープレキシティギャップが減少する。
論文 参考訳(メタデータ) (2024-03-15T21:21:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。