論文の概要: Objective vs. Search: Decomposing What Makes a Good Tokeniser
- arxiv url: http://arxiv.org/abs/2609.19145v1
- Date: Wed, 16 Sep 2026 17:59:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.931606
- Title: Objective vs. Search: Decomposing What Makes a Good Tokeniser
- Title(参考訳): Objective vs. Search: 良いtokeniserを作るものを分解する
- Abstract要約: 2つの支配的トークン化アルゴリズムは現代の言語モデルで使用されている。
この2x2設計空間を完成させる2つの新しいトークン化アルゴリズムを導入する。
我々は,各アルゴリズムが生成するトークンを使って,モデルサイズ,語彙サイズ,ドメインの異なる言語モデルを訓練する。
- 参考スコア(独自算出の注目度): 30.29295648412905
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Two dominant tokenisation algorithms are used by modern language models: byte-pair encoding (BPE) and UnigramLM. These differ along two orthogonal axes: their optimisation objective (compression vs. log-likelihood) and their search procedure (bottom-up merging vs. top-down pruning). Existing comparisons confound these axes, making it unclear whether their observed differences stem from what is being optimised vs. how it is being optimised. We disentangle the two by introducing two new tokenisation algorithms that complete this 2x2 design space: BottomUpLL, a bottom-up likelihood-based tokeniser, and TopDownComp, a top-down compression-based tokeniser. We train language models with tokenisers produced by each algorithm, varying: model size, vocabulary sizes, and domain (English-only vs. multilingual). Evaluating models on bits-per-byte, we find that the search procedure -- not the objective -- is the dominant factor: bottom-up tokenisers consistently achieve lower bits-per-byte in most settings. Evaluating models on the BLiMP task, however, shows no consistent relationship between design choice and performance. Overall, our results disentangle the effect of tokeniser design choices on language modelling performance, offering concrete guidance for their more principled construction.
- Abstract(参考訳): 2つの主要なトークン化アルゴリズムは、バイトペア符号化(BPE)とユニグラムLMという現代言語モデルで使用されている。
これらは2つの直交軸(圧縮対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対対)で異なる。
既存の比較ではこれらの軸が一致しており、観測された違いが最適化されていることと最適化されていることに由来するかどうかは不明である。
私たちはこの2x2設計空間を完成させる2つの新しいトークン化アルゴリズムを導入することで、この2つを混乱させました。
我々は,各アルゴリズムが生成するトークンをモデルサイズ,語彙サイズ,ドメイン(英文のみ対多言語対多言語)など,さまざまな方法で言語モデルを訓練する。
ボトムアップトークンは、ほとんどの設定において、下位ビット単位のバイトを一貫して達成します。
しかし、BLiMPタスク上でのモデル評価では、設計選択と性能の整合性は示されていない。
以上の結果から,トークン設計選択が言語モデリング性能に与える影響を解消し,より原理化された構成のための具体的なガイダンスを提供することができた。
関連論文リスト
- What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling? [1.3177681589844814]
トークン化は、言語モデリングパイプラインの基本コンポーネントである。
本研究では,トークン化が言語モデリングと協調的に最適化されるときに,トークンがどのように学習されるかを分析する。
SSLMsやH-Netsのようなトークンフリーな手法と18のタイプとスクリプトの多言語間の固定トークン化手法を比較した。
論文 参考訳(メタデータ) (2026-08-18T03:34:56Z) - Tokenisation via Convex Relaxations [14.99534435778172]
トークン化は現在のNLPパイプラインの不可欠な部分である。
トークンサ構築を線形プログラムとして定式化し、凸最適化ツールを用いて解決する。
ConvexTokは、固有のトークン化メトリクスと、言語モデルによって達成されるビット単位バイト(BpB)を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-21T17:59:56Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Beyond Text Compression: Evaluating Tokenizers Across Scales [4.0253589606301174]
トークン化器の選択は、英語のタスクに無視できる効果を持つが、多言語設定における一貫した性能差をもたらすことを示す。
我々はZipfの法則に着想を得た新しい固有のトークン化指標を提案し、テキスト圧縮よりも下流のパフォーマンスと強く相関する。
論文 参考訳(メタデータ) (2025-06-03T17:35:56Z) - BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models [55.2480439325792]
本稿では,性能を考慮した文脈埋め込みを用いた言語モデルの自動比較手法を提案する。
提案手法は,2つのLM間の生成容易性について,その相違点を示すコヒーレントな特徴を抽出する。
本研究では,サイズ,モデルファミリ,ポストトレーニングの異なるモデルを比較し,コーパスレベルの難易度だけでは見つからないパフォーマンスの有意義な違いを示す,特定のコンテキストに対する洞察を列挙する。
論文 参考訳(メタデータ) (2025-06-02T19:44:06Z) - Tokenization is Sensitive to Language Variation [14.568179478275255]
トケナイザーはテキストを小さな単位に分割し、あまり一般的でない言語形式に対して異なる振る舞いをするかもしれない。
これは2種類のタスクに対して、下流のLLMパフォーマンスに異なる影響を与える可能性がある。
最高のトークン化器は2つのタスクタイプによって異なり、事前トークン化器はパフォーマンスに最も大きな影響を与える。
論文 参考訳(メタデータ) (2025-02-21T09:58:54Z) - From Language Models over Tokens to Language Models over Characters [54.123846188068384]
現代の言語モデルは、$itcharacter$ stringsではなく$ittoken$ strings上の内部的、数学的に...分布である。
本稿では,トークンレベル言語モデルから文字レベル言語への変換アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-12-04T21:19:20Z) - Exact Byte-Level Probabilities from Tokenized Language Models for FIM-Tasks and Model Ensembles [23.134664392314264]
トークン化は、言語モデル(LM)における多くの未理解の欠点と関連している。
本研究は, トークン化がモデルとバイトレベルのモデルを比較し比較することによって, モデル性能に与える影響について検討する。
本稿では,学習トークン分布と等価バイトレベル分布とのマッピングを確立するフレームワークであるByte-Token Representation Lemmaを紹介する。
論文 参考訳(メタデータ) (2024-10-11T23:30:42Z) - BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and
Semantic Parsing [55.058258437125524]
本稿では,制約付きLanguage Model Parsingを評価するベンチマークであるBenchCLAMPを紹介する。
APIを通じてのみ利用可能な2つのGPT-3変種を含む8つの言語モデルをベンチマークする。
実験により,エンコーダ-デコーダ事前学習言語モデルでは,モデル出力が有効であると制約された場合に,構文解析や意味解析の最先端手法を超えることができることがわかった。
論文 参考訳(メタデータ) (2022-06-21T18:34:11Z) - BBTv2: Pure Black-Box Optimization Can Be Comparable to Gradient Descent
for Few-Shot Learning [83.26610968655815]
Black-Box Tuningは、言語モデルの入力に先立って、連続的なプロンプトトークンを最適化するためのデリバティブフリーなアプローチである。
BBTv2は、言語モデルをグラデーションベースの最適化に匹敵する結果を得るために駆動する、純粋なブラックボックス最適化手法である。
論文 参考訳(メタデータ) (2022-05-23T11:10:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。