論文の概要: TokEval: A Tokenizer Evaluation Suite
- arxiv url: http://arxiv.org/abs/2608.18062v1
- Date: Tue, 18 Aug 2026 17:52:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.435475
- Title: TokEval: A Tokenizer Evaluation Suite
- Title(参考訳): TokEval: トケナイザー評価スイート
- Authors: Clara Meister,
- Abstract要約: TokEvalはトークン化評価指標のフレームワークである。
制御言語モデル事前学習実験を行う。
結果のモデルをビット単位のバイト単位で評価する。
- 参考スコア(独自算出の注目度): 18.651247109977362
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language model tokenizers are typically selected with minimal evaluation, despite the fact that their design choices directly impact model capabilities. This can be partly attributed to a limited understanding of which tokenizer properties affect which aspects of downstream performance. We introduce TokEval, a framework of tokenizer evaluation metrics that goes beyond standard measures like fertility and compression rate to capture linguistically and structurally meaningful properties, e.g., UTF-8 character boundary integrity and digit place-value boundary alignment for mathematics. To validate whether these metrics are predictive of downstream model performance, we conduct controlled language model pretraining experiments, varying solely the tokenizers' training data mixture, pretokenization strategy, and training algorithm. We evaluate the resulting models on bits-per-byte (a tokenizer-agnostic version of perplexity) and several benchmarks, spanning linguistic understanding, mathematical reasoning, and code generation. Our experiments suggest that different intrinsic properties have different impacts on model abilities: information-theoretic metrics predict language modeling abilities (Spearman rho up to 0.80), while structure-sensitive metrics, such as those measuring digit and line-break handling, correlate with task accuracy. We hope TokEval enables more principled tokenizer evaluation, replacing pretraining sweeps with intrinsic measurement wherever the two agree.
- Abstract(参考訳): 言語モデルトークンーザは、設計上の選択がモデル機能に直接影響を及ぼすという事実にもかかわらず、最小限の評価で選択されるのが一般的である。
これは部分的には、どのトークン化プロパティが下流のパフォーマンスのどの側面に影響するかという限定的な理解に起因する可能性がある。
TokEvalは, 言語的および構造的に意味のある特性(例えば, UTF-8文字境界の整合性, 数値的位置値境界の整合性)を捉えるために, 出生率や圧縮率などの標準的な指標を超えるトークン化評価指標のフレームワークである。
これらの指標が下流モデルの性能を予測できるかどうかを検証するため、制御された言語モデル事前学習実験を行い、トークン作成者のトレーニングデータの組み合わせ、事前処理戦略、トレーニングアルゴリズムのみを変化させる。
我々は,バイト単位のビットモデル(トークン化に依存しないパープレキシティ)と,言語理解,数学的推論,コード生成にまたがるいくつかのベンチマークを評価する。
情報理論測度は言語モデリング能力(Spearman rho:最大0.80まで)を予測し、数値や線分処理などの構造に敏感な測度はタスクの精度と相関する。
TokEvalがより原則化されたトークン化器の評価を可能にし、トレーニング前のスイープを本質的な測定に置き換えることを願っている。
関連論文リスト
- TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior [30.782240245074433]
トケナイザーは、テキストが言語モデル(LM)によって表現され、処理される基本的な基盤を提供する。
TokSuiteは、トークン化がLMに与える影響を研究するためのモデルとベンチマークのコレクションである。
論文 参考訳(メタデータ) (2025-12-23T20:43:06Z) - How Different Tokenization Algorithms Impact LLMs and Transformer Models for Binary Code Analysis [0.0]
その重要性にもかかわらず、アセンブリコードのコンテキストにおけるトークン化は未探索領域のままである。
我々は、アセンブリコードのユニークな特徴に合わせて、プリプロセスのカスタマイズオプションとプリトークン化ルールについて検討する。
我々は,トークン化効率,語彙圧縮,組立符号の表現忠実度に基づくトークン化器の比較を行った。
論文 参考訳(メタデータ) (2025-11-05T19:45:26Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Beyond Text Compression: Evaluating Tokenizers Across Scales [4.0253589606301174]
トークン化器の選択は、英語のタスクに無視できる効果を持つが、多言語設定における一貫した性能差をもたらすことを示す。
我々はZipfの法則に着想を得た新しい固有のトークン化指標を提案し、テキスト圧縮よりも下流のパフォーマンスと強く相関する。
論文 参考訳(メタデータ) (2025-06-03T17:35:56Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Language Model Classifier Aligns Better with Physician Word Sensitivity
than XGBoost on Readmission Prediction [86.15787587540132]
語彙レベルでモデルの振る舞いを精査する尺度である感度スコアを導入する。
本実験は,感度スコアのランク相関に基づいて,臨床医と分類医の意思決定論理を比較した。
論文 参考訳(メタデータ) (2022-11-13T23:59:11Z) - Quark: Controllable Text Generation with Reinforced Unlearning [68.07749519374089]
大規模言語モデルは、しばしばユーザの期待に合わない振る舞いを学ぶ。
本稿では,(不必要な)特性を定量化する報酬関数を最適化するアルゴリズムQuarkを紹介する。
未学習の毒性、ネガティブな感情、反復について、我々の実験はQuarkが強いベースラインと最先端の強化学習法の両方より優れていることを示している。
論文 参考訳(メタデータ) (2022-05-26T21:11:51Z) - Impact of Tokenization on Language Models: An Analysis for Turkish [2.4660652494309936]
我々は、OSCARコーパスのトルコ分割におけるRoBERTa事前訓練手順を用いて、トークン化器および事前訓練中規模言語モデルを訓練する。
統計的実験により, モルフォロジーレベルのトークン化器は, 事実上のトークン化器で高い性能を示した。
語彙サイズを増大させることで,デファクトトークン化よりも形態素およびワードレベルのトークン化器の性能が向上することがわかった。
論文 参考訳(メタデータ) (2022-04-19T12:01:46Z) - On the Intrinsic and Extrinsic Fairness Evaluation Metrics for
Contextualized Language Representations [74.70957445600936]
様々な自然言語処理タスクの公平度を測定するために、複数のメトリクスが導入された。
これらの指標は,(1)下流アプリケーションにおけるフェアネスを評価する遠因性指標と,(2)上流言語表現モデルにおけるフェアネスを推定する遠因性指標の2つのカテゴリに大別することができる。
論文 参考訳(メタデータ) (2022-03-25T22:17:43Z) - Are Some Words Worth More than Others? [3.5598388686985354]
簡単な単語予測タスクの枠組み内での2つの本質的な評価手法を提案する。
提案手法を用いて,広く使用されている大規模英語モデルの評価を行った。
論文 参考訳(メタデータ) (2020-10-12T23:12:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。