論文の概要: Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Registered Negative Result
- arxiv url: http://arxiv.org/abs/2608.28151v1
- Date: Fri, 28 Aug 2026 10:13:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.26996
- Title: Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Registered Negative Result
- Title(参考訳): Nested Byte-Level Vocabularies:事前登録済みの否定的な結果
- Abstract要約: 一つの言語モデルが複数の語彙サイズで動作可能であることを示す。
コントロールトークンはアクティブサイズを示し、その埋め込みと出力ヘッドをスライスすることで任意のトレーニングされたサイズにデプロイされる。
キャップトークンも出力制限もないコントロールも同じように堅牢であり、条件付けよりも多粒度トレーニングに寄与する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A byte-level BPE tokenizer is an ordered list of merge rules, so applying only a prefix yields a vocabulary whose token identifiers are the first rows of the full vocabulary. This prefix nesting allows one language model to operate at several vocabulary sizes, use a control token to indicate the active size, and be deployed at any trained size by slicing its embedding and output head. We pre-registered five claims, including margins, seeds, contrasts, and a stop rule, and trained 30 models with 3.1M- and 10.6M-parameter bodies on 200M tokens each. Slicing is numerically exact: across 76 checks, a sliced model reproduces the restricted full model's logits bit for bit and removes 66% of deployed weights without changing latency. However, the shared model trails a fixed-cap specialist by 3.64% bits per byte at 32k against a 1% margin, and by 2.96% at 8k against a 2% margin. A 2x2 ablation separating the control token from output restriction finds that the token changes performance by +0.07% to +0.13%, with all intervals crossing zero, while output restriction costs +0.47% to +1.19%; the factors are substitutes rather than complements. Multi-cap training nevertheless improves robustness: under typographical noise, the same checkpoint degrades 12.5--15.4 points less in its fine mode and outperforms each fixed-cap specialist at that specialist's vocabulary size. A control with neither cap token nor output restriction is equally robust, attributing this benefit to multi-granularity training rather than conditioning. The per-cap penalty tracks each cap's share of training rows, yielding a falsifiable prediction for future work.
- Abstract(参考訳): バイトレベルのBPEトークンライザはマージルールの順序リストなので、プレフィックスのみを適用すると、トークン識別子が全語彙の最初の行である語彙が生成される。
このプレフィックスネストにより、ある言語モデルが複数の語彙サイズで動作し、アクティブサイズを示すコントロールトークンを使用して、その埋め込みと出力ヘッドをスライスすることで、任意のトレーニングされたサイズでデプロイできる。
我々は、マージン、種、コントラスト、ストップルールを含む5つのクレームを事前登録し、それぞれ2億トークンで3.1Mと10.6Mのパラメトリックボディを持つ30のモデルをトレーニングした。
スライシングは数値的に正確である:76回のチェックで、スライスされたモデルは制限されたフルモデルのロジットビットをビットとして再現し、レイテンシを変更することなくデプロイ重量の66%を除去する。
しかし、共有モデルは固定上限のスペシャリストを32kで3.64%、1%のマージンで2.96%、2%のマージンで2.96%追っている。
出力制限から制御トークンを分離した2x2のアブレーションでは、トークンのパフォーマンスが+0.07%から+0.13%に変化し、すべての間隔が0を越え、出力制限コスト+0.47%から+1.19%となる。
タイポグラフィーノイズ下では、同じチェックポイントが12.5-15.4ポイントの微妙なモードで低下し、各固定キャップスペシャリストをその専門家の語彙サイズで上回る。
キャップトークンも出力制限もないコントロールも同じように堅牢であり、条件付けよりも多粒度トレーニングに寄与する。
キャップごとのペナルティは、各キャップのトレーニング行のシェアを追跡し、将来の作業の予測を偽装する。
関連論文リスト
- Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models [67.72077328700088]
本稿では,2次元の異なるデコーダのみの高密度変圧器モデルについて検討した。
Token-1B モデルは低FLOP 方式ではバイトモデル (End-Of-Token-1B と Bytes-1B) より優れていたが、最終的には高原となる。
100Kトークンの順序ではなく256バイトの小さな語彙で操作することで、ログダンピング時にトップクランケーションの必要性を回避することができる。
論文 参考訳(メタデータ) (2026-09-11T00:17:22Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on Multilingual Tokenizer Fertility [0.0]
バグダスクリプトでは、母音は結合マークとして書かれており、このパターンは各母音記号でそれぞれの単語を分割する。
BPEはプレトーケン内でのみマージするため、これらの分割は語彙サイズやコーパス構成に関係なくトレーニングを通じて持続する。
平行コーパスから26の言語にまたがって、17のバグダのうち1つが影響を受けており、それらは1.47倍(チベット語)から9.02倍(タイ語)まで様々である。
5つの言語では、この文字クラスでのみ異なる一致するトークン化器ペアが予測フロアの2.2%以内に落ち、ネパール語では1語当たりのトークンが4.78、ネパール語では1.58である。
論文 参考訳(メタデータ) (2026-08-26T22:56:24Z) - Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding [0.0]
Pruned BPEは、学習後の可視性とトークンの配置方法である。
マージ構造とモデル可視語彙選択を分離する。
実験により、Pruned BPEは標準BPEと比較してエンコード長を一貫して減少させることが示された。
論文 参考訳(メタデータ) (2026-08-01T19:34:44Z) - In-Place Tokenizer Expansion for Pre-trained LLMs [47.56305202796458]
モデルプロデューサが設計を制御する際に、事前訓練されたモデルのトークン化器をアップグレードするためのインプレースレシピを提案する。
2段階の適応、埋め込みのみのトレーニング、それからフルモデルの事前トレーニングが継続され、ソースチェックポイントの品質が回復する。
拡張されたトークンライザは、ヒンディー語とベトナム語を約2.4タイム、および2.6タイムでエンコードする。
論文 参考訳(メタデータ) (2026-07-16T17:32:38Z) - Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls [0.0]
罰則は明確に定義されていない。
それは構造化された出力を損なう。
200の現実世界のスキーマでは、theta=1.3は有効なスキーマ変換出力の率を97%から23%に下げる。
論文 参考訳(メタデータ) (2026-07-09T05:11:22Z) - Bag of Dims: Training-Free Mechanistic Interpretability via Dimension-Level Sign Patterns [0.0]
我々は、すでにトレーニング不要でアーキテクチャ全般的な機能ベースを提供しているトランスフォーマー隠蔽状態の標準基底を示す。
このBag of Dimsフレームワークを、言語にまたがる7つのモデルで検証する。
論文 参考訳(メタデータ) (2026-06-10T19:34:31Z) - Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models [0.0]
大規模言語モデルは、学習された埋め込みテーブルを通じて全ての入力をルーティングする。
我々はKronecker Embeddingsを紹介した。
入力側のトレーニング可能なパラメータの91~94%をフロンティアスケールで除去する。
論文 参考訳(メタデータ) (2026-05-28T06:53:18Z) - Compute Optimal Tokenization [79.3815358070537]
圧縮速度によって制御されるトークンの情報粒度がスケーリングの傾向にどのように影響するかを検討する。
所望の圧縮速度の設定を可能にする50Mから7Bパラメータまで,988の潜在トークン化モデル(BLT)を訓練する。
実験の結果, モデルパラメータは, 一般に認識されるトークンではなく, バイト単位のデータサイズに比例してスケールすることがわかった。
論文 参考訳(メタデータ) (2026-05-02T01:53:22Z) - Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance [0.0]
本研究では,コンパクトで構造化された制約ヘッダーが制約コンプライアンスを低下させることなく,トークンの迅速な消費を低減できるかどうかを検討する。
コンパクトヘッダーは、3ラウンドで複製された制約ポートトークンを約71%減らし、フルプロンプトトークンを25~30%減らした。
論文 参考訳(メタデータ) (2026-04-08T15:18:33Z) - Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection [49.15148871877941]
大規模言語モデル(LLM)の検出に理論的に魅力的なアプローチを提供する次点分布出力
本稿では,LLMの最後の隠蔽状態を用いて,列長の次トーケン分布のメトリクスに基づく一連の特徴量の重み付けを行うパープレキシティ注意重み付けネットワーク(PAWN)を提案する。
PAWNは、トレーニング可能なパラメータのごく一部を持つ最強のベースラインよりも、競争力があり、より優れた分散性能を示している。
論文 参考訳(メタデータ) (2025-01-07T17:00:49Z) - Beyond Next Token Prediction: Patch-Level Training for Large Language Models [69.67438563485887]
大規模言語モデル(LLM)に対するパッチレベルのトレーニングを導入する。
パッチレベルのトレーニングでは、言語モデルの短いパッチシーケンスをフィードし、次のパッチを予測するようにトレーニングします。
パッチレベルのトレーニングは、モデルのパフォーマンスを損なうことなく、全体のトレーニングコストを0.5$times$に削減できることを示す。
論文 参考訳(メタデータ) (2024-07-17T15:48:39Z) - Rho-1: Not All Tokens Are What You Need [132.31428897792114]
以前の言語モデル事前学習手法は、すべてのトレーニングトークンに次トーケン予測損失を均一に適用した。
Rho-1 は選択言語モデリング (SLM) を採用しており、所望の分布に合わせて有用なトークンを選択的に訓練する。
15B OpenWebMathコーパスで継続事前トレーニングを行うと、Rho-1は9つの数学タスクで最大30%のショット精度で絶対的に改善する。
論文 参考訳(メタデータ) (2024-04-11T17:52:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。