論文の概要: Joint Optimization for Greedy Longest-match Tokenization
- arxiv url: http://arxiv.org/abs/2607.23362v1
- Date: Sat, 25 Jul 2026 21:01:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.072995
- Title: Joint Optimization for Greedy Longest-match Tokenization
- Title(参考訳): グレディ・ロングマッチ・トークン化のための共同最適化
- Abstract要約: 近年の研究では、特定の推論規則の圧縮を最適化するために、サブワード語彙を訓練できることが示されている。
我々は、この手法を強欲な左から右へ長大なデコードに拡張する。
グリーディ・ロング・マッチ・トークン化のための共同最適化手法を提案する。
- 参考スコア(独自算出の注目度): 4.106446329199573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has shown that subword vocabularies can be trained to optimize compression for a specific inference rule rather than relying on greedy heuristics such as Byte Pair Encoding (BPE). We extend this approach to greedy left-to-right longest-match decoding, the fast and widely used inference rule underlying WordPiece. We introduce Joint Optimization for Greedy Longest-Match Tokenization (JOLT), which formulates vocabulary learning as an integer program over vocabulary-selection and segmentation-choice variables. Greedy-consistency constraints ensure that each optimized segmentation exactly matches the segmentation produced by longest-match decoding under the selected vocabulary, aligning the training objective with deployment-time tokenization. To scale the optimization, we solve a linear programming relaxation and selectively introduce higher-order segmentations only for unresolved pretokens. The resulting relaxation is nearly integral: rounded solutions fall within 0.008 - 0.176 % of the LP lower bound on the training scope. The bound also shows that BPE is already within 1 - 2 % of the best achievable compression under greedy longest-match decoding, while JOLT closes 89.6 - 99.4 % of the remaining gap. On held-out validation data across four training scopes and vocabulary sizes of 32,000 and 64,000, JOLT produces up to 0.78 % fewer tokens than BPE, with improvements generally increasing as the training scope grows. These results demonstrate that inference-aligned vocabulary optimization can recover most of the limited compression headroom left by BPE while providing a certificate of near-optimality.
- Abstract(参考訳): 近年の研究では、バイトペアエンコーディング(BPE)のような欲求的なヒューリスティックに頼らず、特定の推論規則の圧縮を最適化するために、サブワード語彙をトレーニングできることが示されている。
我々は、このアプローチをWordPieceの基盤となっている高速で広く使われている推論ルールである、グリージーな左から右へ長いマッチデコーディングに拡張する。
本稿では,語彙選択とセグメンテーション選択変数に対する整数プログラムとして語彙学習を定式化したものである。
グレディ一貫性の制約により、各最適化されたセグメンテーションは、選択された語彙の下で最長マッチのデコードによって生成されたセグメンテーションと正確に一致し、トレーニング目標とデプロイメント時のトークン化を一致させる。
最適化をスケールするために、線形プログラミング緩和を解き、未解決プリトケンに対してのみ高階セグメンテーションを選択的に導入する。
丸みを帯びた解は、トレーニング範囲のLPの下限の0.008 - 0.176%以内に収まる。
また、このバウンダリは、BPEがグリーディ・ロングマッチ・デコードの下で達成可能な最高の圧縮の1-2%以内であり、JOLTは残りのギャップの89.6 - 99.4 %を閉じていることを示している。
4つのトレーニングスコープと語彙サイズ32,000と64,000の保持された検証データでは、JOLTはBPEよりも最大0.78%少ないトークンを生成し、トレーニングスコープが大きくなるにつれて一般的に改善されている。
これらの結果は,BPEが残した限られた圧縮ヘッドルームのほとんどを,ほぼ最適性の証明を提供しながら,推論整合ボキャブラリ最適化が復元可能であることを示す。
関連論文リスト
- Tokenisation via Convex Relaxations [14.99534435778172]
トークン化は現在のNLPパイプラインの不可欠な部分である。
トークンサ構築を線形プログラムとして定式化し、凸最適化ツールを用いて解決する。
ConvexTokは、固有のトークン化メトリクスと、言語モデルによって達成されるビット単位バイト(BpB)を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-21T17:59:56Z) - Tokenization with Split Trees [14.246587182553952]
ToaST(Tokenization with Split Trees)は、圧縮を直接最適化するサブワードトークン化手法である。
ToaSTは、40,960以上の語彙サイズでBPE、WordPiece、UnigramLMと比較してトークン数を11%以上削減する。
1.5Bパラメータ言語モデルのトレーニングでは、ToaSTが最高スコアを獲得し、ベースラインの2.6%から7.6%を上回り、3つのうち2つが重要であり、22のタスクのうち13つが最高スコアである。
論文 参考訳(メタデータ) (2026-05-21T16:46:23Z) - AdaptBPE: From General Purpose to Specialized Tokenizers [18.70903226766322]
適応コーパスの周波数に基づいて,低ユーティリティトークンをより関連性の高いトークンに選択的に置き換えるポストトレーニング適応戦略を提案する。
提案アルゴリズムは,目的語彙の適応コーパスを最も効果的に符号化したトークンの在庫を特定する。
この方法は、語彙の微調整プロセスに似た軽量な適応機構として機能し、特定のドメインやタスクに対して最適化されたトークン化を可能にする。
論文 参考訳(メタデータ) (2026-01-29T12:59:40Z) - Training Long-Context LLMs Efficiently via Chunk-wise Optimization [60.05884946552877]
textitSequential Chunk-wise Optimization (SeCO) は、長い入力を管理可能なチャンクに分割するメモリ効率の訓練パラダイムである。
textitSparse Chunk-wise Optimization (SpaCO)を導入し、特定のチャンクへの勾配を選択的に伝播することで計算オーバーヘッドを削減する。
SpaCOは、コンテキスト長からバックプロパゲーションの計算コストを分離し、シーケンスが長くなるにつれて、トレーニング時間が徐々に推論時間に収束することを可能にする。
論文 参考訳(メタデータ) (2025-05-22T14:11:34Z) - A Partition Cover Approach to Tokenization [24.595558878756787]
トークン化とは、文字列を一定の語彙サイズのトークンに符号化するプロセスである。
Byte-Pair corpora (BPE) は、トークン化問題を圧縮問題として定式化し、マージのシーケンスを実行することでそれに取り組む。
GreedTokは圧縮においてBPEやUnigramよりも優れており、GreedWMCに匹敵するカバースコアが得られることを示す。
論文 参考訳(メタデータ) (2025-01-08T17:07:07Z) - Batching BPE Tokenization Merges [55.2480439325792]
BatchBPEはByte PairアルゴリズムのPython実装である。
ベーシックラップトップ上で高品質なトークンをトレーニングするために使用される。
論文 参考訳(メタデータ) (2024-08-05T09:37:21Z) - Training LLMs over Neurally Compressed Text [55.11828645767342]
本稿では,高度に圧縮されたテキスト上での大規模言語モデル(LLM)の訓練について検討する。
テキストをブロックに分割し,それぞれが同じビット長に圧縮する新しい圧縮手法であるEqual-Info Windowsを提案する。
提案手法は, 大規模化により向上し, パープレキシティと推論速度のベンチマークにおいて, バイトレベルのベースラインをはるかに上回る, ニューラルネットワークによる効果的な学習を実演する。
論文 参考訳(メタデータ) (2024-04-04T17:48:28Z) - PoSE: Efficient Context Window Extension of LLMs via Positional
Skip-wise Training [91.99700930388998]
固定されたコンテキストウィンドウを用いて長い入力をシミュレートする位置スキップ-wisEトレーニングを提案する。
PoSEはフル長の微調整に比べてメモリと時間オーバーヘッドを大幅に削減する。
2kのトレーニングコンテキストウィンドウを使用して,LLaMAモデルを128kトークンに拡張した。
論文 参考訳(メタデータ) (2023-09-19T08:03:38Z) - SelfSeg: A Self-supervised Sub-word Segmentation Method for Neural
Machine Translation [51.881877192924414]
サブワードセグメンテーションはニューラルマシン翻訳(NMT)に不可欠な前処理ステップである
本稿では,自己教師型ニューラルネットワークサブワードセグメンテーション手法であるSelfSegを紹介する。
SelfSegはトレーニング/デコードがはるかに高速で、並列コーパスの代わりに単言語辞書のみを必要とする。
論文 参考訳(メタデータ) (2023-07-31T04:38:47Z) - TagCLIP: Improving Discrimination Ability of Open-Vocabulary Semantic Segmentation [53.974228542090046]
対照的に、CLIP(Contrastive Language- Image Pre-Training)は、最近、ピクセルレベルのゼロショット学習タスクにおいて大きな可能性を示している。
CLIPのテキストとパッチの埋め込みを利用してセマンティックマスクを生成する既存のアプローチは、しばしば目に見えないクラスから入力ピクセルを誤識別する。
この問題に対処するためにTagCLIP(Trusty-aware guideed CLIP)を提案する。
論文 参考訳(メタデータ) (2023-04-15T12:52:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。