論文の概要: Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization
- arxiv url: http://arxiv.org/abs/2607.22334v1
- Date: Fri, 24 Jul 2026 14:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.150265
- Title: Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization
- Title(参考訳): Byte-Prefix Marginalizationによるクロストケナイザオンポリシィ蒸留
- Abstract要約: Byte-Prefix Marginalizationは、共有バイト空間における学生語彙上の教師の次のToken分布を再表現する。
BPMは6つの数学とプログラミングのベンチマークにおいて、現在のクロストークン手法を一貫して上回ります。
- 参考スコア(独自算出の注目度): 15.613307729537096
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-weight language models from different families exhibit complementary capabilities, motivating their consolidation into a compact student through on-policy distillation (OPD). However, full-vocabulary OPD typically assumes a shared tokenizer, while existing cross-tokenizer methods may discard teacher probability mass or assign it to student tokens with unrelated content. We introduce Byte-Prefix Marginalization (BPM), which re-expresses the teacher's next-token distribution over the student vocabulary in a shared byte space. Specifically, BPM assigns each teacher token's probability to the longest student token whose byte representation is a prefix of the teacher token's bytes, aggregates mass mapped to the same student token, and places otherwise unmatched mass in an explicit residual category. This produces a vocabulary-complete, byte-aligned, and mass-preserving target for dense OPD. The target exactly recovers the teacher-induced byte-prefix marginal when the relevant prefix does not span multiple teacher tokens (a condition satisfied at more than 99% of training positions) and uses a mass-preserving, chain-factorized lower bound otherwise. Across Qwen3-32B, GLM-Z1-9B-0414, and MiniMax-M2.7 as teachers, BPM consistently outperforms current cross-tokenizer methods on six mathematics and programming benchmarks, improving six-benchmark avg@8 by 3.7-6.6 points over the strongest baselines.
- Abstract(参考訳): 異なる家庭のオープンウェイト言語モデルは補完的な能力を示し、オン・ポリーズ蒸留(OPD)を通じてコンパクトな学生への統合を動機付けている。
しかし、フルボキャブラリ OPD は通常、共有トークン化を前提としており、既存のクロストークン化手法は教師の確率質量を捨てたり、無関係な内容の学生トークンに割り当てたりすることができる。
本稿では,教師の学習者語彙における次点分布を共有バイト空間で再表現するByte-Prefix Marginalization(BPM)を紹介する。
具体的には、BPMは、各教師トークンの確率を、教師トークンのバイトのプレフィックスである最も長い学生トークンに割り当て、同じ学生トークンにマップされたマスを集約し、それ以外の未一致のマスを明示的な残留カテゴリに配置する。
これにより、高密度PDのための語彙完全、バイトアライメント、および大量保存ターゲットが生成される。
ターゲットは、関連する接頭辞が複数の教師トークン(訓練位置の99%以上で満たされた条件)にまたがらない場合に、教師が引き起こしたバイト前固定限界を正確に回復し、それ以外は、大量保存、連鎖分解下限を使用する。
Qwen3-32B、GLM-Z1-9B-0414、MiniMax-M2.7は教師として、BPMは6つの数学とプログラミングのベンチマークにおいて、現行のクロストケナイザメソッドを一貫して上回り、最強のベースラインに対して6ベンチマークのavg@8を3.7-6.6ポイント改善した。
関連論文リスト
- Mismatch Matters: On-Policy Distillation Beyond Token Agreement [27.396104103072844]
ミスマッチトークンは,主に学生不足トークンと学生不足トークンの2種類に分類される。
そこで本研究では,有界ヘリンジャー成形法を応用し,最も重大なサンプル過剰を抑えるためのTIDEと,欠陥のある確率質量を復元するための分析教師の上位K$インジェクションを提案する。
論文 参考訳(メタデータ) (2026-08-10T16:53:14Z) - X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation [19.064775527374618]
クロストケナイザーの知識蒸留により、学生モデルは語彙を持つ教師から学ぶことができる。
ログベースの手法は正しい確率のみを使用し、教師の分布に完全な「暗黒の知識」を欠いている。
本稿では,これらの問題を対象とした2つの相補的損失定式化手法であるX-Tokenを提案する。
論文 参考訳(メタデータ) (2026-05-20T19:59:31Z) - SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation [39.59759394378816]
オンライン蒸留は、教師と学生の予測がトークン単位で同等のトークンであると仮定する。
監視空間を拡大してこの信号を復元するSimCTを提案する。
SimCT は共有語彙 OPD と代表的クロストケナイザベースラインに対して一貫した利得を示す。
論文 参考訳(メタデータ) (2026-05-08T13:16:17Z) - Cross-Tokenizer LLM Distillation through a Byte-Level Interface [47.989175659742294]
クロストケナイザー蒸留(Cross-tokenizer distillation、CTD)とは、教師が異なるトークンを用いた場合の知識を学生言語モデルに伝達することである。
本稿では,トークン化器間の共通インターフェース(バイトレベル)でCTDを動作させる,Byte-Level Distillation (BLD) と呼ばれるシンプルだが効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2026-04-08T18:05:38Z) - Sampling from Your Language Model One Byte at a Time [82.71473348639489]
トークン化は、PBP(Prompt Boundary Problem)として知られるモデル世代に歪みをもたらす可能性がある。
BPEトークン化器を用いて任意のオートレ LM を文字レベルまたはバイトレベル LM に変換する推論時間法を提案する。
提案手法は, PBPを効率的に解き, 異なるトークン化器で言語モデルの語彙を統一することができる。
論文 参考訳(メタデータ) (2025-06-17T02:37:04Z) - Boundless Byte Pair Encoding: Breaking the Pre-tokenization Barrier [11.131061652781192]
事前トークン化は、コーパス内のトークンの分布を一般的なフル長の単語に歪ませる原因となる。
本研究では,境界制約を緩和する改良型BPEアルゴリズムであるBoundlessBを提案する。
我々のアプローチは、2つの完全プレトケンを選択的にスーパーワードと呼ぶより大きな単位にマージする。
論文 参考訳(メタデータ) (2025-03-31T19:36:29Z) - SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator [65.62084602011596]
大規模言語モデル(LLM)は、自然言語処理タスクの範囲で例外的な性能を示した。
特定の意味のないセパレータトークン(句読点)は意味的に意味のあるトークンと比較して注意点に不均等に寄与する。
SepLLMは,これらのセグメントを圧縮し,冗長なトークンを除去することによって推論を高速化する,プラグアンドプレイフレームワークである。
論文 参考訳(メタデータ) (2024-12-16T18:58:57Z) - Batching BPE Tokenization Merges [55.2480439325792]
BatchBPEはByte PairアルゴリズムのPython実装である。
ベーシックラップトップ上で高品質なトークンをトレーニングするために使用される。
論文 参考訳(メタデータ) (2024-08-05T09:37:21Z) - SEP: Self-Enhanced Prompt Tuning for Visual-Language Model [93.94454894142413]
SEP(Self-Enhanced Prompt Tuning)という新しいアプローチを導入する。
SEPは、テキストレベルの埋め込みと視覚レベルの埋め込みの両方を強化するために、差別的な事前知識を明示的に取り入れている。
様々なベンチマークやタスクの総合的な評価は、プロンプトチューニングにおけるSEPの有効性を確認している。
論文 参考訳(メタデータ) (2024-05-24T13:35:56Z) - Nonparametric Masked Language Modeling [113.71921977520864]
既存の言語モデル(LM)は、有限語彙上のソフトマックスでトークンを予測する。
NPMは,このソフトマックスを参照コーパス内の各フレーズの非パラメトリック分布に置き換える最初の非パラメトリックマスク付き言語モデルである。
NPMは、コントラスト目的と全コーパス検索に対するバッチ内近似で効率的に訓練することができる。
論文 参考訳(メタデータ) (2022-12-02T18:10:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。