論文の概要: Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?
- arxiv url: http://arxiv.org/abs/2608.10690v1
- Date: Tue, 11 Aug 2026 09:14:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.97262
- Title: Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?
- Title(参考訳): LLM語彙は隠れコーパスのトークンレベル推定を支援するか?
- Abstract要約: まず、異なるコーパスで訓練されたBPEトークンーが安定なトークンID-分布を共有し、既知のコーパスから隠れコーパスで訓練されたターゲットトークンーへの分布伝達を動機付けていることを示す。
次に、この分布を複数の量子化傾向で近似し、局所密度重み付けを用いてトークンレベルの推定を行うQGDE(Quantile-Guided Density Estimation)を提案する。
- 参考スコア(独自算出の注目度): 43.96699318814863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pretraining corpus composition shapes LLM capabilities, but it often remains hidden even when model weights are released. Prior work has inferred corpus mixtures or traced specific token groups from released tokenizer vocabularies; in contrast, we estimate corpus ratios for arbitrary target tokens. We first show that BPE tokenizers trained on different corpora share stable token ID--ratio distributions, motivating distribution transfer from known corpora to a target tokenizer trained on hidden corpora. We then propose Quantile-Guided Density Estimation (QGDE), which approximates this distribution with multiple quantile trends and uses local density weighting to produce token-level estimates. In controlled settings and a realistic setting using the released SmolLM tokenizer, QGDE achieves mean relative errors as low as 3.00% for token-level estimation and 3.08% after aggregation into category-level mixtures. These results suggest that released tokenizer vocabularies provide a useful signal for fine-grained corpus estimation beyond coarse composition inference.
- Abstract(参考訳): プレトレーニングコーパス組成はLLMの能力を形作っているが、モデル重量が放出されたとしても隠されていることが多い。
従来の研究では, 任意のトークンに対して, コーパスの混合や, 特定のトークン群を抽出し, 任意のトークンに対するコーパスの比率を推定した。
まず、異なるコーパスで訓練されたBPEトークン化剤が安定なトークンID-比分布を共有し、既知のコーパスから隠れコーパスで訓練されたターゲットトークン化剤への分布伝達を動機付けていることを示す。
次に、この分布を複数の量子化傾向で近似し、局所密度重み付けを用いてトークンレベルの推定を行うQGDE(Quantile-Guided Density Estimation)を提案する。
制御された設定とSmolLMトークン化器を用いた現実的な設定において、QGDEは平均相対誤差をトークンレベルの推定では3.00%、カテゴリレベルの混合では3.08%と達成している。
これらの結果から, ケプタライザ語彙は, 粗い組成推定を超えた細粒度コーパス推定に有用な信号であることが示唆された。
関連論文リスト
- Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding [0.0]
Pruned BPEは、学習後の可視性とトークンの配置方法である。
マージ構造とモデル可視語彙選択を分離する。
実験により、Pruned BPEは標準BPEと比較してエンコード長を一貫して減少させることが示された。
論文 参考訳(メタデータ) (2026-08-01T19:34:44Z) - Text Corpora as Concept Fields: Black-Box Hallucination and Novelty Measurement [3.035872403903575]
本稿では,テキストコーパスのtextbfConcept Field について紹介する。
我々は、観測されたデルタとフィールドの局所ガウス推定の間の平均的な絶対的なz-距離である$で、フィールドとの合意を採点する。
提案手法は, 連邦規制法典に基づく接地性検出と, プロジェクト・グーテンベルクにおける新規性検出の2つの大規模設定において評価される。
論文 参考訳(メタデータ) (2026-05-06T16:38:49Z) - Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit [45.18582668677648]
大規模言語モデルにおいて,トークン化剤を移植するためのトレーニング不要な手法を提案する。
それぞれの語彙外トークンを,共有トークンの疎線形結合として近似する。
我々は,OMPがベースモデルの性能を最良にゼロショット保存できることを示す。
論文 参考訳(メタデータ) (2025-06-07T00:51:27Z) - Self-Supervised and Generalizable Tokenization for CLIP-Based 3D Understanding [87.68271178167373]
凍結したCLIPバックボーンを用いたスケール不変表現学習のためのユニバーサル3Dトークン化器を提案する。
S4Tokenは、シーンスケールに関係なくセマンティックインフォームドトークンを生成するトークン化パイプラインである。
論文 参考訳(メタデータ) (2025-05-24T18:26:30Z) - Not all tokens are created equal: Perplexity Attention Weighted Networks for AI generated text detection [49.15148871877941]
大規模言語モデル(LLM)の検出に理論的に魅力的なアプローチを提供する次点分布出力
本稿では,LLMの最後の隠蔽状態を用いて,列長の次トーケン分布のメトリクスに基づく一連の特徴量の重み付けを行うパープレキシティ注意重み付けネットワーク(PAWN)を提案する。
PAWNは、トレーニング可能なパラメータのごく一部を持つ最強のベースラインよりも、競争力があり、より優れた分散性能を示している。
論文 参考訳(メタデータ) (2025-01-07T17:00:49Z) - Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method [108.56493934296687]
本研究では,乱数から発散する概念に触発された偏差に基づくキャリブレーション手法を導入し,プリトレーニングデータ検出のためのトークン確率のキャリブレーションを行う。
我々は,中国語テキスト上でのLLMの検出手法の性能を評価するために,中国語のベンチマークであるPatentMIAを開発した。
論文 参考訳(メタデータ) (2024-09-23T07:55:35Z) - Assessing Keyness using Permutation Tests [0.0]
トークン単位のサンプリングモデルを,トークンではなく文書のサンプルであるコーパスモデルに置き換える。
トークンがドキュメント内やドキュメント間でどのように整理されているかという仮定は必要ありません。
論文 参考訳(メタデータ) (2023-08-25T13:52:57Z) - Nonparametric Masked Language Modeling [113.71921977520864]
既存の言語モデル(LM)は、有限語彙上のソフトマックスでトークンを予測する。
NPMは,このソフトマックスを参照コーパス内の各フレーズの非パラメトリック分布に置き換える最初の非パラメトリックマスク付き言語モデルである。
NPMは、コントラスト目的と全コーパス検索に対するバッチ内近似で効率的に訓練することができる。
論文 参考訳(メタデータ) (2022-12-02T18:10:42Z) - Parameter Space Factorization for Zero-Shot Learning across Tasks and
Languages [112.65994041398481]
本稿では,ニューラルパラメータの空間に対するベイズ生成モデルを提案する。
タスク言語の組み合わせから得られたデータに基づいて、そのような潜伏変数よりも後部を推測する。
我々のモデルは、最先端のゼロショットの言語間転送手法よりも、同等か良い結果が得られる。
論文 参考訳(メタデータ) (2020-01-30T16:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。