論文の概要: Token-Native Storage: Read and Write in your Agent's Language
- arxiv url: http://arxiv.org/abs/2608.02376v2
- Date: Thu, 06 Aug 2026 13:36:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.615071
- Title: Token-Native Storage: Read and Write in your Agent's Language
- Title(参考訳): Token-Native Storage: エージェント言語で読み書きする
- Abstract要約: 我々は、テキストのトークンネイティブ保存を、モデル独自のバイトペアエンコーディング(BPE)トークンIDとして論じる。
BPE番号トークンは周波数ではなく順にマージし、周波数ごとに再ランク付けすることで、通常の整数(ストリームvバイト)がエントロピーコーダの比率のほとんどを回復できる。
モデルはテキストではなくトークンIDを読み取るため、トークンネイティブストアは、読み取り毎に再起動するのではなく、IDを直接操作する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Search and database engines still store text as UTF-8, a format built for humans. But the systems that increasingly read and write that text (embedders, rerankers, and language-model agents) work with token IDs, not characters, so every access pays to translate between the two. As agents become the primary readers and writers of stored text, we argue for token-native storage: keep the text as the model's own byte-pair-encoding (BPE) token IDs. Packing r50k IDs as uint16 already beats UTF-8 by 2.25x on English with no compression, and an entropy coder on top reaches 3.30x. Across six tokenizers and three corpora (English, code, Hindi), compressing token IDs matches or beats every byte codec, even a corpus-trained zstd dictionary. Two findings sharpen the case. BPE numbers tokens by merge order instead of frequency, and re-ranking by frequency lets a plain integer codec (streamvbyte) recover most of the entropy coder's ratio while decoding ~7x faster, a near-free change to how AI labs publish vocabularies. And because a model reads token IDs, not text, a token-native store hands over the IDs directly instead of re-tokenizing on every read. The only requirement is that reader and writer share a tokenizer, and different model families often use different ones today, so we argue for standardization: a published, shared vocabulary, the way ASCII and UTF-8 standardized text.
- Abstract(参考訳): 検索とデータベースエンジンは、人間のために作られたフォーマットであるUTF-8としてテキストを保存している。
しかし、そのテキスト(エンベッドダー、リランカー、言語モデルエージェント)を読み書きするシステムでは、文字ではなくトークンIDが動作します。
エージェントが格納されたテキストの主要な読み手および書き手になるにつれて、私たちはトークンネイティブなストレージを主張します。
uint16としてr50k IDをパッキングすると、英語ではUTF-8が2.25倍、エントロピーコーダが3.30倍になる。
6つのトークンライザと3つのコーパス(英語、コード、ヒンディー語)にまたがって、トークンIDの圧縮は、コーパスで訓練されたzstd辞書でさえ、すべてのバイトコーデックと一致または打ち勝つ。
2つの所見が症例を鋭くした。
周波数ではなく順序をマージしてBPE番号トークンをマージし、周波数ごとに再ランク付けすることで、通常の整数コーデック(ストリームvバイト)がエントロピーコーダの比率の大部分を回復し、デコードが7倍高速になる。
また、モデルがテキストではなくトークンIDを読み取るため、トークンネイティブストアは、読み取り毎に再トークン化するのではなく、IDを直接操作する。
唯一の要件は、読み手と書き手がトークン化子を共有し、異なるモデルファミリが今日では異なるものを使用することが多いことです。
関連論文リスト
- Rate-Utility Frontiers for Language Encodings: Comparing Tokens, Bytes, and Pixels Under Controlled Linguistic Content [11.09559407806515]
コンテントとダウンストリーム容量の両方が制御されている場合、各エンコーディングはどのように保存されるのかを問う。
13言語と5つのスクリプトで検証された並列文を使用して、トークン、バイト、ピクセルを共有ボトルネックを通じて比較する。
表面形状保存,言語間文アライメント,話題分類の3つのユーティリティを評価した。
論文 参考訳(メタデータ) (2026-07-17T16:55:27Z) - Frequency-Ordered Tokenization for Better Text Compression [0.0]
MethodはByte Pairでテキストをトークン化する。
結果を可変長整数でエンコードし、任意の標準圧縮機に渡す。
enwik8(100MBウィキペディア)では、zlibが7.08ポイント(pp)、LZMAが1.69pp、zstdが0.76pp改善されている。
論文 参考訳(メタデータ) (2026-02-26T12:53:48Z) - BBPE16: UTF-16-based byte-level byte-pair encoding for improved multilingual speech recognition [18.054653205555862]
Longer-8 を用いたバイトレベルの BPE (BBPE) は言語に依存しない設計と完全なカバレッジのために広く採用されている。
本稿では,Unicode-16ベースのBBPEトークンであるBBPE16を提案する。
論文 参考訳(メタデータ) (2026-02-02T06:56:27Z) - UTF-8 Plumbing: Byte-level Tokenizers Unavoidably Enable LLMs to Generate Ill-formed UTF-8 [11.900027560734145]
サブワードトークン化は、事前に定義された語彙に従って入力テキストをセグメント化し、言語モデルに入力する。
コードポイントを使用することで、すべてのメンバが段階的に有効な8文字になります。
バイトから始めると、256の初期メンバしか持たない語彙外エラーを避けることができる。
論文 参考訳(メタデータ) (2025-11-05T00:08:01Z) - Back to Bytes: Revisiting Tokenization Through UTF-8 [25.766926865651936]
我々は,テキストの8-8エンコーディングに対応するIDに,テキストを正確にマッピングする最小限のバイトレベルトークンを提供する。
我々の実装は決してアウト・オブ・レンジIDを導入しない。
論文 参考訳(メタデータ) (2025-10-19T20:06:12Z) - SuperBPE: Space Travel for Language Models [103.09169510391972]
我々は、単純なプリトークン化カリキュラムをバイトペア符号化(BPE)アルゴリズムに組み込んだ「スーパーワード」トークンライザ「SuperBPE」を導入する。
SuperBPEは、固定されたテキストを符号化し、平均してBPEよりもトークンが最大33%少ない。
我々のモデルは、30の下流タスクにわたるBPEベースラインに対して平均+4.0%の絶対的な改善を達成している。
論文 参考訳(メタデータ) (2025-03-17T17:53:23Z) - From Language Models over Tokens to Language Models over Characters [54.123846188068384]
現代の言語モデルは、$itcharacter$ stringsではなく$ittoken$ strings上の内部的、数学的に...分布である。
本稿では,トークンレベル言語モデルから文字レベル言語への変換アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-12-04T21:19:20Z) - Batching BPE Tokenization Merges [55.2480439325792]
BatchBPEはByte PairアルゴリズムのPython実装である。
ベーシックラップトップ上で高品質なトークンをトレーニングするために使用される。
論文 参考訳(メタデータ) (2024-08-05T09:37:21Z) - T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text [59.57676466961787]
本稿では,手話における情報密度に基づいて符号化長を調整できる新しい動的ベクトル量子化(DVA-VAE)モデルを提案する。
PHOENIX14Tデータセットを用いて実験を行い,提案手法の有効性を示した。
我々は,486時間の手話ビデオ,音声,文字起こしテキストを含むドイツ語手話データセットPHOENIX-Newsを提案する。
論文 参考訳(メタデータ) (2024-06-11T10:06:53Z) - Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal [58.29382184006158]
そこで本研究では,パラメータフリー,計算ライト,実装容易な修正による動的足場トークン除去機構を組み込んだScaffold-BPEを提案する。
言語モデリングや機械翻訳の広範な実験において、Scaffold-BPEはオリジナルのBPEよりも一貫して優れていた。
論文 参考訳(メタデータ) (2024-04-27T07:12:07Z) - Neural Machine Translation without Embeddings [44.129310924201604]
多くのNLPモデルは、手作りのトークン化規則とサブワード誘導アルゴリズムによって生成されるサブワードトークンのシーケンス上で動作する。
単純な普遍的な代替手段は、すべてのコンピュータ化されたテキストを8バイトのバイト列として表現することである。
英語から10の異なる言語へのバイトバイト機械翻訳の実験では、BLEUの一貫性が向上し、文字レベルや標準のサブワードレベルモデルに匹敵する結果となった。
論文 参考訳(メタデータ) (2020-08-21T09:54:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。