論文の概要: TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving
- arxiv url: http://arxiv.org/abs/2607.29678v2
- Date: Mon, 03 Aug 2026 17:37:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.321213
- Title: TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving
- Title(参考訳): TokTier: エージェント LLM サービングのための厳格なステートフル CPU+GPU トークン化
- Authors: Zhenyu Zhang, Zhichao Cao,
- Abstract要約: 各呼び出しは、小さなアタッチメントの後、長い書き起こしを再送信する。
TokTierは、アペンダの周りの小さなウィンドウを再起動し、リクエスト毎のチェックが安定した事前トークン境界を見つける場合にのみスプリスする。
vLLMでは、最初のトークンに対する中央値は16-34%、P99 23%減少する。
- 参考スコア(独自算出の注目度): 7.926191097327915
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM serving stacks cache prompt KV state, yet the front end still re-tokenizes the full request text on every call. Coding agents pay the most: each call resubmits a long transcript after a small append, and reuse is hard because a short append can move token boundaries near the end of the prior sequence. Across 153,951 agent calls, the median append is 1.4K characters; only 1.0-3.6% of calls start or rebuild a session, but those carry multi-million-character contexts. At the fleet's 94.1% prompt-cache hit rate approaching 0.99, tokenization grows from 10% to 64% of time to first token. TokTier is a stateful CPU+GPU tokenization service for this two-mode workload with one contract: emitted token IDs are always identical to full reference tokenization of the request text. For session continuations it re-tokenizes a small window around the append and splices only when a per-request check finds a stable pre-tokenization boundary, else it widens or falls back. For calls without a reusable prefix it decomposes GPT-family regex pre-tokenization into run-local rules and runs exact pre-tokenization and BPE on a GPU. A sampled shadow verifier re-checks live traffic. Differential campaigns over 17 production tokenizer families ($1.5\times10^{10}$ split checks, a 12.4TB real-text corpus, 93,000+ replayed agent steps) show zero divergence. Incremental repair takes 0.5-1.1ms from 100K to 3M characters, up to $437\times$ faster than HF tokenization and $2.1\times$ faster at 1M characters than the strongest cache-based baseline (Gigatoken) fully prewarmed. GPU full tokenization encodes 1M characters in 0.87ms, $491\times$ below HF and $23.4\times$ below the fastest published CPU method. With vLLM, median time to first token drops 16-34% and P99 23%; under a 50ms P99 objective, four repair cores plus one GPU sustain 1,821 requests/s where a 16-core stateless front end saturates at 40.
- Abstract(参考訳): LLMサービススタックはキャッシュプロンプトKVステートを起動するが、フロントエンドはすべての呼び出しの完全な要求テキストを再起動する。
各呼び出しは小さなアタッチメントの後、長い書き起こしを再送信し、短いアタッチメントが前のシーケンスの終わり近くでトークン境界を移動できるため、再利用は難しい。
153,951件のエージェントコールの中で、中央のアタッチメントは1.4K文字であり、セッションの開始または再構築は1.0-3.6%に過ぎなかった。
94.1%の急激な攻撃率で0.99に近づくと、トークン化は10%から64%に増加し、最初のトークンとなった。
TokTierは、この2モードのワークロードのためのステートフルなCPU+GPUトークンサービスで、1つのコントラクトがある。
セッション継続では、アペンダの周りの小さなウィンドウを再起動し、リクエスト毎のチェックで安定した事前トークン境界が見つかった場合にのみスプリスする。
再利用可能なプレフィックスのない呼び出しに対しては、GPT- family regexプリトークン化を実行時のルールに分解し、GPU上で正確なプリトークン化とBPEを実行する。
サンプルシャドウ検証器は、ライブトラフィックを再チェックする。
17種類のプロダクタライザファミリー(1.5\times10^{10}$ split checks, a 12.4TB real-text corpus, 93,000以上のreplayed agent steps)に対する差分キャンペーンは、ばらつきがゼロである。
増分修理は100Kから3Mまでの0.5-1.1ms、HFトークン化より437\times$、最強のキャッシュベースベースライン(ギガトケン)より2.1\times$1Ms速い。
GPUフルトークン化は、0.87msで100万文字をエンコードし、HF以下で491\times$、最速のCPUメソッドで23.4\times$をエンコードする。
vLLMでは、最初のトークンに対する中央値は16~34%、P99は23%減少し、50msのP99の目標の下では、4つの修復コアと1つのGPUが16コアのステートレスフロントエンドが40で飽和している1,821リクエスト/秒を持続する。
関連論文リスト
- Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - GRID: Grammar-Railed Decoding for Enterprise SQL Generation [0.0]
文法制約付き復号エンジンGRID(Grammar-Railed Decoding)を提案する。
LALR(1)自体を実行可能なオラクルとして使用する。
4つの保証(音量、完全性、終了、およびほぼ一定に近いコスト)は明示的な前提条件で記述される。
論文 参考訳(メタデータ) (2026-07-11T19:25:23Z) - AdaCodec: A Predictive Visual Code for Video MLLMs [66.30108093864139]
我々は,このインターフェースを音声予測ビジュアルコードと呼び,ビデオMLLMを textbfAdaCodec としてインスタンス化する。
AdaCodecは、条件付き予測コストが高い場合にのみ、参照フレームに完全なビジュアルトークンを使用する。
これは、動きや予測残差を含むフレーム間の変化をコンパクトなPトークンとしてエンコードする。
論文 参考訳(メタデータ) (2026-06-01T17:56:35Z) - Spectral Retrieval: Multi-Scale Sinc Convolution over Token Embeddings for Localized Retrieval in LLM Multi-Agent Systems [0.0]
Spectral Retrievalは、遅延相互作用インデックスからトーケン毎の埋め込みを再利用し、複数のスケールで正常化されたシンクカーネルと結合する。
位置とスケールに対する最大コサインは、いずれのエンドポイントよりも確実に情報的である。
論文 参考訳(メタデータ) (2026-05-23T22:50:58Z) - MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference [75.41426145782751]
本稿では,DSAインデクサのリプレースとして,インデクサヘッドをエキスパートの混合プールとして扱うDSAインデクサを提案する。
MISAはロングベンチの密度の高いDSAインデクサとDeepSeek-V3.2とGLM-5で一致し、それぞれ8倍と4倍のインデクサヘッドで動作している。
私たちのTileLangカーネルは、単一のNVIDIA H200 GPU上で、DSAのオリジナルのインデクサカーネルの約3.82倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2026-05-08T07:19:34Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models [49.93891888238178]
ブロックワイド拡散言語モデル(DLM)は任意の順序で複数のトークンを生成し、自動回帰復号パイプラインに代わる有望な代替手段を提供する。
異なるクエリが異なるプレフィックス位置を選択する場合、KVインフレーション問題により、DLM上では裸のスパースアテンションが失敗する。
キャッシュされたプレフィックスアテンション結果を安定したトークンに再利用し、アクティブトークンのみにスパースアテンションを適用するLOSA(Locality-aware Sparse Attention)を提案する。
論文 参考訳(メタデータ) (2026-04-13T20:53:51Z) - HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention [62.79085204939384]
HISA (Hierarchical Indexed Sparse Attention) は、平らなトークンスキャンから2段階の階層的な手順に検索パスを書き換える。
カーネルレベルのベンチマークでは、HISAは64Kコンテキストでの高速化を実現している。
論文 参考訳(メタデータ) (2026-03-30T13:59:51Z) - TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference [0.0]
TIDEは、定期的なチェックポイント層とルータで学習した小さなレイヤを推論時にアタッチするポストトレーニングシステムであり、トークン毎に隠れた状態が収束した最初期のレイヤを選択する。
DeepSeek R1 Distill 8BのNVIDIA A100では、TIDEは100%プリフィルの終了率(11層でトークンの5%、31層で残るもの)を達成し、プリフィルのレイテンシを7.2%削減し、シングルバッチスループットを6.6%向上させた。
論文 参考訳(メタデータ) (2026-03-22T18:58:07Z) - Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference [12.135271159221178]
プロダクションvLLMフリートは、最悪の状況ですべてのインスタンスをプロビジョニングする。
プロダクションvLLMプールは2つのvLLMプールのうちの1つにそれをディスパッチする。
トークン予算ルーティングはGPUインスタンスを17~39%削減する。
論文 参考訳(メタデータ) (2026-03-13T13:06:50Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。