論文の概要: TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving
- arxiv url: http://arxiv.org/abs/2607.29678v3
- Date: Thu, 06 Aug 2026 18:01:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:30.825191
- Title: TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving
- Title(参考訳): TokTier: エージェント LLM サービングのための厳格なステートフル CPU+GPU トークン化
- Abstract要約: コーディングエージェントは、最も多くを支払う:セッションは、小さな追加の後、繰り返し長い書き起こしを提出する。
TokTierは、この2モードのワークロードのためのステートフルなCPU+GPUトークンサービスである。
- 参考スコア(独自算出の注目度): 7.926191097327915
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM serving caches prompt KV state, yet most front ends still re-tokenize the full request on every call. Coding agents pay most: sessions repeatedly submit a long transcript after a small append, which can shift token boundaries near the end of the prior sequence. Across 153,951 calls the median append is ~1.4K characters; only 1.0-3.6% of calls start or rebuild a session, yet those carrymulti-million-character contexts. Fleet prompt-cache hit rate is 94.1%, and as it approaches 0.99, tokenization grows from 10% to 64% of time to first token (TTFT) in component measurements. TokTier is a stateful CPU+GPU tokenization service for this two-mode workload, under one contract: emitted token IDs are always identical to full reference tokenization. For session continuations it re-tokenizes a small window around the append and splices only when a per-request check finds a stable pre-tokenization boundary; failed checks widen the window or fall back to full reference tokenization. For calls without a reusable prefix it runs exact GPT-family regex pre-tokenization and BPE on a GPU. A sampled shadow verifier re-checks live traffic. Across 17 production tokenizer families, differential campaigns cover 1.5x10^10 split checks, a 12.4 TB real-text corpus, and 93,000+ replayed agent steps, with zero divergence. Incremental repair takes 0.5-1.1 ms from 100K to 3M characters, up to 437x faster than HF tokenization and 2.1x faster at 1M characters than the strongest cache-based baseline (Gigatoken) fully prewarmed. GPU tokenization encodes a 1M-character request in 0.87 ms, up to 491x below HF and 23.4x below the fastest published CPU method on the same protocol. With vLLM, median TTFT drops 16-34% and P99 TTFT 23% under recorded bursts. Under a 50 ms P99 objective, a four-core repair pool plus one GPU sustains 1,821 requests/s, where a 16-core stateless front end saturates at 40 requests/s.
- Abstract(参考訳): LLMサービスキャッシュはKV状態を促すが、ほとんどのフロントエンドは、すべての呼び出しの完全な要求を再起動する。
セッションは、小さな追加の後、繰り返し長い書き起こしを送信し、前回のシーケンスの終わり近くでトークン境界をシフトすることができる。
153,951回のコールでは、中央のアタッチメントは ~1.4K 文字であり、セッションの開始または再構築は 1.0-3.6% である。
フリート・プロンプト・キャッシュのヒット率は94.1%であり、0.99に近づくと、トークン化は10%から64%に増加し、コンポーネント測定において最初のトークン(TTFT)となる。
TokTierは、この2モードのワークロードのためのステートフルなCPU+GPUトークンサービスである。
セッション継続では、アペンダの周りの小さなウィンドウを再起動し、リクエスト毎のチェックが安定した事前トークン境界を見つける場合にのみスプリスする。
再利用可能なプレフィックスのない呼び出しでは、GPU上で正確なGPT- family regexプリトークン化とBPEを実行する。
サンプルシャドウ検証器は、ライブトラフィックを再チェックする。
17のプロペラタイザファミリーで、差動キャンペーンは1.5x10^10の分割チェック、12.4TBのリアルタイムコーパス、93,000以上のリプレイされたエージェントステップをカバーし、ばらつきはゼロである。
100Kから3Mの文字から0.5-1.1ms、HFトークン化より最大437倍、100M文字より2.1倍高速で、最強のキャッシュベースベースベースライン(ギガトケン)が完全に事前警戒されている。
GPUトークン化は1M文字の要求を0.87ミリ秒でエンコードし、HFより491倍、同じプロトコル上で最速のCPUメソッドより23.4倍低い。
vLLMでは、中央値TTFTは16-34%、P99TTFTは23%減少する。
50ms P99の目標の下では、4コアの修理プールと1GPUが1,821リクエスト/秒を持続し、16コアのステートレスフロントエンドが40リクエスト/秒で飽和する。
関連論文リスト
- PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents [85.82624962221026]
本稿では、読みを推論から切り離すPARSERを紹介する。
単一のチャンクにバインドされた軽量サブエージェントのバンクは、ドキュメント全体を並列に読み取る。
7Kから896Kまでのコンテキストを持つマルチホップQAでは、4Bバックボーンを持つPARSERが最強のシーケンシャルメモリベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-06T16:19:01Z) - Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - GRID: Grammar-Railed Decoding for Enterprise SQL Generation [0.0]
文法制約付き復号エンジンGRID(Grammar-Railed Decoding)を提案する。
LALR(1)自体を実行可能なオラクルとして使用する。
4つの保証(音量、完全性、終了、およびほぼ一定に近いコスト)は明示的な前提条件で記述される。
論文 参考訳(メタデータ) (2026-07-11T19:25:23Z) - Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving [0.5076419064097734]
我々は、低レイテンシ、小バッチ、デバイス上の物理AIサービスという、反対の体制について研究する。
完全復元可能な状態に対するグラフバウンドチェックポイントと復元機構である実行状態カプセルを導入する。
これにより、トークンアドレス付きKVフラグメントからグラフバウンド実行状態境界への再利用が実現される。
論文 参考訳(メタデータ) (2026-06-18T17:49:36Z) - AdaCodec: A Predictive Visual Code for Video MLLMs [66.30108093864139]
我々は,このインターフェースを音声予測ビジュアルコードと呼び,ビデオMLLMを textbfAdaCodec としてインスタンス化する。
AdaCodecは、条件付き予測コストが高い場合にのみ、参照フレームに完全なビジュアルトークンを使用する。
これは、動きや予測残差を含むフレーム間の変化をコンパクトなPトークンとしてエンコードする。
論文 参考訳(メタデータ) (2026-06-01T17:56:35Z) - Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode [0.0]
物理AIシステムは、クラウドのLLMサービスとは異なるワークロードを実行する。
4つのNVIDIA GPUにわたる7から8BクラスのGQA変換器のバッチ1デコードを測定する。
ピーク帯域幅はピーク帯域幅が増加するにつれて減少する。
論文 参考訳(メタデータ) (2026-05-28T21:03:14Z) - Spectral Retrieval: Multi-Scale Sinc Convolution over Token Embeddings for Localized Retrieval in LLM Multi-Agent Systems [0.0]
Spectral Retrievalは、遅延相互作用インデックスからトーケン毎の埋め込みを再利用し、複数のスケールで正常化されたシンクカーネルと結合する。
位置とスケールに対する最大コサインは、いずれのエンドポイントよりも確実に情報的である。
論文 参考訳(メタデータ) (2026-05-23T22:50:58Z) - MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference [75.41426145782751]
本稿では,DSAインデクサのリプレースとして,インデクサヘッドをエキスパートの混合プールとして扱うDSAインデクサを提案する。
MISAはロングベンチの密度の高いDSAインデクサとDeepSeek-V3.2とGLM-5で一致し、それぞれ8倍と4倍のインデクサヘッドで動作している。
私たちのTileLangカーネルは、単一のNVIDIA H200 GPU上で、DSAのオリジナルのインデクサカーネルの約3.82倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2026-05-08T07:19:34Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models [49.93891888238178]
ブロックワイド拡散言語モデル(DLM)は任意の順序で複数のトークンを生成し、自動回帰復号パイプラインに代わる有望な代替手段を提供する。
異なるクエリが異なるプレフィックス位置を選択する場合、KVインフレーション問題により、DLM上では裸のスパースアテンションが失敗する。
キャッシュされたプレフィックスアテンション結果を安定したトークンに再利用し、アクティブトークンのみにスパースアテンションを適用するLOSA(Locality-aware Sparse Attention)を提案する。
論文 参考訳(メタデータ) (2026-04-13T20:53:51Z) - HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention [62.79085204939384]
HISA (Hierarchical Indexed Sparse Attention) は、平らなトークンスキャンから2段階の階層的な手順に検索パスを書き換える。
カーネルレベルのベンチマークでは、HISAは64Kコンテキストでの高速化を実現している。
論文 参考訳(メタデータ) (2026-03-30T13:59:51Z) - TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference [0.0]
TIDEは、定期的なチェックポイント層とルータで学習した小さなレイヤを推論時にアタッチするポストトレーニングシステムであり、トークン毎に隠れた状態が収束した最初期のレイヤを選択する。
DeepSeek R1 Distill 8BのNVIDIA A100では、TIDEは100%プリフィルの終了率(11層でトークンの5%、31層で残るもの)を達成し、プリフィルのレイテンシを7.2%削減し、シングルバッチスループットを6.6%向上させた。
論文 参考訳(メタデータ) (2026-03-22T18:58:07Z) - Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference [12.135271159221178]
プロダクションvLLMフリートは、最悪の状況ですべてのインスタンスをプロビジョニングする。
プロダクションvLLMプールは2つのvLLMプールのうちの1つにそれをディスパッチする。
トークン予算ルーティングはGPUインスタンスを17~39%削減する。
論文 参考訳(メタデータ) (2026-03-13T13:06:50Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。