論文の概要: CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration
- arxiv url: http://arxiv.org/abs/2605.11186v1
- Date: Mon, 11 May 2026 19:50:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.393575
- Title: CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration
- Title(参考訳): CATS: メモリ制限LDM推論高速化のためのカスケード適応木推定
- Authors: Yuning Han, Yangchenchen Jin, Dylan Zhao, Jingwei Sun,
- Abstract要約: 大規模言語モデル(LLM)における自動回帰デコーディングは本質的にメモリバウンドである。
メモリ制限デバイス上でのケースド検証と修正を行う,自己記述型デコーディングフレームワークであるCATSを提案する。
CATSは、生成品質を劣化させることなく最大5.08倍のウォールクロックスピードアップを達成でき、エッジメモリの制約下では最大1.45倍のSOTA法より優れている。
- 参考スコア(独自算出の注目度): 2.6196419303092466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Auto-regressive decoding in Large Language Models (LLMs) is inherently memory-bound: every generation step requires loading the model weights and intermediate results from memory (e.g., High-Bandwidth Memory (HBM) for GPU servers), making throughput bottlenecked by memory bandwidth rather than compute. Speculative decoding addresses this by enabling parallel verification of multiple draft tokens, effectively amortizing the cost of each target-model call. However, existing speculative decoding methods are designed under the assumption that HBM is sufficiently large to hold both the target model and an auxiliary draft model simultaneously -- an assumption that breaks down on memory-constrained devices such as edge platforms with limited DRAM. We analyze the inference bottleneck in this memory-limited regime and propose CATS, a self-speculative decoding framework that conducts cascaded verification and correction based on the memory budget and parameter offloading patterns on memory-limited devices. This design maximizes token acceptance rate and end-to-end speedup while keeping the peak memory footprint on the device equal to that of the target model alone. We evaluate CATS on different models across five benchmarks on real edge devices. CATS can achieve a wall-clock speedup of up to 5.08x with no degradation in generation quality, outperforming the SOTA method by up to 1.45x under edge memory constraints.
- Abstract(参考訳): 大規模言語モデル(LLM)における自動回帰デコーディングは本質的にメモリバウンドである: 生成ステップ毎にモデルの重みと中間結果(例えば、GPUサーバ用のハイバンド幅メモリ(HBM))をロードする必要がある。
投機的復号化は、複数のドラフトトークンの並列検証を可能にし、各ターゲットモデル呼び出しのコストを効果的に減らし、この問題に対処する。
しかし、既存の投機的復号法は、HBMがターゲットモデルと補助ドラフトモデルの両方を同時に保持するのに十分な大きさであるという前提のもとに設計されている。
本稿では,このメモリ制限方式における推論ボトルネックを分析し,メモリ予算とメモリ制限装置のパラメータオフロードパターンに基づいて,ケースド検証と修正を行う自己投機的復号化フレームワークCATSを提案する。
この設計は、ピークメモリフットプリントをターゲットモデルと同等に保ちながら、トークンの受け入れ率とエンドツーエンドのスピードアップを最大化する。
実エッジデバイス上で5つのベンチマークで異なるモデル上でCATSを評価する。
CATSは、生成品質を劣化させることなく最大5.08倍のウォールクロックスピードアップを達成でき、エッジメモリの制約下では最大1.45倍のSOTA法より優れている。
関連論文リスト
- Beyond N-gram: Data-Aware X-GRAM Extraction for Efficient Embedding Parameter Scaling [24.48256429931821]
X-GRAMは周波数対応の動的トークン注入フレームワークである。
ヘッド容量を保ちながら尾部を圧縮するためにハイブリッドハッシュとエイリアスミキシングを使用する。
SwiGLU ShortConvによって取得したベクトルを洗練し、様々な局所的なn-gram特徴を抽出する。
論文 参考訳(メタデータ) (2026-04-23T14:27:10Z) - Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation [1.2559585990041289]
LARS(Low-Memory Activation-Rank Subspace)は、シーケンス長からメモリ消費を分離する新しい適応フレームワークである。
LARSは、推論、理解、長文データセットにわたるLoRAと比較して、GPUで平均33.54%、CPUで51.95%のメモリフットプリントを削減している。
論文 参考訳(メタデータ) (2026-04-03T17:05:33Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - QMC: Efficient SLM Edge Inference via Outlier-Aware Quantization and Emergent Memories Co-Design [8.787715061109163]
Outlier-aware Quantization Memory Co-Design (QMC) は、新しいヘテロジニアスメモリアーキテクチャを持つリトレーニングフリーな量子化である。
QMCはメモリ使用量を6.3x-7.3x、外部データ転送を7.6倍、エネルギーを11.7倍、レイテンシを12.5倍削減する。
論文 参考訳(メタデータ) (2026-01-21T00:11:34Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Lizard: An Efficient Linearization Framework for Large Language Models [113.87302474262798]
プリトレーニングされたトランスフォーマーベース大規模言語モデル(LLM)をサブクワッドアーキテクチャに変換する線形化フレームワークであるLizardを提案する。
Lizardは、モデル品質を保ちながらソフトマックスアテンションを正確に近似するサブクワッドアテンションメカニズムを導入することで、これらの制限に対処する。
5 ショット MMLU ベンチマークにおいて,Lizard は教師モデルの性能のほぼ無作為な回復を実現し,従来の手法よりも 9.4 ~ 24.5 ポイント高い性能を示した。
論文 参考訳(メタデータ) (2025-07-11T21:19:18Z) - QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache [67.84112700032007]
大きな言語モデル(LLM)は、長いコンテキスト設定のためにエッジデバイスにデプロイされることが増えている。
これらのシナリオでは、キーバリュー(KV)キャッシュがGPUメモリとレイテンシの両方において主要なボトルネックとなっている。
そこで本研究では,ターゲットモデルのアーキテクチャを共有するが,階層的な4ビット量子化KVキャッシュと4ビット量子化重みを併用して高速化を行う,新たな自己推論型デコーディングフレームワークであるQuantSpecを提案する。
論文 参考訳(メタデータ) (2025-02-05T20:43:48Z) - LiVOS: Light Video Object Segmentation with Gated Linear Matching [116.58237547253935]
LiVOSはリニアアテンションによるリニアマッチングを利用する軽量メモリネットワークである。
長くて高解像度のビデオでは、STMベースのメソッドと53%のGPUメモリで一致し、32Gの消費者向けGPU上で4096pの推論をサポートする。
論文 参考訳(メタデータ) (2024-11-05T05:36:17Z) - Memformer: A Memory-Augmented Transformer for Sequence Modeling [55.780849185884996]
本稿では、シーケンスモデリングのための効率的なニューラルネットワークであるMemformerを紹介する。
我々のモデルは長いシーケンスを処理する際に線形時間複雑性と一定メモリ空間複雑性を実現する。
論文 参考訳(メタデータ) (2020-10-14T09:03:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。