論文の概要: SpecQuant: Speculative Decoding with Multi-Parent Quantization for Adaptive LLM Inference
- arxiv url: http://arxiv.org/abs/2609.21704v1
- Date: Fri, 18 Sep 2026 12:39:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:17.085137
- Title: SpecQuant: Speculative Decoding with Multi-Parent Quantization for Adaptive LLM Inference
- Title(参考訳): SpecQuant: 適応LDM推論のためのマルチ領域量子化を用いた投機的復号化
- Abstract要約: SpecQuantは、投機的復号化と多目的量子化を組み合わせたトレーニングフリーのフレームワークで、大規模言語モデルの適応推論を実行する。
MMLU, AlpacaEval, GSM8Kデータセット, ベンチマークに基づくQwen2.5モデル上でSpecQuantを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Running large language models (LLMs) locally continues to be limited by restrictions of compute and memory on consumer hardware. The popular acceleration technologies, such as quantization, speculative decoding, and adaptive inferencing, offer substantial speed boosts but usually necessitate retraining, per architecture tuning, or draft models. SpecQuant is a trainingfree framework, that combines speculative decoding with multiparent quantization to perform adaptive, efficient inference of LLMs. SpecQuant derives multiple quantized variants (INT4, FP8, FP16) from a shared base model, and dynamically routes queries based on predicted complexity; lightweight variants are used for simple or factual tasks, and full-precision models are used for complex reasoning tasks or long-context inputs. The shared-weight design of SpecQuant ensures sufficient token acceptance for speculative decoding without compatibility issues using separate draft parent models. We evaluate SpecQuant on Qwen2.5 based models on the MMLU, AlpacaEval, and GSM8K datasets, or benchmarks, demonstrating 35-43% speedups without degrading accuracy greater than 2%, substantial within the LLM community. SpecQuant enables practical on-device LLM deployment across diverse hardware without special infrastructure or expertise.
- Abstract(参考訳): 大規模言語モデル(LLM)をローカルに実行することは、コンシューマハードウェア上での計算とメモリの制限によって制限され続けている。
量子化、投機的復号化、適応推論といった一般的な加速技術は、大幅な速度向上をもたらすが、通常は再トレーニング、アーキテクチャのチューニング、ドラフトモデルを必要とする。
SpecQuantは、投機的復号化と多目的量子化を組み合わせて、LLMの適応的で効率的な推論を行う、トレーニングフリーのフレームワークである。
SpecQuantは、共有ベースモデルから複数の量子化変種(INT4、FP8、FP16)を導出し、予測された複雑さに基づいてクエリを動的にルーティングする。
SpecQuantの共有軽量設計は、異なるドラフト親モデルを使用して互換性の問題なく投機的復号化のための十分なトークンの受け入れを保証する。
MMLU, AlpacaEval, GSM8Kデータセット, あるいはベンチマークに基づくQwen2.5モデル上でSpecQuantを評価し, LLMコミュニティにおいて精度を2%以上低下させることなく35~43%の高速化を示した。
SpecQuantは、特別なインフラや専門知識がなくても、様々なハードウェアにまたがるデバイス上でのLCMの実践的なデプロイを可能にする。
関連論文リスト
- Quantize with Confidence? An Empirical Study of Quantization for Code Generation [4.347703075408796]
GPTQ, AWQ, QuIP#, AQLM, BitsAndBytes, GGUFの6種類の最先端量子化手法を2つの代表的な大符号モデルファミリに対して実験的に評価した。
保守性、信頼性、セキュリティ、構造的複雑さとともに機能的正確性(pass@1)を評価します。
その結果,量子化技術が正確性やコード品質に与える影響は,有意に異なることがわかった。
論文 参考訳(メタデータ) (2026-07-15T14:05:33Z) - From Bits to Chips: An LLM-based Hardware-Aware Quantization Agent for Streamlined Deployment of LLMs [43.33830246397275]
ハードウェア・アウェア・量子化エージェント(HAQA)を導入し、量子化と展開プロセスの合理化を図る。
結果は、スループットの向上と精度の向上とともに、推論の2.3倍のスピードアップを示す。
論文 参考訳(メタデータ) (2026-01-07T00:39:09Z) - Quantizing Large Language Models for Code Generation: A Differentiated Replication [51.85505914274633]
大規模言語モデル(LLM)は、コード生成において印象的な能力を示しており、特に自然言語で記述された要求を自動的に実装する。
LLMはメモリ(そして結果として炭素)のフットプリントに重大な課題をもたらす。
LLM量子化の新しいフロンティアは4ビット精度であり、平均メモリフットプリントが70%減少する。
論文 参考訳(メタデータ) (2025-03-10T09:26:08Z) - LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment [12.80921403367322]
大規模言語モデル(LLM)は、様々な領域で例外的なパフォーマンスを示す。
LLMのサイズとメモリ要件を削減した量子化技術は、リソース制限されたエッジデバイスにLLMをデプロイするのに有効である。
適応量子化システムLSAQ(Layer-Specific Adaptive Quantization)を提案する。
論文 参考訳(メタデータ) (2024-12-24T03:43:15Z) - QSpec: Speculative Decoding with Complementary Quantization Schemes [53.960146187821685]
大規模言語モデル(LLM)における推論の高速化とメモリ消費削減のために量子化が広く採用されている
品質から効率を分離する新しい量子化パラダイムであるQSpecを提案する。
QSpecは重みとKVキャッシュの両方を段階的に再利用し、再トレーニングや補助モデルなしでほぼゼロコストで切り替えることができる。
論文 参考訳(メタデータ) (2024-10-15T05:57:51Z) - LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit [55.73370804397226]
鍵圧縮技術である量子化は、大きな言語モデルを圧縮し、加速することにより、これらの要求を効果的に軽減することができる。
本稿では,プラグアンドプレイ圧縮ツールキットであるLLMCについて,量子化の影響を公平かつ体系的に検討する。
この汎用ツールキットによって、我々のベンチマークはキャリブレーションデータ、アルゴリズム(3つの戦略)、データフォーマットの3つの重要な側面をカバーしています。
論文 参考訳(メタデータ) (2024-05-09T11:49:05Z) - OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models [57.27101446992148]
大規模言語モデル(LLM)は自然言語処理タスクに革命をもたらした。
近年のPTQ法はメモリフットプリントの削減とLLMの計算効率の向上に有効である。
多様な量子化設定において優れた性能を実現するLLMのOmnidirectly calibrated Quantization手法を提案する。
論文 参考訳(メタデータ) (2023-08-25T02:28:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。