論文の概要: Quantize the Target, Quantize the Drafter: Efficient Inference with Qwen3.5-4B
- arxiv url: http://arxiv.org/abs/2607.04244v2
- Date: Tue, 07 Jul 2026 01:50:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.214936
- Title: Quantize the Target, Quantize the Drafter: Efficient Inference with Qwen3.5-4B
- Title(参考訳): Qwen3.5-4Bを用いた効率的な推論
- Abstract要約: 本報告では,効率的なQwenコンペティションへのアプローチについて述べる。
目標は、リソース制約のあるNVIDIA A10G GPU上でQwen3.5-4Bの低レイテンシサービスを可能にすることである。
- 参考スコア(独自算出の注目度): 9.449137117587199
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This report describes our approach to the Efficient Qwen Competition, where the goal is to enable low-latency serving of Qwen3.5-4B on a resource-constrained NVIDIA A10G GPU. Our system combines a quantized target model with speculative decoding. To recover accuracy, we apply quantization-aware distillation to the target model while retaining the original quantization grid. To speed up decoding, a block-diffusion drafter specialized for the quantized target model is trained using a two-stage procedure: first learning from the high-precision target and then adapting to the low-precision target. Because the drafter is invoked at every speculative decoding step, we further reduce its overhead with quantization and sliding-window attention, preserving draft-token acceptance while improving long-context decoding latency. As a result, our submission achieves a 6.978$\times$ average speedup over the baseline while satisfying the required quality thresholds, ranking 3rd overall. We hope these results provide useful insights for practical LLM inference. The code and resources are available at https://github.com/nota-github/adaptfm-quant-dflash
- Abstract(参考訳): 本稿では,資源制約のNVIDIA A10G GPU上でQwen3.5-4Bの低レイテンシ提供を実現することを目的とした,効率的なQwenコンペティションへのアプローチについて述べる。
我々のシステムは、量子化されたターゲットモデルと投機的復号化を組み合わせている。
精度を回復するために、元の量子化グリッドを保持しながら、ターゲットモデルに量子化対応蒸留を適用した。
復号を高速化するために、量子化対象モデルに特化したブロック拡散ドラフトラを2段階の手順で訓練する。
提案手法は投機的復号化のステップ毎に起動されるので,そのオーバーヘッドを量子化やスライディング・ウインドウ・アテンションによって低減し,長文復号化の遅れを改善しつつ,ドラフト・トケインセプションを維持する。
その結果,要求される品質閾値を満たしつつ,ベースライン上での平均速度アップを6.978$\timesで達成し,総合3位となった。
これらの結果が実用的LLM推論に有用な洞察を与えてくれることを願っている。
コードとリソースはhttps://github.com/nota-github/adaptfm-quant-dflashで入手できる。
関連論文リスト
- Learning Grouped Lattice Vector Quantizers for Low-Bit LLM Compression [57.54335545892155]
本稿では,各重みの群に独自の格子コードブックを割り当てるGLVQ(Grouped Lattice Vector Quantization)フレームワークを紹介する。
提案手法は,既存のトレーニング後の量子化ベースラインと比較して,モデルサイズと精度のトレードオフが良好である。
論文 参考訳(メタデータ) (2025-10-23T20:19:48Z) - CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training [73.46600457802693]
本稿では,量子化による損失に対応する新しい手法を提案する。
CAGEは、同様の計算コストで、精度の観点から最先端の手法を大幅に改善する。
LlamaモデルのQAT事前トレーニングでは、CAGEは4ビット(W4A4)で達成された精度と事前のベストメソッドとを一致させる。
論文 参考訳(メタデータ) (2025-10-21T16:33:57Z) - PoTPTQ: A Two-step Power-of-Two Post-training for LLMs [27.141872509108122]
大規模言語モデル(LLM)は、様々な自然言語処理(NLP)タスクにおいて顕著な性能を示している。
パワーオブツー(PoT)量子化は、この困難に対処するための一般的なツールである。
本稿では,LLM重み付けのための新しいPOT量子化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-16T06:44:14Z) - Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design [34.04231165571518]
投機的復号化と量子化は、大きな言語モデルのメモリバウンド推論を効果的に加速する。
量子化は、重みとアクティベーションを低ビット幅に圧縮することでこれを達成し、低ビット行列乗算による計算を減らす。
実験により、4ビットの重み量子化によるメモリの利点は、投機的復号化による計算負荷によって減少することが示された。
論文 参考訳(メタデータ) (2025-05-28T09:55:08Z) - QSpec: Speculative Decoding with Complementary Quantization Schemes [53.960146187821685]
大規模言語モデル(LLM)における推論の高速化とメモリ消費削減のために量子化が広く採用されている
品質から効率を分離する新しい量子化パラダイムであるQSpecを提案する。
QSpecは重みとKVキャッシュの両方を段階的に再利用し、再トレーニングや補助モデルなしでほぼゼロコストで切り替えることができる。
論文 参考訳(メタデータ) (2024-10-15T05:57:51Z) - PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization [44.547992997369875]
様々な精度で最先端性能を実現する新しい量子化法であるPrefixQuantを提案する。
第一に、PrefixQuantはKVキャッシュにoutlierトークンをプレフィックスすることでトークン単位のoutlierを排除します。
第二に、PrefixQuantは、量子化エラーを補うためにブロックワイズトレーニングのための新しいトレーニング可能なパラメータを導入した。
論文 参考訳(メタデータ) (2024-10-07T17:59:35Z) - Predicting High-precision Depth on Low-Precision Devices Using 2D Hilbert Curves [2.076845464422163]
ディープニューラルネットワーク(DNN)は、単眼と双眼の両方のデータに対して印象的な結果を得た。
これらは高い計算複雑性によって制限され、ローエンドデバイスでの使用を制限する。
低ビット精度予測から高精度深度を復元することを提案する。
論文 参考訳(メタデータ) (2024-05-22T21:59:46Z) - SqueezeLLM: Dense-and-Sparse Quantization [80.32162537942138]
LLMにおける生成推論の主なボトルネックは、単一のバッチ推論のための計算ではなく、メモリ帯域幅である。
学習後量子化フレームワークであるSqueezeLLMを導入し、最大3ビットの超低精度でのロスレス圧縮を実現する。
本フレームワークは,2次情報に基づく最適ビット精度割当を探索する感度ベース非一様量子化法と,2次情報に基づくDense-and-Sparse分解法と,2次情報量割当値と感度重み値を効率的にスパース形式で格納するDense-and-Sparse分解法である。
論文 参考訳(メタデータ) (2023-06-13T08:57:54Z) - Quantune: Post-training Quantization of Convolutional Neural Networks
using Extreme Gradient Boosting for Fast Deployment [15.720551497037176]
本稿では,量子化の構成の探索を高速化するために,Quantune という自動チューニングを提案する。
我々は、Quantuneが6つのCNNモデルに対して0.07 0.65%の精度で、量子化の探索時間を約36.5倍削減することを示した。
論文 参考訳(メタデータ) (2022-02-10T14:05:02Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z) - APQ: Joint Search for Network Architecture, Pruning and Quantization
Policy [49.3037538647714]
本稿では,リソース制約のあるハードウェア上での効率的なディープラーニング推論のためのAPQを提案する。
ニューラルアーキテクチャ、プルーニングポリシー、量子化ポリシーを別々に検索する従来の方法とは異なり、我々はそれらを共同で最適化する。
同じ精度で、APQはMobileNetV2+HAQよりもレイテンシ/エネルギーを2倍/1.3倍削減する。
論文 参考訳(メタデータ) (2020-06-15T16:09:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。