論文の概要: BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration
- arxiv url: http://arxiv.org/abs/2610.02800v1
- Date: Fri, 02 Oct 2026 04:43:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.210285
- Title: BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration
- Title(参考訳): BitNest: メモリ効率のよいLLM推論高速化のためのbit-Nested Speculative Decoding
- Abstract要約: BitNestは、高精度なターゲット表現に直接、低精度のドラフトを組み込む。
FP16の自己回帰復号よりも1.48--1.61倍のエンドツーエンドの高速化を実現している。
- 参考スコア(独自算出の注目度): 31.12541387045665
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Speculative decoding accelerates autoregressive generation by using a lightweight draft to propose multiple tokens for parallel verification. However, existing methods often require an additional draft model or weight representation, introducing non-negligible memory overhead on resource-constrained devices. Self-speculative approaches reduce this overhead, yet still face trade-offs between draft quality, target quality, and storage efficiency. We propose BitNest, a bit-nested speculative decoding framework that embeds a low-precision draft directly into the higher-precision target representation. Instead of deriving a draft from a predefined target, BitNest first constructs a strong low-precision base and then recovers the higher-precision target through residual refinement, enabling both models to share a single physical weight representation. BitNest further extends this progressive-precision design to the KV cache for long-context inference. Across multiple 7B--8B edge-friendly LLMs and diverse workloads, BitNest achieves an average speculative acceptance rate of 95.2% while closely preserving higher-precision model quality, and delivers 1.48--1.61x end-to-end speedup over FP16 autoregressive decoding. On the LLaMA models supported by all representative self-speculative baselines, BitNest also achieves consistently competitive or higher decoding speedup.
- Abstract(参考訳): 投機的復号化は、軽量なドラフトを用いて並列検証のための複数のトークンを提案することで自己回帰生成を加速する。
しかし、既存の手法には追加のドラフトモデルや重み表現が必要であり、リソース制約のデバイスに非無視のメモリオーバーヘッドを導入する。
自己投機的アプローチは、このオーバーヘッドを低減しますが、ドラフト品質、ターゲット品質、ストレージ効率のトレードオフに直面しています。
我々はビットネスト型投機的復号化フレームワークBitNestを提案する。
事前に定義されたターゲットからドラフトを導出する代わりに、BitNestはまず強力な低精度ベースを構築し、その後、リザーブリファインメントを通じて高い精度のターゲットを復元し、両方のモデルが単一の物理重み表現を共有できるようにする。
BitNestはさらに、このプログレッシブ精度設計を長いコンテキスト推論のためにKVキャッシュに拡張している。
複数の7B--8BエッジフレンドリーなLLMと多様なワークロードに対して、BitNestは95.2%の平均的な投機的受け入れ率を実現し、高い精度のモデル品質を守り、FP16の自動回帰デコーディングよりも1.48--1.61倍のエンドツーエンドのスピードアップを提供する。
代表的自己投機ベースラインでサポートされているLLaMAモデルでは、BitNestは一貫して競争力や高い復号速度を達成する。
関連論文リスト
- BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices [6.264768004263451]
大規模言語モデル(LLM)は、強い文脈推論と解釈可能な言語に基づく軌道表現を提供する。
これらのLCMベースの予測器は、非常にメモリと計算集約であり、自律ロボットのリソース制約されたエッジデバイスへのデプロイが困難になる。
LLMに基づく軌道予測器を軽量ビットジェクタに変換するBitTPを提案する。
実験的に、BitTP-Weightは保存するだけでなく、BF16ベースラインよりも予測品質が向上し、ADEは14.29%、FDEは20.97%減少する。
論文 参考訳(メタデータ) (2026-05-28T10:04:02Z) - SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation [0.0]
大規模言語モデルは、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、テキストを自動回帰的に生成する。
最近の圧縮法はトークンマージによるコストを軽減している。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-19T17:44:56Z) - SFMP: Fine-Grained, Hardware-Friendly and Search-Free Mixed-Precision Quantization for Large Language Models [4.269807933198402]
混合精度量子化(Mixed-precision Quantization)は、強いメモリ予算の下で大きな言語モデルを圧縮するための有望なアプローチである。
本研究では,大規模言語モデルを対象とした検索自由かつハードウェアフレンドリな混合精度量子化フレームワークであるSFMPを提案する。
論文 参考訳(メタデータ) (2026-02-01T05:24:19Z) - Fast Inference via Hierarchical Speculative Decoding [65.40448210801763]
階層的投機的復号法(HSD)は,各モデルがトークンを提案し,次に大きなモデルが1つのフォワードパスで検証する階層構造に,ドラフトモデルを積み重ねるアルゴリズムである。
HSDは最高の単軸ベースラインよりも1.2倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2025-10-22T15:56:19Z) - AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs [14.922926621722235]
ハードウェアフレンドリーなBinary-Coded Quantization(BCQ)のマルチ精度拡張であるAnyBCQを提案する。
我々のプログレッシブな精度拡張メカニズムは、予め割り当てられたバイナリコードを再利用しながら、段階的にスケーリング要素を洗練します。
実験により、AnyBCQは低ビット状態における精度低下を著しく制限することが示された。
論文 参考訳(メタデータ) (2025-10-12T06:20:38Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs [13.951330786310262]
FineQは、ソフトウェアとハードウェアの共同設計であり、大規模言語モデルの低ビット細粒度混合精度量子化のための設計である。
重みをよりきめ細かいクラスタに分割し、これらのクラスタ内の外れ値の分布を考慮する。
近似平均ビット幅でのSOTA混合精度量子化アルゴリズムと比較してモデル精度が向上する。
論文 参考訳(メタデータ) (2025-04-28T12:47:23Z) - OneBit: Towards Extremely Low-bit Large Language Models [66.29839811207617]
本稿では, LLMの重量行列を1ビットに大胆に定量化し, LLMの極低ビット幅展開への道を開く。
実験によると、OneBitは(LLaMAモデルの非量子化性能の少なくとも81%)優れたパフォーマンスを、堅牢なトレーニングプロセスで達成している。
論文 参考訳(メタデータ) (2024-02-17T14:26:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。