論文の概要: Accelerating LLM Inference via Vector Index Based Output Embeddings
- arxiv url: http://arxiv.org/abs/2608.27460v1
- Date: Wed, 01 Jul 2026 15:31:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.38645
- Title: Accelerating LLM Inference via Vector Index Based Output Embeddings
- Title(参考訳): ベクトルインデックスに基づく出力埋め込みによるLCM推論の高速化
- Abstract要約: 大規模な出力埋め込み行列は、自己回帰復号時にメモリ帯域幅のボトルネックを生じさせる。
我々は,最大内部積探索としてトップkトークン選択による出力プロジェクションを再構成する。
出力ヘッドは、ハイスコアトークンの小さな候補セットのみを取得し、既存のデコードパイプラインに統合することができる。
- 参考スコア(独自算出の注目度): 20.162409261754934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large output embedding matrices create a significant memory bandwidth bottleneck during autoregressive decoding, especially for compact LLMs with large multilingual vocabularies. We reformulate the output projection followed by top-k token selection as a maximum inner product search over token embeddings and replace the dense vocabulary projection with an HNSW-based vector index. The resulting output head retrieves only a small candidate set of high-scoring tokens and can be integrated into existing decoding pipelines by scattering retrieved logits into a sparse full-vocabulary tensor. On CPU inference with Gemma 3, Llama 3.2, and Qwen 3 models, our method substantially accelerates the output projection and improves end-to-end batch-size-one decoding throughput by up to 82% for Gemma 3 270M, while preserving generation quality under AlpacaEval evaluation. These results suggest approximate retrieval is a practical alternative to dense output projections in latency-sensitive small-batch decoding.
- Abstract(参考訳): 大規模な出力埋め込み行列は、特に大きな多言語語彙を持つコンパクトなLLMにおいて、自己回帰デコード中に重要なメモリ帯域幅のボトルネックを生み出す。
我々は,最大内部積探索としてトップkトークン選択による出力プロジェクションを再構成し,HNSWに基づくベクトルインデックスで高密度語彙プロジェクションを置き換える。
出力ヘッドは、高スコアトークンの小さな候補セットのみを取得し、取得したロジットをスパースフルボキャブラリテンソルに散布することにより、既存の復号パイプラインに統合することができる。
Gemma 3, Llama 3.2, Qwen 3 モデルを用いた CPU 推論では,AlpacaEval 評価で生成品質を保ちながら,出力プロジェクションを大幅に高速化し,Gemma 3 270M に対して最大 82% のバッチ-ワン復号スループットを向上する。
これらの結果は,遅延感度の小さい小バッチ復号法における高密度出力予測の代替として,近似的検索が実用的であることを示唆している。
関連論文リスト
- Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation [6.796779304354568]
Seerはトレーニング不要のフレームワークで、アクティベーション空間のシフトを通じて、第1ステップで有効なセマンティック境界を検出する。
実験の結果,Seerは水田廃棄物を効果的に除去し,スループットを最大$sim$31$times$に向上することがわかった。
論文 参考訳(メタデータ) (2026-07-16T04:37:02Z) - Speculative Decoding with a Speculative Vocabulary [44.656073829954636]
投機的復号化は言語モデル(LM)推論を高速化するための主要なアプローチである。
最近の研究は、ドラフトモデルの語彙を減らし、この出力分布のボトルネックに対処しようと試みている。
本稿では,デコードステップ毎に語彙サブセットを選択する,効率的かつ効果的な方法であるSpecVocabを提案する。
論文 参考訳(メタデータ) (2026-02-14T16:10:00Z) - Output-Space Search: Targeting LLM Generations in a Frozen Encoder-Defined Output Space [0.0]
出力空間探索 (OS-Search) を導入し, LLM 生成を終端探索に変換する。
ストーリーでは、スイーピングZ(テキスト)はプロンプトチェーンよりも3.1倍高いLCMの多様性をもたらす。
コード上では、Z (code) 上のベイジアン最適化は、一致した推論予算の下でコントローラから保持された目的を改善する。
論文 参考訳(メタデータ) (2026-01-29T02:11:43Z) - Decoding in Latent Spaces for Efficient Inference in LLM-based Recommendation [75.72196852363116]
光遅延空間復号法(L2D)は効率的かつ効率的な遅延空間復号法である。
L2Dは言語空間の復号化よりも10倍以上高速で、性能の維持や向上が可能である。
論文 参考訳(メタデータ) (2025-09-15T02:30:35Z) - SpeLLM: Character-Level Multi-Head Decoding [6.474939955469084]
SpeLLMは、複数の出力ヘッドを通して文字レベルの文字列を予測することで、入力と出力の語彙を分離する手法である。
SpeLLMでは、$k$のリニアヘッドが1つの文字を同時に予測し、モデルがより大きな出力空間を表現できるようにする。
4つの事前学習 LLM を用いた実験により,SpeLLM 変種は下流タスク上での競合性能を実現し,ランタイムを5.1%削減した。
論文 参考訳(メタデータ) (2025-07-22T08:07:06Z) - FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling [59.8051705468084]
投機的サンプリングは,大規模言語モデルの自己回帰生成プロセスを促進する重要な手法として登場した。
本稿では、語彙空間圧縮によるドラフト候補選択を最適化する周波数ランクの投機的サンプリングフレームワークFR-Specを提案する。
論文 参考訳(メタデータ) (2025-02-20T18:58:10Z) - Nearest Neighbor Speculative Decoding for LLM Generation and Attribution [87.3259169631789]
Nearest Speculative Decoding (NEST)は、任意の長さの実世界のテキストスパンをLM世代に組み込むことができ、それらのソースへの属性を提供する。
NESTは、様々な知識集約タスクにおいて、基本LMの生成品質と帰属率を大幅に向上させる。
さらに、NESTは、Llama-2-Chat 70Bに適用した場合の推論時間において1.8倍のスピードアップを達成することにより、生成速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-05-29T17:55:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。