論文の概要: HAWK: Rethinking Multimodal Drafting for Speculative Decoding
- arxiv url: http://arxiv.org/abs/2610.00623v1
- Date: Wed, 30 Sep 2026 19:26:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.731336
- Title: HAWK: Rethinking Multimodal Drafting for Speculative Decoding
- Title(参考訳): HAWK: 投機的デコードのためのマルチモーダルドラフトの再考
- Abstract要約: 投機的復号化はLLMの大幅な高速化を実現しているが、大きな視覚言語モデル(LVLM)では効果が低い。
両制約に対処するためにHAWKを提案する。
HAWKは、表現の類似性を使用して、情報的ターゲット層を選択し、隠れた状態を組み合わせる方法を学ぶ。
ビジュアル情報については、生のビジュアルトークンの代わりにターゲットモデルから圧縮されたビジュアル隠れ状態を直接プロジェクタに提供する。
また、プロポーザルが提案した後、ターゲットの予測がどのように変化するかを把握するように、ドラフトラを訓練し、マルチステップのドラフト中にターゲットとの合意を改善する。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding has achieved substantial lossless speedups for LLMs, but remains less effective for large vision-language models (LVLMs), where lightweight drafters struggle to use rich multimodal information. A second limitation is that standard distillation supervises the drafter only along the original training trajectory, without modeling how target predictions shift after the drafter's own proposals. As drafting moves away from this trajectory, the drafter can increasingly disagree with the target, reducing acceptance in later steps. We propose HAWK to address both limitations. HAWK uses representation similarity to select informative target layers and learns how to combine their hidden states. For visual information, it directly provides the drafter with compressed visual hidden states from the target model instead of raw visual tokens, making the visual information easier for a shallow drafter to use. HAWK also trains the drafter to capture how target predictions change after its own proposals, improving its agreement with the target during multi-step drafting. On SmolVLM-256M across ten multimodal benchmarks, HAWK raises average acceptance length from 3.32 to 4.08 and speedup from 2.19x to 2.60x over EAGLE-3 under greedy decoding, and from 2.89 to 3.41 and 1.92x to 2.19x under sampling.
- Abstract(参考訳): 投機的復号化はLLMの大幅なロスレススピードアップを実現しているが、軽量な起草者がリッチなマルチモーダル情報を使用するのに苦労する大規模視覚言語モデル(LVLM)では依然として効果が低い。
第2の制限は、標準蒸留は、ドラフト作成者自身の提案の後にターゲット予測がどのようにシフトするかをモデル化することなく、オリジナルのトレーニング軌道に沿ってのみ、ドラフト作成者を監督することである。
ドラフトがこの軌道から離れるにつれて、ドラフト作成者はターゲットに不一致になり、後続のステップでの受け入れが減少する。
両制約に対処するためにHAWKを提案する。
HAWKは、表現の類似性を使用して、情報的ターゲット層を選択し、隠れた状態を組み合わせる方法を学ぶ。
ビジュアル情報については、生のビジュアルトークンの代わりにターゲットモデルから圧縮された視覚的隠蔽状態を提供する。
HAWKはまた、ターゲットの予測が自身の提案後にどのように変化するかを把握するように、ドラフト作成者を訓練し、マルチステップのドラフト中にターゲットとの合意を改善する。
SmolVLM-256Mは10個のマルチモーダルベンチマークで平均受入距離を3.32から4.08に引き上げ、EAGLE-3で2.19xから2.60xに、サンプリングで2.89から3.41と1.92xから2.19xに高速化する。
関連論文リスト
- Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding [10.569335087583655]
投機的復号化は、軽量なドラフトモデルを用いて、LLM(Large Language Models)推論を加速する。
本稿では、信頼適応トークン(CAT)を最適化したデュアルモード投機デコードフレームワークであるPARD-2を提案する。
論文 参考訳(メタデータ) (2026-05-09T02:50:58Z) - Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning [67.88087883391475]
本稿では,各ドラフト・アンド・検証サイクルのスループットを直接最適化する新しい手法であるLearning to Draftを紹介する。
LTDは2.24倍から4.32倍までのスピードアップ比を達成し、最先端のイーグル3よりも36.4%向上した。
論文 参考訳(メタデータ) (2026-03-02T09:17:48Z) - DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference [27.204773545145326]
DARTは大規模言語モデル(dLLM)の投機的復号化フレームワークである
並列生成を活用して、ドラフトのレイテンシを低減する。
複数のデータセットにまたがる2.03x--3.44xウォールクロックのスピードアップを実現している。
論文 参考訳(メタデータ) (2026-01-27T07:04:24Z) - DEER: Draft with Diffusion, Verify with Autoregressive Models [33.19684425811274]
投機的復号法は自己回帰復号法の本質的な遅延を緩和する。
効率的な投機的復号化フレームワークであるDEERを紹介する。
実験によると、DEERは最大32個のトークンのドラフト受け入れ長に達する。
論文 参考訳(メタデータ) (2025-12-17T08:19:04Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation [4.031603850949324]
本稿では,自動回帰ドラフトモデルの並列ドラフトモデルへの低コストな適応を可能にする新しい投機的復号化手法を提案する。
提案した条件付きドロップトークン法は,ドラフトモデルのトレーニング効率を3倍に向上させることができる。
最適化された推論フレームワークでは、PARDはLLaMA3.1-8B推論を4.08倍高速化し、毎秒311.5トークンを達成する。
論文 参考訳(メタデータ) (2025-04-23T12:27:43Z) - ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts [79.62448915248926]
16ビットモデル推論の精度を犠牲にすることなくLSM推論を高速化する手法として、投機復号法(SD)が登場した。
MXFP4Weight-Only-Quantization (WOQ)は、単にBF16ターゲットモデルの重みをMXFP4に直接キャストするだけなので、MXFP4モデルをプラグアンドプレイ方式でドラフトとして使用することを提案する。
私たちのプラグアンドプレイソリューションでは,BF16ベースラインの最大2倍のスピードアップを実現しています。
論文 参考訳(メタデータ) (2025-03-17T08:38:45Z) - Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding [65.94521678103237]
投機的復号化(英: Speculative decoding)は、大規模言語モデルの生成プロセスを加速する広く使われている手法である。
我々は,草案作成プロセスの並列化のために,草案文を生成するOuroborosを紹介した。
ウロボロは投機的復号化で最大2.8倍、バニラ復号化で3.9倍のスピードアップを達成できる。
論文 参考訳(メタデータ) (2024-02-21T11:31:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。