論文の概要: Verification-Aware Training for Speculative Decoding
- arxiv url: http://arxiv.org/abs/2608.30135v1
- Date: Mon, 31 Aug 2026 01:42:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.194494
- Title: Verification-Aware Training for Speculative Decoding
- Title(参考訳): 投機的復号化のための検証アウェアトレーニング
- Authors: Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun, Dongyoon Han,
- Abstract要約: VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
- 参考スコア(独自算出の注目度): 57.84976863792784
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speculative decoding accelerates large language model inference by using a draft model to generate candidate tokens, which are verified by the target model in a single forward pass. Verification proceeds sequentially and discards every position from the first rejection onward, yet existing draft training relies on token-level imitation of the target with a fixed per-position weighting that reflects neither property. We introduce Verification-Aware Training (VAT), a plug-in framework that simulates verification at every training step and turns the resulting accept and reject patterns into supervision. VAT consists of two components: (i) a verification head, a lightweight jointly trained binary classifier that supervises the draft model on whether each position survives sequential verification; (ii) verification-adaptive weighting, which replaces the fixed weighting schedule by keeping full weight up to each sample's first rejection point and re-anchoring the decay to start there. VAT modifies only the training objective, so it can be layered on top of existing methods without changing the draft architecture, the target model, or the inference procedure. Applied to EAGLE-3 and DFlash on Qwen3-4B, Qwen3-8B, and LLaMA-3.1-8B, VAT improves average acceptance length by up to 11.4% and wall-clock speedup by up to 8.7%, with consistent gains across math, code, and chat benchmarks. Code will be available at https://github.com/naver-ai/vat
- Abstract(参考訳): 投機的復号化は、ドラフトモデルを用いて、ターゲットモデルによって単一の前方通過で検証された候補トークンを生成することにより、大きな言語モデル推論を加速させる。
検証は順次進み、最初の拒絶から全ての位置を放棄するが、既存のドラフトトレーニングでは、どちらの特性も反映しない固定された配置ごとの重み付けで目標のトークンレベルの模倣に依存している。
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATは2つのコンポーネントから構成される。
一 検証ヘッド、各位置が逐次検証を継続するか否かのドラフトモデルを監督する軽量二分分類器
(二) 検証適応重み付けは、各試料の最初の拒絶点まで全重みを保ち、そこで崩壊を再開することにより、固定重み付けスケジュールを置き換える。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
Qwen3-4B、Qwen3-8B、LLaMA-3.1-8BのEAGLE-3およびDFlashに適用すると、VATは平均受信長を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%改善し、数学、コード、チャットベンチマークで一貫した利得を得た。
コードはhttps://github.com/naver-ai/vat.comから入手できる。
関連論文リスト
- ReTrace: Rejected-Trajectory Conditioning for Speculative Decoding [46.17292752074153]
棄却された接尾辞における棄却された位置は、依然として目標の継続と一致している可能性があることを示す。
textbfReTraceは、拒否された軌道条件付けのメソッドで、前回のラウンドから削除された接尾辞に対して、各ドラフトブロックを条件付けする。
ReTraceは、DFlashバックボーン上で、平均受信長とエンドツーエンドの復号速度を継続的に改善する。
論文 参考訳(メタデータ) (2026-08-30T12:20:54Z) - From Tokens to Steps: Verification-Aware Speculative Decoding for Efficient Multi-Step Reasoning [18.37034672013596]
SpecGuardは、モデル内部信号のみを使用してステップレベルの検証を行う投機的復号化フレームワークである。
実験の結果、SpecGuardの精度は3.6%向上し、レイテンシは11%削減された。
論文 参考訳(メタデータ) (2026-04-16T17:20:13Z) - Training-free Dropout Sampling for Semantic Token Acceptance in Speculative Decoding [13.249778063956917]
投機的復号化は、トークンを軽量なドラフトモデルで提案することにより、大きな言語モデル推論を加速する。
この研究は、ドラフトトークンとターゲットモデルの予測分布をマッチングする新しいアプローチであるDropMatchを導入している。
複数のベンチマークで実験したところ、我々のアプローチは、競争力のあるタスク性能を維持しながら、受け入れ期間を延ばすことが示されている。
論文 参考訳(メタデータ) (2026-02-11T04:53:33Z) - DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding [66.40658898418316]
DiffuSpecは、事前訓練された拡散言語モデル(DLM)を用いて、単一のフォワードパスでマルチトークンのドラフトを生成する、トレーニングフリーのドロップインフレームワークである。
ベンチマーク全体を通じて、DiffuSpecは最大3倍のウォールクロックスピードアップを達成し、投機的復号化のための自己回帰型ドラフトラの堅牢な代替手段として拡散ベースのドラフトを確立する。
論文 参考訳(メタデータ) (2025-09-28T07:00:15Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z) - Q-REG: End-to-End Trainable Point Cloud Registration with Surface
Curvature [81.25511385257344]
本稿では、リッチな幾何学的情報を用いて、単一の対応から剛性ポーズを推定する新しい解Q-REGを提案する。
Q-REGは、堅牢な推定を徹底的な探索として形式化し、エンドツーエンドのトレーニングを可能にする。
実験では、Q-REGは対応マッチング法に非依存であり、推論とエンドツーエンドトレーニングの両方で使用した場合に一貫した改善を提供する。
論文 参考訳(メタデータ) (2023-09-27T20:58:53Z) - Certifiable 3D Object Pose Estimation: Foundations, Learning Models, and
Self-Training [23.802602957611676]
証明可能なオブジェクトのポーズ推定の問題を考えると、オブジェクトの部分的な点クラウドが与えられた場合、その目標は、その結果の見積もりに対して正当性を示す証明書を提供することである。
セマンティックキーポイントに基づくポーズ推定モデルであるC-3POを提案する。
論文 参考訳(メタデータ) (2022-06-22T17:06:39Z) - Aligning Pretraining for Detection via Object-Level Contrastive Learning [57.845286545603415]
画像レベルのコントラスト表現学習は、伝達学習の汎用モデルとして非常に有効であることが証明されている。
我々は、これは準最適である可能性があり、従って、自己教師付きプレテキストタスクと下流タスクのアライメントを促進する設計原則を提唱する。
Selective Object Contrastive Learning (SoCo) と呼ばれる本手法は,COCO検出における伝達性能の最先端化を実現する。
論文 参考訳(メタデータ) (2021-06-04T17:59:52Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。