論文の概要: HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction
- arxiv url: http://arxiv.org/abs/2606.26744v2
- Date: Mon, 29 Jun 2026 08:34:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.054503
- Title: HyperDFlash: Hyper-Connection-Aligned Block Speculative Decoding with Gated Residual Reduction
- Title(参考訳): HyperDFlash: Gated Residual Reductionによるハイパーコネクション対応ブロック投機デコーディング
- Authors: Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu,
- Abstract要約: We present HyperDFlash, a block-parallel speculative decoding framework for DeepSeek-V4's Hyper-Connections (HC)。
DeepSeek-V4のネイティブなマルチトークン予測(MTP)モジュールが初期トークンドラフトで高いパフォーマンスを示したにもかかわらず、ドラフトの精度は後の位置で大幅に低下した。
元のDFlash法は効率的なワンパスブロックドラフトをサポートしているが、HCパラダイムにシームレスに適応することはできない。
- 参考スコア(独自算出の注目度): 8.146414118644069
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present HyperDFlash, a block-parallel speculative decoding framework tailored to DeepSeek-V4's Hyper-Connections (HC). Despite the strong performance of DeepSeek-V4's native Multi-Token Prediction (MTP) module on initial token drafting, its draft accuracy degrades sharply at later positions, as error accumulation from unverified intermediate tokens harms draft acceptance rates. Although the original DFlash method supports efficient one-pass block drafting, it cannot be seamlessly adapted to the HC paradigm, since DeepSeek-V4's multi-path residual stream induces inherent feature misalignment with conventional drafting designs. To resolve this architectural mismatch, we propose two dedicated, model-aligned optimizations for HC residual streams. First, we adopt pre-collapse residual states as the exclusive conditioning signal, preserving complete multi-path structural information and better aligning the drafter with the target's native prediction pathway. Second, we replace the heavy generic linear compressor with a lightweight gated residual reducer, whose parameters are directly inherited from the target model's built-in hc_head module. This design yields input-aware path aggregation with three orders of magnitude fewer parameters while maintaining precise architectural alignment. We further enhance model training via a targeted KL distillation loss applied to the LM-head, regularizing predictions against the target distribution to improve early draft quality. Extensive experiments across math reasoning, code synthesis, and conversational benchmarks demonstrate that HyperDFlash consistently outperforms both the native MTP baseline and vanilla DFlash adaptation, achieving substantial gains in average accepted draft length and decoding speedup. These results validate HC alignment, gated reduction, and targeted distillation for high-performance speculative decoding.
- Abstract(参考訳): 我々は,DeepSeek-V4のHyper-Connections (HC) に合わせたブロック並列投機デコーディングフレームワークであるHyperDFlashを紹介する。
DeepSeek-V4のネイティブMTP(Multi-Token Prediction)モジュールが初期トークンドラフトで高いパフォーマンスを示したにもかかわらず、未検証の中間トークンからのエラーの蓄積がドラフト受け入れ率を損なうため、ドラフト精度は後から大幅に低下した。
元のDFlash法は効率的なワンパスブロックの草案作成をサポートしているが、DeepSeek-V4のマルチパス残差ストリームは従来のドラフト設計と固有の特徴の不一致を引き起こすため、HCパラダイムにシームレスに適応することはできない。
このアーキテクチャミスマッチを解決するために、HC残差ストリームに対する2つの専用モデル整合最適化を提案する。
まず,事前崩壊残差状態を排他的条件付け信号として採用し,完全なマルチパス構造情報を保存し,起草者のネイティブな予測経路との整合性を向上する。
第二に、重一般線形圧縮機を軽量ゲート残差低減器に置き換え、パラメータはターゲットモデルのhc_headモジュールから直接受け継がれる。
この設計では、正確なアーキテクチャアライメントを維持しながら、3桁のパラメータを桁違いに減らした入力対応パスアグリゲーションが得られる。
我々は、LMヘッドに適用されたターゲットKL蒸留損失によるモデルトレーニングをさらに強化し、ターゲット分布に対する予測を規則化し、早期のドラフト品質を改善する。
数学推論、コード合成、会話ベンチマークの広範な実験により、HyperDFlashはネイティブのMPPベースラインとバニラのDFlash適応の両方を一貫して上回り、平均的なドラフト長とデコードスピードアップで大幅に向上した。
これらの結果はHCアライメント, ゲート還元, ターゲット蒸留を高性能な投機復号法として評価した。
関連論文リスト
- WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing [44.656073829954636]
WhiFlashは、単一トークンレベルのコントローラの下で自動回帰および拡散ベースの並列ドラフトを統一する、クロスパラダイムなSDメソッドである。
また,WhiFlashは高い受信長を実現し,カテゴリ固有のスループットを最大69.6%向上させることを示した。
論文 参考訳(メタデータ) (2026-06-05T13:23:33Z) - Accelerating Birkhoff Projection for Manifold-Constrained Hyper-Connections [6.932606401614012]
我々は超制約超接続(mHC)のためのエンドツーエンド加速フレームワークを開発する。
実際に重要な4x4 Birkhoffプロジェクション設定に集中し、エンドツーエンドのアクセラレーションフレームワークを開発する。
論文 参考訳(メタデータ) (2026-05-26T13:11:08Z) - $D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation [72.9912717963138]
リモートセンシング画像からのリアルタイムで高忠実な単眼深度推定は、多くのアプリケーションにとって不可欠である。
視覚変換器(ViT)のバックボーンを高密度な予測に使用するのは速いが、知覚品質は低いことが多い。
リモートセンシング単眼深度推定のための深度詳細拡散法(D3$-RSMDE)を提案する。
D3$-RSMDEは、Learninged Perceptual Image Patch similarity (LPIPS)の知覚距離を11.85%削減する。
論文 参考訳(メタデータ) (2026-03-17T10:50:36Z) - JPmHC Dynamical Isometry via Orthogonal Hyper-Connections [2.4311915994390403]
JPmHCは、n個の並列ストリームに作用するトレーニング可能な線形ミキサーでIDスキップを置き換えるフレームワークである。
緩やかな病理を予防し、安定性を高める。
両眼的ベースラインに比べて、より高速な収束、高い精度、計算コストの低減を実現している。
論文 参考訳(メタデータ) (2026-02-20T16:06:01Z) - Coupled Diffusion-Encoder Models for Reconstruction of Flow Fields [11.478292682955669]
本稿では,従来の畳み込み型ResNetエンコーダと確率拡散モデルを統合する結合フレームワークであるDiffCoderを提案する。
積極的な圧縮の下では、DiffCoderはスペクトル精度を大幅に向上し、VAEは相当な劣化を示す。
DiffCoderはフローの分布構造をよりよく保存する。
論文 参考訳(メタデータ) (2026-01-12T19:24:52Z) - SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding [48.96349422252313]
投機的復号化は,Large Language Model (LLM)推論の高速化のための標準手法となっている。
自動回帰デコーディングの遅延を回避し、印象的なスピードアップを実現するために、損失のないドラフト検証手順を利用する。
本稿では,これら2つのボトルネックに共同で対処する新しいフレームワークであるSpecDiff-2を提案する。
論文 参考訳(メタデータ) (2025-11-01T16:12:56Z) - Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference [11.957170239588535]
投機的復号化は、ドラフトモデルを使用して推測を加速する。
事前の方法は、ドラフトコストを部分的に削減するが、受け入れを低下させるか、スケーリングを制限するオーバーヘッドを導入する。
本稿では,遅延受容トレードオフを破る推論アルゴリズムであるMirror Speculative Decoding(Mirror-SD)を提案する。
論文 参考訳(メタデータ) (2025-10-15T05:22:57Z) - MPQ-DMv2: Flexible Residual Mixed Precision Quantization for Low-Bit Diffusion Models with Temporal Distillation [74.34220141721231]
我々は,textbfMixed textbfPrecision textbfQuantizationフレームワークを改良したMPQ-DMv2を提案する。
論文 参考訳(メタデータ) (2025-07-06T08:16:50Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z) - Joint Transmit and Pinching Beamforming for Pinching Antenna Systems (PASS): Optimization-Based or Learning-Based? [89.05848771674773]
MISO (Multiple-input Single-output) フレームワークを提案する。
それは複数の導波路で構成されており、多数の低コストアンテナ(PA)を備えている。
PAの位置は、大規模パスと空間の両方にまたがるように再構成することができる。
論文 参考訳(メタデータ) (2025-02-12T18:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。