論文の概要: LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
- arxiv url: http://arxiv.org/abs/2605.10980v1
- Date: Sat, 09 May 2026 03:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.273872
- Title: LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
- Title(参考訳): LEAP: Lookahead Early-Convergence Token Detection によるdLLM並列性のアンロック
- Authors: Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang,
- Abstract要約: LEAP(Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding)を紹介する。
LEAPは、将来のコンテキストフィルタリングとマルチシーケンス重ね合わせを利用して早期収束トークンを検出する、トレーニングフリーのプラグアンドプレイ方式である。
GSM8Kデータセットでは、LEAPとdParallelを組み合わせることで、モデル精度を維持しながら、ステップ毎に7.2トークンにデコードが高速化される。
- 参考スコア(独自算出の注目度): 35.2079721755684
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Language Models (dLLMs) have garnered significant attention for their potential in highly parallel processing. The parallel capabilities of existing dLLMs stem from the assumption of conditional independence at high confidence levels, which ensures negligible discrepancy between the marginal and joint distributions. However, the stringent confidence thresholds required to preserve accuracy severely constrain the scalability of parallelism. Through systematic token-level statistical analysis, we reveal that a substantial proportion of tokens converge to their correct predictions early in the denoising process yet fail to reach standard confidence thresholds, confirming that current confidence-based criteria are overly conservative. In response, we introduce LEAP (Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding). LEAP is a training-free, plug-and-play method that leverages future context filtering and multi-sequence superposition to detect early-converging tokens. By validating the alignment between early convergence and correctness, we enable reliable early decoding of these tokens. Benchmarking across diverse domains demonstrates that LEAP significantly lowers inference latency and decoding steps. Compared to confidence-based decoding, the average number of denoising steps is reduced by about 30%. On the GSM8K dataset, combining LEAP with dParallel accelerates decoding to 7.2 tokens per step while preserving model precision. LEAP effectively breaks the reliance on high-confidence priors, offering a novel paradigm for parallel decoding.
- Abstract(参考訳): 拡散言語モデル (dLLMs) は、高い並列処理の可能性に対して大きな注目を集めている。
既存のdLLMの並列能力は、高信頼レベルで条件独立を仮定することに由来する。
しかし、精度を維持するために必要な厳密な信頼しきい値は、並列性のスケーラビリティを著しく制限する。
体系的なトークンレベルの統計分析により、トークンのかなりの割合は、復調過程の早い段階で正しい予測に収束するが、標準信頼閾値に達しず、現在の信頼ベースの基準が過度に保守的であることを確認する。
これに対し、LEAP(Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding)を導入する。
LEAPは、将来のコンテキストフィルタリングとマルチシーケンス重ね合わせを利用して早期収束トークンを検出する、トレーニングフリーのプラグアンドプレイ方式である。
早期収束と正しさの整合性を検証することにより、これらのトークンの信頼性の高い早期復号化を可能にする。
さまざまなドメインにわたるベンチマークは、LEAPが推論レイテンシとデコードステップを著しく低下させることを示している。
信頼に基づく復号化と比較すると、平均復号化ステップ数は約30%削減される。
GSM8Kデータセットでは、LEAPとdParallelを組み合わせることで、モデル精度を維持しながら、ステップ毎に7.2トークンにデコードが高速化される。
LEAPは、高信頼の事前依存性を効果的に破壊し、並列デコードのための新しいパラダイムを提供する。
関連論文リスト
- DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention [2.7422645382944935]
そこで我々はDyLLMを提案する。DyLLMは正規トークンのみを選択的に計算することでデコーディングを高速化する学習自由推論フレームワークである。
DyLLMは様々な推論とコード生成ベンチマークで最大9.6倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-03-09T07:02:01Z) - Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning [58.331709210563616]
サブトラクションによる思考は、信頼主導のコントラスト的デコーディングアプローチである。
低信頼トークンの小さなサブセットは、誤りの推論と不要な出力拡大に不当に寄与する。
信頼駆動型コントラストデコーディング(Confidence-Driven Contrastive Decoding)は,デコーディング中の低信頼トークンを検出し,それらの位置で介入する。
論文 参考訳(メタデータ) (2026-02-20T14:13:22Z) - From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models [19.97248408121574]
Diffusion Language Models (DLMs) は並列デコードにより高速な推論速度で同等の精度を提供する。
高信頼トークンは無視可能な情報を持ち、それらに厳密に依存することで、各デコードラウンドにおける効果的な進捗を制限する。
本研究では,情報スループットと復号効率を最大化する学習自由復号法であるExplore-Then-Exploit (ETE)を提案する。
論文 参考訳(メタデータ) (2025-11-26T06:38:37Z) - Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States [28.663951525871756]
本稿では、Latent Refinement Decoding (LRD) と予測フィードバックループを備えた2段階のフレームワークについて紹介する。
LRDは最大10.6倍のスピードアップを提供しながら精度を向上し、並列シーケンス生成の強力な代替手段となる。
論文 参考訳(メタデータ) (2025-10-13T06:38:13Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Cautious Next Token Prediction [62.74127603725369]
我々は、CNTP(Cautious Next Token Prediction)と呼ばれる新しいトレーニングフリーデコード戦略を提案する。
復号過程において、モデルが特定のステップで比較的高い予測エントロピーを持つ場合、独立にステップから始まる複数の試行をサンプリングし、句読点に遭遇する際に停止する。
提案するCNTPアプローチは,既存の標準復号方式よりも明確なマージンで一貫した性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-07-03T05:49:18Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。