論文の概要: LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
- arxiv url: http://arxiv.org/abs/2605.10980v1
- Date: Sat, 09 May 2026 03:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.273872
- Title: LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection
- Title(参考訳): LEAP: Lookahead Early-Convergence Token Detection によるdLLM並列性のアンロック
- Abstract要約: LEAP(Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding)を紹介する。
LEAPは、将来のコンテキストフィルタリングとマルチシーケンス重ね合わせを利用して早期収束トークンを検出する、トレーニングフリーのプラグアンドプレイ方式である。
GSM8Kデータセットでは、LEAPとdParallelを組み合わせることで、モデル精度を維持しながら、ステップ毎に7.2トークンにデコードが高速化される。
- 参考スコア(独自算出の注目度): 35.2079721755684
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion Language Models (dLLMs) have garnered significant attention for their potential in highly parallel processing. The parallel capabilities of existing dLLMs stem from the assumption of conditional independence at high confidence levels, which ensures negligible discrepancy between the marginal and joint distributions. However, the stringent confidence thresholds required to preserve accuracy severely constrain the scalability of parallelism. Through systematic token-level statistical analysis, we reveal that a substantial proportion of tokens converge to their correct predictions early in the denoising process yet fail to reach standard confidence thresholds, confirming that current confidence-based criteria are overly conservative. In response, we introduce LEAP (Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding). LEAP is a training-free, plug-and-play method that leverages future context filtering and multi-sequence superposition to detect early-converging tokens. By validating the alignment between early convergence and correctness, we enable reliable early decoding of these tokens. Benchmarking across diverse domains demonstrates that LEAP significantly lowers inference latency and decoding steps. Compared to confidence-based decoding, the average number of denoising steps is reduced by about 30%. On the GSM8K dataset, combining LEAP with dParallel accelerates decoding to 7.2 tokens per step while preserving model precision. LEAP effectively breaks the reliance on high-confidence priors, offering a novel paradigm for parallel decoding.
- Abstract(参考訳): 拡散言語モデル (dLLMs) は、高い並列処理の可能性に対して大きな注目を集めている。
既存のdLLMの並列能力は、高信頼レベルで条件独立を仮定することに由来する。
しかし、精度を維持するために必要な厳密な信頼しきい値は、並列性のスケーラビリティを著しく制限する。
体系的なトークンレベルの統計分析により、トークンのかなりの割合は、復調過程の早い段階で正しい予測に収束するが、標準信頼閾値に達しず、現在の信頼ベースの基準が過度に保守的であることを確認する。
これに対し、LEAP(Lookahead Early-Convergence Token Detection for Accelerated Parallel Decoding)を導入する。
LEAPは、将来のコンテキストフィルタリングとマルチシーケンス重ね合わせを利用して早期収束トークンを検出する、トレーニングフリーのプラグアンドプレイ方式である。
早期収束と正しさの整合性を検証することにより、これらのトークンの信頼性の高い早期復号化を可能にする。
さまざまなドメインにわたるベンチマークは、LEAPが推論レイテンシとデコードステップを著しく低下させることを示している。
信頼に基づく復号化と比較すると、平均復号化ステップ数は約30%削減される。
GSM8Kデータセットでは、LEAPとdParallelを組み合わせることで、モデル精度を維持しながら、ステップ毎に7.2トークンにデコードが高速化される。
LEAPは、高信頼の事前依存性を効果的に破壊し、並列デコードのための新しいパラダイムを提供する。
関連論文リスト
- Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling [11.823547220829083]
拡散大言語モデル(dLLM)は、自己回帰生成の代替として有望な並列デコードパラダイムを提供する。
同様に低いエントロピーを持つトークンがクラスタ化される傾向にあるという観察から動機付けられた「アーリーバード(EB)」デコーディングフレームワークを提案する。
EB-Decodeは,(1)類似の不確実性のあるトークンを,固定ブロックサイズに依存するのではなく,可変長ブロックに適応的にグループ化する学習可能なネットワーク,(2)予測された可変長ブロック内の復号ステップを減らして,並列でトークンをアンマスクする位置認識型サンプリング,という2つの重要なイネーラを統合する。
論文 参考訳(メタデータ) (2026-09-15T00:12:37Z) - CauTion: Knowing When to Trust LLMs for Ensemble Causal Discovery [51.07538881798502]
大規模言語モデル(LLM)は、統計的推論を補完する将来的なドメイン知識の源を提供する。
我々は、LLMドメイン知識を統計的因果探索アルゴリズムのアンサンブルに確実に統合するフレームワークであるCauTionを提案する。
CauTionは、データ中心とLLM拡張ベースラインの両方を一貫して上回る。
論文 参考訳(メタデータ) (2026-06-02T13:07:43Z) - SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation [15.129362213838974]
2つのコンポーネントを持つトレース対応復号化フレームワークを提案する。
まず、時間空間並列復号(TSPD)は、トークンが収束し、安全に固定できるかどうかを決定するために、信頼、エントロピー、運動量を含む、トーケン軌道毎の特徴を消費する軽量な時間空間コントローラを使用する。
第二に、CE(Confidence Extrapolation)は、トレーニング不要な状態空間モジュールで、前向きな決定を支援するために、不確実性を伴う将来のロジットトレンドを予測する。
論文 参考訳(メタデータ) (2026-05-29T02:29:28Z) - Cluster-Level Attention-Guided Parallel Decoding for Masked Diffusion Language Models [13.325071163425621]
マスク付き拡散言語モデル (MDLM) は、各デノナイジングステップにおける全てのマスキング位置を予測することで並列デコードを可能にする。
我々は、この粒度を再考し、信頼できる予測が連続した高信頼のスパンとしてしばしば現れることを観察する。
自己アテンションマップを用いてクラスタ間の依存関係を推定し、並列コミットのための相互互換CICのコンフリクト対応の選択を可能にする。
論文 参考訳(メタデータ) (2026-05-28T08:42:39Z) - DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding [52.13809682603516]
DC-Leapは、中程度信頼体制におけるdLLMの信頼性の高いアクセラレーションを可能にする、トレーニング不要のフレームワークである。
厳密に順序付けられた因果制約を並列復号プロセスに組み込む。
KVキャッシュと組み合わせると、MBPPでは最大53.19倍、最大105.02倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-05-19T06:27:58Z) - DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention [2.7422645382944935]
そこで我々はDyLLMを提案する。DyLLMは正規トークンのみを選択的に計算することでデコーディングを高速化する学習自由推論フレームワークである。
DyLLMは様々な推論とコード生成ベンチマークで最大9.6倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-03-09T07:02:01Z) - Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning [58.331709210563616]
サブトラクションによる思考は、信頼主導のコントラスト的デコーディングアプローチである。
低信頼トークンの小さなサブセットは、誤りの推論と不要な出力拡大に不当に寄与する。
信頼駆動型コントラストデコーディング(Confidence-Driven Contrastive Decoding)は,デコーディング中の低信頼トークンを検出し,それらの位置で介入する。
論文 参考訳(メタデータ) (2026-02-20T14:13:22Z) - From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models [19.97248408121574]
Diffusion Language Models (DLMs) は並列デコードにより高速な推論速度で同等の精度を提供する。
高信頼トークンは無視可能な情報を持ち、それらに厳密に依存することで、各デコードラウンドにおける効果的な進捗を制限する。
本研究では,情報スループットと復号効率を最大化する学習自由復号法であるExplore-Then-Exploit (ETE)を提案する。
論文 参考訳(メタデータ) (2025-11-26T06:38:37Z) - Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States [28.663951525871756]
本稿では、Latent Refinement Decoding (LRD) と予測フィードバックループを備えた2段階のフレームワークについて紹介する。
LRDは最大10.6倍のスピードアップを提供しながら精度を向上し、並列シーケンス生成の強力な代替手段となる。
論文 参考訳(メタデータ) (2025-10-13T06:38:13Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Cautious Next Token Prediction [62.74127603725369]
我々は、CNTP(Cautious Next Token Prediction)と呼ばれる新しいトレーニングフリーデコード戦略を提案する。
復号過程において、モデルが特定のステップで比較的高い予測エントロピーを持つ場合、独立にステップから始まる複数の試行をサンプリングし、句読点に遭遇する際に停止する。
提案するCNTPアプローチは,既存の標準復号方式よりも明確なマージンで一貫した性能を発揮することを示す。
論文 参考訳(メタデータ) (2025-07-03T05:49:18Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。