論文の概要: Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference
- arxiv url: http://arxiv.org/abs/2608.26574v1
- Date: Thu, 27 Aug 2026 03:34:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.232988
- Title: Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference
- Title(参考訳): 効率よい拡散大言語モデル推論のための依存性を考慮した可逆復号法
- Authors: Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim,
- Abstract要約: Dependency-Aware Revocable Decoding (DARD) は、トークンをマスク、候補、非マスク状態に分離するトレーニング不要のフレームワークである。
DARDは、最近のデコード方式よりも、スピードクオリティのフロンティアを一貫して改善している。
- 参考スコア(独自算出の注目度): 26.756607509798382
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion large language models (dLLMs) offer a promising alternative to autoregressive generation by decoding multiple tokens in parallel through iterative denoising. However, increasing decoding parallelism often degrades generation quality, as early errors can contaminate later contexts. Revocable decoding mitigates this issue by re-evaluating decoded tokens and remasking unreliable ones, but existing methods overlook that unreliable tokens may also corrupt the verification context itself. We identify this failure mode and propose Dependency-Aware Revocable Decoding (DARD), a training-free framework that separates tokens into masked, candidate, and unmasked states. DARD verifies candidate tokens using a selective context that excludes less reliable tokens and adaptively regulates their influence on subsequent decoding. Experiments across 12 textual and multimodal benchmarks on 3 open-source dLLMs show that DARD consistently improves the speed-quality Pareto frontier over recent revocable decoding methods, achieving a 2.71$\times$ speedup and a 4.35-point CIDEr score gain over Saber on Flickr30K.
- Abstract(参考訳): Diffusion Large Language Model (dLLMs) は、複数のトークンを並列に復号化することで、自動回帰生成に代わる有望な代替手段を提供する。
しかしながら、デコード並列性の増加は、初期エラーが後続のコンテキストを汚染する可能性があるため、生成品質を劣化させることが多い。
Revocable decodingは、デコードされたトークンを再評価し、信頼できないトークンを再メイキングすることによってこの問題を緩和するが、既存のメソッドは信頼できないトークンが検証コンテキスト自体を損なう可能性があることを見逃している。
この障害モードを特定し、トークンをマスキング、候補、非マスキング状態に分離するトレーニング不要のフレームワークであるDependency-Aware Revocable Decoding (DARD)を提案する。
DARDは、信頼性の低いトークンを除外し、その後の復号への影響を適応的に規制する選択的なコンテキストを用いて、候補トークンを検証する。
3つのオープンソースdLLMで12のテキストとマルチモーダルのベンチマークを比較したところ、DARDは最近の取り消し可能なデコード方式よりもパレートフロンティアを一貫して改善し、Flickr30Kでは2.71$\times$のスピードアップと4.35ポイントのCIDErスコアがSaberよりも向上した。
関連論文リスト
- Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens [22.687236570529844]
本稿では,組込み空間内で動作するトレーニングフリーフレームワークASRDを提案する。
我々はASRDが最近のリメイキングベースラインを上回り、最大6.4%の精度向上を実現し、推論スループットを最大7.2倍に向上させることを示した。
論文 参考訳(メタデータ) (2026-06-15T15:23:47Z) - Supportive Token Revealing for Fast Diffusion Language Model Decoding [10.022716564968695]
AXONはトレーニングフリーのモジュールで、拡散言語モデルの既存の並列デコード戦略の上に追加することができる。
AXONは、既存の並列デコーダの品質・レイテンシのトレードオフを改善し、精度を維持したり改善したりしながら、機能評価の回数を減らすことができることを示す。
論文 参考訳(メタデータ) (2026-06-02T21:35:54Z) - SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - Diffusion Large Language Models for Visual Speech Recognition [56.81307584718608]
本稿では,最初の拡散大言語モデル(DLLM)に基づく視覚音声認識(VSR)フレームワークを提案する。
DLLM-VSRは早期に高信頼位置をコミットし、コミットトークンを双方向コンテキストとして、曖昧なトークンを洗練させる。
我々は、ビデオ長を用いて、可塑性転写長仮説を構築する長さ誘導型候補復号法を開発した。
提案手法はラベル付きトレーニングデータのみを用いて, LRS3 上で19.5%の最先端 WER を実現する。
論文 参考訳(メタデータ) (2026-05-27T13:22:08Z) - Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers [76.15132587294862]
Wide-In, Narrow-Out (WINO) は、リボッキング可能な並列生成を可能にするトレーニング不要の復号アルゴリズムである。
WINO+は、WINOが生成した検証された認知軌道をモデルパラメータに注入し、トレーニングを効率的な推論と整合させる。
LLaDAとMMaDAの実験では、WINOは品質と効率の両方を改善し、WINO+はこの進歩をさらに強化している。
論文 参考訳(メタデータ) (2026-05-16T11:27:40Z) - PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding [32.667256256847246]
拡散大言語モデル (dLLMs) は、マスク付きトークンシーケンスを反復的に記述することでテキストを生成する。
両軸に沿って推論を共同で改善するトレーニングフリーフレームワークであるParallel Speculative Decoding (PSD)を提案する。
論文 参考訳(メタデータ) (2026-05-15T04:43:02Z) - Residual Context Diffusion Language Models [90.07635240595926]
Residual Context Diffusion (RCD) は、捨てられたトークン表現をコンテキスト残留に変換し、次のデノイングステップでそれらを注入するモジュールである。
RCDは、最小限の計算オーバーヘッドで、5-10ポイントの精度でフロンティアdLLMを一貫して改善する。
論文 参考訳(メタデータ) (2026-01-30T13:16:32Z) - Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models [47.5976588836299]
拡散大言語モデル(dLLM)は、並列デコーディングの高速化や双方向コンテキストモデリングといった利点を提供する。
離散dLLMにおけるバニラデコーディング戦略は、重要な制限に悩まされる。トークンが受け入れられると、後続のステップで修正することはできない。
予測トークン間のクロスバリデーションを利用するトレーニングフリーなデコーディング戦略であるToleratorを提案する。
論文 参考訳(メタデータ) (2025-10-06T17:56:46Z) - Decoding at the Speed of Thought: Harnessing Parallel Decoding of Lexical Units for LLMs [57.27982780697922]
大規模言語モデルは、自然言語の理解と生成において例外的な能力を示した。
しかし、それらの生成速度は、その復号過程の本質的にシーケンシャルな性質によって制限される。
本稿では,データ駆動方式で実装された新しいデコーディング手法であるLexical Unit Decodingを紹介する。
論文 参考訳(メタデータ) (2024-05-24T04:35:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。