論文の概要: Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.28166v1
- Date: Thu, 30 Jul 2026 13:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.572872
- Title: Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models
- Title(参考訳): 拡散言語モデルに対する候補認識復号法
- Authors: Chia-Ming Lee, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu,
- Abstract要約: 拡散言語モデルは、デノナイジングステップ毎に一時的な予測を公開する。
生成時早期出口は、スケジュールが切れる前に復号を停止する。
2つの軸を分離し、それぞれの決定をそれぞれのスコープの証拠と一致させる。
- 参考スコア(独自算出の注目度): 29.849017661114342
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion language models (DLMs) expose a provisional prediction at every denoising step, creating an opportunity for generation-time early exit that stops decoding before the schedule is exhausted. Existing early-exit gates decide termination from fixed-region confidence statistics or schedule-dependent rules, evidence too coarse for a decision that freezes every remaining position at once, so they fire prematurely on long chain-of-thought outputs whose answers stabilize only near the end. Adaptive sampling, the other axis of training-free acceleration, paces how quickly positions commit while decoding continues but never verifies that the output itself has stabilized. We introduce a training-free, candidate-aware early-exit framework that keeps the two axes separate and matches each decision to evidence of its own scope. Confidence-Verified Commit (CVC) governs when the sequence may stop by verifying confidence and sustained argmax stability over the dynamically extracted candidate span using a deterministic parser specified from each task's output format. Block-Wise Early Commit (BWEC) governs where to accelerate by applying a cheaper local rule to non-final blocks, while leaving the final block and global termination under CVC. We refer to their combination as LATCH (Localized Acceleration with Tracked-Candidate Halting). Unlike prior methods, LATCH needs no suffix-prompt construction; it is prompt-anchor-free but format-aware. We evaluate LATCH end to end on 11 tasks under zero-shot settings using LLaDA and Dream. LATCH stays within 2.0 percentage points of full-decoding accuracy across all 22 evaluation settings, with one frozen hyperparameter set that transfers cross-backbone untuned, while achieving end-to-end TPS speedups of 9.3-17.8x on short-answer tasks and 2.0-3.3x on long-reasoning tasks.
- Abstract(参考訳): 拡散言語モデル(DLM)は、各デノナイジングステップで一時的な予測を公開し、スケジュールが切れる前にデコードを止める世代早期終了の機会を生み出す。
既存の早期退避ゲートは、固定領域の信頼統計やスケジュールに依存したルールから終了を決定するが、残りの全ての位置を一度に凍結する決定には証拠があまりに粗いため、答えが終端近くでしか安定しない長い連鎖出力に対して早々に発射する。
適応サンプリング(Adaptive sample)は、トレーニング不要な加速度の軸であり、デコード中のコミットの速度を早めるが、出力自体が安定化したことを決して確認しない。
2つの軸を分離し、それぞれの決定をそれぞれのスコープの証拠と一致させる。
CVC(Confidence-Verified Commit)は、各タスクの出力フォーマットから指定された決定論的パーサを使用して、動的に抽出された候補スパン上での信頼性と持続的なargmax安定性を検証することによって、シーケンスが停止する可能性がある場合に支配する。
Block-Wise Early Commit (BWEC)は、最終ブロックとグローバル終了をCVCに残しながら、より安価なローカルルールを非ファイナルブロックに適用することで、どこで加速するかを規定する。
LATCH(Localized Acceleration with Tracked-Candidate Halting)と呼ぶ。
従来の方法とは異なり、LATCHは接尾辞のプロンプト構造は必要とせず、プロンプトアンカーフリーだがフォーマット対応である。
LLaDAとDreamを用いて、ゼロショット設定で11タスクのLATCH終端を評価する。
LATCHは、22のすべての評価設定において、完全な復号精度の2.0パーセント以内に留まり、クロスバックボーンを調整せずに転送する1つの凍結ハイパーパラメータセットを持ち、短絡タスクでは9.3-17.8倍、長調タスクでは2.0-3.3倍のTPSスピードアップを達成する。
関連論文リスト
- TACG: Trajectory-Aware Commit Gating for Diffusion Language Model Decoding [38.72024551312125]
Trajectory-Aware Commit Gating (TACG) は、トークンのIDを後部に固定するゲートレベルのデコーダである。
TACGをLLaDA,Dream,LLaDA2-Miniベンチマークで評価した。
論文 参考訳(メタデータ) (2026-07-03T11:45:21Z) - Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation [15.129362213838974]
2つのコンポーネントを持つトレース対応復号化フレームワークを提案する。
まず、時間空間並列復号(TSPD)は、トークンが収束し、安全に固定できるかどうかを決定するために、信頼、エントロピー、運動量を含む、トーケン軌道毎の特徴を消費する軽量な時間空間コントローラを使用する。
第二に、CE(Confidence Extrapolation)は、トレーニング不要な状態空間モジュールで、前向きな決定を支援するために、不確実性を伴う将来のロジットトレンドを予測する。
論文 参考訳(メタデータ) (2026-05-29T02:29:28Z) - The Path Matters: Learning a Token-Commitment Policy for Diffusion Language Models [52.93186090124315]
トークンのコミットメントは、再利用可能なトレースステートポリシとして学ぶことができる、と私たちは主張する。
凍結拡散言語モデルのためにこのポリシーをインスタンス化する軽量プラグインコントローラであるTraceLockを紹介する。
論文 参考訳(メタデータ) (2026-05-23T18:23:46Z) - STDec: Spatio-Temporal Stability Guided Decoding for dLLMs [49.55447757907809]
大規模拡散言語モデル(dLLM)は、自己回帰パラダイムに代わる有望な選択肢と見なされ、急速な進歩を遂げている。
ほとんどのdLLMデコーダは依然としてグローバルな信頼しきい値を採用しており、近隣のデコード状態や予測トークンIDの時間的一貫性からローカルコンテキストをモデル化していない。
我々は,dLLMデコーディングにおいて時間的安定性に近い強い安定性を観察し,そのアプローチには空間的認識復号と時間的認識復号が含まれる。
論文 参考訳(メタデータ) (2026-04-07T18:13:31Z) - DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows [20.319113495948294]
我々は多段階推論過程をノイズMDPとして定式化する。
DenoiseFlowは3つの調整段階を通じてプログレッシブなdenoisingを行うクローズドループフレームワークである。
論文 参考訳(メタデータ) (2026-02-28T08:11:38Z) - Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation [9.670831676453673]
均一な更新とコンテキスト更新がタイムステップ間でトークンレベルの変動を誘発する更新忘れについて説明する。
token Timestep Allocation (TTA) を提案する。これはトークンのタイムステップごとのスケジュールによって、ソフトでセマンティックなトークンの順序付けを実現する。
論文 参考訳(メタデータ) (2025-10-30T07:21:05Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。