論文の概要: CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference
- arxiv url: http://arxiv.org/abs/2608.11235v1
- Date: Fri, 31 Jul 2026 07:32:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.589748
- Title: CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference
- Title(参考訳): CORA-Diff:効率的な拡散言語モデル推論のための信頼性指向残留受容
- Abstract要約: 拡散言語モデルは、多くのトークンを並列に更新するが、実用的なデコーダは、しばしば固定されたdenoising horizonを使用する。
本研究では,CORA-Diffを提案する。CORA-Diffは,元のトランスファールールを保護し,ルールが未解決な位置にのみ信頼とパーシステンスをゲーティングする訓練自由法である。
その結果,タスク品質を保ったままの繰り返し認知を低減し,信頼感と持続性が確実な残留受容を可能にすることが示唆された。
- 参考スコア(独自算出の注目度): 24.176666448303095
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Diffusion language models (DLMs) update many tokens in parallel, yet practical decoders often use a fixed denoising horizon. Many predictions stabilize early, but blockwise decoding continues until all positions are resolved, causing repeated dense forward passes. Existing accelerators often rely on learned filters, modified scores, dependency models, or cache-specific mechanisms. We ask whether native trajectory signals can identify residual positions likely to match the deterministic dense endpoint. We propose CORA-Diff, a training-free method that preserves the original transfer rule and applies confidence-and-persistence gating only to positions that rule leaves unresolved. Accepted tokens remain visible as context, and the block terminates once all positions are resolved. This requires no backbone change, learned acceptance model, or logit modification. Our theory explains why high-confidence, persistent predictions are more likely to match the fixed-horizon dense endpoint, and paired post-intervention trajectories provide direct empirical support. We select one operating point on a separate GSM8K calibration subset and freeze it for all evaluations. Under a matched Learn2PD-style LLaDA protocol, CORA-Diff has the lowest measured runtime in all eight task-length settings. Task scores match or exceed dense decoding in five settings, and the largest observed drop is 1.22 points. Its incremental speedups over EOS-aware dense decoding are 2.70x and 3.32x on GSM8K and HumanEval. It also reaches 13.14x under the fixed-horizon 1024/1024 mechanism-isolation protocol and transfers to Dream without retuning at 3.18x-3.53x. These results show that native confidence and persistence enable reliable residual acceptance, reducing repeated denoising computation while preserving task quality.
- Abstract(参考訳): 拡散言語モデル(DLM)は、多くのトークンを並列に更新するが、実用的なデコーダは固定されたデノナイジング水平線を使用することが多い。
多くの予測は早期に安定するが、全ての位置が解決されるまでブロックワイズ復号が続く。
既存のアクセラレータは、学習したフィルタ、修正されたスコア、依存性モデル、キャッシュ固有のメカニズムに依存することが多い。
固有軌道信号が決定論的高密度終端に一致する可能性のある残留位置を特定できるかどうかを問う。
本研究では,CORA-Diffを提案する。CORA-Diffは,元のトランスファールールを保護し,ルールが未解決な位置にのみ信頼とパーシステンスをゲーティングする訓練自由法である。
受信されたトークンはコンテキストとして表示され、すべての位置が解決されるとブロックは終了する。
これは、バックボーンの変更、学習された受け入れモデル、ロジット修正を必要としない。
我々の理論は、高信頼で永続的な予測が固定水平密度の終点と一致しやすい理由を説明している。
別個のGSM8Kキャリブレーションサブセット上で1つのオペレーティングポイントを選択し、すべての評価のために凍結する。
マッチしたLearner2PDスタイルのLLaDAプロトコルの下では、CORA-Diffは8つのタスク長設定で最低のランタイムを持つ。
タスクスコアは5つの設定で濃密なデコードに一致または超え、最も多く観測されたドロップは1.22ポイントである。
EOS対応の高密度デコードに対するインクリメンタルなスピードアップは、GSM8KとHumanEvalの2.70倍と3.32倍である。
また、固定水平1024/1024のメカニズムアイソレーションプロトコルの下で13.14xに達し、3.18x-3.53xで修正することなくドリームに転送される。
これらの結果から,タスク品質を保ちながら繰り返しデノケーション計算を削減し,信頼度と永続性を確保できることが示唆された。
関連論文リスト
- Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models [66.32132912853372]
Diffusion Large Language Models (dLLMs) は自己回帰型言語モデルの競合代替として登場した。
本研究では,中間エントロピー位置を有望な候補ピボットとして求める訓練自由復号法であるRipple-Pivot Search (RPS)を提案する。
RPSは、生成品質を維持しながら標準デコーダの4-10$times$wall-clockスピードアップを実現し、以前のルックアヘッドベースラインの精度を最大5.49%向上させる。
論文 参考訳(メタデータ) (2026-08-12T07:32:29Z) - Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models [29.849017661114342]
拡散言語モデルは、デノナイジングステップ毎に一時的な予測を公開する。
生成時早期出口は、スケジュールが切れる前に復号を停止する。
2つの軸を分離し、それぞれの決定をそれぞれのスコープの証拠と一致させる。
論文 参考訳(メタデータ) (2026-07-30T13:04:47Z) - Learning the Koopman Operator using Attention Free Transformers [0.3848364262836075]
クープマン予測をより堅牢にする2つの相補的成分を導入する。
まず注意のない潜伏メモリ(AFT)ブロックを追加し、過去の潜伏者の短いウィンドウを集約し、クープマンの更新毎に修正潜伏者を生成する。
第二に、動的再符号化: 遅延ドリフトとプロジェクト予測を自動エンコーダ多様体に戻す、軽量でオンラインな変更点トリガを提案する。
論文 参考訳(メタデータ) (2026-06-22T21:36:55Z) - LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models [49.93891888238178]
ブロックワイド拡散言語モデル(DLM)は任意の順序で複数のトークンを生成し、自動回帰復号パイプラインに代わる有望な代替手段を提供する。
異なるクエリが異なるプレフィックス位置を選択する場合、KVインフレーション問題により、DLM上では裸のスパースアテンションが失敗する。
キャッシュされたプレフィックスアテンション結果を安定したトークンに再利用し、アクティブトークンのみにスパースアテンションを適用するLOSA(Locality-aware Sparse Attention)を提案する。
論文 参考訳(メタデータ) (2026-04-13T20:53:51Z) - Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States [28.663951525871756]
本稿では、Latent Refinement Decoding (LRD) と予測フィードバックループを備えた2段階のフレームワークについて紹介する。
LRDは最大10.6倍のスピードアップを提供しながら精度を向上し、並列シーケンス生成の強力な代替手段となる。
論文 参考訳(メタデータ) (2025-10-13T06:38:13Z) - Sequential Diffusion Language Models [110.06562906987052]
拡散言語モデル(DLM)は理論効率が強いが、固定長の復号化とキー値キャッシュとの非互換性によって制限される。
次点と次点の予測を統一するNext Sequence Prediction (NSP)を導入する。
本稿では,事前学習した自己回帰言語モデル(ALM)を最小限のコストで再現可能な逐次拡散言語モデル(SDLM)を提案する。
論文 参考訳(メタデータ) (2025-09-28T17:59:15Z) - Diffusion Language Models Know the Answer Before Decoding [56.96815863705218]
拡散言語モデル (DLM) は自己回帰的アプローチの代替として登場した。
我々の研究は、DLMの早期回答収束の見過ごされた特性を強調し、活用する。
Prophetは、早期コミット復号を可能にするトレーニングフリーの高速復号化パラダイムである。
論文 参考訳(メタデータ) (2025-08-27T15:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。