論文の概要: Rethinking the Generation Order of Block Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.24306v1
- Date: Mon, 27 Jul 2026 11:49:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.40769
- Title: Rethinking the Generation Order of Block Diffusion Language Models
- Title(参考訳): ブロック拡散言語モデルの生成順序の再考
- Abstract要約: 拡散言語モデルはフレキシブルな任意の順序生成を可能にするが、既存のサンプリング手法は主に初期のマスク付き拡散モデル(MDM)のために設計されている。
パラレル自動回帰復号法 (PARD) は, トークンの並列化を許容しつつ, 左から右へのアンマスク構造を保存する単純な訓練不要サンプリング法である。
- 参考スコア(独自算出の注目度): 4.187801730089504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion language models enable flexible arbitrary-order generation, but existing sampling methods are mostly designed for early masked diffusion models (MDMs). In this work, we study sampling for recent block diffusion language models (BDLMs). We show empirically and analytically that these models are naturally more aligned with left-to-right decoding than MDMs. Based on this observation, we propose Parallel Autoregressive Decoding (PARD), a simple training-free sampling method that preserves left-to-right unmasking structure while allowing parallel token commitment. Extensive experiments show that PARD consistently outperforms existing parallel samplers in generation quality, while achieving substantial speedups over pure AR decoding with only a small quality gap.
- Abstract(参考訳): 拡散言語モデルはフレキシブルな任意の順序生成を可能にするが、既存のサンプリング手法は主に初期のマスク付き拡散モデル(MDM)のために設計されている。
本研究では,近年のブロック拡散言語モデル (BDLM) のサンプリングについて検討する。
我々は、これらのモデルがMDMよりも左から右へのデコードに自然に整合していることを経験的かつ分析的に示す。
そこで本研究では,並列トークンのコミットを許容しつつ,左から右へのアンマスク構造を保存する簡単なトレーニング不要サンプリング手法である Parallel Autoregressive Decoding (PARD) を提案する。
大規模な実験により、PARDは既存の並列サンプリング器を世代品質で一貫して上回り、純粋なARデコーディングよりも大幅にスピードアップし、わずかな品質のギャップしか持たないことがわかった。
関連論文リスト
- AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling [60.04959047453115]
AURORA-LMは、デオード可能なテキスト表現の構築と、その分布のモデル化を分離した連続ラテント言語モデルである。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
論文 参考訳(メタデータ) (2026-08-03T17:59:50Z) - How to Train Your Latent Diffusion Language Model Jointly With the Latent Space [76.9057986588963]
遅延拡散モデルは、非自己回帰テキスト生成のための離散拡散の魅力的な代替手段を提供する。
本稿では、潜在エンコーダ、拡散モデル、デコーダを共同で訓練する潜在拡散言語モデル(LDLM)を提案する。
OpenWebTextとLM1Bでは、LDLMは既存の離散および連続拡散言語モデルよりも優れた生成性能を達成する。
論文 参考訳(メタデータ) (2026-05-08T16:05:19Z) - Locally Coherent Parallel Decoding in Diffusion Language Models [6.620088179445404]
拡散言語モデル(DLM)は、線形生成遅延と双方向機能を提供する。
標準DLMは条件付き境界分布とは独立してトークンをサンプリングする。
並列サンプリングを局所的依存モデルと照合する手法であるCoDiLAを紹介する。
論文 参考訳(メタデータ) (2026-03-03T09:56:53Z) - CRoCoDiL: Continuous and Robust Conditioned Diffusion for Language [21.764828393078886]
Masked Diffusion Models (MDMs) は自己回帰生成の効率的な非因果的代替手段を提供する。
拡散過程を連続的な文レベルの意味空間にシフトすることで、これらの制限に対処する。
論文 参考訳(メタデータ) (2026-03-02T12:50:55Z) - Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models [58.946955321428845]
本研究は自己回帰型モンテカルロ(SMC)を提示する。
提案アルゴリズムは,既存のMDLMのほとんどが信頼性に基づくサンプリング戦略に依存している点に起因している。
粒子重み付けのための自己回帰信号として軌道レベルの信頼性を導入する。
論文 参考訳(メタデータ) (2026-02-02T09:21:45Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Accelerating Diffusion LLMs via Adaptive Parallel Decoding [60.407727995313074]
並列にサンプリングされたトークンの数を動的に調整する新しい手法であるアダプティブ並列復号法(APD)を導入する。
APDは、ダウンストリームベンチマークで最小限の品質劣化を伴って、非常に高いスループットを提供する。
論文 参考訳(メタデータ) (2025-05-31T06:10:10Z) - Energy-Based Diffusion Language Models for Text Generation [126.23425882687195]
エネルギーベース拡散言語モデル(Energy-based Diffusion Language Model, EDLM)は、拡散ステップごとに全シーケンスレベルで動作するエネルギーベースモデルである。
我々のフレームワークは、既存の拡散モデルよりも1.3$times$のサンプリングスピードアップを提供する。
論文 参考訳(メタデータ) (2024-10-28T17:25:56Z) - Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling [47.82616476928464]
仮面拡散モデル (MDM) は離散データの生成モデルとして人気がある。
我々はMDMのトレーニングとサンプリングの両方が理論的に時間変数から解放されていることを示す。
一般に使用されている32ビット浮動小数点精度においても,まず基礎となる数値問題を同定した。
論文 参考訳(メタデータ) (2024-09-04T17:48:19Z) - Denoising Diffusion Implicit Models [117.03720513930335]
DDPMと同様の訓練手順を施した反復的暗黙的確率モデルに対して,拡散暗黙モデル(DDIM)を提案する。
DDIMsは、DDPMsと比較して、壁面時間で10倍から50倍高速な高品質のサンプルを作成できる。
論文 参考訳(メタデータ) (2020-10-06T06:15:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。