論文の概要: Parallelism, critical windows, and separations among diffusion language models
- arxiv url: http://arxiv.org/abs/2609.20539v1
- Date: Thu, 17 Sep 2026 15:10:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.335163
- Title: Parallelism, critical windows, and separations among diffusion language models
- Title(参考訳): 拡散言語モデルにおける並列性、臨界窓、分離
- Abstract要約: 拡散大言語モデル(dLLM)の一般的な販売ポイントは、並列処理の能力である。
マスクから均一からガウス拡散まで、dLLMの多くの競合するパラダイムの中で、これらの異なる提案が並列性においてどのように比較されるかの原理的理解は依然として限られている。
均一およびガウス拡散は、基礎となる分布の双対の総相関とスケールする多くの前方通過路、すなわち文脈長よりもはるかに小さい内在的複雑性の尺度でサンプリングすることができる。
- 参考スコア(独自算出の注目度): 13.84229509611525
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A popular selling point of diffusion large language models (dLLMs) is their capacity for parallelism: the ability to generate sequences of text far more efficiently than autoregressive models, which require one forward pass per token. Yet among the many competing paradigms for dLLMs, from masked to uniform to Gaussian diffusion, principled understanding of how these different proposals compare in parallelism remains limited. In this work, we initiate a fine-grained comparison of the capacity for parallelism among these three leading approaches and prove the following: - Uniform and Gaussian diffusion can sample in a number of forward passes which scales with the dual total correlation of the underlying distribution, a measure of intrinsic complexity which can be much smaller than the context length. Previously, it was only known how to achieve this using masked diffusion. - For a certain family of random empirical measures, we show that $\widetildeΘ(\sqrt{d})$ forward passes are necessary and sufficient to sample using uniform or Gaussian diffusion, yet there exist approximate score oracles for which $\widetildeΩ(d)$ forward passes are needed for masked diffusion. This establishes the first provable separation in parallelism between the three prevailing dLLM paradigms. Contrary to popular intuition that masked diffusions are harder to parallelize because they must commit to token values, the latter separation instead comes from the fact that the critical windows in masked diffusion sampling are asymptotically narrower than those in uniform and Gaussian diffusion sampling.
- Abstract(参考訳): 拡散大言語モデル(dLLMs)の一般的な販売ポイントは、パラレル化の能力である: トークン毎に1つのフォワードパスを必要とする自動回帰モデルよりもはるかに効率的にテキストのシーケンスを生成する能力である。
しかし、マスクから均一からガウス拡散まで、dLLMの多くの競合するパラダイムの中で、これらの異なる提案が並列性においてどのように比較されるかの原理的理解は依然として限られている。
本研究では,これら3つの主要なアプローチの並列性のキャパシティの微妙な比較を開始し,以下のことを証明した。 - 均一およびガウス拡散は,基礎となる分布の2つの全相関でスケールする多くの前方通過路において,文脈長よりもはるかに小さい固有複雑性の測定値である。
以前は、マスク拡散を用いてこれを実現する方法しか知られていなかった。
- ランダムな経験的測度のある族に対して、$\widetilde(\sqrt{d})$ forward pass が一様あるいはガウス拡散を用いてサンプリングするのに十分必要であり、しかし、$\widetildeΩ(d)$ forward pass がマスク拡散のために必要であるような近似的なスコアオーラクルが存在することを示す。
これにより、3つの主要なdLLMパラダイム間の並列性の最初の証明可能な分離が確立される。
トークン値にコミットしなければならないため、マスク拡散が並列化するのが難しいという一般的な直観とは対照的に、後者の分離はマスク拡散サンプリングの臨界窓が均一およびガウス拡散サンプリングの窓よりも漸近的に狭いという事実に由来する。
関連論文リスト
- Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Scaling Beyond Masked Diffusion Language Models [18.68471174706656]
本稿では、一様状態と補間離散拡散法の最初のスケーリング法則について述べる。
単純なクロスエントロピーで学習すると,Masked拡散モデルによりFLOPs効率が約12%向上することを示す。
論文 参考訳(メタデータ) (2026-02-16T18:54:47Z) - A Unification of Discrete, Gaussian, and Simplicial Diffusion [32.86558714543654]
Wright-Fisher simplicial diffusion はより安定であり、条件付きDNA 生成における従来のsimplicial diffusion モデルよりも優れていることを示す。
また、個々のドメインでトレーニングされたモデルと競合する複数のドメインでモデルを一度にトレーニングできることも示しています。
論文 参考訳(メタデータ) (2025-12-17T19:39:33Z) - Optimal Inference Schedules for Masked Diffusion Models [16.774584258255768]
マスク付き拡散モデル(MDM)は、順番に多くのトークンを同時に同時にサンプリングすることができる。
分布の事前知識が強くなければ、一般にそれと競合することは不可能であることを示す。
論文 参考訳(メタデータ) (2025-11-06T18:38:24Z) - Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner [66.86440230599656]
拡散言語モデルは必ずしも離散空間にある必要はないと主張する。
特に、連続拡散モデルが離散拡散やループ変換器よりも強い表現性を持つことを示す。
本稿では,連続表現空間と離散トークン空間の結合に関する共同多モード拡散過程を定義する共進化連続拡散法(CCDD)を提案する。
論文 参考訳(メタデータ) (2025-10-03T17:44:41Z) - On the Complexity Theory of Masked Discrete Diffusion: From $\mathrm{poly}(1/ε)$ to Nearly $ε$-Free [49.34727933066799]
マスク付き離散拡散(マスク付き離散拡散)は、トークンが識別される前に特別なマスクシンボルによって劣化するテキスト生成のフレキシブルパラダイムである。
その結果,Eulerサンプルは,$tildeO(d2epsilon-3/2)$離散スコア評価で,総変量(TV)の$epsilon$-精度を達成できることが判明した。
そこで我々は,有界スコアの仮定を取り除き,偏りのない離散スコア近似を保ったMask-Aware Truncated Uniformization (MATU) アプローチを提案する。
論文 参考訳(メタデータ) (2025-09-26T03:50:17Z) - Generalized Interpolating Discrete Diffusion [65.74168524007484]
仮面拡散はその単純さと有効性のために一般的な選択である。
ノイズ発生過程の設計において、より柔軟性の高い離散拡散(GIDD)を補間する新しいファミリを一般化する。
GIDDの柔軟性をエクスプロイトし、マスクと均一ノイズを組み合わせたハイブリッドアプローチを探索し、サンプル品質を向上する。
論文 参考訳(メタデータ) (2025-03-06T14:30:55Z) - Self-Refining Diffusion Samplers: Enabling Parallelization via Parareal Iterations [53.180374639531145]
自己精製拡散サンプリング(SRDS)は、サンプル品質を維持し、追加の並列計算コストでレイテンシを向上させることができる。
微分方程式の並列時間積分法であるPararealアルゴリズムから着想を得た。
論文 参考訳(メタデータ) (2024-12-11T11:08:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。