論文の概要: Multi-Mask Diffusion Language Models for Few-Step Generation
- arxiv url: http://arxiv.org/abs/2607.19686v2
- Date: Fri, 24 Jul 2026 06:22:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.908068
- Title: Multi-Mask Diffusion Language Models for Few-Step Generation
- Title(参考訳): 数ステップ生成のためのマルチマスク拡散言語モデル
- Authors: Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying,
- Abstract要約: 仮面拡散モデル(MDMs)は、言語生成の有望なファミリーである。
均一状態拡散に基づく最近の数段階の代替案は、この縮退を避けている。
マスク構造を数ステップで生成するマルチマスク拡散モデル(MultiMDM)を提案する。
- 参考スコア(独自算出の注目度): 67.14463385328135
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Masked diffusion models (MDMs) are a promising family of language generators, but achieving high-quality few-step generation remains challenging. In MDMs, all forward trajectories collapse to a single fully masked state, leaving no terminal entropy for consistency-style few-step generation. While recent few-step alternatives based on uniform-state diffusion avoid this degeneracy, it becomes harder to distinguish clean tokens from noise than MDMs, which usually harms modeling quality and training efficiency. In this work, we propose a multi-mask diffusion model (MultiMDM) that preserves the masking structure towards few-step generation. In the forward process, each clean token is first pushed towards a designated mask and then gradually mixes over the mask set. As a result, the backward process has a drafting capability by predicting a designated mask before refining to a clean token. We derive a closed-form ELBO training objective for MultiMDM that supports continual training from pretrained MDMs. In addition, we formulate a purely discrete-state consistency distillation scheme, with a shared-Gumbel coupling to reduce pathwise entropy. Experiments on pretraining and distillation show that MultiMDM provides an effective foundation for principled few-step generation.
- Abstract(参考訳): 仮面拡散モデル(MDMs)は言語生成の有望なファミリーであるが、高品質な数ステップ生成を実現することは依然として困難である。
MDMでは、全ての前方軌道は1つの完全にマスクされた状態に崩壊し、整合性のある数ステップ生成のための終端エントロピーは残らない。
最近の一様拡散に基づく数段階の代替は、この縮退を避けるが、清潔なトークンとノイズを区別することは、通常、モデリング品質とトレーニング効率を損なうMDMよりも難しくなる。
本研究では,マスク構造を数ステップで生成するためのマルチマスク拡散モデル(MultiMDM)を提案する。
前処理では、各クリーントークンが最初に指定されたマスクに向かってプッシュされ、その後徐々にマスクセットに混合される。
その結果、クリーントークンに精錬する前に指定マスクを予測することにより、後方処理の起草能力を有する。
予め訓練したMDMからの連続的なトレーニングを支援するマルチMDMのための閉鎖型ELBOトレーニング目標を導出する。
さらに,経路エントロピーを低減するために,共有ガンベルカップリングを用いて純粋に離散状態整合蒸留法を定式化する。
プレトレーニングおよび蒸留実験により、MultiMDMは原則的な数ステップ生成に有効な基礎を提供することが示された。
関連論文リスト
- Infinite Mask Diffusion for Few-Step Distillation [16.340935269530842]
Masked Diffusion Models (MDM) は、言語モデリングにおける自己回帰モデルに代わる有望な代替品として登場した。
MDMの利点を継承しながら理論的境界を緩和するための無限マスク拡散モデル(IMDM)を提案する。
IMDM は LM1B と OpenWebText の小さなステップ数で既存の数ステップの蒸留法を超越している。
論文 参考訳(メタデータ) (2026-05-11T13:07:03Z) - On the Trainability of Masked Diffusion Language Models via Blockwise Locality [58.92209096047332]
マスク付き拡散言語モデル (MDMs) は、最近、標準自己回帰型大言語モデル (AR-LLMs) に代わる有望な代替品として登場した。
ブロックワイズMDMを解析し,AR-LLMと比較し,構造生成の異なる側面を強調する3つの制御タスクについて検討した。
標準ランダムマスキングMDMは線形回帰を確実に学習できず、グラフパスフィニングにおいて高分散トレーニングダイナミクスを示し、スドクではAR-LLMよりも優れていた。
論文 参考訳(メタデータ) (2026-04-27T17:44:26Z) - Learn from Your Mistakes: Self-Correcting Masked Diffusion Models [31.536464269884103]
マスク付き拡散モデル(MDM)は自己回帰モデルに代わる有望な代替品として登場している。
本研究では、モデルにアンマキングと修正の両方を行うよう訓練するフレームワークを提案する。
トレーニングとサンプリングの手法をProSeCo(Progressive Self-Correction)と名付けました。
論文 参考訳(メタデータ) (2026-02-12T05:17:31Z) - Stop Training for the Worst: Progressive Unmasking Accelerates Masked Diffusion Training [21.78753228511593]
Masked Diffusion Models (MDMs) は離散空間における生成モデリングのための有望なアプローチとして登場した。
MDMは指数関数的に大きなマスキングパターンのセットでトレーニングする。
本稿では,プログレッシブ・アンマスキング(PUMA)を提案する。プログレッシブ・アンマスキング(PUMA)は,トレーニング時間と推論時間のマスキングパターンを調整したフォワード・マスキングプロセスの簡単な修正である。
論文 参考訳(メタデータ) (2026-02-10T21:42:50Z) - Unifying Masked Diffusion Models with Various Generation Orders and Beyond [56.70289720766803]
仮面拡散モデル(MDM)は、言語生成のための自己回帰モデル(ARM)の潜在的な代替品である。
広範な拡散生成過程のための秩序表現型マスク拡散モデル(OeMDM)を提案する。
生成順序と拡散バックボーンを共同で学習する学習順マスク拡散モデル(LoMDM)を導入する。
論文 参考訳(メタデータ) (2026-02-02T13:54:32Z) - Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model [74.99242687133408]
Masked Diffusion Models (MDMs) は、視覚、言語、モーダル・ジェネレーションにまたがる有望な可能性を示している。
本稿では,MDM生成をMDP(Markov Decision Process)として再構成し,モデルと推論スケジュールを併用するCo-GRPOを提案する。
論文 参考訳(メタデータ) (2025-12-25T12:06:04Z) - Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models [63.50827603618498]
提案するSparse-LaViDaは,MDMサンプリングを高速化するために,各推論ステップで不要なマスク付きトークンをトランケートするモデリングフレームワークである。
最先端の統一MDM LaViDa-Oをベースに構築されたSparse-LaViDaは、さまざまなタスクで最大2倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-12-16T02:06:06Z) - Remasking Discrete Diffusion Models with Inference-Time Scaling [21.362017006523086]
マスク付き拡散モデルに適用可能な手法であるリマスキー拡散モデル(ReMDM)を原則的に導入する。
最も興味深いことに、ReMDMは推論時間計算スケーリングの形で離散拡散を許容する。
論文 参考訳(メタデータ) (2025-03-01T02:37:51Z) - Improving Self-supervised Pre-training via a Fully-Explored Masked
Language Model [57.77981008219654]
Masked Language Model (MLM)フレームワークは、自己教師型言語事前学習に広く採用されている。
そこで本研究では,テキストシーケンスを複数の非重複セグメントに分割するマスキング手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T21:28:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。