論文の概要: Reducing Pretraining-Generation Mismatch in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2608.09424v1
- Date: Mon, 10 Aug 2026 10:52:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.213129
- Title: Reducing Pretraining-Generation Mismatch in Diffusion Language Models
- Title(参考訳): 拡散言語モデルにおける事前学習ミスマッチの低減
- Authors: Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li,
- Abstract要約: 自動回帰言語モデルは、トレーニングと使用を整合させる: クリーンプロンプトの生成条件とトレーニングは、クリーン左のコンテキストから将来のトークンを予測する。
我々は,ARプレフィックスと非シフト接尾辞を併用した事前学習目的であるPCD(Prefix-Conditioned Diffusion)を提案する。
- 参考スコア(独自算出の注目度): 40.976447974457734
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive language models align training and use: generation conditions on a clean prompt, and training predicts future tokens from clean left context. Diffusion language models offer parallel denoising, but native dLLM pretraining can randomly corrupt prompt and continuation tokens together, weakening the clean-prefix interface needed for prompt-conditioned generation. We identify this mismatch for prompt continuation and propose PCD (Prefix-Conditioned Diffusion), a pretraining objective that combines AR prefix supervision with no-shift suffix denoising. At the training-objective level, PCD changes the attention mask, corruption mask, and label construction in continued pretraining; it does not require an autoregressive decoder, verifier, or new inference mode. By supervising the clean-prefix side autoregressively and applying diffusion only to the unknown continuation, PCD makes the local training interface resemble how block-diffusion models are queried at evaluation time. We further separate intra-sample prefix conditioning from inter-sample objective mixing, allowing us to identify the local alignment signal separately from the optional batch-level mixing knob. Across LLaDA2-Mini and Qwen-1.7B backbones, PCD consistently improves over same-family native dLLM stable baselines, reaching a 4.2% relative gain on the main LLaDA2-Mini six-benchmark average (+2.56 points) and a 14.2% relative gain in the primary Qwen mechanism comparison (+4.86 points). These results suggest that aligning the pretraining context distribution with prompt-conditioned generation can recover a measurable part of the dLLM continuation gap without changing inference.
- Abstract(参考訳): 自動回帰言語モデルは、トレーニングと使用を整合させる: クリーンプロンプトの生成条件とトレーニングは、クリーン左のコンテキストから将来のトークンを予測する。
拡散言語モデルは並列化を提供するが、ネイティブなdLLMプリトレーニングはプロンプトと継続トークンをランダムに破損させ、プロンプト条件付き生成に必要なクリーンプレフィックスインターフェースを弱める。
我々は,このミスマッチを即時継続のために同定し,ARプレフィックスの監督と非シフト接尾辞を併用した事前学習目的であるPCD(Prefix-Conditioned Diffusion)を提案する。
トレーニング対象レベルでは、PCDは注意マスク、汚職マスク、ラベルの構成を継続事前訓練で変更し、自動回帰デコーダ、検証器、新しい推論モードを必要としない。
クリーンプレフィックス側を自己回帰的に監視し、未知の継続にのみ拡散を適用することにより、PCDはローカルトレーニングインタフェースを、評価時にブロック拡散モデルがどのようにクエリされるかに似たものにする。
さらに,サンプル間目標混合からサンプル内プレフィックス条件を分離し,任意のバッチレベル混合ノブと独立に局所アライメント信号を特定する。
LLaDA2-MiniとQwen-1.7Bのバックボーン全体で、PCDは安定なdLLMベースラインを一貫して改善し、LLaDA2-Miniの6ベンチマーク平均(+2.56ポイント)では4.2%、Qwenのメカニズムの比較では14.2%の相対的なゲイン(+4.86ポイント)に達した。
これらの結果から,事前学習した文脈分布を条件付き生成と整合させることで,推論を変化させることなく,dLLM継続ギャップの可測部分を回復できる可能性が示唆された。
関連論文リスト
- Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time [16.04233421396159]
AnchorSteerは、きめ細かい制御を行う、トレーニング不要のフレームワークである。
textbfAnchorSteerとそのコンポーネント。
GenEvalとT2I-CompBench++の実験は、AnchorSteerがテキストのアライメントにおいて既存のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-07-29T09:08:57Z) - UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective [17.48959208263029]
本稿では,事前学習したGPT2チェックポイントを均一な雑音拡散に適応させるための,簡易な事前学習手法を提案する。
我々の研究は、サンプリング予算の増加に伴い、生成的複雑度(GenPPL)とユニグラムエントロピーのトレードオフを着実に改善する。
両スケールで比較した拡散モデルの中で,WinoGrande,SIQA,BBHの精度が最も高い。
論文 参考訳(メタデータ) (2026-07-27T14:40:26Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Uniform Diffusion Models Revisited: Leave-One-Out Denoiser and Absorbing State Reformulation [72.05592785529404]
UDMの標準プラグインブリッジパラメタライゼーションは,後側頭蓋に最適化されないことを示す。
また,UDM関節法をマスク拡散様サンプリング操作に分解して保存する均一拡散の吸収状態再構成も導入した。
論文 参考訳(メタデータ) (2026-05-21T17:27:19Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - EmoLoom-2B: Fast Base-Model Screening for Emotion Classification and VAD with Lexicon-Weak Supervision and KV-Off Evaluation [14.702916401734916]
EmoLoom-2Bは2Bパラメータ以下の小さな言語モデルを、感情分類とValence-Arousal-Dominance予測のための高速なスクリーニング候補に変換する。
プロトコルに忠実で公平な評価を保証するため,単一入力出力契約の下でデータのロード,トレーニング,推論を統一する。
論文 参考訳(メタデータ) (2026-01-03T08:25:58Z) - EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients [6.736735746633275]
拡散に基づく大規模言語モデル (dLLMs) は反復的妄想を通じてトークン生成を洗練させるが、全てのステップが完了する前に答えは安定することが多い。
本稿では,トレーニング時推論に対する十分な推論安定性が検出された場合に,適応的にデノイングを停止する推論時基準であるEDITを提案する。
論文 参考訳(メタデータ) (2025-11-29T23:47:47Z) - DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation [68.19756761027351]
拡散大言語モデル(dLLM)は自己回帰(AR)モデルの魅力的な代替品である。
本研究は,それらの認知過程と強化学習手法について考察する。
我々の研究は、dLLM生成のメカニズムについて深い洞察を与え、効果的な拡散ネイティブなRLトレーニングフレームワークを提供します。
論文 参考訳(メタデータ) (2025-06-25T17:35:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。