論文の概要: Improved Large Language Diffusion Models
- arxiv url: http://arxiv.org/abs/2606.25331v1
- Date: Wed, 24 Jun 2026 02:51:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.198074
- Title: Improved Large Language Diffusion Models
- Title(参考訳): 大規模言語拡散モデルの改良
- Authors: Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen,
- Abstract要約: 8Bマスク付き拡散言語モデルである EmphiLLaDA について検討した。
iLLaDAは、事前トレーニングと教師付き微調整(SFT)、12Tトークンへの事前トレーニング、および12エポックのための25Bトークン命令コーパスの微調整を通じて、マスク付き拡散目標を維持している。
- 参考スコア(独自算出の注目度): 115.83169414681767
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern large language models are predominantly trained with autoregressive factorization and causal attention. We present \emph{iLLaDA}, an 8B masked diffusion language model trained from scratch with fully bidirectional attention. iLLaDA keeps the masked diffusion objective throughout pre-training and supervised fine-tuning (SFT), scaling pre-training to 12T tokens and fine-tuning on a 25B-token instruction corpus for 12 epochs. We further use variable-length generation for efficiency and introduce confidence-based scoring for multiple-choice evaluation. Compared with LLaDA, iLLaDA improves broadly across general, mathematical, and code benchmarks; for example, iLLaDA-Base improves by 21.6 points on BBH and 14.9 points on ARC-Challenge, while iLLaDA-Instruct improves by 14.5 points on MATH and 16.5 points on HumanEval. Despite its non-autoregressive training, iLLaDA also remains competitive with Qwen2.5 7B on several benchmarks. These results show that fully bidirectional diffusion training from scratch is a competitive path toward strong language models. Model weights and codes: https://github.com/ML-GSAI/LLaDA.
- Abstract(参考訳): 現代の大きな言語モデルは、主に自己回帰的因子化と因果的注意で訓練されている。
そこで本研究では,ゼロから学習した8Bマスク付き拡散言語モデルである \emph{iLLaDA} について述べる。
iLLaDAは、事前トレーニングと教師付き微調整(SFT)、12Tトークンへの事前トレーニング、および12エポックのための25Bトークン命令コーパスの微調整を通じて、マスク付き拡散目標を維持している。
さらに、可変長生成を効率に利用し、複数選択評価のための信頼度に基づくスコアリングを導入する。
例えば、iLLaDA-BaseはBBHでは21.6点、ARC-Challengeでは14.9点、iLLaDA-InstructはMATHでは14.5点、HumanEvalでは16.5点である。
非自己回帰トレーニングにもかかわらず、iLLaDAはいくつかのベンチマークでQwen2.5 7Bと競合している。
これらの結果から,スクラッチからの完全双方向拡散訓練は,強言語モデルへの競争経路であることが示唆された。
モデルウェイトとコード:https://github.com/ML-GSAI/LLaDA。
関連論文リスト
- ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping [26.560813832545563]
拡散大言語モデル(dLLMs)は、自己回帰モデル(ARMs)に代わる有望な選択肢として浮上している。
我々は、dLLMの生成ダイナミクスを分析し、キー、値、隠された状態を含む中間表現が連続するイテレーション間でのみ微妙に変化することを発見した。
我々は,dLLMのトレーニング不要な推論高速化フレームワークである textbfES-dLLM を提案する。
論文 参考訳(メタデータ) (2026-03-10T14:31:19Z) - Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct [24.431216450821463]
DiDi-Instructは、高速世代のために数ステップの学生を蒸留するトレーニングベースの方法である。
OpenWebText上でDiDi-Instructは62.2 (8 NFEs)から18.4 (128 NFEs)にパープレキシティを実現する
これらの利得には無視できるエントロピー損失(約1%)が伴い、競合するdLLM蒸留法と比較して、追加のトレーニングウォールタイム時間を20時間以上短縮する。
論文 参考訳(メタデータ) (2025-09-29T16:55:44Z) - MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models [28.79185891706149]
拡散言語モデルは、トレーニングと推論の主な相違に悩まされる。
本稿では,マルコフ特性拡散を利用するためのMasked Diffusion Policy Optimization (MDPO)を提案する。
本研究は,MDLMの事前学習と推測の相違を調査するための大きな可能性を見出した。
論文 参考訳(メタデータ) (2025-08-18T17:58:13Z) - TL;DR: Too Long, Do Re-weighting for Efficient LLM Reasoning Compression [55.37723860832064]
高度なデータアノテーションに依存しない動的比に基づくトレーニングパイプラインを提案する。
我々は、DeepSeek-R1-Distill-7BとDeepSeek-R1-Distill-14Bのモデルと、様々な難易度を持つ様々なベンチマークのモデルに対するアプローチを検証する。
論文 参考訳(メタデータ) (2025-06-03T09:23:41Z) - LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models [95.77351099118323]
Masked Diffusion Models (MDM) は言語モデリングにおいて有望なパラダイムである。
この課題は、優先最適化に必要なエビデンス・ロウアー・バウンド(ELBO)に基づく推定値の高分散から生じる。
本稿では,ELBO推定器の偏差を公式に解析し,優先最適化勾配の偏差と偏差を導出するフレームワークであるVRPOを提案する。
論文 参考訳(メタデータ) (2025-05-25T16:36:20Z) - Large Language Diffusion Models [93.26422905620008]
大規模言語モデル(LLM)は自己回帰モデル(ARM)に依存していると考えられている。
我々は,事前学習および教師付き微調整パラダイムの下で,ゼロから学習した拡散モデルであるLLaDAを紹介する。
一般的なタスクや数学、コードなどに関する広範なベンチマークを通じて、LLaDAは強力なスケーラビリティを示し、自己構築されたARMベースラインと互換性のあるパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-02-14T08:23:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。