論文の概要: Large Language Continuous Diffusion Models
- arxiv url: http://arxiv.org/abs/2610.02665v1
- Date: Fri, 02 Oct 2026 01:34:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.158058
- Title: Large Language Continuous Diffusion Models
- Title(参考訳): 大規模言語連続拡散モデル
- Abstract要約: ステアブルで低次元のODE/SDE潜在軌道上に構築された最初の大規模(3B/8B)連続dLMであるSigmaについて述べる。
埋め込み空間のステアリングは、品質と多様性のトレードオフを効果的に支配し、強力なpass@kパフォーマンスをもたらす。
- 参考スコア(独自算出の注目度): 91.20829802998554
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite the success of discrete diffusion language models (dLMs) for fast parallel decoding, their non-smooth, high-dimensional space hinders trajectory steering for reasoning and inference acceleration. To overcome this, we present Sigma, the first large-scale (3B/8B) continuous dLM built on steerable, low-dimensional ODE/SDE latent trajectories. Trained blockwise via likelihood optimization, Sigma jointly denoises Gaussian-corrupted token embeddings while learning an optimal embedding geometry. To accelerate training, Sigma leverages pre-trained weights from autoregressive (AR) models for warm-starting. During inference, we identify classifier-free guidance and score temperature as essential for high-fidelity reasoning and coding. Across comprehensive math reasoning and coding evaluations against state-of-the-art discrete counterparts (masked dLMs and AR baselines), Sigma achieves competitive performance with discrete models on standard benchmarks (e.g., GSM8K, Minerva, HumanEval, MBPP) after pre-training and on challenging reasoning tasks (e.g., MATH-500, AIME) after supervised fine-tuning. Beyond performance parity, we uncover key structural properties unique to continuous dLMs: (i) embedding-space steering effectively governs the quality-diversity trade-off, yielding strong pass@k performance and (ii) continuous trajectories enable graceful degradation for low NFEs and efficient distillation. These establish continuous dLMs as a promising paradigm for efficient language generation.
- Abstract(参考訳): 高速並列復号化のための離散拡散言語モデル (dLM) の成功にもかかわらず、その非滑らかで高次元空間は推論と推論の加速のために軌道ステアリングを妨げている。
そこで我々は, ステアブルで低次元のODE/SDE潜在軌道上に構築された最初の大規模(3B/8B)連続DLMであるSigmaを提案する。
確率最適化によってブロックワイドに訓練されたシグマは、最適埋め込み幾何学を学習しながら、ガウス崩壊したトークンの埋め込みを共同で認知する。
トレーニングを加速するために、Sigmaは自己回帰(AR)モデルからトレーニング済みの重量を活用してウォームスタートを行う。
推論では,高忠実度推論と符号化に不可欠な分類器フリーガイダンスとスコア温度を同定する。
Sigmaは、最先端の離散的(masked dLMsとARベースライン)に対する総合的な数学推論とコーディング評価を網羅し、事前トレーニング後の標準ベンチマーク(例えば、GSM8K、Minerva、HumanEval、MBPP)上の離散モデルと、監督された微調整後の挑戦的推論タスク(例えば、MATH-500、AIME)との競合性能を達成する。
性能のパリティを超えて、連続dLMに特有の重要な構造特性を明らかにする。
i)埋め込み空間のステアリングは、品質多様性のトレードオフを効果的に支配し、強力なpass@kパフォーマンスをもたらします。
(II) 連続軌道は低NFEの優雅な分解と効率的な蒸留を可能にする。
これらは、効率的な言語生成のための有望なパラダイムとして、連続的なdLMを確立する。
関連論文リスト
- Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - Formalizing the Sampling Design Space of Diffusion-Based Generative Models via Adaptive Solvers and Wasserstein-Bounded Timesteps [4.397130429878499]
拡散に基づく生成モデルは、様々な領域で顕著な性能を達成してきたが、その実践的展開は、しばしば高いサンプリングコストによって制限されている。
本稿では,数値解法を拡散軌道の固有特性と整合する原理的枠組みであるSDMを提案する。
ODE のダイナミクスを解析することにより,低次解法は初期高雑音で十分であり,高次解法は後段の非線形性の増加に対応するために段階的に展開可能であることを示す。
論文 参考訳(メタデータ) (2026-02-13T05:02:07Z) - Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models [58.946955321428845]
本研究は自己回帰型モンテカルロ(SMC)を提示する。
提案アルゴリズムは,既存のMDLMのほとんどが信頼性に基づくサンプリング戦略に依存している点に起因している。
粒子重み付けのための自己回帰信号として軌道レベルの信頼性を導入する。
論文 参考訳(メタデータ) (2026-02-02T09:21:45Z) - Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning [16.244366307890832]
textbfDeepLatent Reasoning(DLR)を提案する。
このフレームワークは、試行錯誤コストを、高価なトークンレベルのフルシーケンス生成から連続潜在多様体へシフトさせる。
実験により、DLRはより安定した訓練収束を実現し、より長い水平推論チェーンをサポートし、推論能力の持続的な蓄積を促進することが示されている。
論文 参考訳(メタデータ) (2026-01-24T03:18:22Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Will Pre-Training Ever End? A First Step Toward Next-Generation Foundation MLLMs via Self-Improving Systematic Cognition [89.50068130832635]
自己改善認知 (SIcog) は、マルチモーダル知識によって次世代のMLLMを構築するための自己学習フレームワークである。
ステップバイステップの視覚的理解のためのChain-of-Descriptionを提案し、詳細なマルチモーダル推論をサポートするために構造化されたChain-of-Thought(CoT)推論を統合する。
実験は、マルチモーダル認知を増強したMLLMの開発におけるSIcogの有効性を示す。
論文 参考訳(メタデータ) (2025-03-16T00:25:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。