論文の概要: AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
- arxiv url: http://arxiv.org/abs/2608.02602v1
- Date: Mon, 03 Aug 2026 17:59:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.75218
- Title: AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
- Title(参考訳): AURORA-LM:連続遅延拡散言語モデリングのための統一表現の自動符号化
- Authors: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si,
- Abstract要約: AURORA-LMは、デオード可能なテキスト表現の構築と、その分布のモデル化を分離した連続ラテント言語モデルである。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
- 参考スコア(独自算出の注目度): 60.04959047453115
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language remains an outlier in generative modeling: while images, video, and audio are increasingly modeled in continuous latent spaces, text generation still relies predominantly on discrete tokens. Existing continuous language models either inherit embedding spaces not designed for joint generation and decoding, or compress autoencoded latents to ease diffusion, sacrificing token-level fidelity. Instead of simplifying the representation to suit the generative model, we preserve a high-capacity, decodable text latent and design the diffusion model to learn its distribution directly. We introduce AURORA-LM, a continuous-latent diffusion language model that separates the construction of a decodable text representation from the modeling of its distribution. A Query-based Encoder-Decoder organizes text into a high-capacity, prefix-aligned latent sequence, and a Block-causal Diffusion Transformer learns its distribution through flow matching, generating blocks left to right while denoising positions within each block in parallel. Because such a latent is harder for diffusion to model, AURORA-LM restricts only the noisy-input pathway while retaining the full clean-latent prediction target, accommodating full-width latents without reducing decoder-facing capacity. We further calibrate the noise-level distribution to the latent width, and introduce self-trajectory consistency to bridge independently sampled training noise and iterative denoising at inference. AURORA-LM achieves the strongest performance among evaluated continuous and diffusion-based language models on OpenWebText free generation and XSum summarization. Scaling to 1B parameters with about 1500 EFLOPs of total compute yields further gains, surpassing a larger publicly released latent-diffusion language model under a matched evaluation protocol. All experiments are conducted on Ascend NPUs.
- Abstract(参考訳): 画像、ビデオ、オーディオは連続的な潜在空間でますますモデル化されているが、テキスト生成は依然として離散トークンに大きく依存している。
既存の連続言語モデルは、共同生成や復号のために設計されていない埋め込み空間を継承するか、あるいは拡散を緩和し、トークンレベルの忠実さを犠牲にするために自動符号化されたラテントを圧縮する。
生成モデルに適合する表現を単純化する代わりに、高容量で遅延可能なテキストを保存し、拡散モデルを設計し、その分布を直接学習する。
AURORA-LMは,デオード可能なテキスト表現の構築と,その分布のモデル化を分離した連続遅延拡散言語モデルである。
クエリベースのEncoder-Decoderは、テキストを高容量、プレフィックス整列潜在シーケンスに整理し、Block-causal Diffusion Transformerはフローマッチングを通じてその分布を学習し、各ブロック内の位置を並列に復調しながらブロックを左から右に生成する。
このような潜伏剤はモデルへの拡散が難しいため、AURORA-LMは、完全クリーン遅延予測ターゲットを維持しながらノイズ入力経路のみを制限し、デコーダ対応容量を減少させることなく、全幅潜伏剤を収容する。
さらに遅延幅への雑音レベルの分布を校正し、独立にサンプリングしたトレーニングノイズと推論時の反復的雑音をブリッジするために自己軌跡の整合性を導入する。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
計算総収率の約1500 EFLOPで1Bパラメータにスケーリングすると、さらに利益が得られ、マッチした評価プロトコルの下で、より大きな公開な潜在拡散言語モデルを上回ることになる。
すべての実験はAscend NPU上で行われる。
関連論文リスト
- How to Train Your Latent Diffusion Language Model Jointly With the Latent Space [76.9057986588963]
遅延拡散モデルは、非自己回帰テキスト生成のための離散拡散の魅力的な代替手段を提供する。
本稿では、潜在エンコーダ、拡散モデル、デコーダを共同で訓練する潜在拡散言語モデル(LDLM)を提案する。
OpenWebTextとLM1Bでは、LDLMは既存の離散および連続拡散言語モデルよりも優れた生成性能を達成する。
論文 参考訳(メタデータ) (2026-05-08T16:05:19Z) - TextLDM: Language Modeling with Continuous Latent Diffusion [89.69255520673248]
拡散変換器(DiT)は、VAEラテント空間におけるフローマッチングで訓練され、画像やビデオ間で統一された視覚生成を行う。
最小限のアーキテクチャ変更で視覚的潜伏拡散のレシピをテキスト生成に転送するTextLDMを提案する。
論文 参考訳(メタデータ) (2026-05-08T13:54:34Z) - CoDAR: Continuous Diffusion Language Models are More Powerful Than You Think [17.27394520177311]
CoDARは、強いコンテキスト条件の離散化学習をしながら、埋め込み空間における拡散を完全に連続的に維持する2段階のフレームワークである。
LM1BとOpenWebTextの実験は、CoDARが潜伏拡散よりも生成品質を大幅に改善することを示した。
論文 参考訳(メタデータ) (2026-03-03T03:05:15Z) - DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation [30.150846119894577]
DISTARはゼロショットのテキスト音声合成フレームワークで、離散的残差ベクトル量子化符号空間で完全に動作する。
DISTARは、堅牢性、自然性、話者/スタイルの整合性において、最先端のゼロショットTSシステムを超えている。
論文 参考訳(メタデータ) (2025-10-14T07:03:29Z) - Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling [87.34677262370924]
標準離散拡散モデルは、吸収[MASK]トークンにそれらをマッピングすることで、すべての観測されていない状態を同一に扱う。
これは'インフォメーション・ヴォイド'を生成します。そこでは、偽のトークンから推測できるセマンティック情報は、デノイングステップの間に失われます。
連続的拡張離散拡散(Continuously Augmented Discrete Diffusion)は、連続的な潜在空間における対拡散で離散状態空間を拡大するフレームワークである。
論文 参考訳(メタデータ) (2025-10-01T18:00:56Z) - Generalized Interpolating Discrete Diffusion [65.74168524007484]
仮面拡散はその単純さと有効性のために一般的な選択である。
ノイズ発生過程の設計において、より柔軟性の高い離散拡散(GIDD)を補間する新しいファミリを一般化する。
GIDDの柔軟性をエクスプロイトし、マスクと均一ノイズを組み合わせたハイブリッドアプローチを探索し、サンプル品質を向上する。
論文 参考訳(メタデータ) (2025-03-06T14:30:55Z) - Latent Diffusion for Language Generation [26.620353485679892]
言語への拡散を適応しようとする最近の試みは、既存の言語モデルの代替として拡散を提示している。
我々は,エンコーダ-デコーダ言語モデルを用いて,高品質なオートエンコーダを効率的に学習できることを実証した。
非条件, クラス条件, シーケンス・ツー・シーケンス言語生成に対する提案手法の有効性を検証する。
論文 参考訳(メタデータ) (2022-12-19T13:57:06Z) - Improve Variational Autoencoder for Text Generationwith Discrete Latent
Bottleneck [52.08901549360262]
変分オートエンコーダ(VAE)は、エンドツーエンドの表現学習において必須のツールである。
VAEは強い自己回帰デコーダで潜伏変数を無視する傾向がある。
よりコンパクトな潜在空間において暗黙的な潜在特徴マッチングを強制する原理的アプローチを提案する。
論文 参考訳(メタデータ) (2020-04-22T14:41:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。