論文の概要: Hierarchical Continuous Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.02193v1
- Date: Thu, 01 Oct 2026 17:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.369767
- Title: Hierarchical Continuous Diffusion Language Models
- Title(参考訳): 階層型連続拡散言語モデル
- Abstract要約: 階層型連続拡散言語モデル(HC-DLM)を提案する。
HC-DLMは離散トークン生成と連続的な潜在軌道を1つの原理化過程で結合する。
これは、一致したモデルサイズでの離散的かつ連続的な拡散ベースライン、スドゥークとカウントダウンのパズル精度、およびLM1Bの生成パープレキシティを向上する。
- 参考スコア(独自算出の注目度): 50.34180702812139
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Discrete diffusion language models offer a compelling alternative to autoregressive generation for tasks demanding bidirectional reasoning and global constraint satisfaction. Yet they share a structural bottleneck: when decoding in parallel, each token is sampled independently from its marginal, severing the statistical dependencies among the tokens decoded together. Continuous diffusion language models avoid this by denoising a shared continuous state, but their denoiser sees only that state, so nothing ties it to a valid token configuration until it is finally decoded. To address this, we propose Hierarchical Continuous Diffusion Language Models (HC-DLM), which couple discrete token generation with a continuous latent trajectory in a single, principled denoising process, whose training objective is derived from a variational bound on the token likelihood. In contrast to recent methods that attach continuous context to a self-contained discrete chain, HC-DLM makes the latent the only persistent generative state: tokens are read out from it at every step and feed back as a scaffold for the next latent update. On structured reasoning (Sudoku), mathematical planning (Countdown) and language modeling (LM1B), HC-DLM improves over discrete and continuous diffusion baselines at matched model size, in puzzle accuracy on Sudoku and Countdown and in generative perplexity on LM1B. Project page: https://hc-dlm.github.io/.
- Abstract(参考訳): 離散拡散言語モデルは、双方向の推論とグローバルな制約満足度を必要とするタスクに対して、自己回帰生成の魅力的な代替手段を提供する。
しかし、それらは構造的なボトルネックを共有している: 並列にデコードする場合、それぞれのトークンはマージンから独立してサンプリングされ、同時にデコードされたトークン間の統計的依存関係を切断する。
連続拡散言語モデルは、共有された連続状態をデノナイズすることによってこれを回避しますが、それらのデノイザはその状態のみを認識しているため、最終的にデコードされるまで、有効なトークン構成に結び付けるものはありません。
そこで本稿では, 離散トークン生成と連続潜在軌道を連成する階層型連続拡散言語モデル(HC-DLM)を提案する。
HC-DLMは、自己完結した離散チェーンに連続的なコンテキストを付加する最近の手法とは対照的に、潜伏状態が唯一永続的な生成状態となる。
構造化推論(Sudoku)、数学的計画(Countdown)、言語モデリング(LM1B)について、HC-DLMは、SudokuとCountdownのパズル精度、LM1Bの生成パープレキシティにおいて、一致したモデルサイズでの離散的および連続的な拡散ベースラインよりも改善する。
プロジェクトページ: https://hc-dlm.github.io/
関連論文リスト
- Distilled Continuous Diffusion Language Models Can Write Code in Few Steps---or One [16.38284188874483]
コード生成のための0.7B連続拡散言語モデルであるPlaidQを紹介する。
以上の結果から,PlaidQの軌道は数段階にのみ積極的に蒸留できることが示唆された。
これらの結果は、数ステップのコード生成と1ステップのコード生成への実行可能なパスとして、継続的拡散を確立します。
論文 参考訳(メタデータ) (2026-09-03T22:42:57Z) - AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling [60.04959047453115]
AURORA-LMは、デオード可能なテキスト表現の構築と、その分布のモデル化を分離した連続ラテント言語モデルである。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
論文 参考訳(メタデータ) (2026-08-03T17:59:50Z) - BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion [47.110252169791075]
BitLMは、各トークンを固定長バイナリコードとして表現する言語モデルである。
大語彙のソフトマックスをビットワイズデノイングに置き換えることで、BitLMはトークン生成をコンパクトなバイナリ空間における反復的なコミットメントとして再設定する。
論文 参考訳(メタデータ) (2026-05-12T06:02:59Z) - DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention [2.7422645382944935]
そこで我々はDyLLMを提案する。DyLLMは正規トークンのみを選択的に計算することでデコーディングを高速化する学習自由推論フレームワークである。
DyLLMは様々な推論とコード生成ベンチマークで最大9.6倍のスループットを実現している。
論文 参考訳(メタデータ) (2026-03-09T07:02:01Z) - Kelix Technical Report [86.64551727600104]
我々は、完全離散自己回帰統一モデルであるKelixを紹介し、離散的および連続的な視覚表現間の理解ギャップを埋める。
最近の研究は、完全自己回帰型マルチモーダルモデリングを可能にするために、離散的な視覚的トークン化を探求している。
論文 参考訳(メタデータ) (2026-02-10T14:48:26Z) - Continuous Autoregressive Language Models [56.49239051750678]
我々はCALM(Continuous Autoregressive Language Models)を紹介する。
CALMは高忠実度オートエンコーダを使用して、Kトークンの塊を1つの連続ベクトルに圧縮する。
我々は、堅牢なトレーニング、評価、および制御可能なサンプリングを可能にする包括的可能性のないフレームワークを開発する。
論文 参考訳(メタデータ) (2025-10-31T17:58:11Z) - Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling [87.34677262370924]
標準離散拡散モデルは、吸収[MASK]トークンにそれらをマッピングすることで、すべての観測されていない状態を同一に扱う。
これは'インフォメーション・ヴォイド'を生成します。そこでは、偽のトークンから推測できるセマンティック情報は、デノイングステップの間に失われます。
連続的拡張離散拡散(Continuously Augmented Discrete Diffusion)は、連続的な潜在空間における対拡散で離散状態空間を拡大するフレームワークである。
論文 参考訳(メタデータ) (2025-10-01T18:00:56Z) - Sequential Diffusion Language Models [110.06562906987052]
拡散言語モデル(DLM)は理論効率が強いが、固定長の復号化とキー値キャッシュとの非互換性によって制限される。
次点と次点の予測を統一するNext Sequence Prediction (NSP)を導入する。
本稿では,事前学習した自己回帰言語モデル(ALM)を最小限のコストで再現可能な逐次拡散言語モデル(SDLM)を提案する。
論文 参考訳(メタデータ) (2025-09-28T17:59:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。