論文の概要: Clock Diffusion: Efficient Semi-Autoregressive Continuous Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.00894v1
- Date: Thu, 01 Oct 2026 01:17:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.837742
- Title: Clock Diffusion: Efficient Semi-Autoregressive Continuous Diffusion Language Models
- Title(参考訳): クロック拡散: 半自己回帰型連続拡散言語モデル
- Abstract要約: 位置依存型ノイズスケジュールを用いて半自己回帰(SAR)連続拡散言語モデル(DLM)を定義するモデルパラメータ化を提案する。
我々は,スライドウィンドウClock Diffusionに基づくガウスDLMのファミリーであるClockDLMsを定義し,OpenWebTextの最先端拡散可能性境界を実現する。
また,キャッシュグラフをダブするより効率的なサンプリング器を提案する。
- 参考スコア(独自算出の注目度): 30.906749938444147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent works on continuous diffusion for discrete data have demonstrated performance on par with comparable discrete diffusion models. However, these continuous counterparts lack key features that are essential to practical use as language models, namely variable-length generation and support for a key-value cache, and they still lag behind the frontier of autoregressive and discrete diffusion quality. In this work, we address these limitations. We do so by introducing a model parameterization that uses position-dependent noise schedules to define semi-autoregressive (SAR) continuous diffusion language models (DLMs). Together with efficient training and sampling algorithms, we call this framework Clock Diffusion, and we present two special cases of our method: block and sliding window generation. We then define ClockDLMs, a family of Gaussian DLMs based on sliding window Clock Diffusion that attain state-of-the-art diffusion likelihood bounds on OpenWebText, even beating the performant block SAR discrete diffusion models. ClockDLMs trained on TinyGSM also substantially outperform continuous baselines on the GSM8K benchmark and match and exceed comparable SAR discrete diffusion models. Finally, building on our parameterization, we propose more efficient samplers that we dub Cache Grab, which adapt techniques from accelerated inference in discrete diffusion, such as committing tokens whose probabilities exceed a confidence threshold and self-speculative decoding, further improving our models' quality and efficiency.
- Abstract(参考訳): 離散データに対する連続拡散に関する最近の研究は、同等の離散拡散モデルに匹敵する性能を示した。
しかし、これらの連続的な機能には、変数長生成やキー値キャッシュのサポートなど、言語モデルとして実用に不可欠な重要な機能がないため、自動回帰と離散拡散品質のフロンティアにはまだ遅れがある。
この作業では、これらの制限に対処する。
位置依存型ノイズスケジュールを用いて半自己回帰(SAR)連続拡散言語モデル(DLM)を定義するモデルパラメータ化を導入する。
効率的なトレーニングとサンプリングアルゴリズムとともに、このフレームワークをClock Diffusionと呼び、ブロックとスライディングウインドウの生成という2つの特殊なケースを提示する。
次に、スライドウインドウに基づくガウスDLMのファミリーであるClockDLMsを定義し、OpenWebText上の最先端拡散可能性境界を達成し、SAR離散拡散モデルに打ち勝つ。
TinyGSMでトレーニングされたクロックDLMは、GSM8Kベンチマークの連続ベースラインを大幅に上回り、SARの離散拡散モデルに匹敵する。
最後に、パラメータ化に基づいて、確率が信頼しきい値を超えるトークンのコミットや自己投機的復号化といった、離散拡散における加速推論の手法を応用し、モデルの品質と効率をさらに向上させるキャッシュグラフをダブするより効率的なサンプリング器を提案する。
関連論文リスト
- Continuous Diffusion Scales Competitively with Discrete Diffusion for Language [48.290726603587444]
確率ベース連続拡散言語モデル(DLM)としてRePlaidを構築する。
自己回帰モデルと比較すると,RePlaidの計算ギャップは20ドル程度であることがわかった。
また、可能性に基づくトレーニングの利点を理解するための理論的洞察も提供します。
論文 参考訳(メタデータ) (2026-05-18T15:15:24Z) - Causal Autoregressive Diffusion Language Model [70.7353007255797]
CARDは厳密な因果注意マスク内の拡散過程を再構成し、単一の前方通過で密集した1対1の監視を可能にする。
我々の結果は,CARDが並列生成のレイテンシの利点を解放しつつ,ARMレベルのデータ効率を実現することを示す。
論文 参考訳(メタデータ) (2026-01-29T17:38:29Z) - Diffusion Beats Autoregressive in Data-Constrained Settings [50.56893491038853]
自己回帰(AR)モデルは長い間、大きな言語モデルのランドスケープを支配してきた。
近年,ARモデルよりもアドバンテージが低いものの,拡散型言語モデルが将来性のある選択肢として浮上している。
本研究では,限られたデータ上で繰り返し学習を行うデータ制約付き環境で,マスク拡散モデルについて系統的に研究する。
我々の結果は、データが計算ではなくボトルネックである場合、拡散モデルは標準的なARパラダイムに代わる魅力的な代替手段となることを示唆している。
論文 参考訳(メタデータ) (2025-07-21T17:59:57Z) - Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models [15.853201399662344]
拡散言語モデルは自己回帰モデルよりも独特な利点を提供する。
確率モデリングに遅れがあり、固定長生成に制限される。
本稿では,離散化拡散モデルと自己回帰モデルとを補間するブロック拡散言語モデルについて紹介する。
論文 参考訳(メタデータ) (2025-03-12T17:43:40Z) - ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer [95.80384464922147]
ACDiTはブロックワイド条件拡散変換器である。
トークン単位の自己回帰とフルシーケンス拡散のフレキシブルな関係を提供する。
本稿では,映像生成タスクにおける自己回帰ベースラインの中で,ACDiTが最良であることを示す。
論文 参考訳(メタデータ) (2024-12-10T18:13:20Z) - Energy-Based Diffusion Language Models for Text Generation [126.23425882687195]
エネルギーベース拡散言語モデル(Energy-based Diffusion Language Model, EDLM)は、拡散ステップごとに全シーケンスレベルで動作するエネルギーベースモデルである。
我々のフレームワークは、既存の拡散モデルよりも1.3$times$のサンプリングスピードアップを提供する。
論文 参考訳(メタデータ) (2024-10-28T17:25:56Z) - Generative Fractional Diffusion Models [53.36835573822926]
我々は,その基礎となる力学に分数拡散過程を利用する,最初の連続時間スコアベース生成モデルを導入する。
実画像データを用いた評価では,GFDMはFIDが低い値で示されるように,画素幅の多様性と画質の向上を実現している。
論文 参考訳(メタデータ) (2023-10-26T17:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。