論文の概要: A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2609.06324v2
- Date: Fri, 11 Sep 2026 18:39:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:04.385095
- Title: A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
- Title(参考訳): マージナルからジョイントへ:拡散言語モデルにおける1ステップブロック生成のための結合ノイズ蒸留
- Abstract要約: サンプルのガウス雑音場によってマスクの埋め込みが乱れてしまうと、離散マスクモデルが1パスでブロック全体をコミットできるかどうかを問う。
本研究では,目標側エンコーダや自己回帰教師を使わずに,そのようなモデルをゼロから訓練するCONDORを提案する。
制御されたTinyStories設定では、このレシピはノイズによって異なるコヒーレントなワンパス継続を生成する。
- 参考スコア(独自算出の注目度): 0.6916773850242582
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion language models (dLLMs) predict all tokens of a block in parallel, but a single forward pass samples each position from its own marginal distribution, so the tokens need not form a coherent block. We ask whether a discrete masked model can commit an entire block in one pass when its mask embeddings are perturbed by a sampled Gaussian noise field: the same noise should give the same coherent continuation, and different noise should give different ones. We propose CONDOR (Coupled-Noise Distillation for One-Step Readout), which trains such a model from scratch without a target-side encoder or an autoregressive teacher. Training combines two signals. On real text, the model predicts masked tokens under several noise samples and is supervised only through the sample that fits the ground truth best, so different noise can specialize to different continuations. For the remaining samples, the model refines its own one-pass prediction over several decoding steps under the same fixed noise and then distills that refined block back into a single pass. On a controlled TinyStories setting, this recipe yields coherent one-pass continuations that vary with the noise, both for a single block and, with a block-causal variant, when blocks are generated one after another.
- Abstract(参考訳): 拡散言語モデル (dLLMs) はブロックの全てのトークンを並列に予測するが、単一のフォワードがそれぞれの位置を自身の限界分布からサンプリングするので、トークンはコヒーレントなブロックを形成する必要はない。
マスク埋め込みがサンプリングされたガウスノイズ場によって摂動された場合、離散マスクモデルが1パスでブロック全体をコミットできるかどうかを問う:同じノイズが同じコヒーレント継続を与えるべきであり、異なるノイズは異なるノイズを与えるべきである。
本研究では,目標側エンコーダや自己回帰教師を使わずに,そのモデルをゼロから訓練するCONDOR(Coupled-Noise Distillation for One-Step Readout)を提案する。
訓練は2つの信号を組み合わせる。
実際のテキストでは、モデルはいくつかのノイズサンプルの下でマスクされたトークンを予測し、基底の真実に最も合うサンプルを通してのみ教師されるため、異なるノイズは異なる継続に特化することができる。
残りのサンプルについては、同じ固定ノイズの下で複数の復号ステップで独自のワンパス予測を洗練し、ブロックを蒸留して1つのパスに戻す。
制御されたTinyStories設定では、このレシピは、ブロックが次々に生成されるとき、単一ブロックとブロック-因果変異の両方において、ノイズと異なるコヒーレントな1パス継続を生成する。
関連論文リスト
- Latent-Kernel Discrete Flow Maps for Few-Step Generation [4.159429302112398]
我々は,M因子化成分を1つの潜伏子で結合したフローマップカーネルを構築する。
1つのステップが、因数分解モデルと同じサンプリング時間複雑度で相関完備化に質量を置くことを示す。
One-Billion-Word (LM1B) とWikiText-103ベンチマークを用いた無条件テキスト生成実験により,LKFモデルが強ヘテロジニアス成分を学習していることが判明した。
論文 参考訳(メタデータ) (2026-07-29T23:46:31Z) - DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs [29.561307941602482]
マスク付きDLMは, 連続的な埋め込み空間の認知を支援するために, 軽量に適応可能であることを示す。
適応モデルは、埋め込み空間において全ての位置を共同で進化させる連続推論をサポートする。
DSL-LLaDA-SDEは4つのベンチマークで最高のROUGE-1を達成する。
論文 参考訳(メタデータ) (2026-05-31T05:27:01Z) - Multi-Token Residual Prediction [21.234596379356724]
拡散言語モデル(Diffusion Language Models)は、マスク付きトークンシーケンスを反復的にデノベートすることでテキストを生成する。
本稿では,依存性を認識可能なマルチトークンデノーミングを実現する軽量モジュールであるMulti-token Residual Prediction (MRP)を紹介する。
MRPは、バックボーンの隠れた状態からのステップ間の残留を予測し、バックボーン毎のトークンを、コストのごく一部で効果的に前方にデノベートする。
論文 参考訳(メタデータ) (2026-05-12T11:40:39Z) - Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference [58.189320101488725]
DLLMは高速な非自己回帰推論を約束するが、並列デコーディングにおいて厳しい品質と速度のトレードオフを被る。
我々は、連続表現を離散デコードプロセスに統合することでこの問題に対処する。
本稿では,初期マスキング状態と最終復号化トークン状態の中間として,新しい連続混合状態を導入するフレームワークであるReMixを提案する。
論文 参考訳(メタデータ) (2026-02-26T11:08:11Z) - Combating Noisy Labels through Fostering Self- and Neighbor-Consistency [120.4394402099635]
ラベルノイズは様々な現実世界のシナリオで広まり、教師付きディープラーニングの課題を提起する。
我々は、Jo-SNC(textbfSelf- と textbfNeighbor-textbfConsistency に基づくサンプル選択とモデル正規化)というノイズロバスト手法を提案する。
我々は、クラスごとの選択閾値を調整するための自己適応型データ駆動しきい値設定方式を設計する。
論文 参考訳(メタデータ) (2026-01-19T07:55:29Z) - Stratified Hazard Sampling: Minimal-Variance Event Scheduling for CTMC/DTMC Discrete Diffusion and Flow Models [0.0]
累積ハザード(CTMC)または累積ジャンプ質量(DTMC)によって駆動される事象としての階層的ハザードサンプリングサンプリング(SHS)モデル
SHSは、累積ハザード(CTMC)または累積ジャンプ質量(DTMC)によって駆動されるイベントとして編集され、累積量を成層化することによってイベントを配置する。
また、ブラックリストスタイルの語彙制約に対する位相アロケーション変種を導入し、リスクの高い位置での早期編集を優先し、遅延マスキングアーティファクトを緩和する。
論文 参考訳(メタデータ) (2026-01-06T08:19:02Z) - DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation [30.150846119894577]
DISTARはゼロショットのテキスト音声合成フレームワークで、離散的残差ベクトル量子化符号空間で完全に動作する。
DISTARは、堅牢性、自然性、話者/スタイルの整合性において、最先端のゼロショットTSシステムを超えている。
論文 参考訳(メタデータ) (2025-10-14T07:03:29Z) - Enabling Approximate Joint Sampling in Diffusion LMs [16.729589221035074]
マスケ拡散言語モデルでは、トークンを順に、そして潜在的に並列にアンマキングすることでテキストを生成する。
本稿では,1つのフルモデルフォワードパスにおいて,関節分布からの複数のトークンのサンプルをエミュレートする方法を考案する。
論文 参考訳(メタデータ) (2025-09-25T21:23:26Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - Autoregressive Speech Synthesis without Vector Quantization [135.4776759536272]
We present MELLE, a novel continuous-valued token based language modeling approach for text-to-speech synthesis (TTS)。
MELLEはテキスト条件から直接連続メル-スペクトログラムフレームを自動回帰生成する。
MELLEは、サンプリングベクトル量子化符号の固有の欠陥を回避し、ロバスト性問題を緩和する。
論文 参考訳(メタデータ) (2024-07-11T14:36:53Z) - Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion [61.03681839276652]
拡散強制(Diffusion Forcing)は、拡散モデルをトレーニングし、トークンの集合に独立した音レベルを付与する、新たなトレーニングパラダイムである。
因果的次トーケン予測モデルを訓練して1つまたは複数の未来のトークンを生成することで、シーケンス生成モデルに拡散強制を適用する。
論文 参考訳(メタデータ) (2024-07-01T15:43:25Z) - ROG$_{PL}$: Robust Open-Set Graph Learning via Region-Based Prototype
Learning [52.60434474638983]
本稿では,複雑な雑音グラフデータに対する堅牢なオープンセット学習を実現するために,ROG$_PL$という統一フレームワークを提案する。
このフレームワークは2つのモジュール、すなわちラベルの伝搬による認知と、リージョンによるオープンセットのプロトタイプ学習で構成されている。
我々の知る限り、ROG$_PL$は複雑なノイズを持つグラフデータに対して、最初の堅牢なオープンセットノード分類法である。
論文 参考訳(メタデータ) (2024-02-28T17:25:06Z) - BASS: Block-wise Adaptation for Speech Summarization [47.518484305407185]
本研究では,非常に長い列の要約モデルを漸進的に訓練する手法を開発した。
音声要約はストリーミングプロセスとして実現され、各ブロック毎に仮説要約が更新される。
How2データセットの実験により、提案したブロックワイドトレーニング手法は、乱れた入力ベースライン上のROUGE-L上で絶対的に3ポイント向上することを示した。
論文 参考訳(メタデータ) (2023-07-17T03:31:36Z) - Transferring Annotator- and Instance-dependent Transition Matrix for Learning from Crowds [88.06545572893455]
現実のクラウドソーシングシナリオでは、ノイズ遷移行列はアノテータとインスタンスに依存します。
まず、すべてのアノテータによるノイズパターンの混合をモデル化し、その後、個々のアノテータにこのモデリングを転送する。
実験により、合成および実世界のクラウドソーシングデータに対する提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2023-06-05T13:43:29Z) - Learning Noise-Aware Encoder-Decoder from Noisy Labels by Alternating
Back-Propagation for Saliency Detection [54.98042023365694]
本稿では,ノイズを考慮したエンコーダ・デコーダ・フレームワークを提案する。
提案モデルはニューラルネットワークによってパラメータ化された2つのサブモデルから構成される。
論文 参考訳(メタデータ) (2020-07-23T18:47:36Z) - Confidence Scores Make Instance-dependent Label-noise Learning Possible [129.84497190791103]
ノイズのあるラベルで学習する際、そのラベルはノイズモデルと呼ばれる遷移分布に従ってランダムに他のクラスに移動することができる。
我々は、各インスタンスラベル対に信頼スコアを付与する、信頼スコア付きインスタンス依存ノイズ(CSIDN)を導入する。
信頼性スコアの助けを借りて、各インスタンスの遷移分布を推定できる。
論文 参考訳(メタデータ) (2020-01-11T16:15:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。