論文の概要: A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2609.06324v1
- Date: Sun, 06 Sep 2026 01:09:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:05:06.905298
- Title: A Ticket from Marginals to Joints: Coupled-Noise Distillation for One-Step Block Generation in Diffusion Language Models
- Title(参考訳): マージナルからジョイントへ:拡散言語モデルにおける1ステップブロック生成のための結合ノイズ蒸留
- Abstract要約: 本研究では,ノイズ条件付きマスマスマスマスデノイザを用いて,1つの前方通過でブロックをコミットできるかどうかを調べた。
TinyStoriesの人間による評価では、1段階の合法性が大きく向上し、異なるノイズ場が1ブロック当たり1フォワードパスで異なるブロックを生成する。
- 参考スコア(独自算出の注目度): 0.6916773850242582
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoregressive language models commit one token per forward pass; diffusion language models commit a block of tokens over several steps. We ask whether a block can be committed in a single forward pass. We study this with a noise-conditioned masked denoiser: a data-independent Gaussian noise field is added to the mask embeddings so that, in principle, each sampled field selects one joint mode of the block. The established way of training such a model is to sample several fields per example and let them compete for the data, by winner-take-all or importance weighting. This gives the noise only coarse control: in our experiments, the information it carries grows roughly with the logarithm of the number of competing fields, and one-step outputs remain rarely coherent across the model sizes tested. We propose CONDOR (Coupled-Noise Distillation for One-Step Readout). A noise-conditioned teacher is trained with a random number of masked positions and winner-take-all. A student proposes a one-step block, retains selected tokens, and learns from the block obtained when the teacher refills the other positions in several steps under the same noise field; a noise-free masked-LM term on the ground truth anchors the student. Human evaluation on TinyStories shows a large gain in one-step legality while different noise fields still yield different blocks, at one forward pass per block.
- Abstract(参考訳): 自動回帰言語モデルはフォワードパス毎に1つのトークンをコミットし、拡散言語モデルはいくつかのステップでトークンのブロックをコミットする。
ブロックを1つのフォワードパスでコミットできるかどうかを問う。
データに依存しないガウスノイズ場がマスク埋め込みに追加され、各サンプルフィールドがブロックの1つのジョイントモードを選択する。
このようなモデルをトレーニングする確立された方法は、サンプル毎に複数のフィールドをサンプリングし、勝者のすべてまたは重要性の重み付けによって、データを競合させることである。
実験では、それが持つ情報は、競合するフィールドの数の対数とほぼ一致して成長し、1段階の出力は、テストされたモデルサイズでコヒーレントであることはめったにない。
単段読み出しのための結合ノイズ蒸留法(CONDOR)を提案する。
騒音条件の教師は、無作為な数の仮面位置と勝者の取り分で訓練される。
学生は、一段ブロックを提案し、選択したトークンを保持し、教師が同じ騒音場下で複数のステップで他の位置を補充したときに得られるブロックから学習する。
TinyStoriesの人間による評価では、1段階の合法性が大きく向上し、異なるノイズ場が1ブロック当たり1フォワードパスで異なるブロックを生成する。
関連論文リスト
- Latent-Kernel Discrete Flow Maps for Few-Step Generation [4.159429302112398]
我々は,M因子化成分を1つの潜伏子で結合したフローマップカーネルを構築する。
1つのステップが、因数分解モデルと同じサンプリング時間複雑度で相関完備化に質量を置くことを示す。
One-Billion-Word (LM1B) とWikiText-103ベンチマークを用いた無条件テキスト生成実験により,LKFモデルが強ヘテロジニアス成分を学習していることが判明した。
論文 参考訳(メタデータ) (2026-07-29T23:46:31Z) - Combating Noisy Labels through Fostering Self- and Neighbor-Consistency [120.4394402099635]
ラベルノイズは様々な現実世界のシナリオで広まり、教師付きディープラーニングの課題を提起する。
我々は、Jo-SNC(textbfSelf- と textbfNeighbor-textbfConsistency に基づくサンプル選択とモデル正規化)というノイズロバスト手法を提案する。
我々は、クラスごとの選択閾値を調整するための自己適応型データ駆動しきい値設定方式を設計する。
論文 参考訳(メタデータ) (2026-01-19T07:55:29Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - ROG$_{PL}$: Robust Open-Set Graph Learning via Region-Based Prototype
Learning [52.60434474638983]
本稿では,複雑な雑音グラフデータに対する堅牢なオープンセット学習を実現するために,ROG$_PL$という統一フレームワークを提案する。
このフレームワークは2つのモジュール、すなわちラベルの伝搬による認知と、リージョンによるオープンセットのプロトタイプ学習で構成されている。
我々の知る限り、ROG$_PL$は複雑なノイズを持つグラフデータに対して、最初の堅牢なオープンセットノード分類法である。
論文 参考訳(メタデータ) (2024-02-28T17:25:06Z) - BASS: Block-wise Adaptation for Speech Summarization [47.518484305407185]
本研究では,非常に長い列の要約モデルを漸進的に訓練する手法を開発した。
音声要約はストリーミングプロセスとして実現され、各ブロック毎に仮説要約が更新される。
How2データセットの実験により、提案したブロックワイドトレーニング手法は、乱れた入力ベースライン上のROUGE-L上で絶対的に3ポイント向上することを示した。
論文 参考訳(メタデータ) (2023-07-17T03:31:36Z) - Transferring Annotator- and Instance-dependent Transition Matrix for Learning from Crowds [88.06545572893455]
現実のクラウドソーシングシナリオでは、ノイズ遷移行列はアノテータとインスタンスに依存します。
まず、すべてのアノテータによるノイズパターンの混合をモデル化し、その後、個々のアノテータにこのモデリングを転送する。
実験により、合成および実世界のクラウドソーシングデータに対する提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2023-06-05T13:43:29Z) - Confidence Scores Make Instance-dependent Label-noise Learning Possible [129.84497190791103]
ノイズのあるラベルで学習する際、そのラベルはノイズモデルと呼ばれる遷移分布に従ってランダムに他のクラスに移動することができる。
我々は、各インスタンスラベル対に信頼スコアを付与する、信頼スコア付きインスタンス依存ノイズ(CSIDN)を導入する。
信頼性スコアの助けを借りて、各インスタンスの遷移分布を推定できる。
論文 参考訳(メタデータ) (2020-01-11T16:15:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。