論文の概要: Mask-Aware Policy Gradients for Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.15200v1
- Date: Thu, 16 Jul 2026 16:57:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.179567
- Title: Mask-Aware Policy Gradients for Diffusion Language Models
- Title(参考訳): 拡散言語モデルのためのマスク対応政策勾配
- Abstract要約: 強化学習は大規模言語モデルの推論を改善するのに有効であることが証明されているが、それをMasked Diffusion Language Models (MDLM)に拡張することは依然として困難である。
MDLMの生成には各ステップで2つの決定が伴う。
我々はこれを2段階の行動 MDP として定式化し、ポリシー勾配が自然にトークン項とマスキング項に分解されることを示す。
- 参考スコア(独自算出の注目度): 24.287374086170882
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning has proven effective for improving reasoning in large language models, but extending it to Masked Diffusion Language Models (MDLMs) remains challenging due to the intractability of the log-likelihood estimation. Existing approaches approximate this log-likelihood by modeling only the token predictions, ignoring the order in which positions are unmasked during generation. We observe that MDLM generation involves two decisions at each step: what tokens to place at each masked position and which positions to remask. We formalize this as a two-stage action MDP, showing that the policy gradient naturally decomposes into a token term and a masking term. Combining optimization of both terms leads to state-of-the-art outcomes on mathematical reasoning and coding benchmarks, with scores of 87.1% on GSM8K and 53.4% on MBPP.
- Abstract(参考訳): 強化学習は大規模言語モデルの推論を改善するのに有効であることが証明されているが、ログのような推定の難しさのため、それをMasked Diffusion Language Models (MDLM) に拡張することは依然として困難である。
既存のアプローチでは、トークンの予測のみをモデル化し、生成時に位置が変更されていない順序を無視して、このログの類似性を近似している。
MDLMの生成には各ステップで2つの決定が伴う。
我々はこれを2段階の行動 MDP として定式化し、ポリシー勾配が自然にトークン項とマスキング項に分解されることを示す。
両方の項の最適化が組み合わさると、数学的推論とコーディングのベンチマークの最先端の結果が得られ、スコアは GSM8K が87.1%、MBPP が53.4% となる。
関連論文リスト
- The Efficiency Gap in Byte Modeling [101.18202046105718]
2つの代替パラダイムは、サブワードトークン化と自己回帰順序付けの使用に挑戦している。
これらの構造的先行性を取り除くことは、計算コストを著しく削減することを示します。
この結果から, 将来のモジュラリティ非依存設計は, 拡張軌道を維持するために, 代替構造バイアスを組み込まなければならないことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T03:03:30Z) - LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language Models [0.0]
本稿では,信頼に基づくアンマスキーを論理ロール誘導アンマスキーに置き換える推論時間手法であるLogicDiffを紹介する。
依存関係順序付きスケジューラは、論理的依存関係順序でトークンをアンマスクする。
LogicDiffは、GSM8Kでは22.0%から60.7%に、MATH-500では23.6%から23.6%に改善した。
論文 参考訳(メタデータ) (2026-03-24T13:08:10Z) - Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes [41.57128726515332]
DID(Deletion-Insertion Diffusion Language Model)を提案する。
DIDはトークンの削除と挿入を離散拡散過程として厳格に定式化する。
固定長および可変長の設定に対する実験により,MDLMと既存の挿入型LMのベースラインよりもDIDの利点が示された。
論文 参考訳(メタデータ) (2026-03-04T12:53:17Z) - Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models [17.18632315520133]
Masked Diffusion Language Modelsは、マスク付きトークンを反復的に充填することでテキストを生成する。
Gt-Marginは、部分的にマスキングされた各状態の下で、より簡単な位置を優先するオラクルアンマスキング順序を与える。
マスク付きコンテキストからオーラクルの注文を模倣するために,教師付きアンマスキングプランナーを学習 to ランクで訓練する。
論文 参考訳(メタデータ) (2026-02-10T07:56:46Z) - Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models [19.847438086389616]
Masked Diffusion Language Modelsは、Autoregressive Language Modelsに代わる有望な選択肢として登場した。
本研究は,MDLMの局所性バイアスが強いことを示す。
本稿では,マスク数に不変な予測を推奨するマスク非依存損失関数を提案する。
論文 参考訳(メタデータ) (2025-11-26T12:44:29Z) - Soft-Masked Diffusion Language Models [35.191030145577145]
マスクトークンの埋め込みと,上位k$の予測トークンの埋め込みを動的にブレンドする新しい手法であるソフトマスキング(SM)を導入する。
SMを用いた169Mパラメータモデルの事前学習を継続すると、パープレキシティとMAUVEスコアが向上することを示した。
最新の拡散モデルDream-7BとDream-Coder-7BをSMで微調整する。
論文 参考訳(メタデータ) (2025-10-20T06:42:03Z) - Exploring Gradient-Guided Masked Language Model to Detect Textual Adversarial Attacks [50.53590930588431]
敵対的な例は 自然言語処理システムに深刻な脅威をもたらします
近年の研究では、対角的テキストは通常のテキストの多様体から逸脱していることが示唆されているが、マスク付き言語モデルは正規データの多様体を近似することができる。
まず、マスク付き言語モデリング(MLM)の目的のマスクアンマスク操作を活用するMLMD(Masked Language Model-based Detection)を導入する。
論文 参考訳(メタデータ) (2025-04-08T14:10:57Z) - Masked Autoencoding for Scalable and Generalizable Decision Making [93.84855114717062]
MaskDPは、強化学習と行動クローンのためのシンプルでスケーラブルな自己教師付き事前学習手法である。
我々は,MaskDPモデルにより,単一ゴールや複数ゴール到達といった新しいBCタスクへのゼロショット転送能力が得られることを発見した。
論文 参考訳(メタデータ) (2022-11-23T07:04:41Z) - Improving Self-supervised Pre-training via a Fully-Explored Masked
Language Model [57.77981008219654]
Masked Language Model (MLM)フレームワークは、自己教師型言語事前学習に広く採用されている。
そこで本研究では,テキストシーケンスを複数の非重複セグメントに分割するマスキング手法を提案する。
論文 参考訳(メタデータ) (2020-10-12T21:28:14Z) - UniLMv2: Pseudo-Masked Language Models for Unified Language Model
Pre-Training [152.63467944568094]
本稿では,自動エンコーディングと部分的自己回帰型言語モデリングタスクの両方に対して,統一言語モデルを事前学習することを提案する。
実験の結果,PMLMを用いて事前学習した統一言語モデルは,多種多様な自然言語理解・生成タスクにおいて,新たな最先端の成果が得られることがわかった。
論文 参考訳(メタデータ) (2020-02-28T15:28:49Z) - Semi-Autoregressive Training Improves Mask-Predict Decoding [119.8412758943192]
本研究では,マスク予測の半自己回帰動作を模倣した条件付きマスキング言語モデルSMARTを提案する。
SMARTでトレーニングされたモデルは、マスク予測デコードを使用すると高品質な変換を生成し、完全な自己回帰モデルで残りの性能ギャップを効果的に閉じる。
論文 参考訳(メタデータ) (2020-01-23T19:56:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。