論文の概要: CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.24763v1
- Date: Thu, 04 Jun 2026 22:21:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.041844
- Title: CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models
- Title(参考訳): 仮設拡散言語モデルのためのCaRE計算対応リマッシング評価プロトコル
- Abstract要約: CaREはMDLMリマキング戦略を監査する計算対応評価フレームワークである。
MDLM評価は,アルゴリズムの改良を隠れた計算量で体系的に説明できることを示す。
- 参考スコア(独自算出の注目度): 8.528908057749694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Masked diffusion language models (MDLMs) are advancing rapidly, yet the evaluation standards needed to reliably interpret their progress have not kept pace. Despite MDLMs becoming competitive with autoregressive language models, seven recent remasking papers evaluate under incompatible settings, varying nominal step counts, metrics, and sampling temperatures without jointly controlling these factors, rendering their strategy rankings largely incomparable and leaving open whether reported gains reflect algorithmic improvements or evaluation artifacts. We present CaRE, a compute-aware evaluation framework that audits MDLM remasking strategies by standardizing actual number of function evaluations (NFE), enforcing multi-metric reporting, and explicitly controlling stochasticity. Applied to 7 remasking strategies across LLaDA-8B-Base and Dream-7B-Base at 4 stochasticity levels and 3 step budgets on OpenWebText and LM1B, CaRE reveals that: (i) temperature explains the majority of MAUVE variance, (ii) compute-matched comparisons reverse several published strategy rankings, and (iii) informed remasking and stochastic unmasking are in tension, with high-entropy remasking reducing MAUVE by 0.296 at 256 steps at unmask_temp=0.25 (p=0.020). A CaRE leaderboard covering 12 open-weight MDLMs (150M to 8B parameters) shows that this interaction direction holds across architectures and scales. These findings demonstrate that current MDLM evaluations can systematically conflate algorithmic improvements with hidden choices of compute and stochasticity. We release the evaluation protocol, implementation, and leaderboard to ensure future remasking claims are reproducible and comparable.
- Abstract(参考訳): 仮設拡散言語モデル (MDLM) は急速に進歩しているが、その進歩を確実に解釈するために必要な評価基準は、そのペースを維持していない。
MDLMは自己回帰言語モデルと競合するようになっているが、最近の7つのリメイキング論文は、これらの要因を共同で制御することなく、不整合性の設定、様々な名目上のステップ数、メトリクス、サンプリング温度で評価し、それらの戦略ランキングは、ほとんど互換性がなく、報告されたゲインがアルゴリズム改善や評価成果物を反映しているかどうかを問わないままにしている。
本稿では,実数関数評価(NFE)を標準化し,マルチメトリックレポーティングを強制し,確率性を明確に制御することでMDLMリメイキング戦略を監査する計算認識評価フレームワークであるCaREを提案する。
LLaDA-8B-BaseとDream-7B-Baseの4つの確率レベルとOpenWebTextとLM1Bの3段階の予算での7つのリマキング戦略に適用すると、CaREは次のように明らかにした。
一 温度がMAUVEの分散の大部分を説明すること。
(二)計算整合比較は、いくつかの公表された戦略ランキングを逆転させ、
3) 情報リマッシングと確率的アンマキングは緊張状態にあり, unmask_temp=0.25 (p=0.020) において256ステップでMAUVEを0.296減少させる。
12個のオープンウェイトMDLM(150Mから8Bパラメータ)をカバーするCaREのリーダーボードは、この相互作用の方向がアーキテクチャとスケールにまたがっていることを示している。
これらの結果から,現在のMDLM評価は,隠れた計算と確率性によってアルゴリズム改善を体系的に説明できることが示唆された。
我々は、将来のリメイキングのクレームが再現可能で同等であることを保証するために、評価プロトコル、実装、およびリーダーボードをリリースする。
関連論文リスト
- A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination [51.06539604709775]
本稿では、制御ユニットを表現編集からロール条件のエビデンスビューへシフトさせる自己進化型エージェントフレームワークであるA-SRを提案する。
A-SRは、コーディネートプロトコル、オンライン評価器・リワードロールポリシー、および状態制御プロセスメモリ間のルーティングによる公式発見をコーディネートする。
論文 参考訳(メタデータ) (2026-08-05T14:01:10Z) - Mask-Aware Policy Gradients for Diffusion Language Models [24.287374086170882]
強化学習は大規模言語モデルの推論を改善するのに有効であることが証明されているが、それをMasked Diffusion Language Models (MDLM)に拡張することは依然として困難である。
MDLMの生成には各ステップで2つの決定が伴う。
我々はこれを2段階の行動 MDP として定式化し、ポリシー勾配が自然にトークン項とマスキング項に分解されることを示す。
論文 参考訳(メタデータ) (2026-07-16T16:57:34Z) - Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks [1.9800951131982487]
我々はSpecRef(Speculative Refinement)を用いて、ARドラフトからマスク付き拡散言語モデルをウォームスタートする。
We evaluate SpecRef across six benchmarks (HumanEval, MBPP, GSM8K, BBH, ARC-Challenge, HellaSwag) with three distinct evaluation protocol。
これらの観察は、多段階または非自己回帰生成パイプラインに適用され、より診断評価の実践に向けて向けられる。
論文 参考訳(メタデータ) (2026-06-25T18:52:24Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - SERSEM: Selective Entropy-Weighted Scoring for Membership Inference in Code Language Models [1.327416973220814]
記憶信号の増幅のために非形式的統語的ボイラプレートを抑える新しいホワイトボックス攻撃フレームワークであるSERSEMを提案する。
以上の結果から,人間中心の符号化異常に注目することは,列レベルの確率平均よりも格段に頑健な暗記の指標となることが示唆された。
論文 参考訳(メタデータ) (2026-04-01T17:03:58Z) - DiffuRank: Effective Document Reranking with Diffusion Language Models [71.16830004674513]
拡散言語モデル(dLLM)に基づいて構築されたフレームワークであるDiffuRankを提案する。
dLLMは、左から右への順序に制約されないより柔軟なデコーディングと生成プロセスをサポートする。
モデルサイズが類似した自己回帰LDMに匹敵する性能を示す。
論文 参考訳(メタデータ) (2026-02-13T02:18:14Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies [47.6755955972232]
我々は,KL規則化マルコフ決定プロセス (MDP) として明示的な基準ポリシを付与し,正規化目標を最適化した。
このフレームワークの下で最適化されたポリシーは、スケジュールよりもデータ分布とより密に一致したサンプルを生成することを証明している。
論文 参考訳(メタデータ) (2025-10-07T09:44:24Z) - The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination [18.05548914181797]
ベンチマークデータ汚染(BDC)-トレーニングセットにベンチマークテストサンプルを含めることで、LLM(Large Language Model)評価における懸念が高まった。
これを解決するために、研究者は既存のベンチマークを更新するための様々な緩和戦略を提案している。
従来の評価手法、例えば精度低下や精度のマッチングは、集計精度のみに焦点を合わせ、しばしば不完全あるいは誤解を招く結論に至る。
論文 参考訳(メタデータ) (2025-03-20T17:55:04Z) - Kalman meets Bellman: Improving Policy Evaluation through Value Tracking [59.691919635037216]
政策評価は強化学習(RL)における重要なプロセスである
我々はKalman Optimization for Value Approximation (KOVA)と呼ばれる最適化手法を考案した。
KOVAはパラメータとノイズリターンの不確実性の両方に関する正規化対象関数を最小化する。
論文 参考訳(メタデータ) (2020-02-17T13:30:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。