論文の概要: Know When to Hold 'em: Correct-Token Retention in Uniform-State Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2610.01275v1
- Date: Thu, 01 Oct 2026 08:13:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.992711
- Title: Know When to Hold 'em: Correct-Token Retention in Uniform-State Diffusion Language Models
- Title(参考訳): 単一状態拡散言語モデルにおける正しい保留時間
- Abstract要約: 自己訂正には不正トークンの修正と正しいトークンの保持の両方が必要である。
提案するCTR-Reg(Correct-Token Retention Regularization, CTR-Reg)は,前処理で未成熟なトークンの保持をモデルに指示する簡易かつ効果的な補助的損失である。
本研究は, 自己修正拡散言語モデルに欠落する重要な要素として, 正解保持を同定し, 有効性を示すものである。
- 参考スコア(独自算出の注目度): 8.078979702939845
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Uniform-state diffusion models (USDMs) can revise any token at any denoising step, which lets them correct their own mistakes, a key advantage over masked diffusion. Self-correction, however, requires both revising incorrect tokens and retaining correct ones, and we show that current USDMs lack the latter. Even under greedy-tail decoding, state-of-the-art USDMs (DUO, UDLM, and uniform-noise SEDD) keep revising 173--270 of 512 positions at every step, and these large, uncoordinated edits collapse sample diversity. A random-token corruption experiment traces this deficit to the models themselves: they reconstruct clean and corrupted tokens with nearly identical accuracy, even though clean tokens are easier targets. A decomposition of the validation NELBO shows that training barely rewards retention: incorrect predictions are heavily penalized at corrupted positions but almost free at clean ones. We propose Correct-Token Retention Regularization (CTR-Reg), a simple but effective auxiliary loss that trains the model to retain tokens left unperturbed by the forward process and requires no change to the sampler. CTR-Reg improves clean-token accuracy by 26.5 percentage points on average across six benchmarks, while leaving corrupted-token accuracy virtually unchanged, and its per-step revisions converge to only 3--11 positions. With just five greedy-tail steps, generative perplexity more than halves under CTR-Reg for all three models while diversity is preserved, and these gains hold across sampling budgets. Our results identify correct-token retention as a key missing ingredient for self-correcting diffusion language models, and demonstrate an effective fix.
- Abstract(参考訳): 均一状態拡散モデル(USDM)は、任意の装飾段階において任意のトークンを修正できるため、彼らは自身の誤りを修正できる。
しかし、自己訂正には不正トークンの修正と正しいトークンの保持の両方が必要であり、現在のUSDMには後者が欠落していることを示す。
派手なテールデコードの下でも、最先端のUSDM (DUO, UDLM, 均一ノイズSEDD) は、各ステップで512位置の173~270の修正を続けており、これらの大きな非コーディネート編集はサンプルの多様性を崩壊させる。
クリーントークンはより容易なターゲットであるにもかかわらず、ほぼ同じ精度でクリーントークンと破損トークンを再構築する。
検証NELBOの分解では、トレーニングが保持にほとんど報われていないことが示され、誤った予測は破損した位置で厳しく罰せられるが、クリーンな位置ではほとんど自由である。
提案するCTR-Reg(Correct-Token Retention Regularization, CTR-Reg)は,前処理で残されるトークンの保持をモデルに指示し,サンプル装置の変更を必要としない簡易かつ効果的な補助的損失である。
CTR-Regは6つのベンチマークで平均26.5ポイントのクリーントーケンの精度を向上する一方、劣化トーケンの精度は事実上変化せず、ステップごとのリビジョンは3-11位に収まる。
わずか5つのグリーディテールステップで、多様性が維持されている間、CTR-Regの下の半減期以上の生成パープレキシティは、サンプリング予算にまたがって保持される。
本研究は, 自己修正拡散言語モデルに欠落する重要な要素として, 正解保持を同定し, 有効性を示すものである。
関連論文リスト
- RePair: Turning Retrieval Failures into Counterfactual Hard Pairs [15.148342372814662]
RePairは、偽陽性を双方向にマイニングし、LLM誘導の反ファクト編集を適用し、ローカルなハードペアの対照的な目的を持つ列車を訓練する。
Flickr30KとCOCO30Kでは、RePairは107Kの合成サンプルで制御された拡張ベースラインを上回っている。
論文 参考訳(メタデータ) (2026-08-30T06:47:38Z) - EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing [6.324418485299426]
プロセス報酬モデル(PRM)は、ステップレベルの厳密な監督を伴う言語モデルトレーニングで広く使用されている。
この仮定は十分に検証されていないと我々は主張する。
我々は,高密度プロセス報酬のためのストレステストフレームワークである textbfEST-PRM を紹介する。
論文 参考訳(メタデータ) (2026-05-30T00:05:14Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models [24.3914653184824]
LVLM(Large Vision-Language Models)は、言語デコーダによって処理される膨大な数の視覚トークンによって、推論の禁止コストに悩まされる。
既存のプルーニング法は、視覚トークンの可逆的な除去が、事前訓練されたフルトケン状態から逸脱した隠れ状態の分布シフトを引き起こすため、大きな性能劣化を引き起こすことが多い。
本稿では,累積的視覚トークンプルーニングと遅延修復機構を統合した一貫性表現プルーナを提案する。
論文 参考訳(メタデータ) (2026-04-04T13:31:45Z) - CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization [122.88484422855934]
本稿では,MeanFlowデコーダを備えた1次元因果画像トークンであるCaTokを紹介する。
時間間隔でトークンを選択することで、CaTokは高速なワンステップ生成と高忠実なマルチステップサンプリングの両方をサポートする因果1D表現を学ぶ。
実験により、CaTokはImageNet再構成の最先端の結果を達成し、0.75 FID、22.53 PSNR、0.674 SSIMに達した。
論文 参考訳(メタデータ) (2026-03-06T16:39:17Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Sparsity Forcing: Reinforcing Token Sparsity of MLLMs [40.93786579652003]
マルチモーダル大規模言語モデル(MLLM)におけるトークンの分散性を,単純なRLベースのポストトレーニングフレームワークであるtextitSparsity Forcing を用いて明示的に強化する。
本手法では,複数ロールアウトを異なるトークン予算で実行し,効率(トーケン還元率)と性能(回答正当性)の両方を共同報酬として定式化することにより,効率・正確性トレードオフを探索する。
論文 参考訳(メタデータ) (2025-04-23T01:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。