論文の概要: Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy
- arxiv url: http://arxiv.org/abs/2607.21372v1
- Date: Thu, 23 Jul 2026 14:37:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.445842
- Title: Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy
- Title(参考訳): 平均-スコア離散拡散:スコアエントロピーのための後-平均デノイザ
- Abstract要約: 我々は,クリーンな後進平均を予測し,正確なカーネル依存線形写像を用いてスコアに変換するEmphmean-to-score (M2S)を導入する。
均一な汚職のために、確率的単純度をブリッジポリトープにマッピングし、吸収マスクの破損のためにMD4を正確に回収する。
- 参考スコア(独自算出の注目度): 17.48959208263029
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Score Entropy Discrete Diffusion (SEDD) parameterizes discrete reverse processes with unconstrained positive score ratios. While positivity guarantees nonnegative reverse jump rates, it does not ensure Bayes realizability: ratios at a noisy state need not be jointly induced by any clean-token posterior under the forward kernel. The score-entropy loss has the correct population optimum but does not enforce this constraint away from it. In a trained pure-uniform SEDD checkpoint, roughly one quarter of complete score vectors violate the coordinate box, while more than half lie inside it yet remain materially incompatible with any valid posterior. Such violations can produce negative pre-normalization weights in finite-step sampling. Projecting raw scores onto the bridge polytope removes all observed negative weights and improves external generative PPL from $203.6$ to $175.1$ without changing the sampler. We introduce \emph{mean-to-score} (M2S), which predicts a clean-token posterior mean and converts it to the score through an exact kernel-dependent linear map. The construction applies to any known coordinate-wise continuous-time Markov chain (CTMC) satisfying a mild support condition. For uniform corruption, it maps the probability simplex onto the bridge polytope; for absorbing-mask corruption, the resulting objective recovers MD4 exactly. In a controlled 28.4M-parameter CIFAR-10 comparison, M2S lowers test BPD from $3.173$ to $3.129$ and FID-50k from $\CifarSEDDFID$ to $\CifarMtwoSFID$. A 170M-parameter M2S model trained on about 262B OpenWebText token slots outperforms the evaluated pure-uniform SEDD, GIDD, and Neural CTMC checkpoints at every tested sampling budget, reaching generative PPL $143.3$ at 128 steps versus $183.6$ for the strongest pure-uniform baseline.
- Abstract(参考訳): スコアエントロピー離散拡散(SEDD)は、制約のない正のスコア比で離散逆過程をパラメータ化する。
陽性度は非負の逆ジャンプ速度を保証するが、ベイズ実現性は保証されない:ノイズ状態の比は前方の核の下にある清潔な後部によって共同で誘導される必要はない。
スコアエントロピーの損失は、正しい人口最適性を持つが、この制約を排除しない。
訓練された純粋な一様SEDDチェックポイントでは、ほぼ4分の1の完全スコアベクトルが座標ボックスに違反し、半分以上が内部に置かれるが、有効な後部座席と実質的に互換性が保たれている。
このような違反は、有限ステップサンプリングにおいて負の事前正規化重みを生じる。
ブリッジポリトープに生のスコアを投影すると、観測された全ての負の重みが取り除かれ、サンプルを変更せずに外部生成PPLを203.6ドルから175.1ドルに改善する。
クリーントーケン後平均を予測し,正確なカーネル依存線形写像を用いてスコアに変換する。
この構成は、任意の座標方向連続時間マルコフ連鎖 (CTMC) に適用され、軽度の支持条件を満たす。
均一な汚職のために、確率的単純度をブリッジポリトープにマッピングし、吸収マスクの破損のためにMD4を正確に回収する。
制御された28.4MパラメータCIFAR-10の比較では、M2SはテストBPDを3.173ドルから3.129ドルに下げ、FID-50kを$\CifarSEDDFID$から$\CifarMtwoSFID$に下げた。
約262BのOpenWebTextトークンスロットでトレーニングされた170MパラメータM2Sモデルは、評価された純ユニフォームSEDD、GIDD、ニューラルCTMCチェックポイントよりも優れており、最も高い純ユニフォームベースラインに対して128ステップで143.3ドルに達する。
関連論文リスト
- Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention [0.0]
レヴィ・アテンション(英: Lévy Attention)は、不均質なランダム測度に対して出力が積分的なクロスアテンション作用素である。
t-PatchGNNオペレーターは、一致した制御に対してコストを5.6%の精度でスワップする。
1回のパスでは3,383人の未確認患者が1.4秒で信頼されている。
論文 参考訳(メタデータ) (2026-08-19T17:50:16Z) - Detecting and Discriminating Operator Misspecification in Hybrid PDE-Parameter Learning: a Reference-Free Instrument, with Discrimination Bounded In Sample [0.0]
私たちは1つのフィットから読み取る楽器を作り、オラクルは持っていません。
回復時に神経推定器がTikhonov-regularized inversionに負ける、事前登録された負の機器である、装置の盲点を報告する。
論文 参考訳(メタデータ) (2026-08-04T21:20:44Z) - One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence [41.99844472131922]
一人の人間が1ラウンド当たり$N$ LLMエージェントを予算$B ll N$監査で監査しなければならない。
我々はこれを、2段階のガウス的コーパスに対する予算付きノイズ検査としてモデル化し、信頼度の高い監査がランダムである場合の誤校正しきい値($*$過去)を特定する。
論文 参考訳(メタデータ) (2026-07-30T14:52:36Z) - Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors [0.6999740786886536]
低ビット量子化により、小さな推論モデルは安価に展開できるが、思考の連鎖を分解することができる。
中心となるトークンのlog-probabilityは$log p(w_t)+H_t$が間違ったオブザーバブルであることを示します。
本稿では,トークンの不確実性と明示的な繰り返しを混在させるデジェネレーションを意識したアラームスコアを組み合わせた,トレーニング不要な復号制御手法を提案する。
論文 参考訳(メタデータ) (2026-07-13T09:34:36Z) - ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - Hardware Validation of DAGI via a Modular "Ridge" Signature and High-Order Synergistic Information [0.0]
IBM Quantumハードウェア上でのDAGI(Directed Acyclic Graph Information)フレームワーク。
理想的な出力分布が低次元モジュラー多様体(リッジ)に制約される小さな制御された実験
キーリカバリはチャンスを超えた:ショット毎の精度0.1689(チャンス0.125,95% Wilson CI[0.1610, 0.1772])
これらの結果は、DAGIが非自明でハードウェアに耐性のある情報構造を検出し、定量化するという主張を支持する。
論文 参考訳(メタデータ) (2026-04-16T14:16:59Z) - Online Covariance Estimation in Averaged SGD: Improved Batch-Mean Rates and Minimax Optimality via Trajectory Regression [12.805268849262243]
我々はPolyak-Ruppert averaged gradient descent (SGD)のオンライン共分散行列推定について検討した。
この構造は、このボトルネックがSGDドリフトからヘッセンの情報をサブ線形に蓄積していることを明らかにする。
論文 参考訳(メタデータ) (2026-04-12T20:49:33Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Spectral Sentinel: Scalable Byzantine-Robust Decentralized Federated Learning via Sketched Random Matrix Theory on Blockchain [0.0]
ビザンチンのクライアントは、不均一な(Non-IID)データの下での濃度勾配を中毒する。
本稿では,ビザンチン検出・集約フレームワークであるSpectral Sentinelを提案する。
Polygonネットワーク上でブロックチェーンを統合することで,完全なシステムを実現しています。
論文 参考訳(メタデータ) (2025-12-14T09:43:03Z) - TARG: Training-Free Adaptive Retrieval Gating for Efficient RAG [46.122203287541005]
トレーニングフリーのAdaptive Retrieval Gating (TARG) は、ベースモデルからの短い非遅延ドラフトのみを使用していつ取得するかを決定する、単発のポリシーである。
NQ-Open、TriviaQA、PopQAでは、TARGは一貫して精度と効率のフロンティアをシフトさせる。
論文 参考訳(メタデータ) (2025-11-12T23:09:52Z) - Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits [54.220839560203096]
FGTSVA, 変分対応型トンプソンサンプリングアルゴリズムを提案する。
新しいデカップリング係数を$mathrmdc$で表すと、FGTS-VAは$tildeO(sqrtmathrmdccdotlog|mathcalF|$)を後悔する。
文脈線形帯域の設定において、FGTSVAの後悔境界は UCB ベースと一致する
論文 参考訳(メタデータ) (2025-11-03T23:25:41Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Your Absorbing Discrete Diffusion Secretly Models the Bayesian Posterior [0.0]
フォワード汚濁分布下での期待デノイザ出力が真の後部を回復することを示す。
我々は、K個の独立な分極パスを実行し、後続手段と分散の両方を集約する推論時アンサンブルを導入する。
論文 参考訳(メタデータ) (2025-07-10T09:42:47Z) - Beyond likelihood ratio bias: Nested multi-time-scale stochastic approximation for likelihood-free parameter estimation [49.78792404811239]
確率分析形式が不明なシミュレーションベースモデルにおける推論について検討する。
我々は、スコアを同時に追跡し、パラメータ更新を駆動する比率のないネスト型マルチタイムスケール近似(SA)手法を用いる。
我々のアルゴリズムは、オリジナルのバイアス$Obig(sqrtfrac1Nbig)$を排除し、収束率を$Obig(beta_k+sqrtfracalpha_kNbig)$から加速できることを示す。
論文 参考訳(メタデータ) (2024-11-20T02:46:15Z) - Near Sample-Optimal Reduction-based Policy Learning for Average Reward
MDP [58.13930707612128]
この研究は、平均報酬マルコフ決定過程(AMDP)における$varepsilon$-Optimal Policyを得る際のサンプルの複雑さを考察する。
我々は、状態-作用対当たりの$widetilde O(H varepsilon-3 ln frac1delta)$サンプルを証明し、$H := sp(h*)$は任意の最適ポリシーのバイアスのスパンであり、$varepsilon$は精度、$delta$は失敗確率である。
論文 参考訳(メタデータ) (2022-12-01T15:57:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。