論文の概要: From Truncation to Commitment: Persistent Context in Uniform Discrete Diffusion
- arxiv url: http://arxiv.org/abs/2609.01043v1
- Date: Tue, 01 Sep 2026 10:43:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.583498
- Title: From Truncation to Commitment: Persistent Context in Uniform Discrete Diffusion
- Title(参考訳): トランニケーションからコミットメントへ:一様離散拡散における持続的文脈
- Authors: Satoshi Hayakawa,
- Abstract要約: 均一状態の離散拡散モデルは、すべての位置を変更可能にしながら、すべてのトークンを並列に更新する。
我々は、選択したargmaxトークンを格納し、その後のモデル入力に挿入する訓練不要なサンプルである、コミット露光サンプリング(CRS)を提案する。
- 参考スコア(独自算出の注目度): 5.2262942936091905
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Uniform-state discrete diffusion models update all tokens in parallel while keeping every position revisable. Even when the commonly used top-$p$ rule leaves only one candidate at a position, that choice affects only the current reverse step and can be revised at the next sampling step. We ask what changes when selected hypotheses instead become persistent context for later predictions. We therefore propose committed reveal sampling (CRS), a training-free sampler that stores selected argmax tokens and inserts them into subsequent model inputs. Our analysis gives a rationale for selecting later and for keeping selected tokens visible. Under the exact forward process, the Bayes error of selecting a clean token cannot increase as noise decreases, while in a simple latent-mode model, keeping the selected token visible helps later parallel predictions agree on the same sequence-level choice. Empirically, paired experiments on Duo-distilled then separate this persistent effect from single-step top-$p$ restriction and scalar temperature scaling. Under the same finalization rule, CRS without top-$p$ truncation reaches lower generative perplexity (GenPPL) than fixed $p=0.95$ and $p=0.9$ baselines across budgets of 8--64 function evaluations (NFE). At 64 NFE, the comparison at matched unigram entropy also gives lower GenPPL for CRS, yielding a more favorable GenPPL--entropy tradeoff. Base Duo shows the same direction in a descriptive comparison, while other diversity and continuation metrics can rank these operating points differently. These results identify support restriction and persistent context as distinct controls of that tradeoff.
- Abstract(参考訳): 均一状態の離散拡散モデルは、すべての位置を変更可能にしながら、すべてのトークンを並列に更新する。
一般的に使用されるトップ$p$ルールが1つの位置に1つの候補を残したとしても、その選択は現在の逆ステップだけに影響し、次のサンプリングステップで修正できる。
選択された仮説が後続の予測に対して永続的な文脈になるとき、どのような変化が起こるか尋ねる。
そこで我々は、選択したargmaxトークンを格納し、後続のモデル入力に挿入する訓練不要なサンプルである、コミット露光サンプリング(CRS)を提案する。
我々の分析は、後から選択し、選択したトークンを目に見えるようにするための根拠を与える。
正確な前処理の下では、ノイズが減少するにつれてクリーントークンを選択するベイズ誤差は増大しないが、単純な潜在モードモデルでは、選択したトークンを可視化することは、後続の並列予測が同じシーケンスレベルの選択に一致するのに役立つ。
実証的に、デュオ蒸留のペア実験は、この持続的な効果を1段階のトップ=$p$制限とスカラー温度スケーリングから分離した。
同じファイナライズルールの下では、トップ$p$トルーニケーションのないCRSは、固定された$p=0.95$と$p=0.9$ベースラインの8-64関数評価 (NFE) よりも低い生成パープレキシティ(GenPPL)に達する。64 NFEでは、一致したユニグラムエントロピーの比較もまた、CRSに対してGenPPLを低くし、より好ましいGenPPLエントロピートレードオフをもたらす。
ベースデュオは記述的比較において同じ方向を示すが、他の多様性と継続の指標はこれらの操作ポイントを異なるランク付けすることができる。
これらの結果は、サポート制限と永続的なコンテキストを、そのトレードオフの異なるコントロールとして識別する。
関連論文リスト
- Adversarial Online Classification with a Preview [17.495168716195476]
最悪のオンライン分類は、リトルストーン次元のようなシーケンシャルな複雑さによって管理されている。
オンラインの順序をランダムにすることなく、古典的な統計次元によって、ランダムなプレビューが最悪ケースのシーケンシャルな複雑さを置き換えることができることを示す。
論文 参考訳(メタデータ) (2026-08-30T01:38:49Z) - Provably adaptive sampling with uniform and remasking discrete diffusion models [9.180350432640912]
本研究では,一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一様・一
我々の主な成果は、適応的なサンプリング保証を確立することである。
構造化された合成分布に関する数値実験は、予測された次元適応挙動を示す。
論文 参考訳(メタデータ) (2026-08-24T17:54:51Z) - Robust Average-Reward Markov Decision Processes: Minimax-Optimal Learning via Plug-in Reductions [51.50375419691955]
分布的に堅牢なマルコフ決定プロセスは、モデルの不確実性の下でのシーケンシャルな意思決定のための原則化されたフレームワークを提供する。
我々は,平均回帰基準の下で,$varepsilon$-Optimal robust policyを学習するのに必要なサンプル数と十分なサンプル数について検討した。
論文 参考訳(メタデータ) (2026-08-06T19:49:48Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - Post-Training with Policy Gradients: Optimality and the Base Model Barrier [27.674563695368665]
結果とプロセス報酬を伴う線形自己回帰モデルの訓練後評価について検討する。
我々は、ポリシー勾配(PG)の変種が、本質的に最小限の報酬クエリ数を持つ1-varepsilon$を実現できることを証明した。
論文 参考訳(メタデータ) (2026-03-07T00:25:53Z) - Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Minimization [1.2674961594128336]
1つのドラフトモデルから$n$トークンが選択されたとき、最適な投機的サンプリングのためのアルゴリズムを考案する。
提案手法は,生成トークン当たり90%の受信と100ミリ秒未満のオーバーヘッドで,ターゲットモデル分布から無視できないずれを生じさせるマルチドラフトアルゴリズムである。
論文 参考訳(メタデータ) (2025-11-19T21:59:43Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z) - Best Policy Identification in Linear MDPs [70.57916977441262]
縮退した線形マルコフ+デルタ決定における最適同定問題について, 生成モデルに基づく固定信頼度設定における検討を行った。
複雑な非最適化プログラムの解としての下位境界は、そのようなアルゴリズムを考案する出発点として用いられる。
論文 参考訳(メタデータ) (2022-08-11T04:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。