論文の概要: How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
- arxiv url: http://arxiv.org/abs/2604.25907v1
- Date: Tue, 28 Apr 2026 17:52:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.986827
- Title: How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
- Title(参考訳): モデルがスーパービジョンにどれくらいの速さでコミットすべきか? Tsallis Loss Continuumにおける推論モデルのトレーニング
- Abstract要約: Loss family $J_Q$ RLVR と log-marginal-likelihood を補間する。
勾配の2つの因子化から2つのモンテカルロ推定子を導出する。
- 参考スコア(独自算出の注目度): 3.9929570259734604
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting reasoning models to new tasks during post-training with only output-level supervision stalls under reinforcement learning from verifiable rewards (RLVR) when the initial success probability $p_0$ is small. Using the Tsallis $q$-logarithm, we define a loss family $J_Q$ that interpolates between RLVR (at $q{=}0$, the exploitation pole) and the log-marginal-likelihood over latent trajectories (at $q{=}1$, the density-estimation pole). All members share the same per-example gradient direction, differing only by a scalar amplification $P_{θ^{-q}}$ that reweights each instance independently of the learning rate. This amplification is the mechanism that addresses cold-start stalling: under gradient flow, the exploitation pole requires $Ω(\frac{1}{p_0})$ time to escape cold start, while the density-estimation pole escapes in $Θ\big(\log(\frac{1}{p_0})\big)$; intermediate $q$ trades escape speed against noise memorization. Because $P_θ$ is intractable, we derive two Monte Carlo estimators from the two factorizations of the gradient: Gradient-Amplified RL (GARL) samples from the prior and amplifies the RL gradient, and Posterior-Attenuated Fine-Tuning (PAFT) importance-resamples from the posterior and runs standard SFT. Both have bias $O\big(\frac{q}{M P_θ^{q+1}}\big)$; GARL has lower variance, PAFT has semantically coherent gradients. On FinQA, HotPotQA, and MuSiQue, GARL at $q{=}0.75$ substantially mitigates cold-start stalling, escaping cold start where GRPO fails entirely. In warm start, GARL at low $q$ dominates FinQA where training is stable; on HotPotQA and MuSiQue, GARL destabilizes during training, and PAFT at $q{=}0.75$ provides stable gradients (best overall on HotPotQA at 47.9 maj@16, $+14.4$ over GRPO).
- Abstract(参考訳): 初回成功確率$p_0$が小さい場合, 検証可能な報酬(RLVR)からの強化学習の下で, 出力レベルの監視のみを伴って, 新たなタスクに推論モデルを適用することは停止する。
Tsallis $q$-logarithm を用いて、RLVR (at $q{=}0$, exploitation pole) と潜時軌道上の対数的類似性 (at $q{=}1$, density-estimation pole) を補間する損失族 $J_Q$ を定義する。
すべてのメンバーは、学習率とは独立に各インスタンスを重み付けするスカラー増幅$P_{θ^{-q}}$でのみ異なる、サンプル毎の勾配方向を共有する。
この増幅はコールドスタートの停止に対処するメカニズムである: 勾配流下では、悪用極はコールドスタートを逃れるために$Ω(\frac{1}{p_0})$時間を必要とし、密度推定極は$ \big(\log(\frac{1}{p_0})\big)$; 中間$q$はノイズ記憶から速度を逃す。
P_θ$は難解であるため、勾配の2つの因子から2つのモンテカルロ推定器を導出する。
どちらもバイアス$O\big(\frac{q}{M P_θ^{q+1}}\big)$; GARL は分散が低く、PAFT は意味的にコヒーレントな勾配を持つ。
FinQA、HotPotQA、MuSiQueでは、$q{=}0.75$のGARLは、GRPOが完全に失敗するコールドスタートの停止を実質的に緩和する。
HotPotQA と MuSiQue では、トレーニング中に GARL は不安定になり、$q{=}0.75$ では PAFT は安定した勾配を提供する(HotPotQA では 47.9 maj@16, $+14.4$ over GRPO)。
関連論文リスト
- Sharp Minimax Regret for Infinite-Memory Logistic Prediction [55.29259818039367]
Lag $j$はスケール$r_j$の予測に影響を与え、$n_T,j=T-j+1$の予測ラウンドに入る。
すべての要約可能なエンベロープに対して、局所化された混合は$cR_T(r)leq C_T(r)$を証明する。
指数関数やエンベロープの場合、有限サンプル条件の下では、トープリッツ・デサインの逆は$cR_T(r)geq c_T(r)$である。
論文 参考訳(メタデータ) (2026-08-27T01:31:46Z) - One Inverse Step is a Convex Program: Bayes-Limit Calibration of Diffusion Inversion [0.0]
1つの暗黙のDDIM反転ステップは、事前訓練された拡散モデルが局所多様体幾何学を符号化するかどうかの最も安価なプローブである。
フェルミ窓はモデルのトレーニングサポートと3.6$-$5.6times$で対立し、ヘッセン=リプシッツ定数は法が読み取る曲率の2-$12%である。
最後の条件付き天井 $_t_max(mathrmsym,J)le1$, from $mathrmCov(x_0mid x_t)succeq0$
論文 参考訳(メタデータ) (2026-08-24T11:01:54Z) - Sharp Stability Threshold and Certification for Designing Stable Residual Architectures [4.781989580907985]
残差ブロックの速度場毎の入力-マグニチュード指数に対する鋭い安定性しきい値を提案する。
しきい値$q = 1$は、2つの独立した引数によって確立される。
残差ブロックを構築する5つの操作の下での入力-マグニチュード指数の算術は、アーキテクチャプリミティブのレベルで$q_k le 1$の効率的な認証を可能にする。
論文 参考訳(メタデータ) (2026-07-16T05:13:44Z) - Asymptotic-Preserving A Posteriori Analysis of Diffusion and Flow-Matching Samplers [0.6768558752130311]
拡散及びフローマッチングサンプリングは、学習した確率フローODEを、大きなノイズスケールから小さな終端フロア($_min$)まで統合し、スコアが硬く、フローが境界層を発達させる。
特異摂動パラメータとして$_min$を扱い、どの固定ステップサンプリングが解けるかを決定する。
論文 参考訳(メタデータ) (2026-07-05T04:48:33Z) - Post-Training with Policy Gradients: Optimality and the Base Model Barrier [27.674563695368665]
結果とプロセス報酬を伴う線形自己回帰モデルの訓練後評価について検討する。
我々は、ポリシー勾配(PG)の変種が、本質的に最小限の報酬クエリ数を持つ1-varepsilon$を実現できることを証明した。
論文 参考訳(メタデータ) (2026-03-07T00:25:53Z) - Complexity of Classical Acceleration for $\ell_1$-Regularized PageRank [14.919427330415608]
FISTAは1/$ローカリティスケーリングを保ちながら$$への依存を改善することができることを示す。
我々はFISTAをわずかに過正規化された目的に基づいて解析し、チェック可能な閉じ込め条件下では、全ての刺激活性化が境界集合内に存在することを示す。
これにより、加速された$(sqrt)-1log(/varepsilon)$項と境界オーバーヘッド$sqrtvol(mathcalB)/(3/2)$からなるバウンダリが得られる。
論文 参考訳(メタデータ) (2026-02-24T17:35:46Z) - Entropic Risk Optimization in Discounted MDPs: Sample Complexity Bounds with a Generative Model [2.4145441422386464]
有限割引決定過程において、最適状態-作用値関数$Q*$と最適ポリシー$pi*$を学習する際のサンプル複雑度を解析する。
我々は、モデルに基づくリスクに敏感な$Q$-value-iteration (MB-RS-QVI) と呼ばれる単純なモデルベースアプローチを提案し、分析する。
論文 参考訳(メタデータ) (2025-05-30T22:27:57Z) - Temperature is All You Need for Generalization in Langevin Dynamics and other Markov Processes [43.857810191928166]
過度にパラメータ化されたモデルのトレーニングにおいて、トレーニングとテストエラーのギャップを分析する。
トレーニング時間にもミキシングにも依存せず、次元や勾配規範にも依存せず、損失やモデルの他の特性にも依存しています。
論文 参考訳(メタデータ) (2025-05-25T10:49:09Z) - On the $O(\rac{\sqrt{d}}{T^{1/4}})$ Convergence Rate of RMSProp and Its Momentum Extension Measured by $\ell_1$ Norm [54.28350823319057]
本稿では、RMSPropとその運動量拡張を考察し、$frac1Tsum_k=1Tの収束速度を確立する。
我々の収束率は、次元$d$を除くすべての係数に関して下界と一致する。
収束率は$frac1Tsum_k=1Tと類似していると考えられる。
論文 参考訳(メタデータ) (2024-02-01T07:21:32Z) - (Accelerated) Noise-adaptive Stochastic Heavy-Ball Momentum [7.095058159492494]
ヘビーボール運動量(SHB)は機械学習モデルのトレーニングに一般的に用いられ、勾配よりも経験的な結果を提供することが多い。
SHBは, 条件値 $kappa2$ の閾値 $b*$ よりも小さい場合に, 高速化されたミニバッチサイズが得られることを示す。
論文 参考訳(メタデータ) (2024-01-12T18:17:28Z) - Settling the Sample Complexity of Online Reinforcement Learning [92.02082223856479]
バーンインコストを発生させることなく、最小限の最適後悔を実現する方法を示す。
最適値/コストや一定の分散といった問題依存量の影響を明らかにするために、我々の理論を拡張します。
論文 参考訳(メタデータ) (2023-07-25T15:42:11Z) - Depth Dependence of $\mu$P Learning Rates in ReLU MLPs [72.14317069090407]
我々は、最大更新(mu$P)学習率の$n$と$L$に依存することを研究する。
我々は、$L3/2.$のように、$L$の非自明な依存があることを発見した。
論文 参考訳(メタデータ) (2023-05-13T01:10:49Z) - Horizon-Free and Variance-Dependent Reinforcement Learning for Latent
Markov Decision Processes [62.90204655228324]
我々は,後期マルコフ決定過程(LMDP)における強化学習(RL)の文脈を考慮した後悔の最小化について検討した。
我々は,モデル最適化と値最適化の両手法でインスタンス化できる,新しいモデルベースアルゴリズムフレームワークを設計する。
論文 参考訳(メタデータ) (2022-10-20T21:32:01Z) - Near-Optimal Regret Bounds for Multi-batch Reinforcement Learning [54.806166861456035]
本研究では,有限水平マルコフ決定過程(MDP)によってモデル化されたエピソディック強化学習(RL)問題をバッチ数に制約を加えて検討する。
我々は,$tildeO(sqrtSAH3Kln (1/delta))$tildeO(cdot)をほぼ最適に後悔するアルゴリズムを設計し,$(S,A,H,K)$の対数項を$K$で隠蔽する。
技術的貢献は2つある: 1) 探索のためのほぼ最適設計スキーム
論文 参考訳(メタデータ) (2022-10-15T09:22:22Z) - Reward-Mixing MDPs with a Few Latent Contexts are Learnable [75.17357040707347]
報酬混合マルコフ決定過程(RMMDP)におけるエピソード強化学習の検討
我々のゴールは、そのようなモデルにおける時間段階の累積報酬をほぼ最大化する、ほぼ最適に近いポリシーを学ぶことである。
論文 参考訳(メタデータ) (2022-10-05T22:52:00Z) - What Happens after SGD Reaches Zero Loss? --A Mathematical Framework [35.31946061894308]
SGD(Gradient Descent)の暗黙のバイアスを理解することは、ディープラーニングにおける重要な課題の1つである。
本稿では、Katzenberger (1991) のアイデアを適応させることにより、そのような分析の一般的な枠組みを提供する。
1) a global analysis of the implicit bias for $eta-2$ steps, not to the local analysis of Blanc et al. (2020) that is only for $eta-1.6$ steps and (2) allowing any noise covariance。
論文 参考訳(メタデータ) (2021-10-13T17:50:46Z) - Breaking the Sample Complexity Barrier to Regret-Optimal Model-Free
Reinforcement Learning [52.76230802067506]
漸進的強化学習における後悔を最小限に抑えるために,新しいモデルフリーアルゴリズムを提案する。
提案アルゴリズムは、2つのQ-ラーニングシーケンスの助けを借りて、初期設定された参照更新ルールを用いる。
初期の分散還元法の設計原理は、他のRL設定とは独立した関心を持つかもしれない。
論文 参考訳(メタデータ) (2021-10-09T21:13:48Z) - $Q$-learning with Logarithmic Regret [60.24952657636464]
楽観的な$Q$は$mathcalOleft(fracSAcdot mathrmpolyleft(Hright)Delta_minlogleft(SATright)right)$ cumulative regret bound, where $S$ is the number of state, $A$ is the number of action, $H$ is the planning horizon, $T$ is the total number of steps, $Delta_min$ is the least sub-Optitimality gap。
論文 参考訳(メタデータ) (2020-06-16T13:01:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。