論文の概要: How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis
- arxiv url: http://arxiv.org/abs/2605.24749v1
- Date: Sat, 23 May 2026 22:00:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:18.362036
- Title: How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis
- Title(参考訳): 政策最適化のためのニューラルリワードモデルがどのように特徴を学習するか:単一インデックス分析
- Authors: Rei Higuchi, Ryotaro Kawata, Akifumi Wachi, Shokichi Takakura, Kohei Miyaguchi, Taiji Suzuki,
- Abstract要約: r*(x) = *(langle *, xrangle)$ と $x sim N(0, I_d)$ でガウスの単一インデックスモデルでフィードバックを研究する。
まず、報酬重み付きサンプルから隠れた方向を*$で学習し、次に重み付きリッジ回帰により読み出し層に適合する2段階のニューラル報酬モデルを分析する。
- 参考スコア(独自算出の注目度): 53.063298916923976
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward modeling is not only a prediction problem: in KL-regularized policy optimization, the learned reward is exponentiated to define the deployed policy, so downstream value depends on errors in reward-tilted regions. We study this feedback in a Gaussian single-index model with $r^*(x) = σ^*(\langle θ^*, x\rangle)$ and $x \sim N(0, I_d)$. We analyze a two-stage neural reward model that first learns the hidden direction $θ^*$ from reward-weighted samples and then fits the readout layer by weighted ridge regression. Exponential reward weighting changes the Hermite signal available to the first layer; for any feature-learning temperature $β_1$ above a dimension-free $O(1)$ threshold, a constant fraction of neurons recover the hidden direction, with weak-recovery complexity governed by the generative exponent. After feature recovery, we derive tilted-policy value-gap bounds for an idealized label-weighted fit with weights $e^{y/β_2}$ and a more practical surrogate-weighted fit with weights $e^{r_{a_0}(x)/β_2}$. Keeping the $β_2$-dependence explicit yields an admissible set of deployment temperatures, balancing the gain from lowering $β_2$ against the learning cost amplified by exponential weighting; in the surrogate-weighted case, proxy-dependent factors shrink this admissible set.
- Abstract(参考訳): KL規則化されたポリシー最適化では、学習された報酬はデプロイされたポリシーを定義するために指数付けされるので、下流の値は報奨対象地域のエラーに依存する。
このフィードバックは、$r^*(x) = σ^*(\langle θ^*, x\rangle)$ と $x \sim N(0,I_d)$ のガウス単射モデルを用いて検討する。
まず、報酬重み付きサンプルから隠れた方向$θ^*$を学習し、次に重み付きリッジ回帰により読み出し層に適合する2段階のニューラル報酬モデルを分析する。
指数的報酬重み付けは、第1層に利用可能なヘルミット信号を変化させる;任意の特徴学習温度$β_1$が、次元自由な$O(1)$閾値を超えると、ニューロンの一定割合が隠れた方向を回復し、生成的指数によって制御される弱い回復の複雑さを持つ。
特徴回復後, 理想的なラベル重み付きフィットにe^{y/β_2}$を, より実用的なサロゲート重み付きフィットにe^{r_{a_0}(x)/β_2}$を導出した。
指数重み付けによって増幅された学習コストに対して、β_2$を下げることによる利得のバランスをとることにより、β_2$依存は許容可能な配置温度の集合を明示する。
関連論文リスト
- When Does $\ell_2$-Boosting Overfit Benignly? High-Dimensional Risk Asymptotics and the $\ell_1$ Implicit Bias [15.113649527486276]
良性オーバーフィッティングが線形レートで失敗することを示します。
この局所化機構は信号の存在下で持続するべきであるが、正確な信号-雑音分解は未解決の問題である。
論文 参考訳(メタデータ) (2026-05-07T14:14:09Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Amortized Simulation-Based Inference in Generalized Bayes via Neural Posterior Estimation [1.096028999747108]
一般化ベイズ推論(英語版)(GBI)は、過信を緩和し、モデルの不特定性の下で改善するために温度$>0$の損失を誘惑する。
本研究は,1つの前進パスでサンプリング可能な1ドル(x,)$条件のニューラルな後進推定器$q_(mid x,)$をトレーニングすることにより,最初の完全償却変分近似を後進群$p_(mid x) propto (),p(x mid )$に与える。
論文 参考訳(メタデータ) (2026-01-29T22:20:47Z) - Retire: Robust Expectile Regression in High Dimensions [3.9391041278203978]
ペナル化量子化法と期待回帰法は、高次元データの異方性検出に有用な手段を提供する。
我々は,頑健な期待回帰(退職)を提案し,研究する。
提案手法は半平滑なニュートン座標降下アルゴリズムにより効率よく解けることを示す。
論文 参考訳(メタデータ) (2022-12-11T18:03:12Z) - Nonparametric regression with modified ReLU networks [77.34726150561087]
ネットワーク重み行列を入力ベクトルに乗じる前に,まず関数$alpha$で修正したReLUニューラルネットワークによる回帰推定を考察する。
論文 参考訳(メタデータ) (2022-07-17T21:46:06Z) - Bounding the Width of Neural Networks via Coupled Initialization -- A
Worst Case Analysis [121.9821494461427]
2層ReLUネットワークに必要なニューロン数を著しく削減する方法を示す。
また、事前の作業を改善するための新しい下位境界を証明し、ある仮定の下では、最善を尽くすことができることを証明します。
論文 参考訳(メタデータ) (2022-06-26T06:51:31Z) - High-dimensional Asymptotics of Feature Learning: How One Gradient Step
Improves the Representation [89.21686761957383]
2層ネットワークにおける第1層パラメータ $boldsymbolW$ の勾配降下ステップについて検討した。
我々の結果は、一つのステップでもランダムな特徴に対してかなりの優位性が得られることを示した。
論文 参考訳(メタデータ) (2022-05-03T12:09:59Z) - Breaking the Sample Complexity Barrier to Regret-Optimal Model-Free
Reinforcement Learning [52.76230802067506]
漸進的強化学習における後悔を最小限に抑えるために,新しいモデルフリーアルゴリズムを提案する。
提案アルゴリズムは、2つのQ-ラーニングシーケンスの助けを借りて、初期設定された参照更新ルールを用いる。
初期の分散還元法の設計原理は、他のRL設定とは独立した関心を持つかもしれない。
論文 参考訳(メタデータ) (2021-10-09T21:13:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。