論文の概要: Planning to Learn
- arxiv url: http://arxiv.org/abs/2610.03667v1
- Date: Fri, 02 Oct 2026 17:38:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.533337
- Title: Planning to Learn
- Title(参考訳): 学ぶための計画
- Abstract要約: 正確な政策勾配は、期待された精度であっても、クロスエントロピーに低下することを示す。
MNISTと、ResNet-50、ResNet-101、ViT-S/16によるImageNetでは、水平線損失は、フラットな学習速度でクロスエントロピーよりもトップ-1の精度を向上させる。
- 参考スコア(独自算出の注目度): 1.1886634182318419
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Policy-gradient methods are central to modern reinforcement learning, including LLM post-training. When they struggle, the usual suspects are exploration, credit assignment and action-sampling noise. Classification has none of them. A classifier is a policy whose expected reward, its \emph{expected accuracy}, is the probability it assigns to the correct label, and because that label is known, the policy gradient is exact and smooth. Yet exact policy gradient loses to cross-entropy, even on expected accuracy. The exact gradient is myopic: it values an update only by what it buys now, but each update also sets where the next one starts, so an update's value depends on how much learning remains. Viewed this way, cross-entropy is patient accuracy, the total error an example would pay if its log-odds rose at unit speed forever, while exact policy gradient is the zero-horizon limit. Truncating this total at the learning that remains yields the horizon loss, a one-line change that moves from cross-entropy toward exact policy gradient as training runs out. In a simple allocation model, it provably escapes the trap that catches each endpoint. On MNIST and on ImageNet with ResNet-50, ResNet-101 and ViT-S/16, the horizon loss improves top-1 accuracy over cross-entropy at a flat learning rate, and the gain grows with label noise.
- Abstract(参考訳): 政策段階的な手法は、LLMポストトレーニングを含む近代的な強化学習の中心である。
争う場合、通常の容疑者は探索、クレジットの割り当て、およびアクションサンプリングノイズである。
分類は存在しない。
分類器は、期待される報酬である「emph{expected accuracy}」が正しいラベルに割り当てる確率であり、そのラベルが知られているので、ポリシー勾配は正確かつ滑らかである。
しかし、正確な政策勾配は、予想される正確性においてさえ、クロスエントロピーに負ける。
正確なグラデーションはミオピック(myopic)である – アップデートを今購入したもののみに評価するが、各更新は次のものを開始する場所も設定しているため、更新の価値は学習の残量に依存する。
このように見れば、クロスエントロピーは患者の正確さであり、例えば、ログオードが永久に単位速度で上昇した場合の総誤差は、正確なポリシー勾配はゼロホライゾン極限である。
トレーニングが終了すると、クロスエントロピーから正確な政策勾配へと移行する一直線的な変化である。
単純なアロケーションモデルでは、エンドポイントをキャッチするトラップを確実にエスケープする。
MNISTおよびImageNet with ResNet-50, ResNet-101, ViT-S/16では、水平線損失により、フラットな学習速度でクロスエントロピー上のトップ-1精度が向上し、ラベルノイズによってゲインが増大する。
関連論文リスト
- CTP-FL: Common-Trajectory Gradient Prediction for Federated Learning [0.42303492200814446]
通信効率のよいフェデレーション最適化は、通常、サーバ更新間でいくつかの勾配評価に費やします。
共通軌道予測フェデレーション学習(textttCTP-FL)を提案する。
textttCTP-FLは、クライアントごとに$K$のミニバッチ勾配と、各通信方向のモデルサイズのベクトルを使い、全参加型FedAvg-Mのラウンドごとの計算と通信にマッチする。
論文 参考訳(メタデータ) (2026-09-28T13:22:45Z) - IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients [4.619541348328937]
私たちはデコーダのみのトランスフォーマーについて単純な質問をする:どちらの2つの層が実際に生成された予測トークンの確率なのか?
既存のレイヤ単位の読み出しツールは、ほとんど答えない。
IG-Lensは,ベースラインから最終層への隠れ状態を通る単一の経路に沿って,統合勾配のテレスコープアプリケーションである。
論文 参考訳(メタデータ) (2026-06-29T01:41:42Z) - Gradient Equilibrium in Online Learning: Theory and Applications [56.02856551198923]
勾配平衡は標準オンライン学習法によって達成される。
勾配平衡は、オンライン予測問題において解釈可能かつ有意義な性質に変換される。
勾配平衡フレームワークは,ブラックボックス予測の偏りを緩和する手法の開発に利用できることを示す。
論文 参考訳(メタデータ) (2025-01-14T18:59:09Z) - Almost sure convergence rates of stochastic gradient methods under gradient domination [2.96614015844317]
大域的および局所的な勾配支配特性は、強い凸性のより現実的な置き換えであることが示されている。
収束率 $f(X_n)-f*in obig(n-frac14beta-1+epsilonbig)$ は勾配降下の最終反復である。
教師付き学習と強化学習の両方において,本研究結果をトレーニングタスクに適用する方法を示す。
論文 参考訳(メタデータ) (2024-05-22T12:40:57Z) - Random Feedback Alignment Algorithms to train Neural Networks: Why do
they Align? [0.0]
ランダムウォーカーの更新と真の勾配とのアライメントは、近似勾配降下を駆動する。
勾配アライメントはそれらの固定点に対する安定性の基準であることを示す。
高レベルの勾配アライメントがアルゴリズム性能の低下につながることを実証する。
論文 参考訳(メタデータ) (2023-06-04T10:50:13Z) - Policy Gradient for Continuing Tasks in Non-stationary Markov Decision
Processes [112.38662246621969]
強化学習は、マルコフ決定プロセスにおいて期待される累積報酬を最大化するポリシーを見つけることの問題を考える。
我々は、ポリシーを更新するために上昇方向として使用する値関数の偏りのないナビゲーション勾配を計算する。
ポリシー勾配型アルゴリズムの大きな欠点は、定常性の仮定が課せられない限り、それらがエピソジックなタスクに限定されていることである。
論文 参考訳(メタデータ) (2020-10-16T15:15:42Z) - Implicit Bias in Deep Linear Classification: Initialization Scale vs
Training Accuracy [71.25689267025244]
移行がスケールとトレーニング損失の最小化の関係によってどのように制御されるかを示す。
以上の結果から,勾配降下の限界挙動は,ばかげた訓練精度でのみ引き起こされることが示唆された。
論文 参考訳(メタデータ) (2020-07-13T23:49:53Z) - Do We Need Zero Training Loss After Achieving Zero Training Error? [76.44358201918156]
本研究では,遠心分離法(Emphflooding)と呼ばれる直接解法を提案する。
本研究では, 浸水により性能が向上し, 副産物として, 試験損失の2重降下曲線が誘導されることを実験的に示す。
論文 参考訳(メタデータ) (2020-02-20T12:50:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。