論文の概要: BrachistoneLR: A Brachistochrone-Inspired Learning-Rate Schedule and a Controlled Benchmark of Scheduling Policies
- arxiv url: http://arxiv.org/abs/2609.08069v1
- Date: Tue, 08 Sep 2026 00:24:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:42:19.923318
- Title: BrachistoneLR: A Brachistochrone-Inspired Learning-Rate Schedule and a Controlled Benchmark of Scheduling Policies
- Title(参考訳): BrachistoneLR:Brachistochroneにインスパイアされたラーニングレートスケジュールとスケジューリングポリシーの制御されたベンチマーク
- Authors: Md. Sadekur Rahman Roni, Md. Jalal uddin Chowdhury, Moutusi Dash Nimi,
- Abstract要約: ブラチストンLRは,ブラチストロンの鉛直座標をピークからフロアレートの範囲にマッピングして構築したスケジュールである。
72回以上のスケジュールを3つの画像分類データセットでベンチマークする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The learning-rate schedule is a consequential choice in training deep networks, yet the policies in common use are heuristic, and published comparisons are hard to read, because architecture, dataset, and budget tend to vary alongside the schedule. We study BrachistoneLR, a schedule built by mapping the vertical coordinate of the brachistochrone, the curve of fastest descent under gravity, onto the range between a peak and a floor rate. Expanding the definition shows it to be cosine annealing with the half-period set to E - 1 instead of E, the configuration a standard implementation gives when its period argument is one less than the number of epochs. The rate therefore reaches its floor at the last epoch trained rather than one epoch later, and we show this difference decays as E^-2, making it a short-horizon effect. We then benchmark six schedules over 72 runs on three image classification datasets (MNIST, Fashion-MNIST, CIFAR-10) and four architecture families (fully connected, convolutional, recurrent, residual), fixing the optimizer, data pipeline, and evaluation protocol so that only the schedule varies. Schedules that fall smoothly from peak to floor beat the constant rate and calendar-based decay by margins that grow with task difficulty, reaching 2.5 points of dataset mean on CIFAR-10. Within that leading group, BrachistoneLR, cosine annealing, and warmup-cosine lie within 0.06 accuracy points and 0.17 of a mean rank, which one seed per configuration cannot separate. BrachistoneLR is best on both residual networks and has the highest CIFAR-10 mean, and it sets no milestones, decay factor, warmup length, or restart period. We conclude that the shape of a schedule matters more than its parameterization, that the choice of whether to use a smooth schedule matters more than the choice among them, and that the terminal-rate distinction is worth attention only over short horizons.
- Abstract(参考訳): 学習速度のスケジュールは、ディープネットワークのトレーニングにおいて、連続した選択であるが、一般的な利用方針はヒューリスティックであり、アーキテクチャ、データセット、予算がスケジュールとともに変化する傾向があるため、公表された比較は読みにくい。
ブラチストンLRは,ブラチストロンの鉛直座標,すなわち重力下での降下曲線をピークからフロアレートの範囲にマッピングすることによって構築されたスケジュールである。
定義を拡張することで、E の代わりに E - 1 の半周期集合と余周期アニーリング(cosine annealing)であることが示され、標準実装では、その周期引数がエポックの数より 1 少ないときに与えられる。
この速度は1つのエポックではなく1つのエポックで訓練された最後のエポックに到達し、この差はE^-2として示され、短水平効果となる。
次に、72以上の6つのスケジュールを3つの画像分類データセット(MNIST、Fashion-MNIST、CIFAR-10)と4つのアーキテクチャファミリ(完全に接続された、畳み込み、再帰、残差)でベンチマークし、最適化器、データパイプライン、評価プロトコルを修正し、スケジュールだけを変える。
CIFAR-10では、ピークからフロアまで円滑に落ちるスケジュールが一定レートを上回り、タスクの難易度に応じて成長するマージンによるカレンダーベースの崩壊が平均2.5ポイントに達する。
このグループの中では、ブラチストンLR、コサインアニール、ウォームアップコサインは平均ランクの0.06の精度ポイントと0.17の範囲内にあり、構成ごとに1つの種子は分離できない。
ブラチストンLRは、両方の残留ネットワーク上で最高であり、CIFAR-10の平均値が最も高く、マイルストーン、崩壊要因、ウォームアップ期間、再起動期間は設定されていない。
スケジュールの形状はパラメータ化よりも重要であり、スムーズなスケジュールを使うかどうかの選択はそれらの選択よりも重要であり、ターミナルレートの区別は短い地平線上でのみ注目に値すると結論付けている。
関連論文リスト
- PATH: Next-Interval Prediction via Autoregressive Tree Hierarchy on Tabular Data [20.090153676612143]
インターバル予測は、可能な限り短い間隔で対象のカバレッジレベルを達成することを目的としている。
PATHは、各間隔から次のネストされたサブインターバルまで、確率質量がどのように流れるかを学ぶ。
PATHは結果の間隔を大幅に短縮し、平均正規化の長さは0.1473であり、平均カバレッジは0.9144である。
論文 参考訳(メタデータ) (2026-08-08T11:57:20Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling [51.78972657142583]
我々は、Timer-S1、強力なMixture-of-Experts(MoE)時系列基礎モデル、合計8.3Bのパラメータ、各トークンの0.75Bのアクティブパラメータ、コンテキスト長11.5Kについて紹介する。
既存のトレーニング済み時系列基盤モデルのスケーラビリティボトルネックを克服するため,シリアルスケーリングを3次元で実施する。
論文 参考訳(メタデータ) (2026-03-05T04:13:57Z) - Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging [70.05077723711618]
本研究では, 1-32xChinchillaスケールで学習した言語モデルが時間とともに減衰し, 問題の発生源とキャパシティ条件によって減衰速度が決定されることを示した。
以上の結果から,重み付き平均化と地平線なしのステップサイズを組み合わせることで,大規模言語モデルの事前学習におけるコサイン学習率のスケジュールに代わる実用的で効果的な選択肢が得られることが示唆された。
論文 参考訳(メタデータ) (2026-02-03T16:24:05Z) - Architecture-Agnostic Curriculum Learning for Document Understanding: Empirical Evidence from Text-Only and Multimodal [13.329839705160927]
文書理解モデルにおいて,プログレッシブなデータスケジューリングが一貫した効率向上をもたらすかどうかを検討する。
このスケジュールは,6.67から10.0までの有効エポックなデータ削減と合わせて,ウォールクロックのトレーニング時間を約33%短縮することを確認した。
論文 参考訳(メタデータ) (2026-02-02T10:09:26Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z) - RTMO: Towards High-Performance One-Stage Real-Time Multi-Person Pose Estimation [46.659592045271125]
RTMOは座標分類をシームレスに統合する一段階のポーズ推定フレームワークである。
高速を維持しながらトップダウン手法に匹敵する精度を達成する。
私たちの最大のモデルであるRTMO-lは、COCO val 2017で74.8%AP、1つのV100 GPUで141FPSを実現しています。
論文 参考訳(メタデータ) (2023-12-12T18:55:29Z) - Eigencurve: Optimal Learning Rate Schedule for SGD on Quadratic
Objectives with Skewed Hessian Spectrums [26.44093918424658]
Eigencurveは、2次目的のSGDの最小収束率(定数まで)を達成することができる学習率スケジュールの最初のファミリーである。
実験結果から,Eigencurveは画像分類タスクにおいて,ステップ崩壊を著しく上回り得ることが示された。
実用的な応用のための2つの単純な学習率スケジューラは、Eigencurveを近似することができる。
論文 参考訳(メタデータ) (2021-10-27T01:17:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。