論文の概要: AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization
- arxiv url: http://arxiv.org/abs/2608.01997v1
- Date: Mon, 03 Aug 2026 09:57:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.479706
- Title: AOS: Adaptive Optimizer Switching via Training-State Signals for Faster Convergence and Better Generalization
- Title(参考訳): AOS: 学習状態信号による適応オプティマイザスイッチングによる収束の高速化と一般化
- Abstract要約: AOS-Rは6つのオンライン勾配空間信号を監視する。
状態保存運動量伝達と400ステップの学習速度ブリッジは、遷移点毎に精度を低下させる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Single-optimizer training is a poor fit for the distinct phases of deep network optimization: adaptive methods handle noisy early gradients well but overshoot flat minima, while SGD with momentum generalizes better in the late phase but converges slowly early on. We introduce AOS-R (Adaptive Optimizer Switching, Rule-Based), a lightweight controller that monitors six online gradient-space signals -- gradient noise scale (GNS), Hutchinson curvature trace, loss stagnation, update stability ratio, gradient stability index (GSI), and loss improvement ratio (LIR) -- and switches among AdamW, SGD-M, and Lion as the optimization landscape evolves. State-preserving momentum transfer and a 400-step learning-rate bridge prevent accuracy degradation at every transition point. On CIFAR-100/WRN-28x10, AOS-R reaches 78% top-1 in 81 epochs -- 26% fewer than AdamW (109), 43% fewer than SGD-M (143), and 16% fewer than Lion (96). Across eight model-dataset benchmarks, AOS-R achieves best accuracy on 6 of 8 combinations with a mean +0.4 pp gain and 0.80x convergence speedup over AdamW under a single shared hyperparameter configuration.
- Abstract(参考訳): 適応的手法はノイズの多い初期勾配をうまく処理するが、平坦なミニマをオーバーシュートする一方、運動量を持つSGDは後期ではより一般化するが、徐々に収束する。
AOS-R(Adaptive Optimizer Switching, Rule-Based)は、AdamW、SGD-M、Lionの6つのオンライン勾配空間信号(勾配ノイズスケール(GNS)、ハッチンソン曲率トレース、損失停滞、更新安定性比(GSI)、勾配安定性指数(GSI)、損失改善比(LIR))を監視する軽量コントローラである。
状態保存運動量伝達と400ステップの学習速度ブリッジは、遷移点毎に精度劣化を防止する。
CIFAR-100/WRN-28x10では、AmdaW (109) より26%、SGD-M (143) より43%、Lion (96) より16%、AOS-Rは81のエポックで78%のトップ-1に達した。
8つのモデルデータセットのベンチマークで、AOS-Rは平均+0.4ppゲインと0.80x収束速度をAdamW上で1つの共有ハイパーパラメータ構成で最大6つの組み合わせで達成する。
関連論文リスト
- SS-ESOAP: Self-Scaled Adaptive Preconditioning for Physics-Informed Learning [70.71795707610961]
メソッドは、Kronecker幾何に適応したスカラーセマントエネルギー補正でSOAPスタイルのプレコンディショニングを強化する。
メソッドは8つのPDEベンチマークのうち6つで最下位の残差に達する。
4つの代表PDEの3列の$L2$と$H1$エラーは、低い残差と改善された解精度の間のリンクをサポートする。
論文 参考訳(メタデータ) (2026-08-29T21:34:47Z) - LDAC-Net: A Learnable Multi-Lag Differencing Attention-Convolution Network for Drift-Robust Recognition with Low-Cost MOX Gas Sensors [6.156377010595533]
安価な金属酸化物(MOX)ガスセンサをベースとしたポータブル電子ノイズシステムは、ガスと臭気の認識に実用的なソリューションを提供する。
既存のパイプラインは通常、固定された一階時間差分(FOTD)を使用する。
LDAC-Netは,マルチチャネルMOX信号で直接動作する,注目畳み込みネットワークとは違い,エンドツーエンドで学習可能なマルチラグである。
論文 参考訳(メタデータ) (2026-08-26T11:20:27Z) - Spectral Gradient Orthogonalization Improves Differentially Private Training at Scale [17.610398782149293]
空間的相関が勾配エネルギーを低ランクの部分空間に集中させる視覚モデルでは、ほとんどのノイズは信号がほとんどない方向に落ちる。
偏極分解によるスペクトル勾配直交化は後処理ステップとして導入される。
直交スペクトル信号対雑音比(SNR)が特異ベクトル回復に十分である場合にのみ精度が向上する。
論文 参考訳(メタデータ) (2026-08-18T06:35:26Z) - ISO: An RLVR-Native Optimization Stack [50.40395312897848]
アイソスペクトル最適化(ISO)としてスペクトル継承を運用する
オフラインでは、ISO-Mergerは共有ベーススペシャリストのフレーム変更を単一の固定スペクトルモデルに統合する。
オンラインのISO-Mergerは、AdamWやMuonを含む選択されたベースをフレーム変数に適用し、ベーススペクトルを固定する。
論文 参考訳(メタデータ) (2026-07-21T17:51:36Z) - Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 [53.71882250666667]
エージェント最適化法で報告されているほとんどの利得はワンショットである。
これは、デプロイされたエージェントにとって重要な設定をテストするものではない。
エージェントハーネス最適化に対する3つのアプローチを比較する。
論文 参考訳(メタデータ) (2026-07-15T16:36:04Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - Singularity-aware Optimization via Randomized Geometric Probing: Towards Stable Non-smooth Optimization [8.412194372218895]
本研究では,Singularity-aware Adam (S-Adam)を紹介した。
S-アダムには適応減衰機構が組み込まれており、不安定な地域での更新を減速し、スムーズな盆地での高速収束を保っている。
最適量子化アウェアトレーニング(QAT)と高雑音小バッチ学習の実証評価は、S-AdamがAdamWとProx-SGDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-28T08:00:40Z) - Convex Optimization for Alignment and Preference Learning on a Single GPU [52.997197698288936]
人間の好みに合わせて微調整された大きな言語モデルは、GeminiやChatGPTといったシステムの成功を導いた。
DPO(Direct Preference Optimization)は、よりシンプルな代替手段を提供するが、一貫性のないランキング精度やGPUリソースへの高い依存といった制限がある。
本稿では,理論的保証の強い新しい軽量戦略であるConvex Optimization for Alignment and Preference Learning Algorithm (COALA)を提案する。
論文 参考訳(メタデータ) (2026-05-22T05:25:00Z) - Directional Consistency as a Complementary Optimization Signal: The GONO Framework [0.0]
我々は、深層学習最適化における未探索現象を定式化し、指向性アライメントと損失収束を分離することができる。
本稿では,方向整合性の下でモーメントを増幅し,振動中にそれを抑圧する cc_t に基づいて,Adam の運動量ベータを適応させる GONO を紹介する。
我々は、GONOがAdamの収束率と一致することを証明し、信号が非形式的であるとき、正確にAdamに還元する。
論文 参考訳(メタデータ) (2026-05-07T17:05:05Z) - ESSA: Evolutionary Strategies for Scalable Alignment [8.418036456622158]
我々は,前向き推論とブラックボックス最適化のみを用いて,Large Language Models (LLM) を整列する勾配のないフレームワークであるESSAを提案する。
ESSAはQwen2.5-Math-7Bのテスト精度をGSM8Kで12.6%、PRM800Kで14.8%改善し、IFEvalでLLaMA3.1-8Bの精度を22.5%向上させた。
大規模な設定では、ESSAは勾配ベースの方法よりもスケーリングが強い。
論文 参考訳(メタデータ) (2025-07-06T16:23:07Z) - AdaGC: Improving Training Stability for Large Language Model Pretraining [18.163318397205533]
大きなLanguageText Models(LLM)は、スケーリング中に損失の急増に直面します。
グローバルなクリッピングがこれを緩和する一方で、従来のアプローチは特定のバリエーションを緩和する。
我々は,AdaGCがグローバルクリッピングよりも25%早く収束していることを示す。
論文 参考訳(メタデータ) (2025-02-16T08:13:23Z) - No More Adam: Learning Rate Scaling at Initialization is All You Need [13.892699813809857]
SGD-SaIは運動量による勾配降下(SGDM)の簡易かつ効果的な増強である
適応的な2階運動量に頼ることなく学習率を調整することで、SGD-SaIはトレーニングの不均衡を第1段階から防ぐことができる。
その単純さと効率にもかかわらず、SGD-SaIは様々なトランスフォーマーベースのタスクのトレーニングにおいて、AdamWと一貫して一致し、より優れています。
論文 参考訳(メタデータ) (2024-12-16T13:41:37Z) - Patch-Level Contrasting without Patch Correspondence for Accurate and
Dense Contrastive Representation Learning [79.43940012723539]
ADCLRは、正確で高密度な視覚表現を学習するための自己教師型学習フレームワークである。
提案手法は, コントラッシブな手法のための新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2023-06-23T07:38:09Z) - Non-Parametric Adaptive Network Pruning [125.4414216272874]
アルゴリズム設計を簡略化するノンパラメトリックモデリングを導入。
顔認識コミュニティに触発されて,メッセージパッシングアルゴリズムを用いて,適応的な例示数を求める。
EPrunerは「重要」フィルタを決定する際にトレーニングデータへの依存を壊します。
論文 参考訳(メタデータ) (2021-01-20T06:18:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。