論文の概要: Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling
- arxiv url: http://arxiv.org/abs/2605.31371v1
- Date: Fri, 29 May 2026 14:41:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.673512
- Title: Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling
- Title(参考訳): ソフトサイン:パラメータの均一性を改善するための最適化器のスムースサイン
- Abstract要約: サインベースとLMOにインスパイアされたデバイスは、パフォーマンスのフットプリントが強かったために、ディープラーニングに大きな注目を集めている。
我々は,符号ベースの更新からハードライクなステップへのパラメータ的遷移を考慮に入れた,符号ベースの最適化であるSoftSignumを提案する。
我々は、SoftMuonがハードサインベースの標準のAdamWよりも一貫して改善していることを示します。
- 参考スコア(独自算出の注目度): 43.61290689244612
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sign-based and LMO-inspired optimizers have recently attracted substantial attention in deep learning due to their strong performance and low memory footprint. However, their fixed-magnitude updates can hurt terminal convergence: they decouple update mechanisms from gradient magnitudes and fail to account for parameter heterogeneity, often leading to oscillation rather than convergence. We propose SoftSignum, a smooth relaxation of sign-based optimization that replaces the hard sign map with a temperature-controlled soft-sign transformation, enabling a parameter-wise transition from sign-like updates to magnitude-sensitive SGD-like steps. We complement it with an adaptive quantile-based temperature schedule and extend the same principle to matrix-valued optimizers, obtaining SoftMuon. We also develop a generalized geometry-relaxation framework based on strongly convex regularizers and Fenchel conjugates, proving convergence in stochastic non-convex setting. Experiments on diverse deep learning tasks, including LLM pretraining, show that SoftSignum and SoftMuon consistently improve over their hard sign-based counterparts and standard AdamW.
- Abstract(参考訳): 符号ベースとLMOにインスパイアされたオプティマイザは、パフォーマンスとメモリフットプリントの低さにより、最近、ディープラーニングに大きな注目を集めている。
それらは更新機構を勾配等級から切り離し、パラメータの不均一性を考慮せず、しばしば収束よりも振動を引き起こす。
ハードサインマップを温度制御されたソフトサイン変換に置き換えた,スムーズな符号ベースの最適化であるSoftSignumを提案する。
我々は、適応量子化に基づく温度スケジュールを補完し、同じ原理を行列値オプティマイザに拡張し、SoftMuonを得る。
また、強凸正規化器とフェンシェル共役器に基づく一般化幾何緩和フレームワークを開発し、確率的非凸設定における収束を証明した。
LLMプレトレーニングを含む多様なディープラーニングタスクの実験では、SoftSignumとSoftMuonは、ハードサインベースのタスクや標準のAdamWよりも一貫して改善されている。
関連論文リスト
- Bringing Order to Asynchronous SGD: Towards Optimality under Data-Dependent Delays with Momentum [16.032739611868685]
非同期分散勾配トレーニング(SGD)は、スケーラブルな分散トレーニングを可能にするが、安定性に悩まされる。
遅延依存学習率や安定度認識トレーニングといった既存の緩和戦略は、通常遅延勾配を廃止または廃止する。
本稿では,安定度を緩和しながら遅延勾配から情報を保存するために,モーメントに基づく非同期フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-03T20:24:24Z) - CurvZO: Adaptive Curvature-Guided Sparse Zeroth-Order Optimization for Efficient LLM Fine-Tuning [15.930478833291827]
バックプロパゲーションを備えた微調整の大型言語モデル(LLM)は高い性能を実現するが、かなりのメモリオーバーヘッドを引き起こす。
本稿では、スカラーZOフィードバックからオンラインの曲率信号を追跡するCurvZOを提案する。
CurvZOは微調整性能を継続的に改善し,ZOベースラインでのトレーニング時間を短縮することを示す。
論文 参考訳(メタデータ) (2026-03-23T09:13:45Z) - The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers [9.020853139493239]
非収束性と不安定性の1つの原因は、非遅延的なステップサイズスケジューリングである、と我々は主張する。
そこで本研究では,信号ベース対角線における一律的なステップサイズ決定を強制する,新たな攻撃アルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-02-22T08:37:06Z) - Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations [55.047454145941366]
Streaming Mergingは、反復最適化プロセスとしてマージを概念化する革新的なモデル更新パラダイムである。
ARMは勾配勾配勾配のダイナミクスを近似するために設計された戦略である。
ARMは初期のSFTチェックポイントしか必要とせず、反復的なマージによって完全に収束したSFTモデルを上回る。
論文 参考訳(メタデータ) (2026-02-03T08:15:57Z) - Unifying Sign and Magnitude for Optimizing Deep Vision Networks via ThermoLion [0.0]
現在のパラダイムは、情報チャネルドリフトパラメータに静的な妥協を課している。
我々は「低次元」探索モデルと「低次元」動的アライメントフレームワークを導入する。
論文 参考訳(メタデータ) (2025-12-01T17:04:17Z) - Taming LLMs by Scaling Learning Rates with Gradient Grouping [49.91587150497186]
大きな言語モデル(LLM)のトレーニングは、その大規模で異質なアーキテクチャのため、課題を提起する。
SGG(Scaling with Gradient Grouping)は、動的グルーピングとグループ固有のスケーリングによる適応的な学習率推定を改善するグラデーションラッパーである。
論文 参考訳(メタデータ) (2025-06-01T15:30:37Z) - Zeroth-Order Fine-Tuning of LLMs in Random Subspaces [63.10833446782114]
言語モデルのサイズが大きくなるにつれて、バックプロパゲーションに対するメモリ要求が増加する。
Zeroth-order (ZO) 最適化手法はメモリ効率の良い代替手段を提供する。
本稿では,高次元摂動によって生じる課題に対処するために,部分空間ゼロ次最適化を提案する。
論文 参考訳(メタデータ) (2024-10-11T17:01:43Z) - Adaptive Friction in Deep Learning: Enhancing Optimizers with Sigmoid and Tanh Function [0.0]
我々は適応摩擦係数を統合する2つの新しい勾配であるsigSignGradとtanhSignGradを紹介する。
我々の理論解析は,摩擦係数Sの広帯域調整能力を示す。
ResNet50 と ViT アーキテクチャを用いた CIFAR-10, Mini-Image-Net 実験により,提案手法の優れた性能が確認された。
論文 参考訳(メタデータ) (2024-08-07T03:20:46Z) - Learning Layer-wise Equivariances Automatically using Gradients [66.81218780702125]
畳み込みは等価対称性をニューラルネットワークにエンコードし、より優れた一般化性能をもたらす。
対称性は、ネットワークが表現できる機能、事前に指定する必要、適応できない機能に対して、固定されたハード制約を提供する。
私たちのゴールは、勾配を使ってデータから自動的に学習できるフレキシブル対称性の制約を可能にすることです。
論文 参考訳(メタデータ) (2023-10-09T20:22:43Z) - Positive-Negative Momentum: Manipulating Stochastic Gradient Noise to
Improve Generalization [89.7882166459412]
勾配雑音(SGN)は、ディープラーニングの暗黙の正規化として機能する。
深層学習を改善するためにランダムノイズを注入してSGNを人工的にシミュレートしようとした作品もある。
低計算コストでSGNをシミュレーションし、学習率やバッチサイズを変更することなく、PNM(Positive-Negative Momentum)アプローチを提案する。
論文 参考訳(メタデータ) (2021-03-31T16:08:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。