論文の概要: Reducing Per-Sample Harm in Stochastic Optimization
- arxiv url: http://arxiv.org/abs/2607.16261v1
- Date: Sun, 28 Jun 2026 18:01:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.063278
- Title: Reducing Per-Sample Harm in Stochastic Optimization
- Title(参考訳): 確率最適化におけるサンプル当たりのハーム削減
- Abstract要約: 現代では、現在のミニバッチからの勾配と、運動量や適応モーメントといった歴史的な最適化状態が組み合わさっている。
我々はこの効果を害とみなし、パラメータ更新を最適化問題として定式化する。
正確な定式化は難解であるため、高効率なプロキシを導入する。
- 参考スコア(独自算出の注目度): 1.5229257192293202
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern optimizers combine gradients from the current mini-batch with historical optimization state, such as momentum or adaptive moments. While highly effective, aggregating across the batch and incorporating this history can produce parameter updates that increase the loss of individual samples. We term this effect harm and formalize the parameter update as an optimization problem that explicitly minimizes the conflicting impact of both batch averaging and past optimization state on current data. Because the exact formulation is intractable, we introduce a highly efficient proxy. We first reduce the problem's dimensionality to the batch size, and then drastically cut memory and speed bottlenecks by successfully restricting the optimization to the last linear layer. This hinges on the unexpected finding that this layer alone reliably captures the second-order statistics of the per-sample gradients. The resulting surrogate problem integrates readily into standard optimizers like SGD and AdamW, and can be solved using a small number of GPU-friendly iterations. Crucially, the method exhibits favorable scaling properties, as the relative computational overhead shrinks as the model size or input grows. Experiments on image classification benchmarks confirm reduced per-sample interference and improved generalization.
- Abstract(参考訳): 現代のオプティマイザは、現在のミニバッチからの勾配と、運動量や適応モーメントといった歴史的な最適化状態を組み合わせる。
非常に効果的だが、バッチをまたいで集約し、この履歴を組み込むことで、個々のサンプルの損失を増大させるパラメータ更新を生成することができる。
この効果を害と定義し、パラメータ更新を最適化問題として定式化し、現在のデータに対するバッチ平均化と過去の最適化状態の相反する影響を明示的に最小化する。
正確な定式化は難解であるため、高効率なプロキシを導入する。
まず,問題の次元をバッチサイズに削減し,最終線形層への最適化をうまく制限することで,メモリと速度のボトルネックを大幅に削減する。
このことは、この層だけがサンプルごとの勾配の2階統計を確実に捉えているという予期せぬ発見に基づいている。
結果として生じるサロゲート問題は、SGDやAdamWのような標準オプティマイザと容易に統合でき、GPUフレンドリーな少数のイテレーションで解決できる。
モデルのサイズや入力が大きくなるにつれて、相対的な計算オーバーヘッドが減少するので、この方法は好ましいスケーリング特性を示す。
画像分類ベンチマークの実験では、サンプルごとの干渉が減少し、一般化が改善された。
関連論文リスト
- Turning Stale Gradients into Stable Gradients: Coherent Coordinate Descent with Implicit Landscape Smoothing for Lightweight Zeroth-Order Optimization [11.723535704837266]
バックプロパゲーションが利用できないシナリオでは、ゼロオーダ(ZO)最適化が重要となる。
既存の方法は、サンプル非効率(例:標準有限差分)であるか、ランダム化推定による高い分散に悩まされている、という大きなトレードオフに直面している。
本研究では,CoCD(Coherent Coordinate Descent)を提案する。
論文 参考訳(メタデータ) (2026-05-14T04:52:24Z) - Low-rank Momentum Factorization for Memory Efficient Training [13.464518325870444]
Momentum Factorized (MoFaSGD) は、1次運動量の動的に更新された低ランクSVD表現を維持している。
大規模な言語モデルベンチマークにおけるMoFaSGDの有効性を実証し、メモリ削減(例えばLoRA)と性能の競合的なトレードオフを実現する。
論文 参考訳(メタデータ) (2025-07-10T18:04:52Z) - AdaLomo: Low-memory Optimization with Adaptive Learning Rate [59.64965955386855]
大規模言語モデルに対する適応学習率(AdaLomo)を用いた低メモリ最適化を提案する。
AdaLomoはAdamWと同等の結果を得ると同時に、メモリ要件を大幅に削減し、大きな言語モデルをトレーニングするためのハードウェア障壁を低くする。
論文 参考訳(メタデータ) (2023-10-16T09:04:28Z) - Self-Tuning Stochastic Optimization with Curvature-Aware Gradient
Filtering [53.523517926927894]
サンプルごとのHessian-vector積と勾配を用いて、自己チューニングの二次構造を構築する。
モデルに基づく手続きが雑音勾配設定に収束することを証明する。
これは自己チューニング二次体を構築するための興味深いステップである。
論文 参考訳(メタデータ) (2020-11-09T22:07:30Z) - Stochastic Optimization with Laggard Data Pipelines [65.20044914532221]
共通最適化手法の「データ抽出」拡張は同期手法よりも優れた性能を示すことを示す。
具体的には、ミニバッチによる凸最適化において、データエコーは、最適統計率を維持しながら収束率の曲率に支配される部分の高速化をもたらすことを示す。
論文 参考訳(メタデータ) (2020-10-26T14:55:31Z) - Balancing Rates and Variance via Adaptive Batch-Size for Stochastic
Optimization Problems [120.21685755278509]
本研究は,ステップサイズの減衰が正確な収束に必要であるという事実と,一定のステップサイズがエラーまでの時間でより速く学習するという事実のバランスをとることを目的とする。
ステップサイズのミニバッチを最初から修正するのではなく,パラメータを適応的に進化させることを提案する。
論文 参考訳(メタデータ) (2020-07-02T16:02:02Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。