論文の概要: A Trust-region Framework for Moment Estimation
- arxiv url: http://arxiv.org/abs/2608.04026v1
- Date: Sun, 26 Jul 2026 20:46:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-09 10:00:34.271865
- Title: A Trust-region Framework for Moment Estimation
- Title(参考訳): モーメント推定のための信頼領域フレームワーク
- Abstract要約: 適応モーメント推定機構の動作を理解するための信頼領域フレームワークを開発する。
FineWeb-Edu と TinyStories でトレーニングされた GPT2-124M の実験から,信頼領域制約が弱い場合には,第4モーメント実現が最大のメリットをもたらすことが示唆された。
- 参考スコア(独自算出の注目度): 1.3537117504260623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we develop a trust-region framework for understanding the behavior of adaptive moment estimation mechanisms, such as \textsc{Adam}, in stochastic gradient optimization. Specifically, in this framework, the magnitude of the update step for each individual weight is constrained within a trust-region governed by a moment constraint of order $p\in[2,4]$. The resulting derivation then leads to a family of learning-rate mechanisms based on second-moment estimation and a normalized $p$-th moment estimation. When $p=4$, this involves kurtosis-like estimation. The general mechanism, referred to as \textsc{Gmake}, provides a unified interpretation of normalization by moment estimation, learning-rate scheduling, spectral lowpass filtering as momentum, and operator-level spectral normalization within a common trust-region framework. Experiments on GPT2-124M trained on FineWeb-Edu and TinyStories suggest that the fourth-moment realization provides its greatest benefit when trust-region constraints are weak. As progressively stronger trust-region controls are introduced, the second-moment realization becomes increasingly competitive, often achieving slightly lower validation loss than its corresponding fourth-moment realization.
- Abstract(参考訳): 本稿では, 確率勾配最適化において, 適応モーメント推定機構(textsc{Adam} など)の動作を理解するための信頼領域フレームワークを開発する。
具体的には、各重みに対する更新ステップの規模は、オーダー$p\in[2,4]$のモーメント制約によって管理される信頼領域内で制約される。
結果の導出は、第二モーメント推定と正規化された$p$-thモーメント推定に基づく学習速度機構のファミリにつながる。
p=4$の場合、これはクルトーシスのような推定を伴う。
一般的なメカニズムは「textsc{Gmake}」と呼ばれ、モーメント推定、学習速度スケジューリング、運動量としてのスペクトルローパスフィルタリング、共通信頼領域フレームワークにおける演算子レベルのスペクトル正規化による正規化の統一的な解釈を提供する。
FineWeb-Edu と TinyStories でトレーニングされた GPT2-124M の実験から,信頼領域制約が弱い場合には,第4モーメント実現が最大のメリットをもたらすことが示唆された。
ますます強力な信頼領域制御が導入されるにつれて、第二モーメント実現はますます競争力を高め、しばしば対応する第四モーメント実現よりもわずかに低い検証損失を達成する。
関連論文リスト
- From matrix inversion to constraints: provably tighter confidence regions for importance weights in label shift [0.5926203312586109]
本稿では,倒立型推論から直接行列制約フレームワークへのパラダイムシフトを提案する。
我々はこの枠組みを用いて、連立信頼領域を定義し、線形プログラミングを通して境界区間を抽出する。
提案手法は, インバージョン法よりも信頼区間が短く, 予測セットも小さい。
論文 参考訳(メタデータ) (2026-09-13T21:28:26Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - Is Fairness Truly Fair? Towards Reliable Lipschitz Fairness in Multi-Task Learning via Fixed-\ exorpdfstring{$δ$}{delta} Alignment [0.32792728203318305]
リプシッツ様式の個人公正は、意味論的に類似した例が同様の予測を受けるべきだという考えを定式化する。
本稿では,各モデルの表現距離から監査耐性を導出した場合,異なるセマンティックしきい値の下で異なるアルゴリズムを比較する。
トレーニング時間制御正規化から評価時間固定値の監査を分離する信頼性対応フレームワークである textbfReLiF を提案する。
論文 参考訳(メタデータ) (2026-06-09T09:36:54Z) - Rethinking the Divergence Regularization in LLM RL [56.952725733148746]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の訓練後において重要な要素となっている。
そこで本稿では,ハードマスクをスムーズなアドバンテージ重み付き二次正規化器に置き換える多変量正規化政策最適化(DRPO)を提案する。
DRPOはDPPOと同じ信頼領域を保ちながら、有界で連続的な勾配重みを誘導する。
論文 参考訳(メタデータ) (2026-06-08T17:58:23Z) - Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning [81.57028614960576]
1)信頼性の高い -- 信頼性の高い -- 信頼性の高い領域での回答は高度に正確で安定したものになり、2)高冗長性 -- モデルは正しい回答に達した後ずっと経ってから不必要なトークンを生成する。
これらの特性はより効率的で信頼性の高い推論戦略を解き放つ。
論文 参考訳(メタデータ) (2026-06-01T10:11:14Z) - Ratio-Variance Regularized Policy Optimization [64.95520246570446]
ポリシ比の分散を明示的に制約することは、信頼領域の制約に対する原則的な局所近似をもたらすことを示す。
本稿では,この制約を実装したR2bf VPO$(Ratio-Variance Regularized Policy Optimization)を紹介する。
論文 参考訳(メタデータ) (2026-05-26T09:53:42Z) - Fortifying Time Series: DTW-Certified Robust Anomaly Detection [12.25463709762372]
時系列異常検出は、高精度なアプリケーションにおける安全性を確保するために重要である。
既存のディフェンスは、ほとんど互換性がないか、$ell_p$-norm制約の下でのみ、認証された堅牢性を提供する。
ランダムな平滑化パラダイムを適用することで,時系列異常検出における最初のemphDTW認証型ロバストディフェンスを導入する。
論文 参考訳(メタデータ) (2026-05-08T12:59:52Z) - Safe RLHF Beyond Expectation: Stochastic Dominance for Universal Spectral Risk Control [12.053369001333058]
本稿では,予測コスト制約をFSD(First-Order Dominance)制約に置き換える,リスクに敏感なアライメントフレームワークを提案する。
RADは, 有効性を保ちながら, ベースラインよりも無害性を向上し, アウト・オブ・ディストリビューション評価においてより堅牢性を示す。
論文 参考訳(メタデータ) (2026-03-11T16:24:20Z) - Tempora: Characterising the Time-Contingent Utility of Online Test-Time Adaptation [16.841308606553685]
テスト時間適応(TTA)は、ドメインシフトの下で劣化するマシンラーニング(ML)モデルに対して、魅力的な治療法を提供する。
従来の評価では、正確さとレイテンシのトレードオフを見越して、無制限の処理時間を前提としていた。
時間的圧力下でのTTA評価のためのフレームワークであるTemporaを紹介する。
論文 参考訳(メタデータ) (2026-02-05T19:10:53Z) - Interval-Based AUC (iAUC): Extending ROC Analysis to Uncertainty-Aware Classification [12.024101882027466]
本研究では,不確実性を考慮したROCフレームワークを提案する。
AUC_L$ と $AUC_U$ の2つの新しい手段を導入する。
有効なクラス条件付きカバレッジでは、$AUC_L$ と $AUC_U$ は理論最適 AUC の形式的下限と上限を提供する。
論文 参考訳(メタデータ) (2026-02-04T17:12:04Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z) - FedSpeed: Larger Local Interval, Less Communication Round, and Higher
Generalization Accuracy [84.45004766136663]
フェデレートラーニング(Federated Learning)は、分散機械学習フレームワークである。
これは、局所的不整合最適と局所的過度な適合による頑丈なクライアントドリフトによってもたらされる非消滅バイアスに悩まされる。
本稿では,これらの問題による負の影響を軽減するために,新しい実用的手法であるFedSpeedを提案する。
論文 参考訳(メタデータ) (2023-02-21T03:55:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。