論文の概要: GNMR: Runtime Stability Control for Low-Precision Large Language Model Training
- arxiv url: http://arxiv.org/abs/2606.00539v1
- Date: Sat, 30 May 2026 05:11:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.514157
- Title: GNMR: Runtime Stability Control for Low-Precision Large Language Model Training
- Title(参考訳): GNMR:低精度大言語モデルトレーニングのための実行時安定性制御
- Abstract要約: 訓練安定性は、低精度言語モデルのトレーニングにおいて重要なボトルネックである。
これを実行時安定性制御として定式化し、GNMR(Gradient Norm-to-Mean Ratio)を提案する。
GNMRは、ハードな$mathrmmaxO$予算と短いロック間隔の下で、局所的なリスク信号を有界回復行動にマッピングする。
- 参考スコア(独自算出の注目度): 9.313855354525872
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training stability is a key bottleneck in low-precision language model training: efficient low-cost paths can still produce short-lived numerical risks at a small set of operators. We formulate this as runtime stability control and present Gradient Norm-to-Mean Ratio (GNMR), a lightweight controller that compares each recoverable unit's current gradient norm with its historical mean. Together with $Δ$-GNMR for abrupt short-window increases, GNMR maps local risk signals to bounded recovery actions under a hard $\mathrm{maxO}$ budget and a short lock interval, without changing the numerical format, kernel, or backend recipe. Across activation-quantization stress, DeepSeek-style recipe-level training, and LLaMA-2 13B fine-tuning, GNMR preserves high-fidelity quality with sparse, budgeted recovery. These results support GNMR as a backend-agnostic controller to improve low-precision training stability while preserving low-cost execution.
- Abstract(参考訳): 訓練安定性は、低精度言語モデルのトレーニングにおいて重要なボトルネックである。
我々はこれを実行時安定性制御として定式化し、各回収可能な単位の現在の勾配ノルムをその歴史的平均値と比較する軽量コントローラであるグラディエントノルム平均比(GNMR)を提示する。
急激なショートウインドウに対する$Δ$-GNMRとともに、GNMRは、数値形式、カーネル、バックエンドのレシピを変更することなく、ハードな$\mathrm{maxO}$予算と短いロック間隔の下で、局所リスク信号を有界回復行動にマッピングする。
活性化量子化ストレス、DeepSeekスタイルのレシピレベルトレーニング、LLaMA-2 13Bの微調整を含むGNMRは、細かな予算の回復によって高忠実度を保っている。
これらの結果は、GNMRをバックエンドに依存しないコントローラとしてサポートし、低コストな実行を保ちながら、低精度のトレーニング安定性を向上させる。
関連論文リスト
- RELTA-SGLD: Relative-Growth Localized Taming for Nonconvex Stochastic-Gradient Langevin Learning [10.599439539657785]
RELTA-SGLDは,過線形の漸進的な更新を安定化し,元の学習の不要な抑制を低減させるテーキング方式である。
閾値はテーミングのオン位置を決定するが、一方1段階のリャプノフ条件に由来する相対成長原理はテーミング強度を決定する。
論文 参考訳(メタデータ) (2026-07-21T19:43:54Z) - Residual-Controlled Multiplier Learning for Stochastic Constrained Decision-Making [12.04727482907937]
CMLは、ミニバッチ条件下での一次フィードバック乗算器のノイズを追跡する問題に対処する。
乗算器を有限ゲイン乗算器と原始降下のための有効圧力信号に分解する。
論文 参考訳(メタデータ) (2026-06-05T09:35:22Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs [19.079556051442168]
強化学習(Reinforcement Learning, RL)は、推論タスクにおける大規模言語モデルの改善に広く用いられている。
しかし、REINFORCE や GRPO のような広く採用されている批判のない政策段階的手法では、高い非同期性によって政策段階的推定器は明らかにノイズを生じさせる。
本稿では,REINFORCE/GRPOスタイルのアルゴリズムの安定化手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T18:40:51Z) - Adaptive recurrent flow map operator learning for reaction diffusion dynamics [0.9137554315375919]
我々は,適応的反復学習(DDOL-ART)を軽量な検証マイルストーンを持つ頑健な再帰戦略を用いて行う演算子学習器を開発した。
DDOL-ARTは長いロールアウトで安定なワンステップ演算子を学び、ゼロショットを強いシフトに一般化する。
物理ベースの数値損失演算子学習器(NLOL)よりも、マッチした設定で数倍高速である。
論文 参考訳(メタデータ) (2026-02-10T07:33:13Z) - SAFE: Stable Alignment Finetuning with Entropy-Aware Predictive Control for Reinforcement Learning from Human Feedback (RLHF) [0.0]
LM-RLHF設定のためのポリシーアクター批判RL法を新たに開発した。
本稿では,新たな多層安定化フレームワークであるSAFE(Stable Alignment Finetuning with Entropy-aware Control)を提案する。
論文 参考訳(メタデータ) (2026-02-04T15:26:44Z) - Safe Langevin Soft Actor Critic [10.683491090059867]
拘束強化学習における報酬と安全性のバランスをとるために,安全ランゲヴィン・ソフト・アクター・クリティカル(SL-SAC)を導入した。
SL-SACは10タスク中7タスクで最低コストを達成し,競争的リターンを維持していることを示す。
Safety-Gymnasiumでは、SL-SACは最先端のベースラインと比較して、速度タスクの19-63%のコスト削減を実現している。
論文 参考訳(メタデータ) (2026-01-31T08:06:35Z) - A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization [58.116300485427764]
強化学習のポストトレーニングは、大きな言語モデルにおける推論の振る舞いを引き出すことができる。
トークンレベルの補正は、オフポリシーネスの度合いが大きい場合、不安定なトレーニングダイナミクスにつながることが多い。
我々は,最小固定率 (MinPRO) を簡易かつ効果的に提案する。
論文 参考訳(メタデータ) (2026-01-30T08:47:19Z) - RRaPINNs: Residual Risk-Aware Physics Informed Neural Networks [0.0]
物理インフォームドニューラルネットワーク(PINN)は通常、大きな局所的なエラーを隠蔽する平均残差を最小化する。
CVaR(Residual Risk-Aware Physics-Informed Neural Networks PINNs)を提案する。
本稿では, メモリレスサンプリング, グローバルのみのテール予算, 残留中心リスクなどのフレームワークの制限について論じ, 永続的ハードポイント再生, 局所的リスク予算, およびBC/IC用語に対する多目的リスクを概説する。
論文 参考訳(メタデータ) (2025-11-23T16:10:45Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Direct Preference Optimization: Your Language Model is Secretly a Reward Model [119.65409513119963]
本稿では,RLHFにおける報酬モデルの新たなパラメータ化について紹介する。
DPO(Direct Preference Optimization)と呼ばれる結果のアルゴリズムは、安定的で、性能が高く、計算的にも軽量である。
我々の実験は、DPOが人間の好みに合わせて微調整できるだけでなく、既存の方法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-29T17:57:46Z) - Gaussian Process-based Min-norm Stabilizing Controller for
Control-Affine Systems with Uncertain Input Effects and Dynamics [90.81186513537777]
本稿では,この問題の制御・アフィン特性を捉えた新しい化合物カーネルを提案する。
この結果の最適化問題は凸であることを示し、ガウス過程に基づく制御リャプノフ関数第二次コーンプログラム(GP-CLF-SOCP)と呼ぶ。
論文 参考訳(メタデータ) (2020-11-14T01:27:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。