論文の概要: Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability
- arxiv url: http://arxiv.org/abs/2606.28116v1
- Date: Fri, 26 Jun 2026 14:18:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.509599
- Title: Mechanism-Driven Monitors for Preemptive Detection of LLM Training Instability
- Title(参考訳): LLMトレーニング不安定性のプリエンプティブ検出のためのメカニズム駆動型モニタ
- Authors: Ruixuan Huang, Yipei Wang, Wenyi Fang, Hantao Huang, Yifan Huang, Ansheng You, Zhenxing Zhang, Shuai Wang, Fan Wu, Yang Zheng,
- Abstract要約: 本研究では,各クリティカルモジュールの機能的役割から内部モニターを導出することにより,トレーニング不安定性のメカニズム駆動検出を行う。
低精度の注意、大規模学習率、複合障害に関する私たちのフォールトインジェクション実験は、これらの信号が異なる障害に対して異なるシグネチャを提供することを示している。
- 参考スコア(独自算出の注目度): 20.49786007379445
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier large language model training consumes massive accelerator fleets and long wall-clock computation, making stability failures costly when they occur. After a numerical or a hyperparameter fault has already destabilized the training dynamics, it may continue for thousands of steps while loss and gradient norms still appear normal. We study mechanism-driven detection of training instability by deriving internal monitors from the functional role of each critical module and from the earliest computational sites where failures are expected to produce measurable signatures. For low-precision flash attention, we monitor the spectral entropy of a QK bilinear decomposition, whose first-order term becomes abnormal before the loss fully collapses. For MoE routers, we derive indicators from their role in expert selection. Our fault-injection experiments on low-precision attention, large learning-rate, and combined faults show that these signals provide distinct signatures for different failures, triggering thousands of steps before loss divergence.
- Abstract(参考訳): 最前線の大規模言語モデルトレーニングは、巨大なアクセラレータフリートと長いウォールタイム計算を消費し、それらが発生した時に安定性の障害を引き起こす。
数値やハイパーパラメータの断層が既にトレーニングダイナミクスを不安定化させた後、損失や勾配のノルムが正常に見える間、数千のステップを継続する可能性がある。
本研究では,各臨界モジュールの機能的役割から内部モニターを導出し,故障が測定可能なシグネチャを生成できる最初期の計算現場からトレーニング不安定のメカニズム駆動検出について検討した。
低精度フラッシュアテンションでは、損失が完全に崩壊する前に1次項が異常となるQK双線形分解のスペクトルエントロピーをモニタする。
MoEルータについては、専門家の選択における役割からインジケータを導出する。
低精度の注意、大きな学習率、複合的な障害に関する私たちのフォールトインジェクション実験は、これらの信号が異なる障害に対して異なるシグネチャを提供することを示している。
関連論文リスト
- Mitigating Error Amplification in Fast Adversarial Training [58.74042726356826]
FAT(Fast Adversarial Training)は、ネットワークに摂動不変表現の学習を促すことによって、モデルロバスト性の向上に有効であることが証明されている。
FATは、しばしば破滅的なオーバーフィッティング(CO)に悩まされ、モデルがトレーニングアタックに過度に適合し、目に見えないものへの一般化に失敗する。
本稿では、摂動予算と監視信号の両方を動的に調整する分散対応動的ガイダンス(DDG)戦略を提案する。
論文 参考訳(メタデータ) (2026-04-27T11:23:18Z) - Causally-Constrained Probabilistic Forecasting for Time-Series Anomaly Detection [1.8995711908407733]
本研究では,異常検出のための因果制約付き確率予測フレームワークを提案する。
ディープ・シークエンス・モデリングに先立って、明示的な時間付き因果グラフを統合する。
実験により,提案手法が最先端検出性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-20T09:24:28Z) - Shifting Uncertainty to Critical Moments: Towards Reliable Uncertainty Quantification for VLA Model [10.781664119473966]
本稿では,ロールアウトの成功と失敗を予測するための統一的不確実性定量化手法を提案する。
本手法は, 故障予測精度を大幅に向上し, 故障検出のための信頼性の高い信号を得る。
論文 参考訳(メタデータ) (2026-03-18T22:52:03Z) - Axle Sensor Fusion for Online Continual Wheel Fault Detection in Wayside Railway Monitoring [1.1199585259018456]
本研究は,鉄道断層診断のためのセマンティック・アウェア,ラベル効率のよい連続学習フレームワークを提案する。
このモデルは、フラットやポリゴン化による小さな欠陥を検出しながら、進化する運用条件に適応する。
論文 参考訳(メタデータ) (2026-02-18T00:14:18Z) - ProbeLLM: Automating Principled Diagnosis of LLM Failures [89.44131968886184]
ProbeLLMはベンチマークに依存しない自動探索フレームワークで、個々の障害から構造的障害モードへの脆弱性発見を増大させる。
ProbeLLMは、検証可能なテストケースにプローブを制限し、ツールの拡張された生成と検証を活用することで、信頼性のある証拠として障害発見を根拠とする。
論文 参考訳(メタデータ) (2026-02-13T14:33:13Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Spectral Alignment as Predictor of Loss Explosion in Neural Network Training [31.831122738372603]
ディープニューラルネットワークのトレーニングにおける損失爆発は、数百万ドルのトレーニング実行を無効にする可能性がある。
重み行列の主特異ベクトルと層入力の分布アライメントを監視する新しい計量であるスペクトルアライメントを導入する。
言語モデルに関する実証的な結果は、SA分布の監視が従来のスカラーメトリクスよりもはるかに早く、明確な損失爆発の警告を提供することを示している。
論文 参考訳(メタデータ) (2025-10-05T13:35:34Z) - CVCM Track Circuits Pre-emptive Failure Diagnostics for Predictive Maintenance Using Deep Neural Networks [0.15056924758531146]
線路回路は鉄道の運行にとって重要であり、列車を見つけるための主要な信号線サブシステムとして機能している。
多くの障害は、時間とともに進化する微妙な異常として発生し、しばしば監視された信号では視覚的に見えなくなる。
本稿では,障害にエスカレートする前に,異常を適切に分類する予測保守フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:13:51Z) - Unsupervised Continual Anomaly Detection with Contrastively-learned
Prompt [80.43623986759691]
UCADと呼ばれる新しい非教師付き連続異常検出フレームワークを提案する。
このフレームワークは、対照的に学習したプロンプトを通じて、UDAに継続的な学習能力を持たせる。
我々は総合的な実験を行い、教師なし連続異常検出とセグメンテーションのベンチマークを設定した。
論文 参考訳(メタデータ) (2024-01-02T03:37:11Z) - Causal Disentanglement Hidden Markov Model for Fault Diagnosis [55.90917958154425]
本研究では, 軸受破壊機構の因果性を学ぶために, 因果解離隠れマルコフモデル (CDHM) を提案する。
具体的には、時系列データをフル活用し、振動信号を断層関連要因と断層関連要因に段階的に分解する。
アプリケーションの範囲を広げるために、学習された非絡み合った表現を他の作業環境に転送するために、教師なしのドメイン適応を採用する。
論文 参考訳(メタデータ) (2023-08-06T05:58:45Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。