論文の概要: TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training
- arxiv url: http://arxiv.org/abs/2608.30769v1
- Date: Mon, 31 Aug 2026 13:33:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.419453
- Title: TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training
- Title(参考訳): TrainSDC:大規模言語モデルトレーニングにおける無声データ破壊の特性と緩和
- Abstract要約: 本稿では,Transformer トレーニングにおいて,主要な計算インタフェースにまたがるサイレントデータ破損(SDC)の脆弱性を初めて体系的に評価する。
そこで本研究では,Q/Kパス再計算,残差ゲイン監視,指数認識勾配スケーリングからなる評価誘導型保護フレームワークTrainSDCを提案する。
- 参考スコア(独自算出の注目度): 9.623697282987083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM training is increasingly vulnerable to silent data corruption (SDC), yet existing protection methods largely treat Transformer computations uniformly because their vulnerability remains poorly understood. We present the first systematic characterization of SDC vulnerability across major computation interfaces in both the forward and backward passes of Transformer training. Our analysis reveals two distinct error propagation mechanisms: forward-pass vulnerability is highly location dependent, with faults on the Q/K path producing persistent training deviations, whereas backward-pass vulnerability is largely governed by gradient exponent distributions rather than computation locations. Motivated by these observations, we propose TrainSDC, a characterization-guided protection framework consisting of Q/K-path recomputation, residual-gain monitoring, and exponent-aware gradient scaling. Experiments on Llama 3.2-1B and Qwen3-0.6B show that TrainSDC maintains training behavior close to fault-free execution under both sparse and dense fault injection while introducing only 1.65%-6.76% runtime overhead.
- Abstract(参考訳): LLMトレーニングは、サイレントデータ破損(SDC)に対してますます脆弱になっているが、既存の保護手法は、その脆弱性がよく分かっていないため、トランスフォーマーの計算を一様に扱う。
本稿では,Transformer トレーニングの前方および後方パスにおいて,SDC 脆弱性の最初の体系的特徴について述べる。
フォワードパスの脆弱性は,Q/K経路の欠陥が持続的なトレーニング偏差を生じさせるのに対して,後方パスの脆弱性は計算位置よりも勾配指数分布に支配されている。
そこで本研究では,Q/Kパス再計算,残差ゲインモニタリング,指数的勾配スケーリングからなる評価誘導型保護フレームワークTrainSDCを提案する。
Llama 3.2-1B と Qwen3-0.6B の実験では、TrainSDC は、わずか1.65%-6.76%のランタイムオーバーヘッドを導入しながら、スパースと高密度の障害注入の両方の下で、障害のない実行に近いトレーニング動作を維持している。
関連論文リスト
- Benchmarking Sensor-Fault Robustness in Forecasting [34.25988781693566]
我々は,予測アーキテクチャとロバスト性改善手法を評価するために,共有CPS地上センサフォアストレステストプロトコルであるSensorFault-Benchを紹介する。
最悪のシナリオ劣化、クリーン平均二乗誤差(MSE)、最悪のシナリオ故障時間MSEを報告し、絶対誤差から相対ロバスト性を分離する。
SensorFault-Benchは、オープンソースコード、ドキュメント化されたデータアクセス、再生および拡張ガイドを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:41:14Z) - Balancing Stability and Plasticity in Sequentially Trained Early-Exiting Neural Networks [11.704570155438887]
早期に出現するニューラルネットワークは、中間分類器で入力を出力することで適応推論を可能にする。
モデルの異なるレベルで動作する2つの代替手法を提案する。
標準ベンチマークの実験は、我々のアプローチが早期終了性能を一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-05-06T18:36:32Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling [12.573852448122716]
テキスト・ツー・イメージ(T2I)拡散モデルは画像合成において顕著な成功を収めているが、大規模データやオープンエコシステムへの依存は深刻なバックドアセキュリティリスクをもたらす。
既存の防御、特に入力レベルメソッドは、より実用的だが、しばしばステルスでセマンティクスを保存するトリガー設計の下で信頼性が低い観測可能な異常に頼っている。
入力レベルのバックドア検出フレームワークであるSETを提案する。これはマルチスケールの摂動下で応答オフセット機能を構築し、小さなクリーンなサンプル集合からコンパクトな良性応答空間を学習する。
論文 参考訳(メタデータ) (2026-04-14T08:31:37Z) - Exploring Silent Data Corruption as a Reliability Challenge in LLM Training [2.720409520634766]
Silent Data Corruption (SDC): システムレベルの検出メカニズムをバイパスするハードウェアによる障害。
この研究は、間欠的なSDCが大規模言語モデルの事前学習にどのように影響するかについて、制御された研究を提供する。
観測された汚職シグネチャに基づいて,潜在的に有害なパラメータの更新を識別する軽量な検出手法を提案する。
論文 参考訳(メタデータ) (2026-04-01T10:37:16Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - ThreatFormer-IDS: Robust Transformer Intrusion Detection with Zero-Day Generalization and Explainable Attribution [0.0]
IoTおよび産業ネットワークの侵入検出には、進化するトラフィックと限定されたラベルの下で信頼性を維持しながら、低い偽陽性率で稀な攻撃を検出できるモデルが必要である。
本研究では,トランスフォーマーをベースとしたシーケンシャルモデリングフレームワークThreatFormer-IDSを提案する。
時系列評価を備えたToN IoTベンチマークでは、ThreatFormer-IDSがAUCROC 0.994、AUC-PR 0.956、Recall@1%FPR 0.910を達成した。
論文 参考訳(メタデータ) (2026-02-26T23:20:42Z) - Lie Detector: Unified Backdoor Detection via Cross-Examination Framework [68.45399098884364]
半正直な設定で一貫したバックドア検出フレームワークを提案する。
本手法は,SoTAベースラインよりも5.4%,1.6%,11.9%の精度で検出性能が向上する。
特に、マルチモーダルな大規模言語モデルにおいて、バックドアを効果的に検出するのは、これが初めてである。
論文 参考訳(メタデータ) (2025-03-21T06:12:06Z) - Improving LLM Safety Alignment with Dual-Objective Optimization [81.98466438000086]
大規模言語モデル(LLM)の既存のトレーニング時間安全アライメント技術は、ジェイルブレイク攻撃に対して脆弱なままである。
本研究では,DPOの目的を2つの構成要素にまとめる安全アライメントの改善について提案する。(1) 安全でない世代が部分的に発生しても拒否を促す頑健な拒絶訓練,(2) 有害な知識の未学習。
論文 参考訳(メタデータ) (2025-03-05T18:01:05Z) - Efficient local linearity regularization to overcome catastrophic
overfitting [59.463867084204566]
単段階逆行訓練におけるカタストロフィックオーバーフィッティング(CO)は、逆行性テスト精度(最大0%まで)の急激な低下をもたらす。
我々は,従来のAT評価においてCOを効果的かつ効率的に緩和するために,ELLEと呼ばれる正規化項を導入する。
論文 参考訳(メタデータ) (2024-01-21T22:55:26Z) - Robust Pre-Training by Adversarial Contrastive Learning [120.33706897927391]
近年の研究では、敵の訓練と統合されると、自己監督型事前訓練が最先端の堅牢性につながることが示されている。
我々は,データ強化と対向的摂動の両面に整合した学習表現により,ロバストネスを意識した自己指導型事前学習を改善する。
論文 参考訳(メタデータ) (2020-10-26T04:44:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。