論文の概要: Exploring Silent Data Corruption as a Reliability Challenge in LLM Training
- arxiv url: http://arxiv.org/abs/2604.00726v1
- Date: Wed, 01 Apr 2026 10:37:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.942542
- Title: Exploring Silent Data Corruption as a Reliability Challenge in LLM Training
- Title(参考訳): LLMトレーニングにおける信頼性問題としての無音データ破壊の探究
- Authors: Anton Altenbernd, Philipp Wiesner, Odej Kao,
- Abstract要約: Silent Data Corruption (SDC): システムレベルの検出メカニズムをバイパスするハードウェアによる障害。
この研究は、間欠的なSDCが大規模言語モデルの事前学習にどのように影響するかについて、制御された研究を提供する。
観測された汚職シグネチャに基づいて,潜在的に有害なパラメータの更新を識別する軽量な検出手法を提案する。
- 参考スコア(独自算出の注目度): 2.720409520634766
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As Large Language Models (LLMs) scale in size and complexity, the consequences of failures during training become increasingly severe. A major challenge arises from Silent Data Corruption (SDC): hardware-induced faults that bypass system-level detection mechanisms. SDC may behave like benign numerical noise, but can also cause harmful gradient corruption that leads to loss spikes, divergence, or stalled progress. This work provides a controlled study of how intermittent SDC affects LLM pretraining. Using targeted fault injection at the level of GPU matrix-multiply instructions, we characterize the sensitivity of different bit positions, kernel functions, and execution stages. Our analysis shows that locally originating faults can produce impactful corruption, including NaN propagation, short-lived spikes in loss, gradient norm, and attention logits, as well as persistent parameter divergence. Building on the observed corruption signatures, we propose a lightweight detection method that identifies potentially harmful parameter updates. Experiments on LLaMA models with 60M, 350M, and 1.3B parameters demonstrate that recomputing the most recent training step upon detection can effectively mitigate the impact of these events.
- Abstract(参考訳): 大きな言語モデル(LLM)のサイズと複雑さがスケールするにつれて、トレーニング中の失敗の結果はますます深刻になる。
Silent Data Corruption (SDC): システムレベルの検出メカニズムをバイパスするハードウェアによる障害。
SDCは、良質な数値ノイズのように振る舞うが、有害な勾配劣化を引き起こし、損失のスパイク、発散、進行の停滞につながる。
この研究は、間欠的なSDCがLLM事前学習に与える影響について制御された研究を提供する。
本稿では,GPU行列と乗算命令のレベルでの目標故障注入を用いて,異なるビット位置,カーネル関数,実行ステージの感度を特徴付ける。
解析の結果、局所的に発生する断層は、NaN伝播、損失の短寿命スパイク、勾配ノルム、アテンションロジット、および持続的パラメータのばらつきなど、衝撃的な破壊を引き起こすことが示された。
観測された汚職署名に基づいて,潜在的に有害なパラメータの更新を識別する軽量な検出手法を提案する。
60M、350M、および1.3Bパラメータを持つLLaMAモデルに対する実験は、検出における最新のトレーニングステップを再計算することで、これらのイベントの影響を効果的に軽減できることを示した。
関連論文リスト
- Error Amplification Limits ANN-to-SNN Conversion in Continuous Control [64.99656514469972]
スパイキングニューラルネットワーク(SNN)は、すでに訓練済みのニューラルネットワーク(ANN)を変換することで、競争性能を達成することができる。
既存の変換法は、適切なベースラインがほとんど存在しないような連続的な制御では性能が良くない。
本研究では, 時間的相関誤差を抑制するために, 残留膜電位を決定段階にわたって超過する軽量なトレーニング自由機構であるCRPIを提案する。
論文 参考訳(メタデータ) (2026-01-29T14:28:00Z) - Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing [12.835224376066769]
大きな言語モデル(LLM)は目覚ましい機能を示しているが、そのデプロイメントは望ましくない振る舞いによってしばしば損なわれている。
本稿では,表現とその勾配を解析することによって,望ましくないLCMの挙動を診断する,新しい,効率的なフレームワークを提案する。
本手法は,有害な内容の追跡,バックドア中毒の検出,知識汚染の同定などのタスクに対して,系統的に評価する。
論文 参考訳(メタデータ) (2025-09-26T12:07:47Z) - Defending against Indirect Prompt Injection by Instruction Detection [109.30156975159561]
InstructDetectorは、LLMの動作状態を利用して潜在的なIPI攻撃を特定する、新しい検出ベースのアプローチである。
InstructDetectorは、ドメイン内設定で99.60%、ドメイン外設定で96.90%の検出精度を達成し、攻撃成功率をBIPIAベンチマークで0.03%に下げる。
論文 参考訳(メタデータ) (2025-05-08T13:04:45Z) - Understanding Silent Data Corruption in LLM Training [22.679273469491754]
本研究では,SDCを呈する健全な生産ノードと不健康なノードのモデルトレーニングを比較して,サイレントデータ破損(SDC)が大規模言語訓練に与える影響について検討した。
その結果,SDCが計算に与える影響は,不健康なノードによって異なることがわかった。
論文 参考訳(メタデータ) (2025-02-17T22:07:49Z) - ATTNChecker: Highly-Optimized Fault Tolerant Attention for Large Language Model Training [14.178223242134166]
大規模言語モデル (LLM) は様々な自然言語処理タスクにおいて顕著な性能を示した。
LLMは、特にアテンション機構において故障の影響を受けやすいが、これはトランスフォーマーベースのLLMの重要な構成要素である。
我々は,LLMにおけるアテンション機構に適したアルゴリズムベースフォールトトレランス(ABFT)技術であるATTNCheckerを提案する。
論文 参考訳(メタデータ) (2024-10-15T15:52:45Z) - Analyzing Adversarial Inputs in Deep Reinforcement Learning [53.3760591018817]
本稿では, 正当性検証のレンズを用いて, 逆入力の特性を包括的に解析する。
このような摂動に対する感受性に基づいてモデルを分類するために、新しい計量である逆数率(Adversarial Rate)を導入する。
本分析は, 直交入力が所定のDRLシステムの安全性にどのように影響するかを実証的に示す。
論文 参考訳(メタデータ) (2024-02-07T21:58:40Z) - A Micro Architectural Events Aware Real-Time Embedded System Fault Injector [0.12187048691454236]
本稿では,マイクロアーキテクチャイベントの監視,集約,検査を容易にする新しい故障インジェクタを提案する。
この手法はメモリシステム内のビットフリップを目標とし、CPUレジスタとRAMに影響を与える。
これらの断層注入の結果、ソフトエラーの影響を徹底的に解析し、同定された断層とSACRESが要求する本質的なタイミング予測可能性との間に堅牢な相関関係を確立することができる。
論文 参考訳(メタデータ) (2024-01-16T14:41:20Z) - Robust Tiny Object Detection in Aerial Images amidst Label Noise [50.257696872021164]
本研究は,ノイズラベル管理下での微小物体検出の問題に対処する。
本稿では,DN-TOD(Denoising Tiny Object Detector)を提案する。
本手法は,1段と2段の両方のオブジェクト検出パイプラインにシームレスに統合できる。
論文 参考訳(メタデータ) (2024-01-16T02:14:33Z) - Diffusion Denoising Process for Perceptron Bias in Out-of-distribution
Detection [67.49587673594276]
我々は、識別器モデルが入力の特定の特徴に対してより敏感であることを示唆する新しいパーセプトロンバイアスの仮定を導入し、過度な問題を引き起こした。
DMの拡散分解過程 (DDP) が非対称の新たな形態として機能し, 入力を高め, 過信問題を緩和するのに適していることを示す。
CIFAR10, CIFAR100, ImageNetによる実験により, 提案手法がSOTA手法より優れていることが示された。
論文 参考訳(メタデータ) (2022-11-21T08:45:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。