論文の概要: From Bit-Position Sensitivity to Unequal Error Protection for DNN Inference Memory
- arxiv url: http://arxiv.org/abs/2607.19623v1
- Date: Tue, 21 Jul 2026 23:07:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.941696
- Title: From Bit-Position Sensitivity to Unequal Error Protection for DNN Inference Memory
- Title(参考訳): DNN推論メモリにおけるビット電位感度から不等誤差保護へ
- Abstract要約: 16のワークロードにわたるML推論において,ビット位置当たりの故障感度を特徴付ける。
我々の中心的な経験的発見は、シャープなビット感度遷移である: 決定論的単一ビットストレステストの下で、データタイプ固有のしきい値であるXsafeに、最も重要でない分数ビットのいずれかをめくって、タスクメトリクスを1%以下に低下させる。
- 参考スコア(独自算出の注目度): 0.4610618579893946
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We characterize per-bit-position fault sensitivity in ML inference across 16 workloads -- spanning transformer-based models and attention-free CNNs -- and across three floating-point formats. Our central empirical finding is a sharp bit-sensitivity transition: flipping any of the least-significant fraction bits up to a data-type-specific threshold, Xsafe, degrades task metrics by less than 1% under deterministic single-bit stress tests. Sensitivity rises through the upper fraction bits and spikes at the exponent-mantissa boundary, where a single-bit flip causes catastrophic collapse. Because low-order bits are largely inconsequential while high-order and exponent bits are critical, uniform SECDED protection -- which guards every bit equally at 12.5% storage overhead -- is unnecessarily conservative. We derive per-data-type Xsafe floors (FP16: 6, BF16: 4, FP32: 15) and workload-aware tiers that widen the unprotected region for resilient model classes, raising ECC savings to 37.5-62.5% without retraining. Text-conditioned diffusion models dictate the conservative floor; vision encoders, NLU models, and resilient LLMs tolerate wider bypass regions. These floors and tiers drive an Unequal Error Protection (UEP) codec with per-cacheline data-type tags and a dual-partition SRAM architecture for ML accelerators. Validation across 870+ fault-injection runs confirms selective protection holds under contiguous 2- and 3-bit upsets. The codec reduces ECC area by 27.8% relative to uniform SECDED; dual-voltage operation of the non-critical partition lowers gross BF16 read energy by about 17%, with a roughly 4% dual-partition macro-area overhead.
- Abstract(参考訳): 16のワークロード – トランスフォーマーベースのモデルとアテンションフリーなCNN – と3つの浮動小数点フォーマット – にわたって,ML推論におけるビット配置毎の障害感度を特徴付けています。
我々の中心的な経験的発見は、シャープなビット感度遷移である: 決定論的単ビットストレステストにおいて、データタイプ固有のしきい値であるXsafeに、最も重要でない分数ビットのいずれかを反転させ、タスクメトリクスを1%以下に低下させる。
感度は、1ビットのフリップが破滅的な崩壊を引き起こす指数マンティッサ境界の上部の分数ビットとスパイクを通して上昇する。
低次ビットは大部分が不整合であるのに対し、高次ビットと指数ビットは重要であり、均一なSECDED保護は、全てのビットを12.5%のストレージオーバヘッドで等しく保護するが、必然的に保守的である。
データあたりのXsafeフロア(FP16: 6, BF16: 4, FP32: 15)と、回復力のあるモデルクラスのために保護されていない領域を広げるワークロード対応ティアを導き、再トレーニングなしでECCの節約率を37.5-62.5%に引き上げる。
テキスト条件付き拡散モデルは保守的なフロアを規定し、視覚エンコーダ、NLUモデル、弾力性LLMは広いバイパス領域を許容する。
これらのフロアとティアはUnequal Error Protection (UEP)コーデックを駆動し、キャッシュ毎のデータ型タグとMLアクセラレータ用のデュアルパーティションSRAMアーキテクチャを備える。
870以上のフォールトインジェクションの検証により、連続した2ビットと3ビットの動揺の下で選択的な保護ホールドが確認される。
コーデックは、均一なSECDEDと比較してECC面積を27.8%削減し、非臨界パーティションの二重電圧操作により、総出力のBF16が約17%減少し、二分割のマクロ領域オーバーヘッドが約4%減少する。
関連論文リスト
- PRISM: Sensitivity-Aware PolynoMial PRuning for EffIcient Neural Network Encryption [0.0]
本稿では,Pruned CKKS-en critical Neural Networkの信頼性評価を行う。
PAP(Polynomial-Sensitivity-Aware Pruning)は、本質的に信頼性に配慮した構造化プルーニング法である。
論文 参考訳(メタデータ) (2026-07-20T05:47:06Z) - Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL [18.134050827462005]
大規模言語モデル(LLM)は、ミッションクリティカルドメイン(金融、医療、法律など)に展開する。
16ビットの精度の実験では、異種GPU間で破滅的な出力のばらつきが見られる。
ハードウェア制約を解きながらFP32アクセラレータを近似するターゲット介入であるHybrid Error ALleviation (HEAL)を提案する。
論文 参考訳(メタデータ) (2026-06-19T01:21:10Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Runtime-Certified Bounded-Error Quantized Attention [0.0]
本稿では,実行時対応型KVキャッシュアーキテクチャを提案する。
二項誤差分解は、キー量子化および(ii)値再構成誤差から、(i)注目分布歪みに対するヘッド当たり、ステップ当たりのバウンダリが得られる。
PG-19、NIAH、RULERのベンチマークにおいて、このシステムは言語モデリングと検索タスクのためのノイズ内の密度の高いFP16 KV品質と一致している。
論文 参考訳(メタデータ) (2026-05-20T08:04:40Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding [144.70522923640095]
大規模言語モデル(LLM)はデコード時にハードウェア効率が低下する。
本稿では,デコードコストの最小化に最適化されたハードウェア対応モデルシステムであるStep-3を紹介する。
Step-3はDeepSeek-V3やQwen3 MoE 235Bのようなモデルと比較して、理論的デコードコストを大幅に削減する。
論文 参考訳(メタデータ) (2025-07-25T16:53:13Z) - Towards Effective and Efficient Non-autoregressive Decoding Using Block-based Attention Mask [74.64216073678617]
AMDはアテンションマスクを用いて隠された出力ラベルの連続ブロック内で並列NAR推論を行う。
ビームサーチアルゴリズムは、CTC、ARデコーダ、AMD確率の動的融合を利用するように設計されている。
LibriSpeech-100hrコーパスの実験では、AMDモジュールを組み込んだトリパルタイトデコーダが最大1.73倍のデコード速度比を生み出すことを示唆している。
論文 参考訳(メタデータ) (2024-06-14T13:42:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。