論文の概要: RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models
- arxiv url: http://arxiv.org/abs/2609.28262v1
- Date: Wed, 23 Sep 2026 15:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.086238
- Title: RAMP: Robust Adaptive Mixed-Precision Quantization for Edge CPU Vision Models
- Title(参考訳): RAMP:エッジCPUビジョンモデルのためのロバスト適応混合精度量子化
- Abstract要約: 混合精度量子化は、精度を維持しながら推論レイテンシを低減することを約束する。
本稿では,4つの異なるニューラルネットワークを横断するレイヤワイドINT8量子化のための感度指標の体系的研究を行う。
この結果から,異種エッジCPU上に量子化ビジョンモデルを配置する実践者や研究者に対して,具体的なアロケーションポリシが得られた。
- 参考スコア(独自算出の注目度): 2.452410403088629
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying deep learning models on edge CPUs is bottlenecked by computational and memory constraints. Mixed-precision quantization promises to reduce inference latency while preserving accuracy. However, quantization affects different layer types in inconsistent ways, so identifying where accuracy loss is minimized and latency reduction is maximized is critical, as the effect accumulates over a full deployment into substantial savings or unacceptable task degradation. Such identification relies on sensitivity metrics, proxies that estimate layer-wise degradation without evaluating the task accuracy of every candidate policy. Nevertheless, widely used metrics fail systematically on modern architectures. We present a systematic empirical study of 13 sensitivity metrics for layer-wise INT8 quantization across four distinctly different neural networks, and validate the resulting policies on two ARM64 platforms. Gradient-based sensitivity methods fail on 4 out of 8 model-hardware configurations and weight-based statistics on 2. In contrast, the Jensen-Shannon Divergence achieves zero catastrophic failures, reliably isolating the layers that cannot be safely quantized. A sensitivity metric alone does not define a policy, and the fixed thresholds typically used for that step are fragile over the highly skewed distributions of modern architectures. We address this with K-Means clustering, achieving near-lossless accuracy and a mean speed-up of $1.81\times$ over the full-precision model. Finally, we reveal that excluding from quantization the layers whose speed-up is negligible, regardless of their sensitivity, can be counterproductive, as it induces computational graph fragmentation and disables operator fusion. Our results yield concrete allocation policies for practitioners and researchers deploying quantized vision models on heterogeneous edge CPUs, without GPU access or gradient computation.
- Abstract(参考訳): エッジCPUにディープラーニングモデルをデプロイするのは、計算とメモリの制約によってボトルネックになる。
混合精度量子化は、精度を維持しながら推論レイテンシを低減することを約束する。
しかし、量子化は相容れない方法で異なるレイヤタイプに影響を与えるため、精度の損失を最小限に抑え、遅延の低減を最大化することは重要である。
このような識別は、すべての候補ポリシーのタスク精度を評価することなく、階層的劣化を推定する感度指標に依存する。
しかし、広く使われているメトリクスは、現代のアーキテクチャでは体系的に失敗する。
本研究では,4つの異なるニューラルネットワーク上での層ワイドINT8量子化のための13の感度指標の系統的研究を行い,その結果を2つのARM64プラットフォーム上で検証した。
グラディエントベースの感度法は8つのモデルハードウェア構成のうち4つで失敗する。
対照的に、Jensen-Shannon Divergenceは破滅的な失敗をゼロとし、安全に定量化できない層を確実に分離する。
感度測定だけではポリシーを定義しておらず、そのステップで一般的に使用される固定しきい値は、モダンアーキテクチャの高度に歪んだ分布に対して脆弱である。
K-Meansクラスタリングでこの問題に対処し、ほぼロスレスな精度を実現し、フル精度モデル上での平均速度は1.81\times$である。
最後に、計算グラフの断片化を誘導し、演算子融合を無効にするので、その感度によらず、スピードアップが無視できる層を量子化することを除いては、非生産的であることを明らかにした。
この結果から,GPUアクセスや勾配計算を使わずに,異種エッジCPU上に量子化されたビジョンモデルをデプロイする実践者や研究者にとって具体的なアロケーションポリシが得られた。
関連論文リスト
- CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training [73.46600457802693]
本稿では,量子化による損失に対応する新しい手法を提案する。
CAGEは、同様の計算コストで、精度の観点から最先端の手法を大幅に改善する。
LlamaモデルのQAT事前トレーニングでは、CAGEは4ビット(W4A4)で達成された精度と事前のベストメソッドとを一致させる。
論文 参考訳(メタデータ) (2025-10-21T16:33:57Z) - DPQuant: Efficient and Differentially-Private Model Training via Dynamic Quantization Scheduling [7.79764032127686]
Differentially-Private SGD(DP-SGD)は、機密データを使用してニューラルネットワークをトレーニングする際のユーザのプライバシを保護する強力なテクニックである。
DP-SGDの量子化は,通常のSGDに比べて高い精度で劣化することを示した。
QPQuantは動的量子化フレームワークであり、各エポックで量子化するレイヤの変動部分集合を適応的に選択する。
論文 参考訳(メタデータ) (2025-09-03T16:51:26Z) - Decentralized Nonconvex Composite Federated Learning with Gradient Tracking and Momentum [78.27945336558987]
分散サーバ(DFL)はクライアント・クライアント・アーキテクチャへの依存をなくす。
非滑らかな正規化はしばしば機械学習タスクに組み込まれる。
本稿では,これらの問題を解決する新しいDNCFLアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-04-17T08:32:25Z) - GAQAT: gradient-adaptive quantization-aware training for domain generalization [54.31450550793485]
そこで本研究では,DGのためのGAQAT(Gradient-Adaptive Quantization-Aware Training)フレームワークを提案する。
我々のアプローチは、低精度量子化におけるスケール・グラディエント・コンフリクト問題を特定することから始まる。
GAQATフレームワークの有効性を実験により検証した。
論文 参考訳(メタデータ) (2024-12-07T06:07:21Z) - Augmenting Hessians with Inter-Layer Dependencies for Mixed-Precision
Post-Training Quantization [7.392278887917975]
本稿では,ネットワーク上のテンソルに異なる数値精度を割り当てる混合精度ポストトレーニング量子化手法を提案する。
実験では,16ビットベースラインの25.48%$,21.69%$,33.28%$に対して,レイテンシの低減を実証した。
論文 参考訳(メタデータ) (2023-06-08T02:18:58Z) - Mixed Precision Post Training Quantization of Neural Networks with
Sensitivity Guided Search [7.392278887917975]
混合精度量子化により、異なるテンソルを様々な数値精度のレベルに量子化することができる。
我々は,コンピュータビジョンと自然言語処理の手法を評価し,最大27.59%,34.31%のレイテンシ低減を実証した。
論文 参考訳(メタデータ) (2023-02-02T19:30:00Z) - Neural Networks with Quantization Constraints [111.42313650830248]
量子化学習における制約付き学習手法を提案する。
結果の問題は強い双対であり、勾配推定は不要であることを示す。
提案手法は画像分類タスクにおける競合性能を示す。
論文 参考訳(メタデータ) (2022-10-27T17:12:48Z) - AMED: Automatic Mixed-Precision Quantization for Edge Devices [3.5223695602582614]
量子ニューラルネットワークは、レイテンシ、消費電力、モデルサイズをパフォーマンスに大きな影響を与えずに減少させることでよく知られている。
混合精度量子化は、異なるビット幅での算術演算をサポートするカスタマイズされたハードウェアのより良い利用を提供する。
論文 参考訳(メタデータ) (2022-05-30T21:23:22Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。