論文の概要: QScheduler: Adaptive Gradient Sampling for Zeroth-Order On-Device Training on INT8 NPUs
- arxiv url: http://arxiv.org/abs/2607.18802v1
- Date: Tue, 21 Jul 2026 07:30:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.348964
- Title: QScheduler: Adaptive Gradient Sampling for Zeroth-Order On-Device Training on INT8 NPUs
- Title(参考訳): QScheduler: INT8 NPUにおけるゼロ階オンデバイストレーニングのための適応型グラディエントサンプリング
- Abstract要約: この研究は、トレーニング進捗に基づいてqを調整する適応アルゴリズムであるQSchedulerを導入している。
STM32N6のNeural-ART NPU上でINT8の量子化されたオンデバイストレーニングの最初の概念実証を提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zeroth-Order (ZO) optimization enables On-Device Learning (ODL) on NPU-equipped microcontrollers by estimating gradients through forward passes alone, bypassing the need for backpropagation primitives and reducing memory requirements. The number of gradient samples q critically affects training: insufficient samples produce noisy gradients that plateau early, while excessive samples consume more computational resources. However, finding an optimal q typically requires costly hyperparameter searches. This work introduces QScheduler, an adaptive algorithm that adjusts q based on training progress, and provides the first proof-of-concept of INT8 quantized on-device training on the STM32N6's Neural-ART NPU. Experiments on EuroSAT and STL-10 show that QScheduler matches well-tuned fixed-q configurations for both ResNet18 and MobileNetV2, without requiring prior q hyperparameter optimization.
- Abstract(参考訳): Zeroth-Order(ZO)最適化により、バックプロパゲーションプリミティブの必要性を回避し、メモリ要求を低減し、フォワードパスのみを通して勾配を推定することで、NPU搭載マイクロコントローラ上のオンデバイスラーニング(ODL)が可能になる。
不十分なサンプルはノイズの多い勾配を発生させ、過剰なサンプルはより多くの計算資源を消費する。
しかし、最適なqを見つけるには、通常、コストのかかるハイパーパラメーター探索が必要となる。
この研究は、トレーニング進捗に基づいてqを調整する適応アルゴリズムであるQSchedulerを導入し、STM32N6のNeural-ART NPU上でINT8の量子化オンデバイストレーニングの最初の概念実証を提供する。
EuroSATとSTL-10の実験では、QSchedulerは事前のqハイパーパラメータ最適化を必要とせず、ResNet18とMobileNetV2の両方でよく調整された固定Q構成と一致している。
関連論文リスト
- STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training [4.460241963597604]
状態のメモリフットプリントを削減する分散トレーニングフレームワークSTQuantを提案する。
GPT-2 と ViT の実験では、STQuant はメモリの劣化を84.4%削減し、平均ビット幅は5.1ビットである。
STQuantはO(N/K)計算オーバーヘッドのみを発生させ、O(1)余剰空間を必要とする。
論文 参考訳(メタデータ) (2026-04-08T08:57:09Z) - Layer-wise QUBO-Based Training of CNN Classifiers for Quantum Annealing [0.0]
本稿では,畳み込みニューラルネットワーク(CNN)の頭部を学習するための,擬似Un Binary Optimization(QUBO)に基づく反復的フレームワークを提案する。
出力毎の分解は、$C$クラス問題を$C$独立QUBOに分割し、それぞれ$(d+1)K$バイナリ変数で、$d$が特徴次元、$K$がビット精度で分割する。
我々は,6つの画像分類ベンチマーク(スコーンディジット,MNIST,Fashion-MNIST,CIFAR-10,EMNIST,KMNIST)の評価を行った。
論文 参考訳(メタデータ) (2026-03-03T13:10:36Z) - IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers [15.498250598583484]
視覚変換器の量子化アウェアトレーニング(QAT)手法は、非線形層量子化における精度損失を回復するために、高価なリトレーニングに依存している。
既存のPTQ(Post-Training Quantization)手法は、非線形関数を部分的に定量化するか、アクティベーション分布を調整して精度を維持するが、完全に整数のみの推論を達成できない。
IPTQ-ViTは、完全に整数のみの視覚変換を行うための新しいPTQフレームワークである。
論文 参考訳(メタデータ) (2025-11-19T11:56:16Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - QuZO: Quantized Zeroth-Order Fine-Tuning for Large Language Models [27.730213115659986]
言語モデル(LLM)はしばしば、推論におけるメモリコストとレイテンシを低減するために、精度を下げるために量子化される。
従来の微調整手法ではバックプロパゲーションが必要であり、低精度設定ではエラーが発生しやすい。
本稿では,低精度フォワードパスを用いた微調整LDMのための量子ゼロオーダー(Quantized Zeroth-Order)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T22:20:31Z) - Towards Theoretically Inspired Neural Initialization Optimization [66.04735385415427]
我々は,ニューラルネットワークの初期状態を評価するための理論的知見を備えた,GradCosineという微分可能な量を提案する。
標準制約下でGradCosineを最大化することにより、ネットワークのトレーニングとテストの両方の性能を向上させることができることを示す。
サンプル分析から実際のバッチ設定に一般化されたNIOは、無視可能なコストで、より優れた初期化を自動で探すことができる。
論文 参考訳(メタデータ) (2022-10-12T06:49:16Z) - On-Device Training Under 256KB Memory [62.95579393237751]
本稿では,256KBのメモリでデバイス上でのトレーニングを可能にするアルゴリズム・システム協調設計フレームワークを提案する。
私たちのフレームワークは256KBと1MBのFlashで畳み込みニューラルネットワークのデバイス上での小さなトレーニングを可能にする最初のソリューションです。
論文 参考訳(メタデータ) (2022-06-30T17:59:08Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z) - GradInit: Learning to Initialize Neural Networks for Stable and
Efficient Training [59.160154997555956]
ニューラルネットワークを初期化するための自動化およびアーキテクチャ手法であるgradinitを提案する。
各ネットワーク層の分散は、SGDまたはAdamの単一ステップが最小の損失値をもたらすように調整される。
また、学習率のウォームアップを伴わずに、オリジナルのPost-LN Transformerを機械翻訳用にトレーニングすることもできる。
論文 参考訳(メタデータ) (2021-02-16T11:45:35Z) - APQ: Joint Search for Network Architecture, Pruning and Quantization
Policy [49.3037538647714]
本稿では,リソース制約のあるハードウェア上での効率的なディープラーニング推論のためのAPQを提案する。
ニューラルアーキテクチャ、プルーニングポリシー、量子化ポリシーを別々に検索する従来の方法とは異なり、我々はそれらを共同で最適化する。
同じ精度で、APQはMobileNetV2+HAQよりもレイテンシ/エネルギーを2倍/1.3倍削減する。
論文 参考訳(メタデータ) (2020-06-15T16:09:17Z) - Shifted and Squeezed 8-bit Floating Point format for Low-Precision
Training of Deep Neural Networks [13.929168096016957]
本研究では,8ビット浮動小数点(FP8)数を用いたディープニューラルネットワークのトレーニング手法を提案する。
ビット精度の低減により、有効メモリが大きくなり、計算速度が向上する。
提案手法は,従来の8ビット精度訓練法と異なり,代表モデルに対して最初から動作可能であることを示す。
論文 参考訳(メタデータ) (2020-01-16T06:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。