論文の概要: TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models
- arxiv url: http://arxiv.org/abs/2608.03057v1
- Date: Tue, 04 Aug 2026 03:14:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.005871
- Title: TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models
- Title(参考訳): TASQ:拡散モデルのための時間適応ビットスカラー化量子化
- Abstract要約: 時間適応型ビットスカラー化量子化(TASQ)を導入する。
TASQは1つの共有最大精度重みバッファを格納し、各層に対して低い有効精度を選択し、最小のビットをトラッカーすることでステージを劣化させるテンポラル空間LSBマスクを学習する。
PixArt-Sigma、SANA-1.6B、SDXL-Turboでは、TASQはより少ない計算で静的量子化に匹敵する品質を達成する。
- 参考スコア(独自算出の注目度): 23.880006390519622
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Static quantization assigns one weight precision to every denoising step. To preserve quality, that precision must accommodate the most quantization-sensitive step, even though many other steps can tolerate fewer bits. The resulting model may satisfy its memory budget, but it repeatedly pays worst-case arithmetic throughout the denoising trajectory. We introduce Temporal-Adaptive Bit Sparsification Quantization (TASQ) to separate these two costs. TASQ stores one shared maximum-precision weight buffer and learns a Temporal-Spatial LSB Mask that selects a lower effective precision for each layer and denoising stage by truncating least-significant bits. Storage therefore remains fixed by the worst case, while BitOPs decrease at less sensitive stages without per-stage weight copies or runtime search. A Temporal-Precision Engine maps the learned schedule to bit-serial execution, where cycles scale with effective precision and switching precision has no measured cycle overhead. On PixArt-Sigma, SANA-1.6B, and SDXL-Turbo, TASQ achieves quality comparable to static quantization with less computation. Together with the Temporal-Precision Engine, it reduces execution cycles by 25 to 50 percent over static quantization and by 6.1 to 7.5x over a naive static 8-bit bit-serial execution. Code is available at https://github.com/seokho-han/tasq.
- Abstract(参考訳): 静的量子化は、各重み付けステップに1つの重み付け精度を割り当てる。
品質を維持するためには、他の多くのステップがより少ないビットを許容できるにもかかわらず、その精度は最も量子化に敏感なステップを満たさなければならない。
結果として得られるモデルはメモリの予算を満たすかもしれないが、デノイング軌道を通して最悪のケースの算術を何度も支払う。
これら2つのコストを分離するために、時間適応ビットスカラー化量子化(TASQ)を導入する。
TASQは1つの共有最大精度重みバッファを格納し、各層に対して低い有効精度を選択し、最小のビットをトラッカーすることでステージを劣化させるテンポラル空間LSBマスクを学習する。
そのため、ストレージは最悪の場合によって固定されるが、BitOPはステージ単位の重み付けや実行時検索なしで、より敏感な段階で減少する。
時間精度エンジンは、学習したスケジュールをビットシリアル実行にマッピングする。
PixArt-Sigma、SANA-1.6B、SDXL-Turboでは、TASQはより少ない計算で静的量子化に匹敵する品質を達成する。
テンポラル・プレシジョンエンジンとともに、静的量子化による実行サイクルを25から50%減らし、単純で静的な8ビットのビットシリアル実行による6.1から7.5倍減らした。
コードはhttps://github.com/seokho-han/tasq.comで入手できる。
関連論文リスト
- BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - DQT: Dynamic Quantization Training via Dequantization-Free Nested Integer Arithmetic [4.184808780116726]
本稿では,このボトルネックを取り除く新しいフレームワークである動的量子化トレーニング(DQT)を紹介する。
DQTの中核はネストされた整数表現であり、低い精度の値は高い精度のものにビット単位で埋め込まれている。
これによりDQTは、バックボーンネットワークの量子化のない静的混合精度の両方を可能にする最初の量子化フレームワークとなる。
論文 参考訳(メタデータ) (2025-08-07T07:31:48Z) - MSQ: Memory-Efficient Bit Sparsification Quantization [11.510434574824213]
混合精度量子化は効率と精度のバランスが優れているため、広く好まれる。
メモリ効率の良いビットスカラー化量子化(MSQ)を提案する。
MSQは、トレーニング可能なパラメータの最大8.00倍の削減、トレーニング時間の最大86%の削減を実現している。
論文 参考訳(メタデータ) (2025-07-30T03:21:29Z) - Automatic mixed precision for optimizing gained time with constrained loss mean-squared-error based on model partition to sequential sub-graphs [0.8999666725996975]
混合精度(MP)は、ネットワーク層間での数値的精度の変化によってトレードオフを緩和する。
本研究では,PTQ(Post-Training Quantization)内の最適なMP構成を自動的に選択することに焦点を当てた。
論文 参考訳(メタデータ) (2025-05-19T12:51:02Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - Qrazor: Reliable and Effortless 4-bit LLM Quantization by Significant Data Razoring [2.983583925806601]
QRazorは、ウェイト、アクティベーション、KVキャッシュの4ビット量子化をトランスフォーマーベース言語モデルで実現可能な、シンプルで効果的な量子化方式である。
まず、8ビットまたは16ビットの整数を用いてデータを量子化し、絶対的な最大スケーリングで完全精度のモデルに近い精度で保存し、次に、重要なデータレイソーシング(SDR)技術を用いて4ビットに圧縮する。
論文 参考訳(メタデータ) (2025-01-23T02:20:08Z) - DeepGEMM: Accelerated Ultra Low-Precision Inference on CPU Architectures
using Lookup Tables [49.965024476651706]
DeepGEMMはSIMDハードウェア上で超高精度畳み込みニューラルネットワークを実行するためのルックアップテーブルベースのアプローチである。
実装は、x86プラットフォーム上で、対応する8ビット整数カーネルを最大1.74倍の性能で上回る。
論文 参考訳(メタデータ) (2023-04-18T15:13:10Z) - CSQ: Growing Mixed-Precision Quantization Scheme with Bi-level
Continuous Sparsification [51.81850995661478]
混合精度量子化はディープニューラルネットワーク(DNN)に広く応用されている
トレーニング中のビットレベル正規化とプルーニングに基づく動的精度調整の試みは、ノイズ勾配と不安定収束に悩まされている。
安定度を向上した混合精度量子化スキームを探索するビットレベル学習法である連続スカラー化量子化(CSQ)を提案する。
論文 参考訳(メタデータ) (2022-12-06T05:44:21Z) - Optimal Clipping and Magnitude-aware Differentiation for Improved
Quantization-aware Training [8.106641866299377]
現在のプラクティスは、クリッピングしきい値スカラーを設定するためにスカラーに依存しており、最適であることを示すことはできない。
最適クリッピングスカラーを決定するアルゴリズムであるOptimally Clippeds And Vectors (OCTAV)を提案する。
OCTAVは、量子化認識トレーニング(QAT)ルーチンのイテレーション毎に、テンソル毎に、フライ時に最適なクリッピングスカラーを見つける。
論文 参考訳(メタデータ) (2022-06-13T22:15:21Z) - 8-bit Optimizers via Block-wise Quantization [57.25800395197516]
ステートフルズは、例えば過去の値の指数的滑らかな和(運動量付きSGD)や2乗和(アダム)など、時間の経過とともに統計を維持している。
この状態は、通常の勾配降下よりも最適化を加速するために使用することができるが、そうでなければモデルパラメータに割り当てられる可能性のあるメモリを使用する。
本稿では,32ビットの勾配状態を用いた場合の性能レベルを維持しながら,8ビット統計を用いた第1次勾配法を開発する。
論文 参考訳(メタデータ) (2021-10-06T15:43:20Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。