論文の概要: RPFQ-ViT: Rotated Phase-Frame Quantization for Extremely Low-Bit Weights in Vision Transformers
- arxiv url: http://arxiv.org/abs/2610.04457v1
- Date: Sat, 03 Oct 2026 11:48:01 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:52:28.863823
- Title: RPFQ-ViT: Rotated Phase-Frame Quantization for Extremely Low-Bit Weights in Vision Transformers
- Title(参考訳): RPFQ-ViT:視覚変換器の極低ビット重みに対する回転位相フレーム量子化
- Abstract要約: ViT(Vision Transformer)は、画像認識とモバイルビジョンアプリケーションにおいて強力なパフォーマンスを実現する。
従来の実数値コードブックはトランスフォーマー射影の方向幾何学とあまり一致しないため、ViTは深刻な精度の劣化に悩まされることが多い。
2次元位相平面におけるペアチャネルの量子化を行う回転位相フレーム量子化法RPFQ-ViTを提案する。
- 参考スコア(独自算出の注目度): 5.899551083314432
- License:
- Abstract: Vision Transformers (ViTs) achieve strong performance on image recognition and mobile vision applications, but their high-dimensional linear projections and attention computations still impose substantial storage and inference costs. Extremely low-bit quantization is a promising solution, yet ViTs often suffer severe accuracy degradation because conventional real-valued scalar codebooks are poorly matched to the directional geometry of Transformer projections. We present RPFQ-ViT, a Rotated Phase-Frame Quantization method that quantizes paired channels in two-dimensional phase planes, enabling low-bit codes to better preserve projection directions while recovering magnitude with lightweight scaling. RPFQ-ViT serves as a drop-in QAT replacement for nn.Linear and does not modify the standard real-valued attention, normalization, or activation computation graph. On ImageNet-1K, RPFQ-ViT-B/16 reaches 79.33% Top-1 / 94.48% Top-5 under W2/A4, Swin-T reaches 79.30% Top-1 / 94.79% Top-5 under W2/A8, and DeiT-S reaches 77.41% Top-1 / 93.11% Top-5 under W2/A8. Ablations, phase-geometry analysis, and direction-preservation metrics show that channel pairing, learnable rotation, phase-anchor learning, and residual phase refinement each improve quantization quality. We further deploy RPFQ-ViT image-classification models on native iOS and Android runtime stacks; with 2-bit packed weights, model size shrinks by roughly $5.4$-$7.1\times$ relative to FP32 and end-to-end on-device latency drops by $1.4$-$1.6\times$. All ImageNet results trained in our codebase use a matched 300-epoch recipe and are reported as mean accuracies over three independent runs. These results show that RPFQ-ViT provides a favorable trade-off among accuracy, compression, and practical mobile deployment for extremely low-bit ViTs.
- Abstract(参考訳): 視覚変換器(ViT)は画像認識や移動体視覚アプリケーションにおいて高い性能を発揮するが、その高次元線形投影と注意計算は依然として相当なストレージと推論コストを課している。
極低ビット量子化は有望な解であるが、従来の実数値スカラーコードブックはトランスフォーマー射影の方向幾何学とあまり一致しないため、ViTは深刻な精度の劣化に悩まされることが多い。
本稿では,2次元位相平面におけるペアチャネルの量子化を行う回転位相フレーム量子化法RPFQ-ViTについて述べる。
RPFQ-ViTはnn.LinearのQAT代替として機能し、標準的な実測値、正規化、アクティベーション計算グラフを変更しない。
ImageNet-1Kでは、RPFQ-ViT-B/16が79.33%のTop-1 / 94.48%のTop-5、W2/A8のTop-1 / 94.79%のTop-5、W2/A8のDeiT-Sが77.41%のTop-1 / 93.11%のTop-5に達した。
アブレーション、位相幾何学解析、方向保存測定は、チャネルペアリング、学習可能な回転、位相アンコール学習、残位相改善がそれぞれ量子化品質を向上させることを示している。
さらに、ネイティブのiOSとAndroidランタイムスタックにRPFQ-ViTイメージ分類モデルをデプロイします。2ビット充填重量で、モデルサイズが約5.4$-$7.1\times$とFP32と比較して、エンドツーエンドのレイテンシ低下が1.4$-$1.6\times$です。
コードベースでトレーニングされたすべてのImageNet結果は、マッチした300エポックレシピを使用しており、3つの独立した実行に対して平均的なアキュラシーであると報告されています。
これらの結果から,RPFQ-ViTは極めて低ビットのViTに対して,精度,圧縮,実用的なモバイルデプロイメントにおいて良好なトレードオフを提供することが示された。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - FTerViT: Fully Ternary Vision Transformer [6.993507427960346]
我々は、アンカーウェイト行列と正規化パラメータを三元化(FTerViT)する完全三元化ビジョン変換器を導入する。
FTerViTは、知識蒸留を用いて訓練され、その後、軽量な量子化対応回復フェーズが続く。
3次 W2A8 DeiT-III-S at 384$times$384 resolution は 82.43% ImageNet-1K top-1 at 6.09,MB である。
論文 参考訳(メタデータ) (2026-05-20T13:41:53Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - Compress image to patches for Vision Transformer [0.0]
本稿では、CI2P-ViTというCNNとVision Transformerに基づくハイブリッドモデルを提案する。
このモデルにはCI2Pと呼ばれるモジュールが組み込まれており、CompressAIエンコーダを使って画像を圧縮し、一連の畳み込みを通じてパッチのシーケンスを生成する。
アニマルズ-10データセットの地上訓練で、CI2P-ViTは92.37%の精度を達成し、ViT-B/16ベースラインよりも3.3%改善した。
論文 参考訳(メタデータ) (2025-02-14T12:40:37Z) - ParFormer: A Vision Transformer with Parallel Mixer and Sparse Channel Attention Patch Embedding [9.144813021145039]
本稿では、並列ミキサーとスパースチャネル注意パッチ埋め込み(SCAPE)を組み込んだ視覚変換器であるParFormerを紹介する。
ParFormerは、畳み込み機構とアテンション機構を組み合わせることで、特徴抽出を改善する。
エッジデバイスのデプロイメントでは、ParFormer-Tのスループットは278.1イメージ/秒で、EdgeNeXt-Sよりも1.38ドル高い。
より大型のParFormer-Lは83.5%のTop-1精度に達し、精度と効率のバランスの取れたトレードオフを提供する。
論文 参考訳(メタデータ) (2024-03-22T07:32:21Z) - Sub-token ViT Embedding via Stochastic Resonance Transformers [51.12001699637727]
Vision Transformer (ViT) アーキテクチャは、画像を高次元のベクトル化トークンの集合として表現し、それぞれが長方形の非重複パッチに対応する。
我々は「確率共鳴」にインスパイアされた無訓練法を提案する。
結果として得られるSRT(Stochastic Resonance Transformer)は、元の表現のリッチな意味情報を保持するが、空間的トークン化の粗い効果を軽減し、より微細な空間領域に基盤を置いている。
論文 参考訳(メタデータ) (2023-10-06T01:53:27Z) - Q-ViT: Accurate and Fully Quantized Low-bit Vision Transformer [56.87383229709899]
我々は、完全量子化視覚変換器(Q-ViT)のための情報修正モジュール(IRM)と分配誘導蒸留法を開発した。
我々の手法は、先行技術よりもはるかに優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-10-13T04:00:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。