論文の概要: VisionMX: Unlocking Microscaling Post-Training Quantization for Vision Models
- arxiv url: http://arxiv.org/abs/2610.03218v1
- Date: Fri, 02 Oct 2026 12:32:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.369485
- Title: VisionMX: Unlocking Microscaling Post-Training Quantization for Vision Models
- Title(参考訳): VisionMX:ビジョンモデルのためのマイクロスケーリング後の量子化
- Abstract要約: VisionMXは、有界ウェイトラウンドを最適化し、アクティベーションに折り畳み可能なアフィン補正を適用する、訓練後のMX量子化法である。
直接変換と評価後の量子化ベースラインを改善し、MX変換に最も敏感なアーキテクチャにおける最大の性能回復を行う。
- 参考スコア(独自算出の注目度): 8.826662658678368
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Microscaling (MX) formats are emerging as a hardware-supported approach to efficient training and inference. They combine low-precision elements with shared block scales, but their impact on vision models remains underexplored. We systematically investigate post-training MX quantization across vision models and tasks. An analysis of direct conversion identifies three sources of error: block-scale representation, the poor alignment of some small convolutional weight tensors with nonuniform element grids, and the underuse of signed codes by nonnegative activations. These findings motivate VisionMX, a post-training MX quantization method that optimizes bounded weight rounding and applies a foldable affine correction to activations. We evaluate VisionMX across image classification, object detection, semantic segmentation, and low-light image enhancement using several MX-style formats. It improves on direct conversion and the evaluated post-training quantization baselines, with the largest performance recoveries in architectures most sensitive to MX conversion
- Abstract(参考訳): マイクロスケーリング(MX)フォーマットは、効率的なトレーニングと推論のためのハードウェアサポートされたアプローチとして登場している。
低精度要素と共有ブロックスケールを組み合わせるが、その視覚モデルへの影響は未解明のままである。
視覚モデルとタスク間のMX量子化の訓練後について系統的に検討する。
直接変換の分析では、ブロックスケール表現、非一様要素格子を持つ小さな畳み込み重みテンソルの不整合、非負のアクティベーションによる符号のアンダーユースという3つの誤り源が特定される。
これらの結果がVisionMXを動機付けている。これは、有界ウェイトラウンドリングを最適化し、アクティベーションに折りたたみ可能なアフィン補正を適用する、ポストトレーニングMX量子化法である。
画像分類,オブジェクト検出,セマンティックセグメンテーション,低照度画像強調を複数のMXスタイルのフォーマットで評価した。
MX変換に最も敏感なアーキテクチャにおける最大の性能回復は、直接変換と評価後量子化ベースラインの改善である。
関連論文リスト
- Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought [55.65577137924979]
本稿では,連続的な数値座標を用いたMLLM画像の推論を可能にするフレームワークを提案する。
NV-CoTはMLLM作用空間を離散語彙トークンから連続ユークリッド空間へと拡張する。
3つのベンチマーク実験により、NV-CoTは局所化精度と最終回答精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-02-27T12:04:07Z) - LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs [11.773543873657752]
可逆変換をアクティベーションに適用することで、量子化を大幅に改善することができる。
現代のハードウェアは、マイクロスケーリング(MX)データフォーマットをますますサポートしている。
学習可能な非可逆アフィン変換への外乱還元を一般化する手法である LATMiX を提案する。
論文 参考訳(メタデータ) (2026-02-04T15:32:27Z) - Recipes for Pre-training LLMs with MXFP8 [0.08732752045535426]
最大8Bパラメータを持つモデルを用いて,最大15Tトークンの高品質データセットに基づいてトレーニングを行った。
MXFP8-E4M3データ型と特定の数値変換アルゴリズムが,BF16で実施したデータと一致するトレーニングセッションを実現する方法を示す。
論文 参考訳(メタデータ) (2025-05-30T21:08:15Z) - Pixel-Inconsistency Modeling for Image Manipulation Localization [59.968362815126326]
デジタル画像法医学は、画像認証と操作のローカライゼーションにおいて重要な役割を果たす。
本稿では,画素不整合アーチファクトの解析を通じて,一般化されたロバストな操作ローカライゼーションモデルを提案する。
実験により,本手法は固有の画素不整合偽指紋を抽出することに成功した。
論文 参考訳(メタデータ) (2023-09-30T02:54:51Z) - Improving Pixel-based MIM by Reducing Wasted Modeling Capability [77.99468514275185]
浅い層から低レベルの特徴を明示的に利用して画素再構成を支援する手法を提案する。
私たちの知る限りでは、等方的アーキテクチャのためのマルチレベル特徴融合を体系的に研究するのは、私たちは初めてです。
提案手法は, 微調整では1.2%, 線形探索では2.8%, セマンティックセグメンテーションでは2.6%など, 大幅な性能向上をもたらす。
論文 参考訳(メタデータ) (2023-08-01T03:44:56Z) - Learning Efficient Coding of Natural Images with Maximum Manifold
Capacity Representations [4.666056064419346]
効率的な符号化仮説は、感覚系の応答特性が入力の統計に適応していることを提案する。
エレガントではあるものの、情報理論の特性は実際的な設定や最適化の目的関数として使うのが難しいことで知られている。
ここでは、多様体の容量を直接最適化し、最大多様体容量表現(MMCR)が得られるという仮定を概説する。
論文 参考訳(メタデータ) (2023-03-06T17:26:30Z) - With Shared Microexponents, A Little Shifting Goes a Long Way [5.535209406979682]
Block Data Representations (BDR) は、ディープラーニングのための幅の狭いフォーマットを探索し、評価するためのフレームワークである。
共有マイクロエクスポネント(MX)に基づく新しいフォーマットが同定され、他の最先端の量子化手法よりも優れている。
論文 参考訳(メタデータ) (2023-02-16T00:37:55Z) - MAT: Mask-Aware Transformer for Large Hole Image Inpainting [79.67039090195527]
本稿では, 変圧器と畳み込みの利点を統一する, 大穴塗装の新しいモデルを提案する。
実験では、複数のベンチマークデータセット上で、新しいモデルの最先端のパフォーマンスを示す。
論文 参考訳(メタデータ) (2022-03-29T06:36:17Z) - A Hierarchical Transformation-Discriminating Generative Model for Few
Shot Anomaly Detection [93.38607559281601]
各トレーニングイメージのマルチスケールパッチ分布をキャプチャする階層的生成モデルを開発した。
この異常スコアは、スケール及び画像領域にわたる正しい変換のパッチベースの投票を集約して得られる。
論文 参考訳(メタデータ) (2021-04-29T17:49:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。