論文の概要: Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
- arxiv url: http://arxiv.org/abs/2609.09240v1
- Date: Tue, 08 Sep 2026 06:21:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.741884
- Title: Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
- Title(参考訳): Qwen3-8B能力維持、再現、無損失包装、パッケージ実行へのトレーニング後のターナライゼーションのスケールアップ
- Abstract要約: 本研究では,Qwen3-4BからQwen3-8Bへのアグレッシブ後変換パイプラインのスケールアップについて検討する。
この変換では、KOTMS回転、E2M-ATQ適応三元化、重量のみのA16構成でのGPTQスタイルの誤り補償が使用される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Ultra-low-bit language models promise reductions in storage and memory traffic, but a nominal "1.58-bit" label does not specify the deployed representation or its execution cost. We study a scale-up of an aggressive post-training conversion pipeline from Qwen3-4B to Qwen3-8B. The conversion uses KOTMS rotation, E2M-ATQ adaptive ternarisation, and GPTQ-style error compensation in a weight-only A16 configuration. We do not claim these algorithms as new. Our contribution is the end-to-end scale-up characterisation: an external reproduction gate, matched 4B/8B capability analysis, cross-corpus perplexity, effective-bit accounting, lossless lattice-aware packing, and direct packed execution. The 8B model reaches a three-corpus perplexity ratio of 1.361x, with WikiText-2, C4, and PTB ratios of 1.318x, 1.393x, and 1.371x. On eight zero-shot tasks at n = 500, mean accuracy is 64.6% versus 72.4% for FP16, corresponding to 78.5% chance-corrected retention and a 7.8-point absolute cost. The matched 4B run retains 69.6%, yielding an 8.9-point 8B advantage. The packed checkpoint is 8.24 GiB and preserves the recorded perplexity to measurement precision. Direct packed execution reaches 15.52 tokens/s in 7.35 GiB, while a preliminary packed GEMV remains slower than FP16 cuBLAS. The result is a validated scale-up baseline: model size improves robustness to aggressive post-training discretisation, actual serialisation is solved for the measured artefact, and direct execution is feasible, while broader seeds, calibration distributions, and kernel optimisation remain open.
- Abstract(参考訳): ウルトラロービット言語モデルは、ストレージとメモリトラフィックの削減を約束するが、名目上の"1.58ビット"ラベルは、デプロイされた表現や実行コストを規定していない。
本研究では,Qwen3-4BからQwen3-8Bへのアグレッシブ後変換パイプラインのスケールアップについて検討する。
この変換では、KOTMS回転、E2M-ATQ適応三元化、重量のみのA16構成でのGPTQスタイルの誤り補償が使用される。
我々はこれらのアルゴリズムを新しいものとは主張しない。
我々の貢献は、外部再生ゲート、マッチする4B/8B機能解析、クロスコーパスパープレキシティ、有効ビット会計、ロスレス格子認識パッキング、直接充填実行である。
8Bモデルは、WikiText-2、C4、TB比1.318x、1.393x、1.371xの3コーパスパープレキシティ比に達する。
n = 500の8つのゼロショットタスクでは、平均精度は64.6%、FP16は72.4%であり、78.5%の確率修正保持と7.8ポイントの絶対コストに対応する。
マッチした4Bランは69.6%を維持し、8.9ポイントの8Bで勝利した。
充填されたチェックポイントは8.24 GiBであり、測定精度に記録された難易度を保存する。
直接充填されたGEMVは7.35 GiBで15.52トークン/秒に達し、予備充填されたGEMVはFP16 cuBLASよりも遅いままである。
モデルサイズは、アグレッシブなトレーニング後の離散化に対して堅牢性を改善し、実シリアライゼーションは測定されたアーティファクトに対して解決され、直接実行は可能であり、より広いシード、キャリブレーション分布、カーネル最適化は引き続きオープンである。
関連論文リスト
- Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment [0.0]
ウルトラロービット言語モデルは、ストレージとメモリ帯域幅を削減できるが、名目上の"1.58ビット"ラベルは、格納された表現、保持機能、実行時の動作を完全に記述していない。
KOTMS回転,E2M-ATQ三元化,およびTWLAからのGPTQスタイルの誤り補償を用いた4B-パラメータモデルQwenの終端学習後変換について検討した。
有効ビット会計,タスク能力保持,複雑度,キャリブレーション感度,チェックポイント構成,デプロイメント動作を評価した。
論文 参考訳(メタデータ) (2026-09-02T00:42:54Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models [0.0]
可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
論文 参考訳(メタデータ) (2026-07-03T02:42:04Z) - BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models [0.0]
BitCal-TTSは、greedy 4ビット推論のための軽量ランタイムコントローラである。
標準のHugging Face 4ビット推論と統合され、フォワードフックを使ってログとラストレイヤーの隠蔽状態を生成する。
Qwen2.5インストラクトモデルによるGSM8Kの評価シャードについて、BitCal-TTSは、非ビット対応ベースラインよりも正確なマッチング精度を向上させる。
論文 参考訳(メタデータ) (2026-05-07T01:10:34Z) - FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression [5.385515135626162]
FASQ(Flexible Accelerated Subspace Quantization)は,大規模言語モデルに製品量化を適用するキャリブレーションフリーフレームワークである。
Meta-Llama-3-8Bでは、FASQは4ビット GPTQ と AWQ の精度(67-42%モデルサイズ)を37-42%モデルサイズで上回っている。
論文 参考訳(メタデータ) (2026-04-22T20:03:36Z) - RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference [1.1100764382749708]
RAMP (Reinforcement Adaptive Mixed Precision) は、グローバルビット予算の下でパープレキシティを最小限に抑えるために、層幅の割り当て毎に学習する。
Llama 2 7Bでは、RAMPは3.68GB (3.65 ビット)で5.54パープレキシティを実現し、均一な4ビット AWQ (5.60 ビット、3.90 GB)と GPTQ を6%、品質は1%から3%向上した。
論文 参考訳(メタデータ) (2026-03-18T16:16:28Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization [73.60493264901359]
本稿では,1ビット,1.58ビット,2ビット,3ビット,4ビットの量子化設定に対して厳密な比較を行う統一フレームワークを提案する。
3次、2ビット、3ビット量子化は、サイズと精度のトレードオフにおいて同等のパフォーマンスを維持していることを示す。
ハードウェアの制約を考慮すると、2ビット量子化はメモリの削減とスピードアップに有望な可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-04T18:59:26Z) - Quantized Neural Networks for Low-Precision Accumulation with Guaranteed
Overflow Avoidance [68.8204255655161]
本稿では,推定時のアキュムレータの精度を下げる際に,数値オーバーフローを回避する量子化学習アルゴリズムを提案する。
本手法は,浮動小数点点ベースラインに対するモデル精度を維持しつつ,アキュムレータの精度を低減できることを示す。
論文 参考訳(メタデータ) (2023-01-31T02:46:57Z) - The case for 4-bit precision: k-bit Inference Scaling Laws [75.4335600212427]
量子化法は、モデル内の各パラメータを表すために必要なビット数を減少させる。
最終的なモデルサイズは、元のモデルのパラメータの数と圧縮率の両方に依存する。
我々は16ビットの入力とkビットのパラメータを持つ35,000以上のゼロショット実験を行い、どの量子化手法が3ビットから8ビットの精度でスケーリングを改善するかを検証した。
論文 参考訳(メタデータ) (2022-12-19T18:48:33Z) - Combined Scaling for Zero-shot Transfer Learning [146.0851484769142]
我々は,ImageNet ILSVRC-2012バリデーションセットにおいて,85.7%のトップ1の精度を達成できるBASICと組み合わせたスケーリング手法を提案する。
この精度はCLIPとALIGNの9.3%を超える。
我々のモデルは、ロバストネスベンチマークの大幅な改善も示しています。
論文 参考訳(メタデータ) (2021-11-19T05:25:46Z) - Training with Quantization Noise for Extreme Model Compression [57.51832088938618]
与えられたモデルサイズに対する精度を最大化しながら、コンパクトなモデルを作成するという問題に取り組む。
標準的な解決策は、トレーニング中に重みが定量化され、勾配がストレート・スルー推定器に近似される量子化意識訓練(Quantization Aware Training)でネットワークをトレーニングすることである。
本稿では, この手法を, 極端な圧縮法を用いて, int8 の固定点量子化を超えて機能するように拡張する。
論文 参考訳(メタデータ) (2020-04-15T20:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。