論文の概要: From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization
- arxiv url: http://arxiv.org/abs/2608.09595v1
- Date: Mon, 10 Aug 2026 13:28:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.289566
- Title: From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization
- Title(参考訳): SweepからSeam: トレーニング後の量子化をインターリーブしたクロスブロック
- Abstract要約: 本稿では,連続チャンク間の境界ペアを再検討するスケジューリング修正であるInterleaved Cross-Block Quantization (ICBQ)を提案する。
ICBQは、マッチしたSequential CBQベースラインと比較して3次量子化パープレキシティを減少させ、ベースラインが著しく劣化する構成において有限なパープレキシティをもたらす。
- 参考スコア(独自算出の注目度): 6.30853901017231
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Compressing large language models to two bits or fewer is increasingly feasible through block-wise post-training quantization; cross-block variants reconstruct neighboring Transformer blocks within a moving window. In the fixed two-block setting studied here, the matched sequential baseline moves this window through the network once, so errors introduced early in the sweep are not revisited. We propose Interleaved Cross-Block Quantization (ICBQ), a scheduling modification that revisits the boundary pair between consecutive chunks. Each seam pair is refined twice: first at the end of one chunk and again at the start of the next. The method retains the local two-block objective and reuses the calibration inputs of existing block-wise PTQ pipelines. Under stated local contraction and smoothness assumptions, we derive a depth-wise upper-bound comparison in which seam revisits multiply the propagated term while the residual remains bounded independently of depth. In the reported experiments, ICBQ reduces ternary-quantization perplexity relative to the matched Sequential CBQ baseline, yields finite perplexity in configurations where the baseline has severe degradation, and can also be used with 3-bit and 2-bit GPTQ.
- Abstract(参考訳): 大規模言語モデルを2ビット以下に圧縮することは、ブロックワイズ後の量子化によってますます実現可能になり、クロスブロックの変種は、移動ウィンドウ内で隣接するTransformerブロックを再構築する。
ここでは、固定された2ブロック設定において、一致したシーケンシャルベースラインが一度このウィンドウをネットワークに移動させるため、スイープの初期に導入されたエラーは再検討されない。
本稿では,連続チャンク間の境界ペアを再検討するスケジューリング修正であるInterleaved Cross-Block Quantization (ICBQ)を提案する。
それぞれのシームペアは2回精製され、まず1つのチャンクの終わりに、そしてもう1つのチャンクの始めに精製される。
この方法は、局所的な2ブロックの目的を維持し、既存のブロックワイドPTQパイプラインのキャリブレーション入力を再利用する。
局所的な収縮と滑らかさの仮定の下で、シームがプロパゲート項を乗算し、残余が深さとは無関係に有界であるような、深さ方向の上界比較を導出する。
報告された実験では、CBQはマッチした逐次CBQベースラインに対して三次量子化のパープレキシティを減少させ、ベースラインが著しく劣化する構成において有限のパープレキシティを生じるとともに、3ビットと2ビットのGPTQでも使用できる。
関連論文リスト
- Neural network realization of binary refinement iterates via a two-chart atlas selector [0.0]
コンパクトに支持された全ての連続分級線形種は、固定幅と深さの正確なReLU実現を線形に認める有限の精製繰り返しを持つことを示す。
この構成はまた、自然の終点整合条件を満たす全ての連続片方向線型円関数の正確な読み出しを与える。
論文 参考訳(メタデータ) (2026-07-21T14:11:16Z) - FlowBlock: Wavefront-Parallel Decoding for Self-Correcting Diffusion Language Models [16.404926372068047]
ブロックワイド拡散大言語モデル (dLLM) はブロックレベルで逐次デコードし、ブロック間で有効なKVキャッシュの再利用を可能にするが、ブロック間デコーディングを厳密にシリアライズする。
2つのメカニズム上に構築されたトレーニング不要な並列デコーディングフレームワークである textbfflowblock を提案する。
LLaDA-2.1とLLaDA-2.0の2つのシリアルブロック単位のdLLMを最大2.95$times$と4.01$times$に改善し、レイテンシを最大53.6%、77.1%削減した。
論文 参考訳(メタデータ) (2026-07-20T08:05:03Z) - DeepLoop: Depth Scaling for Looped Transformers [91.7922038545625]
ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
論文 参考訳(メタデータ) (2026-07-15T06:37:05Z) - Branch-resolved Pauli-block spectroscopy of residual conditional phase in two-qubit gates [0.0]
分岐分解パウリブロック分光法を導入し, サイクルごとの残留ZZ回転角theta_cをその符号で推定する。
このアプローチは、標準忠実度ベンチマークが先行順序で未解決である残条件相の低オーバーヘッド符号付きサイクル当たりの予測を与える。
論文 参考訳(メタデータ) (2026-07-11T10:32:05Z) - LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs [52.1276403258812]
ブロックワイドPTQの簡易かつ効果的な拡張であるLFQ(Logit-aware Final-block Quantization)を導入する。
LFQは、最先端のブロックワイドPTQよりも複雑な生成タスクの精度を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-28T11:02:23Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - CBQ: Cross-Block Quantization for Large Language Models [66.82132832702895]
ポストトレーニング量子化(PTQ)は、超低コストで大規模言語モデル(LLM)を圧縮する上で重要な役割を果たしている。
LLMのためのクロスブロック再構成に基づくPTQ手法CBQを提案する。
CBQはリコンストラクションスキームを使用してクロスブロック依存関係を採用し、エラーの蓄積を最小限に抑えるために複数のブロックにまたがる長距離依存関係を確立する。
論文 参考訳(メタデータ) (2023-12-13T07:56:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。