論文の概要: Loopy: Low-Bit Quantization Framework for Looped Language Models
- arxiv url: http://arxiv.org/abs/2610.05265v1
- Date: Sun, 04 Oct 2026 14:35:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:13:20.878477
- Title: Loopy: Low-Bit Quantization Framework for Looped Language Models
- Title(参考訳): Loopy: ループ言語モデルのための低ビット量子化フレームワーク
- Abstract要約: 後学習量子化(PTQ)は、ループ言語モデルのメモリフットプリントと推論コストを削減できる。
再帰的な深度認識の目的を通じて共有コア量子化を定式化するPTQフレームワークであるLoopyを提案する。
8つの設定で、Loopyは異なるベースライン間で最先端の結果を達成する。
- 参考スコア(独自算出の注目度): 13.719382065156083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Looped language models provide a parameter-efficient way to scale iterative test-time computation by repeatedly executing a shared recurrent core. Post-training quantization (PTQ) can reduce the memory footprint and inference cost of looped language models, but errors introduced by a quantized shared core affect subsequent cores. Among PTQ methods, channel scaling and orthogonal rotations preserve the floating-point computation while producing representations with different quantization quality. We find that quantization configuration candidate rankings can change with recurrent depth, motivating configuration selection at the target deployment depth. However, evaluating every candidate over the full calibration set at this depth is costly. We therefore propose Loopy, a PTQ framework that formulates shared-core quantization through a recurrent-depth-aware objective, selecting shared low-bit representations by their final prediction loss at the target deployment depth. Channel scaling and orthogonal rotations parameterize the candidate representations. To approximately solve this selection problem efficiently, Loopy progressively allocates calibration windows to promising candidates while preserving complete target-depth execution, using only forward evaluations. Across eight settings, Loopy achieves the state-of-the-art results among different baselines. On Ouro-1.4B under W4A4, Loopy reduces LAMBADA perplexity by 36.5% relative to SpinQuant. Our code is available at https://github.com/Shameless0817/Loopy-review.git.
- Abstract(参考訳): ループ言語モデルは、共有されたリカレントコアを繰り返し実行することにより、反復的なテスト時間計算をスケールするためのパラメータ効率のよい方法を提供する。
後トレーニング量子化(PTQ)は、ループ言語モデルのメモリフットプリントと推論コストを削減できるが、量子化された共有コアによるエラーはその後のコアに影響を与える。
PTQ法のうち、チャネルスケーリングと直交回転は、異なる量子化品質の表現を生成しながら浮動小数点演算を保存する。
量子化設定候補ランキングは、再帰的な深さで変化し、ターゲットの展開深さで設定の選択を動機付けることができる。
しかし、この深さに設定されたフルキャリブレーションの全ての候補を評価するのはコストがかかる。
そこで本研究では,提案するPTQフレームワークであるLoopyを提案する。これは,再帰的な深度認識目的によって共有コア量子化を定式化し,目標展開深度における最終的な予測損失による共有低ビット表現を選択する。
チャネルスケーリングと直交回転は、候補表現をパラメータ化する。
この選択問題を効率よく解くために、Loopyは前方評価のみを用いて、完全な目標深度実行を保ちながら、キャリブレーションウインドウを有望な候補に徐々に割り当てる。
8つの設定で、Loopyは異なるベースライン間で最先端の結果を達成する。
W4A4の下でのOuro-1.4Bでは、LoopyはLAMBADAのパープレキシティをSpinQuantと比較して36.5%削減する。
私たちのコードはhttps://github.com/Shameless0817/Loopy-review.gitで利用可能です。
関連論文リスト
- S4R: Scaling for Rigid-Body Interpenetration Resolution [77.64742259295664]
静的相互接続修復のためのスケール継続法であるS4Rを提案する。
メッシュレベルの共有評価器とシーン毎の統一タイミングプロトコルを用いて,Kubric,HY3D-Bench,Thingi10K上のS4Rを評価する。
論文 参考訳(メタデータ) (2026-09-17T15:02:45Z) - PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models [31.647243569492446]
ポストトレーニング量子化(PTQ)は、高価なリトレーニングなしで事前トレーニングされたモデルを圧縮することで、実用的なソリューションを提供する。
既存のPTQ手法は、非常に低ビット設定で深刻な品質劣化に悩まされている。
低ビット拡散モデルのための単純かつ効果的なPTQフレームワークPermuQuantを提案する。
論文 参考訳(メタデータ) (2026-05-10T12:26:50Z) - LoopQ: Quantization for Recursive Transformers [14.001192614503807]
本稿では,LoopLMにおける量子化に関する最初の体系的研究について述べる。
ループ対応のPTQフレームワークであるLoopQを提案する。
実験によると、W4A4量子化の下では、LoopQは平均下流の精度を68.8%改善し、最強の静的PTQベースラインと比較して平均パープレキシティを87.7%低減している。
論文 参考訳(メタデータ) (2026-05-08T01:45:28Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - DeepPrune: Parallel Scaling without Inter-trace Redundancy [53.62015294143274]
並列推論トレースの80%以上は、実質的な無駄な計算を代表して、同じ最終回答をもたらす。
動的プルーニングによる効率的な並列スケーリングを実現する新しいフレームワークであるDeepPruneを提案する。
我々の研究は並列推論のための新しい標準を確立し、高性能推論をより効率的にする。
論文 参考訳(メタデータ) (2025-10-09T17:24:54Z) - Low-bit Model Quantization for Deep Neural Networks: A Survey [123.89598730307208]
本稿では、ディープニューラルネットワーク(DNN)における低ビット量子化に向けた最近の5年間の進歩について調査する。
我々は最先端の量子化手法を議論し、それらのコア技術に基づいて8つの主要なカテゴリと24のサブカテゴリに分類する。
我々は、モデル量子化の分野における潜在的研究の機会に光を当てた。
論文 参考訳(メタデータ) (2025-05-08T13:26:19Z) - ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals [10.860081994662645]
大規模言語モデル(LLM)の学習後の量子化は、推論時の計算コストを抑えるという約束を果たす。
本稿では,最先端技術をさらに推し進めるPTQ手法であるResQを提案する。
ResQは、様々なベンチマークにおいて、最近の一様および混合精度のPTQ法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-12-18T22:01:55Z) - Quantune: Post-training Quantization of Convolutional Neural Networks
using Extreme Gradient Boosting for Fast Deployment [15.720551497037176]
本稿では,量子化の構成の探索を高速化するために,Quantune という自動チューニングを提案する。
我々は、Quantuneが6つのCNNモデルに対して0.07 0.65%の精度で、量子化の探索時間を約36.5倍削減することを示した。
論文 参考訳(メタデータ) (2022-02-10T14:05:02Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。