論文の概要: QuantForge: Discovering Residual Decompositions for MXFP4 Post-Training Quantization
- arxiv url: http://arxiv.org/abs/2609.34680v1
- Date: Mon, 28 Sep 2026 09:08:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 11:20:44.062227
- Title: QuantForge: Discovering Residual Decompositions for MXFP4 Post-Training Quantization
- Title(参考訳): QuantForge: MXFP4後の量子化における残留分解の発見
- Abstract要約: トレーニング後の量子化は、大きな言語モデルのメモリ要求を減らすことができるが、厳密なMXFP4 W4A4の下での精度を保つには、いくつかの設計上の選択を調整する必要がある。
競合する説明を記録するPTQ発見システムであるQuantForgeを導入し、それらを区別する制御を選択し、後継コードが結果の結論を実装することをチェックする。
我々は,制御されたエビデンスをその後のプログラム変更に変換することにより,転送可能なPTQアルゴリズムの発見を改善することを示す。
- 参考スコア(独自算出の注目度): 12.24682066234241
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Four-bit post-training quantization can reduce the memory demands of large language models, but preserving accuracy under strict MXFP4 W4A4 requires coordinating several design choices. Coordinate transforms change block-encoding errors, which in turn affect the residuals propagated through the network. The useful algorithmic decomposition is therefore not fully known before search. LLM-driven program evolution offers a way to explore these choices, but performance scores alone do not explain which design should change next. We introduce QuantForge, a PTQ discovery system that records competing explanations, selects controls that distinguish them, and checks that successor code implements the resulting conclusions. This residual compilation guides program revisions while retaining useful programs even when their original explanations are rejected. Remeasuring the revised program reveals the next error to address. This process discovers HiRes, a fixed MXFP4 quantizer that shapes coordinates, refines legal code assignments, and recovers errors along attention and MLP paths. Each stage acts on residuals measured after the preceding stage has executed. Across seven tasks, HiRes achieves the lowest seven-model Robust Fit (0.09300) and the lowest quantized Fit-7 at 32B. In matched-budget comparisons of LLM-driven program evolution, each with 240 evaluator calls, QuantForge reaches a held-out transfer target in six of eight runs, compared with three each for textual memory and reflection memory, and one for score-only evolution, despite evaluating fewer new programs. These results show that QuantForge improves the discovery of transferable PTQ algorithms by turning controlled evidence into subsequent program changes.
- Abstract(参考訳): トレーニング後の4ビット量子化は、大きな言語モデルのメモリ要求を減らすことができるが、厳密なMXFP4 W4A4の下での精度を保つには、いくつかの設計上の選択を調整する必要がある。
コーディネート変換はブロックエンコーディングエラーを変化させ、ネットワークを介して伝播する残差に影響を与える。
したがって、有用なアルゴリズム分解は、探索前に完全には知られていない。
LLM駆動のプログラム進化は、これらの選択を探索する方法を提供するが、パフォーマンススコアだけでは、次にどの設計を変更するべきかを説明できない。
競合する説明を記録するPTQ発見システムであるQuantForgeを導入し、それらを区別する制御を選択し、後継コードが結果の結論を実装することをチェックする。
この残余のコンパイルは、元の説明が拒否された場合でも、有用なプログラムを維持しながら、プログラムのリビジョンをガイドする。
修正されたプログラムを再現すると、次に対処すべきエラーが明らかになる。
このプロセスは、座標を形作る固定MXFP4量子化器であるHiResを発見し、法的な符号割り当てを洗練し、注意とMLPパスに沿ってエラーを回復する。
各ステージは、前段の実行後に測定された残留物に作用する。
7つのタスクで、HiResは最低の7モデルRobust Fit (0.09300)、最低の量子化Fit-7を32Bで達成する。
LLM駆動型プログラム進化の整合予算比較では、240回の評価器コールで、QuantForgeはテキストメモリとリフレクションメモリでそれぞれ3回、スコアオンリーのプログラムで1回、それぞれ8回のうち6回で保留の転送目標に達した。
これらの結果から、QuantForgeは、制御されたエビデンスをその後のプログラム変更に変換することにより、転送可能なPTQアルゴリズムの発見を改善することが示された。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs [9.68624792431081]
本稿では,学習後の量子化フレームワークであるRecurrent Residual Quantization (RRQ)を紹介する。
RRQは、重みを低ビットの量子化された基底として表し、量子化された残差補正の列を表わす。
Qwen3-8Bでは,全RTN 2-/4-/6-/8-bitパッケージを1,293秒で構築した。
論文 参考訳(メタデータ) (2026-08-04T08:32:05Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Regression Accumulation in Multi-Turn LLM Programming Conversations [25.94870617800846]
回帰累積は6つのモデルにまたがる
後続のコードが以前の要件と競合するクロスTurn Conflictは、主要な障害クラスである。
検証ゲートは、すべてのモデルを一貫して改善する唯一の戦略である。
論文 参考訳(メタデータ) (2026-07-02T08:15:40Z) - Memory-Guided Tree Search with Cross-Branch Knowledge Transfer for LLM Solver Synthesis [3.0663322946413287]
メモリ誘導型ツリー検索フレームワークであるMEMOIRを2レベルメモリ階層で導入する。
組合せ最適化の7つの問題の中で、MEMOIRは96.7%の解の有効性を達成している。
MeMOIRのラン・トゥ・ランの妥当性標準偏差は、評価したベースライン毎の1桁以下である。
論文 参考訳(メタデータ) (2026-05-17T16:47:31Z) - BPDQ: Bit-Plane Decomposition Quantization on a Variable Grid for Large Language Models [56.504879072674015]
本稿では,ビットプレーンとスカラー係数による可変量子化グリッドを構成するビットプレーン分解量子化(BPDQ)を提案する。
BPDQは、1つのGTX 3090上でQwen2.5-72Bを83.85%のGSM8Kの精度で提供できる(ただし16ビットでは90.83%)。
論文 参考訳(メタデータ) (2026-02-04T02:54:37Z) - Quantizing Large Language Models for Code Generation: A Differentiated Replication [51.85505914274633]
大規模言語モデル(LLM)は、コード生成において印象的な能力を示しており、特に自然言語で記述された要求を自動的に実装する。
LLMはメモリ(そして結果として炭素)のフットプリントに重大な課題をもたらす。
LLM量子化の新しいフロンティアは4ビット精度であり、平均メモリフットプリントが70%減少する。
論文 参考訳(メタデータ) (2025-03-10T09:26:08Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - Enhancing Mathematical Reasoning in LLMs by Stepwise Correction [39.67266805233599]
Best-of-N復号法は、大規模言語モデル(LLM)に複数の解を生成するように指示し、それぞれがスコアリング関数を使用してスコアし、数学的な推論問題に対する最終解として最も高いスコアを選択する。
本稿では,LLMが生成した推論経路の誤りステップを特定し,修正するのに役立つ,ステップワイズ補正(StepCo)という新しいプロンプト手法を提案する。
バリデーション・then-reviseプロセスは、回答の正しさを向上するだけでなく、生成に必要なパスを減らしてトークン消費を減らす。
論文 参考訳(メタデータ) (2024-10-16T18:18:42Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。