論文の概要: Scale-QLoRA: Code-Invariant Adapter Merging for Native 4-bit Microscaling LLMs
- arxiv url: http://arxiv.org/abs/2609.04526v1
- Date: Thu, 03 Sep 2026 22:29:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.842758
- Title: Scale-QLoRA: Code-Invariant Adapter Merging for Native 4-bit Microscaling LLMs
- Title(参考訳): Scale-QLoRA: ネイティブ4ビットマイクロスケーリングLLMのためのコード不変アダプタマージ
- Abstract要約: Scale-QLoRAは、ネイティブなブロック単位のスケールフィールドのみを適応し、デプロイメントグリッド上でスケールをトレーニングし、すべてのE2M1コードを凍結する。
4つのモデルと4つのタスクで、Scale-QLoRAとマージ対応のQAT-LoRAはどちらも正確さに欠ける。
- 参考スコア(独自算出の注目度): 2.1102551867513646
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Merging a LoRA adapter into its base model is standard deployment practice: it removes the runtime adapter's per-forward overhead and leaves a single standalone checkpoint any serving stack can load. On a native 4-bit microscaling checkpoint (NVFP4, MXFP4) that step stops being free. The merged weights must be written back through a quantizer, which re-derives the checkpoint's discrete E2M1 code plane (roughly 90% of the artifact's bytes), so the deployed artifact becomes coupled to one quantization convention, and every later code-touching event in its lifecycle can move it. Done naively the step is worse than fragile: it deletes the adaptation, by up to 39 pp, because against an already-on-grid base the reconstruction optimum is that base. Scale-QLoRA instead adapts only the native per-block scale field, trains those scales on the deployment grid, and freezes every E2M1 code. Within a fixed native format, scale grid, block layout and code plane, merging is then a bit-exact identity and the merged artifact is code-invariant. Across four models and four tasks, Scale-QLoRA and merge-aware QAT-LoRA are both accuracy-lossless, so we claim no accuracy ordering between them; they differ structurally, in that QAT-LoRA re-derives the code plane through a quantizer while Scale-QLoRA preserves it exactly. That difference is what the lifecycle prices: nearest-rounding implementations disagree by about a point on the measured task, and more extreme rule mismatches can drive the weight-space artifact to ~0%, which we report as a sensitivity bound rather than a deployment frequency. Preserving the code plane also drops the weight-space straight-through estimator from training (3.9x per step on the dense 8B model) and enables exact rollback, code-plane deduplication, and a ~125x faster scale-only task swap.
- Abstract(参考訳): LoRAアダプタをベースモデルにマージすることは、標準的なデプロイメントプラクティスである。ランタイムアダプタのフォワード毎のオーバーヘッドを取り除き、任意のサービススタックがロード可能な単一のスタンドアロンチェックポイントを残します。
ネイティブの4ビットマイクロスケーリングチェックポイント(NVFP4, MXFP4)では、ステップが無料になる。
マージウェイトは、チェックポイントの離散E2M1コードプレーン(アーティファクトのバイトの約90%)を導出する量子化器を通して書き直さなければならない。
既存のグリッドベースに対して、再構築の最適条件はそのベースであるため、39ppまでの適応を削除します。
Scale-QLoRAは代わりに、ネイティブなブロック単位のスケールフィールドのみを適応し、デプロイメントグリッド上でスケールをトレーニングし、すべてのE2M1コードを凍結する。
固定されたネイティブフォーマット、スケールグリッド、ブロックレイアウト、コードプレーンの中で、マージはビットエクササイズで、マージされたアーティファクトはコード不変である。
4つのモデルと4つのタスクのうち、Scale-QLoRAとmerge-awareのQAT-LoRAはどちらも精度が劣っているため、それらの間の精度の順序は主張できない。
より極端なルールミスマッチは、重量空間のアーティファクトを ~0% まで押し上げます。
コードプレーンの保存はまた、トレーニングからウェイトスペースのストレートスルー推定器(高密度8Bモデルでは3.9倍)を落とし、正確なロールバック、コードプレーンの重複、約125倍高速なスケールのみのタスクスワップを可能にする。
関連論文リスト
- Low-Rank Ternary Adaptation for Fine-Tuning Transformers [54.3230438745856]
3次変換器は、極端なメモリと計算効率を提供する。
既存のロービットのLoRAベースの手法では、3次重みを直接微調整することはできない。
3次重みの離散的な更新を表す3次乗法適応を提案する。
論文 参考訳(メタデータ) (2026-08-25T12:15:56Z) - Tied Trit-Planes: Constraining PTQTP to a Uniform Nine-Level Quantizer, with a Persistent Folded Format for Disk-Streamed Mixture-of-Experts Serving [0.28304882054363123]
この研究はPTQTPの解法に制約としてそのアイデンティティを課した最初のものである。
我々は、284B-A13B混合エキスパートモデルであるDeepSeek-V4-Flash-0731のルートエキスパートに適用する。
すべてのコード、フォーマット、評価アーティファクトは、fucina推論スタックでオープンソースである。
論文 参考訳(メタデータ) (2026-08-09T20:53:47Z) - Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks [75.92297551160692]
OpenClawのような汎用エージェントは、自律的なツールユーザとしてますます利用されている。
マルチリンガルなSWEベンチマークおよびアダプタプロトコルであるClaw-SWE-Benchを紹介する。
Claw-SWE-Benchは、SWEスタイルの符号化エージェント評価の第一級軸として、ハーネスとコスト会計を扱う。
論文 参考訳(メタデータ) (2026-06-10T17:16:23Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale [0.0]
本稿ではトランスフォーマー言語モデルのためのアーキテクチャオーバーレイであるTFGNを紹介する。
TFGNは入力条件付きパラメータ効率の更新を生成し、残りのトランスは変更しない。
我々の知る限り、TFGNはLLMスケールでの破滅的な忘れを同時に閉じる最初のアーキテクチャである。
論文 参考訳(メタデータ) (2026-05-14T16:46:26Z) - AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization [2.9721401411878254]
トレーニング後の4ビットへの重みのみの量子化は、大規模言語モデル推論のメモリと計算コストの削減に広く用いられている。
4ビットLLM重み量子化のための軽量なAAAC(Activation-Aware Adaptive Codebooks)を提案する。
AWQ, GPTQ, IF4, GPTVQ, OmniQuant, SqueezeLLM, QuIP#をモデルファミリー間で評価した。
論文 参考訳(メタデータ) (2026-05-09T04:59:21Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - Per-Axis Weight Deltas for Frequent Model Updates [0.4552848064814397]
本稿では,軽量な1軸FP16スケーリング因子とともに,重量差の符号のみを記憶する単純な1ビットデルタ方式を提案する。
この設計は1ビットデルタのコンパクトさを保ちながら、重量次元の変動をより正確に捉えている。
論文 参考訳(メタデータ) (2025-12-16T16:46:28Z) - LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning [50.89500210372827]
リソース制約のあるエッジデバイスに大規模言語モデル(LLM)をデプロイするには、量子化と微調整が不可欠である。
LoTA-QAFは量子化LDM用に特別に設計された新しい微調整法である。
MMLUベンチマークでは,16ビットLORAを最大5.14%越えて,量子化モデルの性能を効果的に回復する。
論文 参考訳(メタデータ) (2025-05-24T14:47:28Z) - Rotate, Clip, and Partition: Towards W2A4KV4 Quantization by Integrating Rotation and Learnable Non-uniform Quantizer [7.833559115428751]
Rotate, Clip, and Partition (RCP)は量子化対応トレーニング(QAT)アプローチである。
RCPは最近の回転法と新しい一様質量量化器の設計を統合している。
RCPはLLaMA-2-7BをW2A4KV4に圧縮でき、わずか2.84 WikiText2 pplと5.29倍のメモリフットプリントが失われた。
論文 参考訳(メタデータ) (2025-02-17T08:12:34Z) - AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration [54.692405042065815]
LLM低ビット量のみの量子化のためのハードウェアフレンドリーなアプローチであるActivation-Aware Weight Quantization (AWQ)を提案する。
AWQ は 1% の正重みしか保護せず,命令調整型 LM とマルチモーダル LM の量子化性能に優れる。
また,4ビットオンデバイスLLM/VLMに適した,効率的なフレキシブルな推論フレームワークであるTinyChatを実装した。
論文 参考訳(メタデータ) (2023-06-01T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。