論文の概要: How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model
- arxiv url: http://arxiv.org/abs/2607.25583v1
- Date: Tue, 28 Jul 2026 11:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.814149
- Title: How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model
- Title(参考訳): どのくらい小さくできるのか? 60Mパラメータモデルによるテキスト間SQLのLoRAランク、ターゲットモジュール、量子化トレードオフの制御された研究
- Authors: Mahendra Singh Rathor, Anagheem Azzam,
- Abstract要約: r=16のLoRAは11.6パーセントの精度(59.6%対71.2%の精度)で回復し、パラメータの1%未満をトレーニングし、31%のピークGPUメモリを消費する。
INT8 と NF4 の量子化による QLoRA は、メモリコストが劇的に低く (0.60 GB) 、同等の精度 (52.8% と 53.2%) を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-efficient fine-tuning (PEFT) and low-bit quantization are now standard tools for adapting language models under tight compute budgets, yet their interaction is most often studied on billion-parameter models where the design space is expensive to explore. We ask a complementary question: on a specific, fully reproducible 60M-parameter encoder-decoder model (T5-small) and a single-table text-to-SQL benchmark (WikiSQL), how much task accuracy does each efficiency knob actually cost? We run a controlled, single-variable study over (i) LoRA rank r in {2, 4, 8, 16, 32}, (ii) the set of adapted modules, and (iii) numerical precision. We report task accuracy alongside system-level metrics including trainable parameters, peak training memory, inference latency, and throughput, and frame adaptation as a constrained trade-off rather than an accuracy-only objective. Our results show that LoRA with r=16 recovers within 11.6 percentage points of full fine-tuning accuracy (59.6% vs. 71.2% exact-match) while training fewer than 1% of parameters and consuming 31% less peak GPU memory. Within this setting, rank beyond r=16 yields no measurable accuracy gain. QLoRA with INT8 and NF4 quantization achieves comparable accuracy (52.8% and 53.2%) at dramatically lower memory cost (0.60 GB each), demonstrating a compelling trade-off for memory-constrained deployments. All code, configurations, and logs are released for full reproducibility.
- Abstract(参考訳): パラメータ効率のよい微調整(PEFT)と低ビット量子化(低ビット量子化)は、現在では厳密な計算予算の下で言語モデルを適応するための標準ツールとなっているが、その相互作用は、設計空間が探索に費用がかかる10億パラメータモデルでよく研究されている。
具体的かつ完全に再現可能な60Mパラメータ・デコーダモデル(T5-small)と単一テーブルのテキスト・トゥ・SQLベンチマーク(WikiSQL)では、各効率ノブの実際のコストはどの程度か?
コントロール可能な単一変数の研究を実施
(i)LoRA rank r in {2, 4, 8, 16, 32}
(ii)適応加群の集合、及び
(三)数値精度。
トレーニング可能なパラメータ、ピークトレーニングメモリ、推論遅延、スループットを含むシステムレベルのメトリクスとともにタスクの精度を報告し、フレーム適応を精度のみの目的ではなく制約付きトレードオフとして報告する。
以上の結果から,r=16のLoRAは11.6ポイント以内の完全微調整精度(59.6% vs. 71.2%)で回復し,パラメータの1%未満をトレーニングし,ピークGPUメモリを31%少なく消費することがわかった。
この設定内では、r=16以上のランクは測定可能な精度の利得を得られない。
INT8とNF4の量子化によるQLoRAは、メモリコスト(それぞれ0.60GB)で同等の精度(52.8%と53.2%)を達成する。
すべてのコード、設定、ログは、完全な再現性のためにリリースされます。
関連論文リスト
- Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models [0.0]
可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
論文 参考訳(メタデータ) (2026-07-03T02:42:04Z) - FDM: A Framework for Decision-making to build ML-based Malware detection systems [3.552368449344917]
本稿では,MLベースのマルウェア検出システムを構築するためのFDMフレームワークを提案する。
FDMは、9つの設定範囲にまたがる推奨事項に5つの運用パラメータをランク付けしている。
フレームワークを検証するために、3つのデータセットで4つの実験を行った。
論文 参考訳(メタデータ) (2026-06-05T04:21:22Z) - GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets [28.100700446484595]
混合精度量子化は、大規模言語モデルの高精度トレードオフを改善する。
GAMMAは,モジュール単位の精度の選好を,学習後のパイプライン内で完全に学習するフレームワークである。
論文 参考訳(メタデータ) (2026-05-18T14:30:58Z) - One-for-All: A Lightweight Stabilized and Parameter-Efficient Pre-trained LLM for Time Series Forecasting [4.364999214109123]
One-for-Allは、時系列分析のためにトレーニング済みの大規模言語モデルを適用するためのフレームワークである。
rsLoRAは、低いランクでの証明可能な勾配安定性を可能にする数学的に基底的なランク安定化機構を導入している。
One-for-Allは最先端の効率と精度のトレードオフを達成する。
論文 参考訳(メタデータ) (2026-03-31T13:54:43Z) - EfficientLLM: Efficiency in Large Language Models [64.3537131208038]
大規模言語モデル(LLM)は大きな進歩を導いてきたが、その増加とコンテキストウィンドウは計算、エネルギー、金銭的コストを禁止している。
本稿では,新しいベンチマークであるEfficientLLMを紹介する。
論文 参考訳(メタデータ) (2025-05-20T02:27:08Z) - EfficientQAT: Efficient Quantization-Aware Training for Large Language Models [50.525259103219256]
量子化対応トレーニング(QAT)は、低ビット表現によるメモリ消費を最小限の精度で削減することで、ソリューションを提供する。
より有効なQATアルゴリズムであるEfficient QAT(Efficient Quantization-Aware Training)を提案する。
効率的なQATは、全てのパラメータのブロックワイドトレーニング(Block-AP)と量子化パラメータのエンドツーエンドトレーニング(E2E-QP)の2つのフェーズを含む。
論文 参考訳(メタデータ) (2024-07-10T17:53:30Z) - QLoRA: Efficient Finetuning of Quantized LLMs [66.58009990713134]
我々は,48GBのGPU上で65Bパラメータモデルを微調整するのに十分なメモリ使用量を削減する,効率的な微調整手法QLoRAを提案する。
QLoRAは凍結した4ビット量子化事前学習言語モデルを通して低ランクアダプタ(LoRA)に逆伝搬する
最高のモデルファミリであるGuanacoは、Vicunaベンチマークでリリースされたすべてのモデルより優れています。
論文 参考訳(メタデータ) (2023-05-23T17:50:33Z) - The case for 4-bit precision: k-bit Inference Scaling Laws [75.4335600212427]
量子化法は、モデル内の各パラメータを表すために必要なビット数を減少させる。
最終的なモデルサイズは、元のモデルのパラメータの数と圧縮率の両方に依存する。
我々は16ビットの入力とkビットのパラメータを持つ35,000以上のゼロショット実験を行い、どの量子化手法が3ビットから8ビットの精度でスケーリングを改善するかを検証した。
論文 参考訳(メタデータ) (2022-12-19T18:48:33Z) - Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter
Encoders for Natural Language Understanding Systems [63.713297451300086]
本研究では,700Mから9.3Bまでの非埋め込みパラメータ数を持つ事前学習エンコーダの大規模実験結果について述べる。
その後、17M-170Mパラメータからより小さなモデルに蒸留し、仮想アシスタントシステムの自然言語理解(NLU)コンポーネントに応用した。
論文 参考訳(メタデータ) (2022-06-15T20:44:23Z) - HAWQV3: Dyadic Neural Network Quantization [73.11579145354801]
現在の低精度量子化アルゴリズムは、浮動小数点から量子化された整数値への変換の隠れコストを持つことが多い。
HAWQV3は、新しい混合精度整数のみの量子化フレームワークである。
論文 参考訳(メタデータ) (2020-11-20T23:51:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。