論文の概要: Analysis of Quantized and Efficiently Adapted Protein Language Models
- arxiv url: http://arxiv.org/abs/2610.00665v1
- Date: Wed, 30 Sep 2026 20:02:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.750009
- Title: Analysis of Quantized and Efficiently Adapted Protein Language Models
- Title(参考訳): 量子化・適応型タンパク質言語モデルの解析
- Abstract要約: ESM-2,ESMC,ProtBERT,ProtT5,Ankh,Ankh3,Profluent-E1の4ビット量子化および低ランクアダプタ微調整(QLoRA)を評価した。
タンパク質予測タスク全体で、多くのモデルタスクペアは完全な微調整性能の90%以上を保持した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Background: Protein language models (PLMs) are increasingly used for sequence generation and property prediction, but their size makes fine-tuning and deployment expensive. The effects of quantization and parameter efficient fine-tuning on performance, representations and generation remain insufficiently characterized. Results: We evaluated 4-bit quantization and low-rank adapter fine-tuning (QLoRA) across ESM-2, ESMC, ProtBERT, ProtT5, Ankh, Ankh3 and Profluent-E1. Across protein prediction tasks, many model-task pairs retained more than 90% of full fine-tuning performance. Peak GPU memory savings approached 90% for the largest models, although performance and efficiency varied by model, dataset and training configuration. QLoRA often preserved early-layer representations while inducing task-specific adaptations in middle and late layers, resembling full fine-tuning with smaller representational changes. Training speed and power effects were more varied. For unconditional generation with ProLLaMA, ProtGPT2, ProGen2, ProteinGLM and ESM3, 4-bit quantization largely preserved predicted structural and sequence-level properties, but token-level analysis revealed model-dependent shifts in autoregressive output distributions. Conclusion: QLoRA and 4-bit quantization reduce PLM computational requirements, particularly GPU memory usage. Our results support QLoRA as a first-pass strategy for memory limited adaptation, reserving full fine-tuning for challenging tasks, unstable architectures or low validation recovery. For generative PLMs, sequence-level and structural metrics should be complemented with distributional analysis, since downstream predictions alone may miss quantization-induced shifts. These approaches can broaden access to large-scale protein modelling while requiring model- and task-specific validation.
- Abstract(参考訳): 背景: タンパク質言語モデル(PLM)は、シーケンス生成やプロパティ予測にますます使われていますが、そのサイズは微調整やデプロイにコストがかかります。
量子化とパラメータの効率的な微調整が性能、表現、生成に与える影響は依然として不十分である。
結果: ESM-2, ESMC, ProtBERT, ProtT5, Ankh, Ankh3, Profluent-E1の4ビット量子化および低ランクアダプタ微調整を行った。
タンパク質予測タスク全体で、多くのモデルタスクペアは完全な微調整性能の90%以上を保持した。
ピークGPUメモリの節約は、最大モデルの90%に近づいたが、性能と効率はモデル、データセット、トレーニング設定によって異なる。
QLoRAはしばしば初期層表現を保存し、中層と後期層でタスク固有の適応を誘導した。
訓練速度とパワーエフェクトはより多様であった。
ProLLaMA, ProtGPT2, ProGen2, ProteinGLM, ESM3を用いた無条件生成では, 4ビット量子化は予測された構造およびシーケンスレベルの特性をほとんど保存していたが, トークンレベル解析により自己回帰出力分布のモデル依存的なシフトが明らかにされた。
結論: QLoRA と 4ビット量子化は PLM の計算要求、特に GPU メモリ使用量を減らす。
我々はQLoRAをメモリ制限適応のためのファーストパス戦略としてサポートし、課題の完全な微調整、不安定なアーキテクチャ、低いバリデーションリカバリを実現した。
生成的PLMでは、下流の予測だけで量子化によるシフトを見逃す可能性があるため、シーケンスレベルと構造的メトリクスは分布解析に補完されるべきである。
これらのアプローチは、モデルやタスク固有の検証を必要としながら、大規模タンパク質モデリングへのアクセスを拡大することができる。
関連論文リスト
- ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - Beyond Outliers: A Study of Optimizers Under Quantization [82.75879062804955]
量子化下でのモデルロバスト性に対する選択の影響について検討する。
モデルの性能が、異なるベースラインでトレーニングした場合にどのように低下するかを評価する。
異なるパラメータによる量子化対応トレーニングのスケーリング法則を導出する。
論文 参考訳(メタデータ) (2025-09-27T21:15:22Z) - PT$^2$-LLM: Post-Training Ternarization for Large Language Models [52.4629647715623]
大きな言語モデル(LLM)は、様々なタスクにまたがる印象的な機能を示しているが、その大きなメモリと計算能力は、デプロイメントを妨げている。
PT$2$-LLMを提案する。
その中核は2段精製パイプラインを備えた非対称3次量子化器である。
論文 参考訳(メタデータ) (2025-09-27T03:01:48Z) - On the Simplification of Neural Network Architectures for Predictive Process Monitoring [0.5735035463793009]
パラメータ数とアーキテクチャの深さの両面からモデル複雑性の低減が予測性能に与える影響を分析する。
その結果,Transformerモデルが85%縮小すると性能が2~3%低下することがわかった。
以上の結果から,モデル簡易化が予測精度を維持できる可能性が示唆された。
論文 参考訳(メタデータ) (2025-09-21T16:21:45Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources [35.16907522675046]
大規模言語モデル(LLM)は、さまざまな自然言語処理タスクに顕著な影響を与えている。
下流データセットでトレーニング済みのモデルを微調整することで、大幅なパフォーマンス向上を実現している。
このプロセスは通常、大量の高価なハイエンドGPUを必要とする。
トレーニング状態の量子化と格納を行う量子化フルパラメータチューニングフレームワークであるQFTを提案する。
論文 参考訳(メタデータ) (2023-10-11T02:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。