論文の概要: MI-PEFT: Mixture-of-Experts Integrated Parameter-Efficient Fine-Tuning Protein Language Models Improves Acidophilic Proteins Classification
- arxiv url: http://arxiv.org/abs/2609.08059v1
- Date: Mon, 07 Sep 2026 23:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.534466
- Title: MI-PEFT: Mixture-of-Experts Integrated Parameter-Efficient Fine-Tuning Protein Language Models Improves Acidophilic Proteins Classification
- Title(参考訳): MI-PEFT:Acidophilic Proteinsの分類を改善したパラメータ効率の良い微調整タンパク質言語モデル
- Authors: Honghan Shen,
- Abstract要約: 酸性親水性タンパク質は、工業的生触媒、酸関連バイオプロセッシング、酸安定酵素の発見に重要である。
本稿では,MI-PEFT(MI-PEFT)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Acidophilic proteins that remain stable and functional under highly acidic conditions, are important for industrial biocatalysis, acid-related bioprocessing, and the discovery of acid-stable enzymes. However, their identification relies heavily on time-consuming experimental screening methods. With the rapid growth of protein sequence databases, the need for computational identification methods that are both accurate and efficient has become stronger. The emergence of protein language models (PLMs) has significantly improved the sequence representation of downstream biological prediction tasks. This paper proposes MI-PEFT, a mixture-of-experts integrated parameter-efficient fine-tuning framework. Built on the ESM C-600M backbone, the framework incorporates LoRA-based PEFT methods and a DeepSeekMoE-based classification head to resolve the limitations of PEFT and significantly improve computational efficiency. Notably, this task is characterized by a significant class imbalance in the dataset, making high specificity particularly challenging. The experimental results demonstrate that MI-PEFT on PLMs, especially {\text{C}}^{\text{3}}\text{A}, serves as an efficient tool for identifying acidophilic proteins and a constrained pathway that helps resolve class-imbalance by preserving the pretrained representations.
- Abstract(参考訳): 高酸性条件下で安定かつ機能的に機能する酸性親水性タンパク質は、工業的生物触媒作用、酸関連バイオプロセッシング、酸安定酵素の発見に重要である。
しかし、それらの識別は、時間を要する実験的なスクリーニング手法に大きく依存している。
タンパク質配列データベースの急速な成長に伴い、正確かつ効率的な計算識別手法の必要性が高まっている。
タンパク質言語モデル(PLM)の出現は、下流の生物学的予測タスクのシーケンス表現を大幅に改善した。
本稿では,MI-PEFT(MI-PEFT)を提案する。
ESM C-600Mのバックボーン上に構築されたこのフレームワークには、LoRAベースのPEFTメソッドとDeepSeekMoEベースの分類ヘッドが組み込まれており、PEFTの限界を解消し、計算効率を大幅に改善する。
特に、このタスクはデータセットにおける重要なクラス不均衡によって特徴づけられ、特に高い特異性は困難である。
実験により, PLM上のMI-PEFT, 特に {\text{C}}^{\text{3}}\text{A} は, 酸性親和性タンパク質を同定するための効率的なツールであり, 予め訓練した表現を保存することにより, クラス不均衡の解消を支援する経路として有効であることが確認された。
関連論文リスト
- Self Distillation Fine-Tuning of Protein Language Models Improves Versatility in Protein Design [61.2846583160056]
Supervised Fine-tuning (SFT) は、大規模言語モデルを特殊なドメインに適応するための標準的なアプローチである。
これは、高品質なアノテートされたデータは、自然言語よりもタンパク質の入手がはるかに難しいためである。
生成したタンパク質配列の忠実度,信頼性,新規性を改善するために設計された,PLMの高速SFTのための簡易かつ汎用的なレシピを提案する。
論文 参考訳(メタデータ) (2025-12-10T05:34:47Z) - Deep Learning Model for Amyloidogenicity Prediction using a Pre-trained Protein LLM [0.0]
タンパク質のアミロイド生成性を予測する最近のアプローチは、進化のモチーフとアミノ酸の個々の性質に強く基づいている。
本研究では,事前学習したタンパク質大言語モデルから得られたタンパク質配列の文脈的特徴について検討した。
本手法は,10倍のクロスバリデーションで84.5%,テストデータセットで83%の精度を達成した。
論文 参考訳(メタデータ) (2025-08-18T02:21:48Z) - Lightweight MSA Design Advances Protein Folding From Evolutionary Embeddings [51.731441632457226]
マルチシークエンスアライメント(MSA)は低ホモロジーおよび孤児タンパク質で機能する。
我々は、下流の折り畳みをより良くサポートするMSAを生成する軽量なMSA設計フレームワークPLAMEを紹介する。
AlphaFold2の低ホモロジー/孤児ベンチマークでは、PLAMEは構造精度の最先端の改善を提供する。
論文 参考訳(メタデータ) (2025-06-17T04:11:30Z) - A general language model for peptide identification [3.856457290796735]
PDeepPPは、事前訓練されたタンパク質言語モデルとハイブリッドトランスフォーマー-畳み込みアーキテクチャを統合する統合ディープラーニングフレームワークである。
大規模かつ正確なペプチド分析を可能にすることにより、PDeepPPは生物医学研究と疾患治療のための新しい治療標的の発見を支援している。
論文 参考訳(メタデータ) (2025-02-21T17:31:22Z) - Long-context Protein Language Modeling Using Bidirectional Mamba with Shared Projection Layers [76.95505296417866]
言語モデル(LM)の自己教師による訓練は、有意義な表現の学習や創薬設計において、タンパク質配列に大きな成功を収めている。
ほとんどのタンパク質LMは、短い文脈長を持つ個々のタンパク質に基づいて訓練されたトランスフォーマーアーキテクチャに基づいている。
そこで本研究では,選択的構造化状態空間モデルに基づく代替タンパク質であるBiMamba-Sに基づくLC-PLMを提案する。
論文 参考訳(メタデータ) (2024-10-29T16:43:28Z) - Efficiently Predicting Protein Stability Changes Upon Single-point
Mutation with Large Language Models [51.57843608615827]
タンパク質の熱安定性を正確に予測する能力は、様々なサブフィールドや生化学への応用において重要である。
タンパク質配列と構造的特徴を統合したESMによる効率的なアプローチを導入し, 単一点突然変異によるタンパク質の熱安定性変化を予測する。
論文 参考訳(メタデータ) (2023-12-07T03:25:49Z) - Deep Learning Methods for Protein Family Classification on PDB
Sequencing Data [0.0]
本稿では,新たな双方向LSTMや畳み込みモデルなどのディープラーニングフレームワークの性能を,広く利用可能なシークエンシングデータ上で実証し比較する。
我々のディープラーニングモデルは従来の機械学習手法よりも優れた性能を示し、畳み込みアーキテクチャは最も印象的な推論性能を提供する。
論文 参考訳(メタデータ) (2022-07-14T06:11:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。