論文の概要: ProtLingo: Efficient Protein Language Modeling via Conditional Memory and Expert Routing
- arxiv url: http://arxiv.org/abs/2609.04793v1
- Date: Fri, 04 Sep 2026 06:46:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.937035
- Title: ProtLingo: Efficient Protein Language Modeling via Conditional Memory and Expert Routing
- Title(参考訳): ProtLingo: 条件記憶とエキスパートルーティングによる効率的なタンパク質言語モデリング
- Abstract要約: タンパク質言語モデル(PLM)は、ラベルなし配列から配列-関数関係をモデル化するためのスケーラブルなアプローチを提供する。
ProtLingoは、条件付きローカルメモリとスパースエキスパートルーティングを備えた事前トレーニングされた単一シーケンスバックボーンを増強する、効率的なPLMフレームワークである。
ProtLingoは、突然変異効果予測の強力なパラメータ効率を含む、1億5000万スケールのバックボーンと競合するパフォーマンスを実現している。
- 参考スコア(独自算出の注目度): 39.80134572747517
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Proteins perform diverse cellular functions, and even single amino-acid substitutions can alter stability, activity, or molecular interactions. Protein language models (PLMs) provide a scalable approach for modeling such sequence--function relationships from unlabeled sequences, but increasing the size of dense Transformer backbones often brings substantial computational cost without consistently improving mutation-sensitive prediction. We introduce ProtLingo, an efficient PLM framework that augments a pretrained single-sequence backbone with conditional local memory and sparse expert routing. ProtLingo maps contextual residue representations into route-specific discrete codes, composes centered local windows into latent $N$-gram addresses, and retrieves reusable residual signals associated with recurring local sequence contexts. In parallel, selected feed-forward blocks are upcycled into sparse Mixture-of-Experts layers with shared and routed experts, enabling residue-dependent computation while activating only a subset of parameters. Experiments on protein fitness prediction, FLIP benchmarks, and supervised contact prediction show that ProtLingo achieves competitive performance with a 150M-scale backbone, including strong parameter efficiency on mutation-effect prediction and preserved long-range structural representations.
- Abstract(参考訳): タンパク質は多様な細胞機能を持ち、単一のアミノ酸置換でも安定性、活性、分子間相互作用を変化させることができる。
タンパク質言語モデル (PLM) は、ラベルのない配列からそのような配列-関数関係をモデル化するためのスケーラブルなアプローチを提供するが、高密度トランスフォーマーバックボーンのサイズを増大させると、常に突然変異に敏感な予測を改善することなく、かなりの計算コストがかかる。
ProtLingoは、条件付きローカルメモリとスパースエキスパートルーティングを備えた事前トレーニングされた単一シーケンスバックボーンを増強する、効率的なPLMフレームワークである。
ProtLingoは、コンテキスト残余表現をルート固有の離散コードにマッピングし、中央のローカルウィンドウを潜伏する$N$-gramアドレスに構成し、繰り返し発生するローカルシーケンスコンテキストに関連する再利用可能な残余信号を取得する。
並行して、選択されたフィードフォワードブロックは、共有された専門家とルーティングされた専門家によってスパース・ミックス・オブ・エキスパート層にアップサイクルされ、パラメータのサブセットのみをアクティベートしながら残余依存の計算を可能にする。
タンパク質の適合性予測、FLIPベンチマーク、および教師付き接触予測の実験は、ProtLingoが150Mスケールのバックボーンと競合する性能を達成していることを示している。
関連論文リスト
- Multi-Objective Molecular Generation with Frequency-Controlled Evolutionary Dynamics [0.0]
SpectralMolは、化学構造をフーリエ係数のコンパクト行列として処理するアルゴリズムである。
より多くのドッキングヒットと、より多様な足場を生成しながら、競合する物理化学的特性を維持している。
結果は、周波数制御の進化力学が多目的分子設計への解釈可能、効率的、訓練不要な経路を提供するという証拠を支持する。
論文 参考訳(メタデータ) (2026-06-25T18:42:07Z) - Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment [2.249367818885166]
LOGICAは文脈条件付き予測のためのフレームワークであり、出力-ログ空間で直接コントラスト学習を行う。
変異局所変種ランキングでは特に有効であり、比較は摂動地における変異トークンの文脈条件による可能性に還元される。
論文 参考訳(メタデータ) (2026-06-17T05:30:47Z) - PROTOCOL: Late Interaction Retrieval for Protein Homolog Search [8.797956246984388]
ProtoColはタンパク質を残基埋め込みの集合として表現するモデルである。
タンパク質を独立にコードし、候補表現を事前計算可能とし、残基の埋め込みよりもMaxSimで候補を採点する。
SCOPeスーパーファミリーとPfamファミリーのベンチマークでは、ProtoColはシーケンスコンポジション、アライメントベース、プールされたPLM、訓練された単一ベクトルベースラインより優れている。
論文 参考訳(メタデータ) (2026-05-27T22:50:48Z) - scHelix: Asymmetric Dual-Stream Integration via Explicit Gene-Level Disentanglement [84.88065404629079]
scHelixは、機能がどのように処理されるかを根本的に変更するデータセット適応フレームワークである。
scHelixは、停止段階のグラフキャッシュを備えたデュアルストリームスパース拡散エンコーダを使用する。
scHelixは最先端のメソッドより優れています。
論文 参考訳(メタデータ) (2026-05-18T15:55:13Z) - Efficient Protein Optimization via Structure-aware Hamiltonian Dynamics [16.336540408998598]
HADESはハミルトニアン力学を利用したベイズ最適化法であり、構造対応の近似後部から効率的にサンプリングする。
このような連続状態系から離散的なタンパク質配列を提案するために、位置離散化手順を導入する。
実験により,本手法はシリコン内評価において最先端のベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-16T05:53:53Z) - S$^2$Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual Screening [72.89086338778098]
タンパク質リガンドコントラスト表現学習のための2段階フレームワークを提案する。
最初の段階では、ESM2ベースのバックボーンを用いて、ChemBLでタンパク質配列を事前訓練する。
第2段階では、残基レベルゲーティングモジュールを介して配列と構造情報を融合することでPDBBindを微調整する。
この補助的なタスクは、モデルを誘導し、タンパク質配列内の結合残基を正確に局在させ、それらの3次元空間配列をキャプチャする。
論文 参考訳(メタデータ) (2025-11-10T11:57:47Z) - SeqProFT: Applying LoRA Finetuning for Sequence-only Protein Property Predictions [8.112057136324431]
本研究では,ESM-2モデルのエンド・ツー・エンドの微調整を行うためにLoRA法を用いる。
下流ネットワークにマルチヘッドアテンション機構を統合して、シーケンス特徴とコンタクトマップ情報を組み合わせる。
論文 参考訳(メタデータ) (2024-11-18T12:40:39Z) - Pre-training Co-evolutionary Protein Representation via A Pairwise
Masked Language Model [93.9943278892735]
タンパク質配列表現学習の鍵となる問題は、配列中の残基間の共変量によって反映される共進化情報をキャプチャすることである。
Pairwise Masked Language Model (PMLM) と呼ばれる専用言語モデルによる事前学習により,この情報を直接キャプチャする新しい手法を提案する。
提案手法は, 相互関係を効果的に把握し, ベースラインと比較して, 接触予測性能を最大9%向上できることを示す。
論文 参考訳(メタデータ) (2021-10-29T04:01:32Z) - EBM-Fold: Fully-Differentiable Protein Folding Powered by Energy-based
Models [53.17320541056843]
本研究では,データ駆動型生成ネットワークを用いたタンパク質構造最適化手法を提案する。
EBM-Foldアプローチは,従来のロゼッタ構造最適化ルーチンと比較して,高品質なデコイを効率よく生成できる。
論文 参考訳(メタデータ) (2021-05-11T03:40:29Z) - Spatially Adaptive Inference with Stochastic Feature Sampling and
Interpolation [72.40827239394565]
スパースサンプリングされた場所のみの機能を計算することを提案する。
次に、効率的な手順で特徴写像を密に再構築する。
提案したネットワークは、様々なコンピュータビジョンタスクの精度を維持しながら、かなりの計算を省くために実験的に示されている。
論文 参考訳(メタデータ) (2020-03-19T15:36:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。