論文の概要: Linear Fitness Subspace in Protein Language Models Enables Sample-Efficient Directed Evolution
- arxiv url: http://arxiv.org/abs/2610.07607v1
- Date: Tue, 06 Oct 2026 01:50:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.750826
- Title: Linear Fitness Subspace in Protein Language Models Enables Sample-Efficient Directed Evolution
- Title(参考訳): タンパク質言語モデルにおける線形充足部分空間は、サンプル効率のよい進化を可能にする
- Abstract要約: Subspace-Guided Evolutionary Search (SGES)は、ゼロショットPLMと最近のML誘導タンパク質最適化ベースライン上での適合予測と探索効率を改善する。
SGESは、小さな初期サンプルからLFSを推定し、学習した部分空間における代理モデリング、不確実性推定、および取得を実行する。
- 参考スコア(独自算出の注目度): 23.05727295922027
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Model-guided directed evolution seeks to identify high-fitness protein variants under limited oracle budgets. Protein language models (PLMs) provide rich representations for this task, but task-agnostic zero-shot scores can be misaligned with a target assay, while supervised search in high-dimensional embedding spaces can make surrogate modeling and uncertainty estimation sample-inefficient. We propose the Linear Fitness Subspace (LFS) hypothesis: within mutation-induced residue-level representation changes, a compact, assay-specific set of directions makes fitness variation linearly accessible from few labeled variants. This is a local, supervision-recoverable statement rather than a claim that protein fitness landscapes or global PLM geometry are universally linear. Building on this observation, we introduce Subspace-Guided Evolutionary Search (SGES), which estimates an LFS from a small initial sample and performs surrogate modeling, uncertainty estimation, and acquisition in the learned subspace. Across 10 core ProteinGym assays, 87 extended static-validation assays, and an 18-assay budgeted-search evaluation, SGES improves fitness prediction and search efficiency over zero-shot PLMs and recent ML-guided protein optimization baselines. Controlled comparisons with PCA, random projections, label-shuffled PLS, classical mutation features, and acquisition ablations further isolate the benefit of a fitness-aligned site-delta coordinate.
- Abstract(参考訳): モデル誘導指向進化は、限られたオラクル予算の下で高適合性タンパク質の変異を同定しようとする。
タンパク質言語モデル(PLM)は、このタスクに対して豊かな表現を提供するが、タスクに依存しないゼロショットスコアは、ターゲットアッセイと誤って一致し、高次元埋め込み空間における教師付き探索は、サロゲートモデリングと不確実性推定サンプル非効率をもたらす。
突然変異による残差レベルの表現変化では、コンパクトでアッセイ特異的な方向のセットは、ほとんどラベル付けされていない変種からフィットネス変動を線形にアクセスできるようにする。
これは、タンパク質のフィットネス・ランドスケープや地球規模のPLM幾何学が普遍的に線形であるという主張よりも、局所的に、監督可能なステートメントである。
そこで本研究では,SGES(Subspace-Guided Evolutionary Search)を導入し,小規模な初期サンプルからLFSを推定し,サロゲートモデリング,不確実性推定,学習部分空間の取得を行う。
10コアのProteinGymアッセイ、87拡張静的バリデーションアッセイ、および18アッセイの予算付き調査評価、SGESは、ゼロショットPLMと最近のML誘導タンパク質最適化ベースラインの適合予測と探索効率を改善した。
PCA、ランダムプロジェクション、ラベルシャッフルPSS、古典的な突然変異の特徴、および取得の短縮との制御された比較により、フィットネス対応のサイトデルタ座標の利点はさらに分離される。
関連論文リスト
- PFArena: Benchmarking Language Models for Protein Modification [82.29931662881336]
PFArenaは、シングルミュータント生成とマルチミュータントランキングをカバーする4つの制御されたタスクインターフェースからなるベンチマークである。
PLMは、タンパク質特異的な前駆体を活用することにより、オープンエンドの単一変異体生成の習熟度を示す。
LLMとエージェントは、特にターゲット固有のフィットネスデータが利用可能である場合、マルチミュータントランキングで強く機能する。
論文 参考訳(メタデータ) (2026-09-24T02:05:02Z) - Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs [55.715754117956514]
複数のシーケンスアライメントは、明示的な進化コンテキストを持つタンパク質言語モデルを提供する。
MSAサブサンプリングは限定的なトークン予算では避けられない。
本稿では,因子グラフ推論を用いて固定予算MSAサブセットを推定するAP-REASONERを提案する。
論文 参考訳(メタデータ) (2026-07-24T13:55:21Z) - Self Distillation Fine-Tuning of Protein Language Models Improves Versatility in Protein Design [61.2846583160056]
Supervised Fine-tuning (SFT) は、大規模言語モデルを特殊なドメインに適応するための標準的なアプローチである。
これは、高品質なアノテートされたデータは、自然言語よりもタンパク質の入手がはるかに難しいためである。
生成したタンパク質配列の忠実度,信頼性,新規性を改善するために設計された,PLMの高速SFTのための簡易かつ汎用的なレシピを提案する。
論文 参考訳(メタデータ) (2025-12-10T05:34:47Z) - Evolutionary Profiles for Protein Fitness Prediction [45.945064429964084]
EvoIFは、配列構造表現を進化的信号と融合させ、ログノードスコアリングのキャリブレーションされた確率を得る。
タンパク質Gym (217変異アッセイ; >2.5M変異株)について、EvoIFとそのMSA対応変異体は、トレーニング深度のわずか0.1%を使用しながら、最先端または競争的な性能を達成する。
論文 参考訳(メタデータ) (2025-10-08T17:46:02Z) - Lightweight MSA Design Advances Protein Folding From Evolutionary Embeddings [51.731441632457226]
マルチシークエンスアライメント(MSA)は低ホモロジーおよび孤児タンパク質で機能する。
我々は、下流の折り畳みをより良くサポートするMSAを生成する軽量なMSA設計フレームワークPLAMEを紹介する。
AlphaFold2の低ホモロジー/孤児ベンチマークでは、PLAMEは構造精度の最先端の改善を提供する。
論文 参考訳(メタデータ) (2025-06-17T04:11:30Z) - Efficiently Predicting Protein Stability Changes Upon Single-point
Mutation with Large Language Models [51.57843608615827]
タンパク質の熱安定性を正確に予測する能力は、様々なサブフィールドや生化学への応用において重要である。
タンパク質配列と構造的特徴を統合したESMによる効率的なアプローチを導入し, 単一点突然変異によるタンパク質の熱安定性変化を予測する。
論文 参考訳(メタデータ) (2023-12-07T03:25:49Z) - ODBO: Bayesian Optimization with Search Space Prescreening for Directed Protein Evolution [18.726398852721204]
タンパク質指向進化のための効率的で実験的な設計指向のクローズドループ最適化フレームワークを提案する。
ODBOは、新しい低次元タンパク質エンコーディング戦略と、外乱検出による検索空間事前スクリーニングによって強化されたベイズ最適化を組み合わせている。
本研究は, タンパク質指向進化実験を4回実施し, 興味のある変異を見出すためのフレームワークの能力を実証した。
論文 参考訳(メタデータ) (2022-05-19T13:21:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。