論文の概要: RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design
- arxiv url: http://arxiv.org/abs/2604.17175v1
- Date: Sun, 19 Apr 2026 00:20:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.370109
- Title: RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design
- Title(参考訳): RosettaSearch: タンパク質配列設計のための多目的推論時間検索
- Authors: Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio,
- Abstract要約: タンパク質配列最適化のための推論時間生成手法であるRosettaSearchを紹介する。
我々は,探索と搾取を制御可能な探索アルゴリズムにおいて,大規模言語モデル (LLM) を用いて生成する。
RosettaSearchは、LigandMPNNのシングルパスデコードでは生成できない高忠実度設計を復元する。
- 参考スコア(独自算出の注目度): 18.417610174760526
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We introduce RosettaSearch, an inference-time multi-objective optimization approach for protein sequence optimization. We use large language models (LLMs) as a generative optimizer within a search algorithm capable of controlled exploration and exploitation, using rewards computed from RosettaFold3, a structure prediction model. In a large-scale evaluation, we apply RosettaSearch to 400 suboptimal sequences generated by LigandMPNN (a state-of-the-art model trained for protein sequence design), recovering high-fidelity designs that LigandMPNN's single-pass decoding fails to produce. RosettaSearch's designs show improvements in structural fidelity metrics ranging between 18\% to 68\%, translating to a 2.5$\times$ improvement in design success rate. We observe that these gains in success rate are robust when RosettaSearch-designed sequences are evaluated with an independent structure prediction oracle (Chai-1) and generalize across two distinct LLM families (o4-mini and Gemini-3), with performance scaling consistently with reasoning capability. We further demonstrate that RosettaSearch improves sequence fidelity for ProteinMPNN-designed sequences on \textit{de novo} backbones from the Dayhoff atlas, showing that the approach generalizes beyond native protein structures to computationally generated backbones. We also demonstrate a multi-modal extension of RosettaSearch with vision-language models, where images of predicted protein structures are used as feedback to incorporate structural context to guide protein sequence generation. The sequence trajectories generated by our approach can be used as training data in sequence design models or in post-training and will be released along with the code and datasets upon publication.
- Abstract(参考訳): 本稿では,タンパク質配列最適化のための推論時間多目的最適化手法であるRosettaSearchを紹介する。
我々は、構造予測モデルであるRosettaFold3から計算した報酬を用いて、探索と搾取を制御できる探索アルゴリズム内の生成最適化器として、大規模言語モデル(LLM)を用いる。
大規模評価では、LigandMPNN(タンパク質配列設計のために訓練された最先端のモデル)が生成した400のサブ最適シーケンスにRosettaSearchを適用し、LgandMPNNのシングルパス復号が生成できないような高忠実度設計を復元する。
RosettaSearchの設計は、設計成功率の2.5$\times$改善に換算して、18\%から68\%までの構造的忠実度メトリクスの改善を示している。
RosettaSearchの設計したシーケンスを独立した構造予測オラクル(Chai-1)で評価し、2つの異なるLLMファミリー(o4-miniとGemini-3)にまたがって一般化すると、これらの成功率の上昇は堅牢である。
さらに、RosettaSearchは、Dayhoff atlas の \textit{de novo} のバックボーン上に設計されたタンパク質MPNN の配列の忠実性を改善し、そのアプローチがネイティブなタンパク質構造を超えて計算的に生成されたバックボーンに一般化されることを実証した。
また、視覚言語モデルを用いたRosettaSearchのマルチモーダル拡張を実演し、予測されたタンパク質構造のイメージをフィードバックとして使用して、構造コンテキストを組み込んでタンパク質配列生成をガイドする。
提案手法によって生成されたシーケンストラジェクトリは,シーケンス設計モデルやポストトレーニングのトレーニングデータとして使用することができ,公開時にコードやデータセットとともにリリースされる。
関連論文リスト
- Designing RNAs with Language Models [3.332772772624738]
RNA設計は指数関数的に大きな配列空間と指数関数的に多くの競合する折り畳みのために困難である。
自己回帰言語モデル (LM) としてインスタンス化された再利用可能なニューラル近似器を導入し, ターゲット構造を直接シーケンスにマッピングする。
4つのデータセットにわたって、我々の手法はボルツマン確率のような重要な指標上で最先端のシステムよりも1.7倍高速である。
論文 参考訳(メタデータ) (2026-02-12T22:57:09Z) - Fine-tuning of Large Language Models for Constituency Parsing Using a Sequence to Sequence Approach [0.0]
本研究では,大規模言語モデルを用いた句構造解析の新しい手法について検討する。
主な目的は、スペイン語の構文を教えるために設計されたツールであるMiSintaxisの機能を拡張することである。
その結果,句構造解析において高い精度を示し,この手法の可能性を強調した。
論文 参考訳(メタデータ) (2025-10-18T18:00:20Z) - Protein as a Second Language for LLMs [50.34983283157322]
『Protein-as-Second-Language』の枠組みは、新しいシンボリック言語における文としてアミノ酸配列を再構成する。
属性予測,記述的理解,拡張推論にまたがる79,926個のタンパク質-QAインスタンスのバイリンガルコーパスをキュレートする。
提案手法は,オープンソース LLM と GPT-4 間で一貫した利得を提供し,最大 17.2% のROUGE-L 改善を実現している。
論文 参考訳(メタデータ) (2025-10-13T09:21:45Z) - DPLM-2: A Multimodal Diffusion Protein Language Model [75.98083311705182]
DPLM-2は, 離散拡散タンパク質言語モデル(DPLM)を拡張し, 配列と構造の両方に適合する多モーダルタンパク質基盤モデルである。
DPLM-2は、配列と構造、およびその限界と条件の結合分布を学習する。
実験によりDPLM-2は高度に互換性のあるアミノ酸配列とそれに対応する3D構造を同時に生成できることが示された。
論文 参考訳(メタデータ) (2024-10-17T17:20:24Z) - FoldToken: Learning Protein Language via Vector Quantization and Beyond [56.19308144551836]
タンパク質配列構造を離散シンボルとして表現するために textbfFoldTokenizer を導入する。
学習したシンボルを textbfFoldToken と呼び、FoldToken の配列が新しいタンパク質言語として機能する。
論文 参考訳(メタデータ) (2024-02-04T12:18:51Z) - Skeleton2vec: A Self-supervised Learning Framework with Contextualized
Target Representations for Skeleton Sequence [56.092059713922744]
予測対象として高レベルな文脈化機能を使用することで,優れた性能が得られることを示す。
具体的には、シンプルで効率的な3D行動表現学習フレームワークであるSkeleton2vecを提案する。
提案するSkeleton2vecは,従来の手法より優れ,最先端の結果が得られる。
論文 参考訳(メタデータ) (2024-01-01T12:08:35Z) - Target-aware Variational Auto-encoders for Ligand Generation with
Multimodal Protein Representation Learning [2.01243755755303]
ターゲット認識型自動エンコーダであるTargetVAEを導入し、任意のタンパク質標的に対する高い結合親和性で生成する。
これは、タンパク質の異なる表現を単一のモデルに統一する最初の試みであり、これは我々がタンパク質マルチモーダルネットワーク(PMN)と呼ぶ。
論文 参考訳(メタデータ) (2023-08-02T12:08:17Z) - Scalable Learning of Latent Language Structure With Logical Offline
Cycle Consistency [71.42261918225773]
概念的には、LOCCOは、トレーニング対象のセマンティクスを使用してラベルなしテキストのアノテーションを生成する、自己学習の一形態と見なすことができる。
追加ボーナスとして、LOCCOによって生成されたアノテーションは、神経テキスト生成モデルをトレーニングするために自明に再利用することができる。
論文 参考訳(メタデータ) (2023-05-31T16:47:20Z) - A Systematic Study of Joint Representation Learning on Protein Sequences
and Structures [38.94729758958265]
効果的なタンパク質表現の学習は、タンパク質機能の予測のような生物学の様々なタスクにおいて重要である。
近年, タンパク質言語モデル(PLM)に基づく配列表現学習法は, 配列ベースタスクでは優れているが, タンパク質構造に関わるタスクへの直接適応は依然として困難である。
本研究は、最先端のPLMと異なる構造エンコーダを統合することで、結合タンパク質表現学習の包括的研究を行う。
論文 参考訳(メタデータ) (2023-03-11T01:24:10Z) - EBM-Fold: Fully-Differentiable Protein Folding Powered by Energy-based
Models [53.17320541056843]
本研究では,データ駆動型生成ネットワークを用いたタンパク質構造最適化手法を提案する。
EBM-Foldアプローチは,従来のロゼッタ構造最適化ルーチンと比較して,高品質なデコイを効率よく生成できる。
論文 参考訳(メタデータ) (2021-05-11T03:40:29Z) - Interpretable Structured Learning with Sparse Gated Sequence Encoder for
Protein-Protein Interaction Prediction [2.9488233765621295]
アミノ酸配列から情報表現を学習することでタンパク質-タンパク質相互作用(PPI)を予測することは、生物学において難しいが重要な問題である。
我々は、シーケンスのみからPPIをモデル化し、予測するための新しいディープフレームワークを提案する。
本モデルでは,シーケンスからコンテキスト化およびシーケンシャル情報を活用することによってシーケンス表現を学習するための双方向ゲート再帰ユニットを組み込んだ。
論文 参考訳(メタデータ) (2020-10-16T17:13:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。