論文の概要: AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model
- arxiv url: http://arxiv.org/abs/2507.08920v2
- Date: Tue, 29 Jul 2025 05:17:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-07-30 14:59:51.283443
- Title: AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model
- Title(参考訳): AMix-1: テストタイムのスケーラブルタンパク質基盤モデルへの道
- Abstract要約: 本稿では,Flow Bayesian Networks上に構築された強力なタンパク質基盤モデルAMix-1を紹介する。
AMix-1は、事前学習のスケーリング法則、創発的能力分析、コンテキスト内学習機構、テスト時間スケーリングアルゴリズムを含む、体系的なトレーニング手法によって強化されている。
この基盤を基盤として、タンパク質設計を汎用フレームワークに統合するためのマルチシーケンスアライメント(MSA)ベースのコンテキスト内学習戦略を考案した。
- 参考スコア(独自算出の注目度): 92.51919604882984
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce AMix-1, a powerful protein foundation model built on Bayesian Flow Networks and empowered by a systematic training methodology, encompassing pretraining scaling laws, emergent capability analysis, in-context learning mechanism, and test-time scaling algorithm. To guarantee robust scalability, we establish a predictive scaling law and reveal the progressive emergence of structural understanding via loss perspective, culminating in a strong 1.7-billion model. Building on this foundation, we devise a multiple sequence alignment (MSA)-based in-context learning strategy to unify protein design into a general framework, where AMix-1 recognizes deep evolutionary signals among MSAs and consistently generates structurally and functionally coherent proteins. This framework enables the successful design of a dramatically improved AmeR variant with an up to $50\times$ activity increase over its wild type. Pushing the boundaries of protein engineering, we further empower AMix-1 with an evolutionary test-time scaling algorithm for in silico directed evolution that delivers substantial, scalable performance gains as verification budgets are intensified, laying the groundwork for next-generation lab-in-the-loop protein design.
- Abstract(参考訳): 本稿では,ベイジアンフローネットワーク上に構築された強力なタンパク質基盤モデルであるAMix-1を紹介する。
堅牢なスケーラビリティを保証するため、我々は予測スケーリング法を確立し、ロスパースペクティブによる構造的理解の進行を明らかにし、強力な1.7ビリオンモデルで終わる。
この基盤を基盤として, AMix-1がMSA間の深い進化信号を認識し, 構造的かつ機能的に整合したタンパク質を一貫して生成する, 汎用的なフレームワークにタンパク質設計を統合するための, マルチシーケンスアライメント(MSA)ベースのインコンテキスト学習戦略を考案した。
このフレームワークは、劇的に改善されたAmeRバリアントの設計を成功させることができ、ワイルドタイプよりも最大50\times$アクティビティが増加します。
タンパク質工学の境界を推し進める上で、我々はさらにAMix-1の進化的テストタイムスケーリングアルゴリズムをシリコ指向の進化に応用し、検証予算が強化されるにつれて、大幅な、スケーラブルなパフォーマンス向上を実現し、次世代のin-the-loopタンパク質設計の基盤となる。
関連論文リスト
- AMix-2: Establishing Protein as a Native Modality in Large Language Models [88.00237394496698]
大型言語モデル(LLM)において、タンパク質をネイティブなモダリティとして確立するタンパク質-テキスト基盤モデルAMix-2を提案する。
AMix-2は、(1)自然言語とタンパク質配列を共有トークン空間に埋め込む統一されたタンパク質-テキストの定式化、(2)ブロックワイド拡散言語モデリングバックボーンの2つの主要なアイデアに基づいて構築されている。
本稿では,様々な理解・設計タスクにまたがって,時間認識・ホモロジー認識プロトコルを用いた総合ベンチマークであるProteinArenaを紹介する。
論文 参考訳(メタデータ) (2026-05-29T07:58:08Z) - Rigidity-Aware Geometric Pretraining for Protein Design and Conformational Ensembles [74.32932832937618]
幾何学的事前学習フレームワークであるtextbfRigidSSL$(textitRigidity-Aware Self-Supervised Learning$)を紹介した。
フェーズI(RigidSSL-Perturb)は、AlphaFoldタンパク質構造データベースから432K構造から、シミュレートされた摂動を持つ幾何学的先行を学習する。
フェーズII(RigidSSL-MD)は、1.3K分子動力学軌道上のこれらの表現を洗練し、物理的に現実的な遷移を捉える。
論文 参考訳(メタデータ) (2026-03-02T21:32:30Z) - SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers [50.18388227899971]
本稿では,SaProt TokenizationとDiffusion Transformer (DiT)アーキテクチャを統合することで,タンパク質のバックボーン生成を促進する新しいフレームワークであるSaDiTを提案する。
実験により、SaDiTはRFDiffusionやProteinaといった最先端モデルよりも計算速度と構造的生存性が優れていることが示された。
論文 参考訳(メタデータ) (2026-02-06T13:50:13Z) - A Model-Centric Review of Deep Learning for Protein Design [0.0]
ディープラーニングはタンパク質設計を変換し、正確な構造予測、シーケンス最適化、de novoタンパク質生成を可能にした。
ProtGPT2、ProteinMPNN、RFdiffusionなどの生成モデルは、自然進化に基づく制限を超えてシーケンスとバックボーンの設計を可能にした。
最近では、ESM3を含む共同シーケンス構造共設計モデルが両方のモダリティを統一されたフレームワークに統合し、設計性が向上した。
論文 参考訳(メタデータ) (2025-02-26T14:31:21Z) - SFM-Protein: Integrative Co-evolutionary Pre-training for Advanced Protein Sequence Representation [97.99658944212675]
タンパク質基盤モデルのための新しい事前学習戦略を導入する。
アミノ酸残基間の相互作用を強調し、短距離および長距離の共進化的特徴の抽出を強化する。
大規模タンパク質配列データセットを用いて学習し,より優れた一般化能力を示す。
論文 参考訳(メタデータ) (2024-10-31T15:22:03Z) - MSAGPT: Neural Prompting Protein Structure Prediction via MSA Generative Pre-Training [48.398329286769304]
マルチシークエンスアライメント(MSA)は、タンパク質ファミリーの進化的軌道を明らかにする上で重要な役割を担っている。
MSAGPTは、低MSA状態下でのMSA生成前訓練を通じてタンパク質構造予測を促進する新しいアプローチである。
論文 参考訳(メタデータ) (2024-06-08T04:23:57Z) - Beyond ESM2: Graph-Enhanced Protein Sequence Modeling with Efficient Clustering [24.415612744612773]
タンパク質は生命の過程に必須であり、進化と多様性を支えている。
シークエンシング技術の進歩により数百万のタンパク質が明らかにされ、生物学的分析とAI開発のための高度な事前学習されたタンパク質モデルの必要性が強調されている。
FacebookのESM2は、これまでで最も先進的なタンパク質言語モデルであり、教師なし学習にマスク付き予測タスクを活用し、顕著な生化学的精度でアミノ酸表現を作成する。
しかし、機能的なタンパク質の洞察の提供に欠けており、表現の質を高める機会を示唆している。
本研究は,タンパク質ファミリー分類をESM2のトレーニングに組み込むことにより,このギャップに対処する。
論文 参考訳(メタデータ) (2024-04-24T11:09:43Z) - Structure-informed Language Models Are Protein Designers [69.70134899296912]
配列ベースタンパク質言語モデル(pLM)の汎用的手法であるLM-Designを提案する。
pLMに軽量な構造アダプターを埋め込んだ構造手術を行い,構造意識を付加した構造手術を行った。
実験の結果,我々の手法は最先端の手法よりも大きなマージンで優れていることがわかった。
論文 参考訳(メタデータ) (2023-02-03T10:49:52Z) - Learning Geometrically Disentangled Representations of Protein Folding
Simulations [72.03095377508856]
この研究は、薬物標的タンパク質の構造的アンサンブルに基づいて生成ニューラルネットワークを学習することに焦点を当てている。
モデル課題は、様々な薬物分子に結合したタンパク質の構造的変動を特徴付けることである。
その結果,我々の幾何学的学習に基づく手法は,複雑な構造変化を生成するための精度と効率の両方を享受できることがわかった。
論文 参考訳(メタデータ) (2022-05-20T19:38:00Z) - EBM-Fold: Fully-Differentiable Protein Folding Powered by Energy-based
Models [53.17320541056843]
本研究では,データ駆動型生成ネットワークを用いたタンパク質構造最適化手法を提案する。
EBM-Foldアプローチは,従来のロゼッタ構造最適化ルーチンと比較して,高品質なデコイを効率よく生成できる。
論文 参考訳(メタデータ) (2021-05-11T03:40:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。