論文の概要: Learning Latent Protein Languages for Autoregressive Generation
- arxiv url: http://arxiv.org/abs/2610.03978v1
- Date: Fri, 02 Oct 2026 19:44:35 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:55:16.908777
- Title: Learning Latent Protein Languages for Autoregressive Generation
- Title(参考訳): 自己回帰生成のための潜在タンパク質言語学習
- Abstract要約: タンパク質潜在言語(Protein Latent Language)と構造潜在言語(Structure Latent Language)という2つの学習された潜在言語を紹介した。
PLLは、凍結したESM-2エンコーダ上に構築された4,096状態の文脈アルファベットに配列をマッピングする。
SLLはGCP-VQE Liteシーケンスと信頼性復号をバックボーン座標に適用する。
- 参考スコア(独自算出の注目度): 5.323590625033627
- License:
- Abstract: Autoregressive transformers remain comparatively weak for protein sequence and structure generation. We study the role of target representation: amino acid tokens encode residue identities without explicit contextual semantics, while backbone coordinates require a discrete representation in our framework. We introduce two learned latent protein languages. Protein Latent Language (PLL) maps sequences to a 4,096-state contextual alphabet built on a frozen ESM-2 encoder, with one token per residue. Structure Latent Language (SLL) adapts GCP-VQVAE Lite with auxiliary sequence and confidence supervision while retaining decoding to backbone coordinates. We separately pretrain autoregressive transformer models on PLL and SLL tokens using next-token prediction, yielding PLLM and SLLM. Under matched downstream sequence training, PLLM has a fitted compute-scaling exponent of 0.038 versus 0.020 for the amino acid autoregressive model. In unconditional sequence generation, PLLM reduces the fraction of samples below a heuristic 1.5-bit residue-composition entropy threshold by 54% relative to the amino acid model across sampling temperatures. For sequence-to-structure prediction, replacing the original GCP-VQVAE Lite tokenizer with SLL reduces best validation perplexity by 34% under matched training. For long proteins, latent-token sampling is approximately 1,000 times faster than MSA-based AlphaFold2 in our measurements. In backbone generation, SLLM compares favorably with other generative models on diversity and novelty. We also observe early signs that using SLLM's internal token confidence for inference-time sampling can improve sequence-to-structure prediction quality beyond a single decoded sample. These results position learned latent protein languages as a promising substrate for autoregressive transformer scaling and inference-time sampling in protein generation.
- Abstract(参考訳): 自己回帰トランスフォーマーは、タンパク質配列と構造生成において比較的弱いままである。
アミノ酸トークンは明示的な文脈意味論を伴わずに残基のアイデンティティを符号化するが、バックボーン座標は我々のフレームワークにおいて離散表現を必要とする。
我々は2つの学習された潜在タンパク質言語を紹介した。
タンパク質ラテント言語(PLL)は、凍結されたESM-2エンコーダ上に構築された4,096状態の文脈アルファベットに配列をマッピングする。
Structure Latent Language (SLL)はGCP-VQVAE Liteに、バックボーン座標への復号を保ちながら、補助シーケンスと信頼性の監督を施す。
PLLおよびSLLトークン上での自己回帰型トランスフォーマモデルとPLLMとSLLMとを別々に事前学習した。
整合下流シーケンストレーニングでは、PLLMはアミノ酸自己回帰モデルに対して0.038対0.020の計算スケーリング指数が適合している。
無条件配列生成では、PLLMはサンプルの分画を1.5ビット残基分解エントロピー閾値以下に減らし、サンプリング温度のアミノ酸モデルと比較すると54%減少する。
シーケンスから構造への予測では、オリジナルのGCP-VQVAE LiteトークンライザをSLLに置き換えることで、マッチしたトレーニング下での最高のバリデーションの難易度を34%削減する。
長いタンパク質の場合,潜伏サンプリングはMSAベースのAlphaFold2の約1000倍の速度である。
バックボーン生成において、SLLMは多様性と新規性に関する他の生成モデルと好意的に比較する。
また,SLLMの内部トークン信頼度を推論時サンプリングに利用することにより,単一復号化サンプルを超えるシーケンス・ツー・ストラクチャの予測精度が向上することを示す。
これらの結果は,タンパク質生成における自己回帰的トランスフォーマースケーリングと推論時間サンプリングのための有望な基質として,学習された潜在タンパク質言語の位置を定めている。
関連論文リスト
- LEMON-ZEST: Evolution-Informed Tokenization for Efficient Protein Language Modeling [0.0]
複数配列アライメントの保存領域から派生した進化インフォームドボキャブラリであるZESTを紹介する。
ZESTは、シーケンスを平均4つの残基のトークン長に圧縮し、標準の1024のコンテキストウィンドウ内で4,000個の残基を処理する。
1つのH100 GPUで1週間トレーニングされたタンパク質配列間のリモートホモロジーを検出するための,コンパクトな200MシーケンスベースモデルLEMONを提案する。
論文 参考訳(メタデータ) (2026-09-29T14:27:24Z) - ProtLingo: Efficient Protein Language Modeling via Conditional Memory and Expert Routing [39.80134572747517]
タンパク質言語モデル(PLM)は、ラベルなし配列から配列-関数関係をモデル化するためのスケーラブルなアプローチを提供する。
ProtLingoは、条件付きローカルメモリとスパースエキスパートルーティングを備えた事前トレーニングされた単一シーケンスバックボーンを増強する、効率的なPLMフレームワークである。
ProtLingoは、突然変異効果予測の強力なパラメータ効率を含む、1億5000万スケールのバックボーンと競合するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-09-04T06:46:42Z) - Self Distillation Fine-Tuning of Protein Language Models Improves Versatility in Protein Design [61.2846583160056]
Supervised Fine-tuning (SFT) は、大規模言語モデルを特殊なドメインに適応するための標準的なアプローチである。
これは、高品質なアノテートされたデータは、自然言語よりもタンパク質の入手がはるかに難しいためである。
生成したタンパク質配列の忠実度,信頼性,新規性を改善するために設計された,PLMの高速SFTのための簡易かつ汎用的なレシピを提案する。
論文 参考訳(メタデータ) (2025-12-10T05:34:47Z) - S$^2$Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual Screening [72.89086338778098]
タンパク質リガンドコントラスト表現学習のための2段階フレームワークを提案する。
最初の段階では、ESM2ベースのバックボーンを用いて、ChemBLでタンパク質配列を事前訓練する。
第2段階では、残基レベルゲーティングモジュールを介して配列と構造情報を融合することでPDBBindを微調整する。
この補助的なタスクは、モデルを誘導し、タンパク質配列内の結合残基を正確に局在させ、それらの3次元空間配列をキャプチャする。
論文 参考訳(メタデータ) (2025-11-10T11:57:47Z) - Protein as a Second Language for LLMs [50.34983283157322]
『Protein-as-Second-Language』の枠組みは、新しいシンボリック言語における文としてアミノ酸配列を再構成する。
属性予測,記述的理解,拡張推論にまたがる79,926個のタンパク質-QAインスタンスのバイリンガルコーパスをキュレートする。
提案手法は,オープンソース LLM と GPT-4 間で一貫した利得を提供し,最大 17.2% のROUGE-L 改善を実現している。
論文 参考訳(メタデータ) (2025-10-13T09:21:45Z) - Generative Antibody Design for Complementary Chain Pairing Sequences
through Encoder-Decoder Language Model [0.0]
ペア化パートナーから補体重鎖や軽鎖を生成するエンコーダデコーダモデルであるペア化T5(pAbT5)を提案する。
本研究は,pAbT5の誘導抗体設計における可能性を示し,鎖の組合わせによる生物学的制約を取り入れた。
論文 参考訳(メタデータ) (2023-01-06T23:34:52Z) - Reprogramming Pretrained Language Models for Protein Sequence
Representation Learning [68.75392232599654]
エンドツーエンドの表現学習フレームワークである辞書学習(R2DL)による表現学習を提案する。
R2DLは、タンパク質配列の埋め込みを学ぶために、事前訓練された英語モデルを再プログラムする。
我々のモデルは,事前訓練および標準教師付き手法によって設定されたベースラインに対して,最大105ドルの精度でデータ効率を大幅に向上させることができる。
論文 参考訳(メタデータ) (2023-01-05T15:55:18Z) - Pre-training Co-evolutionary Protein Representation via A Pairwise
Masked Language Model [93.9943278892735]
タンパク質配列表現学習の鍵となる問題は、配列中の残基間の共変量によって反映される共進化情報をキャプチャすることである。
Pairwise Masked Language Model (PMLM) と呼ばれる専用言語モデルによる事前学習により,この情報を直接キャプチャする新しい手法を提案する。
提案手法は, 相互関係を効果的に把握し, ベースラインと比較して, 接触予測性能を最大9%向上できることを示す。
論文 参考訳(メタデータ) (2021-10-29T04:01:32Z) - COCO-LM: Correcting and Contrasting Text Sequences for Language Model
Pretraining [59.169836983883656]
COCO-LMは、チャレンジングなエラーとテキストシーケンスの変換によって言語モデルを事前学習する新しい自己監視学習フレームワークです。
COCO-LMは、オリジナルのテキストシーケンスでマスク&予測トークンに補助言語モデルを採用しています。
分析の結果,coco-lmのアドバンテージは,困難なトレーニング信号,よりコンテキスト化されたトークン表現,正規化されたシーケンス表現であることがわかった。
論文 参考訳(メタデータ) (2021-02-16T22:24:29Z) - Pre-training Protein Language Models with Label-Agnostic Binding Pairs
Enhances Performance in Downstream Tasks [1.452875650827562]
タンパク質配列の1%未満は構造的にも機能的にも注釈付けされている。
本稿では,結合タンパク質配列と非結合タンパク質配列を混合したRoBERTaモデルを提案する。
トランスフォーマーの注意機構は,タンパク質結合部位の発見に寄与することが示唆された。
論文 参考訳(メタデータ) (2020-12-05T17:37:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。