論文の概要: Evolutionary Curriculum Learning Improves Biological Sequence Modeling
- arxiv url: http://arxiv.org/abs/2608.00697v1
- Date: Sat, 01 Aug 2026 14:54:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.869459
- Title: Evolutionary Curriculum Learning Improves Biological Sequence Modeling
- Title(参考訳): 進化的カリキュラム学習は生物学的シーケンスモデリングを改善する
- Authors: Richard Zhu, Kento Nishi,
- Abstract要約: 変異型オートエンコーダ(VAE)は、病気の変異予測から機能的RNA設計に至るまで、生物学的配列の強力な生成モデルとして登場した。
標準的な生物学的VAEトレーニングは、全ての配列を交換可能なものとして扱い、進化的に高度に分岐した配列を組織する豊富な進化構造を無視している。
本研究では,この構造を利用した学習戦略である進化学習カリキュラム(ECL)を提案する。
- 参考スコア(独自算出の注目度): 6.89005543900307
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Variational autoencoders (VAEs) trained on multiple sequence alignments (MSAs) have emerged as powerful generative models for biological sequences, with applications ranging from disease variant prediction to functional RNA design. However, standard biological VAE training treats all sequences as exchangeable, ignoring the rich evolutionary structure that organizes homologous sequences from evolutionarily close to highly divergent. We propose Evolutionary Curriculum Learning (ECL), a training strategy that exploits this structure by progressively exposing the model to sequences of increasing evolutionary distance from sampled anchors, following a power-law expansion schedule. Applied to two architecturally distinct VAE models and two biological domains--protein variant effect prediction with EVE and RNA family sequence generation with RfamGen--ECL improves downstream task performance across five random seeds per configuration. Mean ClinVar classification AUROC rises from 0.981 to 0.989 for p53; for PTEN, ECL attains 1.000 in every seed whereas the baseline is unstable (mean 0.905, falling as low as 0.54). For RNA, ECL raises mean covariance-model bit scores on all three families tested and exceeds its seed-matched baseline in 12 of 15 training runs, though with only three families the effect cannot be established as significant at the family level. Ablation experiments show that progressively expanding the sampled sequences by evolutionary distance outperforms fixed-size neighborhood sampling in addition to uniform random sampling. Evolutionary distance is therefore a useful inductive bias for ordering the training curriculum in biological sequence modeling.
- Abstract(参考訳): 変異型オートエンコーダ(VAE)は、病気の変異予測から機能的RNA設計に至るまで、生物学的配列の強力な生成モデルとして登場した。
しかしながら、標準的な生物学的VAEトレーニングは全ての配列を交換可能なものとして扱い、相同配列を進化的に高度に分岐した状態から構成する豊富な進化構造を無視している。
本稿では,この構造を利用した進化的カリキュラム学習(ECL)を提案する。
RfamGen--ECLによるEVEおよびRNAファミリー配列生成によるタンパク質変異効果の予測は、構成毎に5つのランダムシードに対して下流タスク性能を向上させる。
平均ClinVar分類AUROCはp53では0.981から0.989に上昇し、PTENではECLは1.000まで上昇するが、ベースラインは不安定である(平均0.905は0.54まで低下する)。
RNAでは、ECLは試験された3つのファミリーの平均共分散モデルビットスコアを上昇させ、15のトレーニングランのうち12のシードマッチングベースラインを超えるが、3つのファミリーでしかその効果を家族レベルでは確立できない。
アブレーション実験により、進化距離によるサンプル配列の段階的な拡大は、均一なランダムサンプリングに加えて、一定の大きさの近傍サンプリングよりも優れていることが示された。
したがって、進化的距離は生物学的配列モデリングにおける訓練カリキュラムの順序付けに有用な帰納的バイアスとなる。
関連論文リスト
- STRAND: Sequence-Conditioned Transport for Single-Cell Perturbations [31.08466183513241]
STRANDは、制御DNA配列の条件付けによって単一細胞の応答を予測する生成モデルである。
配列による摂動を表現することは、遺伝子識別子の固定セットではなく、訓練中に見えないlociでのゼロショット推論をサポートする。
K562, Jurkat, RPE1細胞におけるCRISPR摂動データセットのSTRANDを評価する。
論文 参考訳(メタデータ) (2026-02-10T00:57:38Z) - Regulatory DNA sequence Design with Reinforcement Learning [56.20290878358356]
本稿では,強化学習を利用して事前学習した自己回帰モデルを微調整する生成手法を提案する。
2つの酵母培地条件下でのプロモーター設計タスクの評価と,3種類のヒト細胞に対するエンハンサー設計タスクの評価を行った。
論文 参考訳(メタデータ) (2025-03-11T02:33:33Z) - UniGenX: a unified generative foundation model that couples sequence, structure and function to accelerate scientific design across proteins, molecules and materials [62.72989417755985]
自然系における関数の統一生成モデルUniGenXを提案する。
UniGenXはシンボルトークンと数値トークンの混合ストリームとして異種入力を表す。
ドメイン間のファンクション・アウェア・ジェネレーションに対して、最先端または競合的なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-03-09T16:43:07Z) - GENERator: A Long-Context Generative Genomic Foundation Model [66.46537421135996]
本稿では,98k塩基対 (bp) と1.2Bパラメータからなるゲノム基盤モデル GENERator を提案する。
DNAの386Bbpからなる拡張データセットに基づいて、GENERatorは、確立されたベンチマークと新しく提案されたベンチマークの両方で最先端のパフォーマンスを実証する。
また、特に特定のアクティビティプロファイルを持つエンハンサーシーケンスを即応的に生成することで、シーケンス最適化において大きな可能性を秘めている。
論文 参考訳(メタデータ) (2025-02-11T05:39:49Z) - DPLM-2: A Multimodal Diffusion Protein Language Model [75.98083311705182]
DPLM-2は, 離散拡散タンパク質言語モデル(DPLM)を拡張し, 配列と構造の両方に適合する多モーダルタンパク質基盤モデルである。
DPLM-2は、配列と構造、およびその限界と条件の結合分布を学習する。
実験によりDPLM-2は高度に互換性のあるアミノ酸配列とそれに対応する3D構造を同時に生成できることが示された。
論文 参考訳(メタデータ) (2024-10-17T17:20:24Z) - Semantically Rich Local Dataset Generation for Explainable AI in Genomics [0.716879432974126]
ゲノム配列に基づいて訓練されたブラックボックス深層学習モデルは、異なる遺伝子制御機構の結果を予測するのに優れている。
本稿では、遺伝的プログラミングを用いて、その意味的多様性に寄与する配列の摂動を進化させることによりデータセットを生成することを提案する。
論文 参考訳(メタデータ) (2024-07-03T10:31:30Z) - Learning to Predict Mutation Effects of Protein-Protein Interactions by Microenvironment-aware Hierarchical Prompt Learning [78.38442423223832]
我々は、新しいコードブック事前学習タスク、すなわちマスク付きマイクロ環境モデリングを開発する。
突然変異効果予測において、最先端の事前学習法よりも優れた性能と訓練効率を示す。
論文 参考訳(メタデータ) (2024-05-16T03:53:21Z) - EvoVGM: A Deep Variational Generative Model for Evolutionary Parameter
Estimation [0.0]
本研究では,局所生物学的進化パラメータの真後部を共同で近似した深部変分ベイズ生成モデルを提案する。
本研究では,いくつかの進化シナリオと実際のウイルス配列アライメントをシミュレートした合成配列アライメントにおける手法の一貫性と有効性を示す。
論文 参考訳(メタデータ) (2022-05-25T20:08:10Z) - Epigenetic evolution of deep convolutional models [81.21462458089142]
我々は、より深い畳み込みモデルを進化させるために、これまで提案されていた神経進化の枠組みを構築した。
異なる形状と大きさのカーネルを同一層内に共存させる畳み込み層配置を提案する。
提案したレイアウトにより、畳み込み層内の個々のカーネルのサイズと形状を、対応する新しい突然変異演算子で進化させることができる。
論文 参考訳(メタデータ) (2021-04-12T12:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。