論文の概要: Canopy: A Heterograph Foundation Model for Metabolic Engineering
- arxiv url: http://arxiv.org/abs/2607.06224v1
- Date: Tue, 07 Jul 2026 12:48:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.514889
- Title: Canopy: A Heterograph Foundation Model for Metabolic Engineering
- Title(参考訳): Canopy: 代謝工学のためのヘテログラフ基礎モデル
- Abstract要約: Canopyは10の公開およびプロプライエタリなデータソースを統合知識グラフに統合する異種グラフ基盤モデルである。
ノード機能はドメイン固有の基盤モデルを通じてエンコードされ、単一のグラフ内でマルチモーダル表現が生成される。
発酵試薬予測の下流のタスクでは、凍結したカノピーの埋め込みは軽量プローブで$R2 = 0.41$に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Designing microbial strains that produce high-value chemicals at commercially viable titers remains a central challenge in metabolic engineering. Existing computational approaches either rely on stoichiometric constraint-based models that cannot learn from experimental data, or apply tabular machine learning to hand-crafted features that discard the relational structure of biological knowledge. We present Canopy, a heterogeneous graph foundation model that integrates ten public and proprietary data sources into a unified knowledge graph (KG) of 6.9M nodes across 13 types and 34 edge types, covering genes, proteins, metabolites, reactions, pathways, strains, and fermentation experiments. Node features are encoded through domain-specific foundation models (ESM-2 for protein sequences, MoLFormer for chemical SMILES, and PubMedBERT for biomedical text), yielding a multi-modal representation within a single graph. We pretrain a Heterogeneous Graph Transformer (HGT) augmented with SignNet positional encodings, Jumping Knowledge aggregation, and virtual nodes using four self-supervised objectives (link prediction, masked node modelling, distance prediction, and contrastive experiment clustering), balanced via learned homoscedastic uncertainty weighting. On the downstream task of fermentation titer prediction, frozen Canopy embeddings achieve $R^{2} = 0.41$ with a lightweight probe, outperforming tabular baselines (best $R^{2} = 0.24$) and homogeneous GNN variants.
- Abstract(参考訳): 高価値化学物質を商業的に生産する微生物株を設計することは、代謝工学における中心的な課題である。
既存の計算手法は、実験データから学習できない確率論的制約に基づくモデルに依存するか、または生物学的知識のリレーショナル構造を捨てる手作りの特徴に表層機械学習を適用する。
Canopyは、10の公開およびプロプライエタリなデータソースを13種類および34種類のエッジタイプにわたる6.9Mノードの統一知識グラフ(KG)に統合し、遺伝子、タンパク質、代謝物、反応、経路、ひずみ、発酵実験をカバーする異種グラフ基盤モデルである。
ノード機能はドメイン固有の基礎モデル(タンパク質配列のESM-2、化学SMILESのMoLFormer、生医学テキストのPubMedBERT)によって符号化され、単一のグラフ内でマルチモーダル表現が得られる。
我々は,4つの自己教師対象(リンク予測,マスクノードモデリング,距離予測,コントラスト実験クラスタリング)を用いて,SignNet位置エンコーディング,Jumping Knowledgeアグリゲーション,仮想ノードを付加したHGT(Heterogeneous Graph Transformer)を事前訓練する。
発酵試薬予測の下流のタスクでは、凍結したカノピーの埋め込みは、軽量なプローブで$R^{2} = 0.41$、タブ状のベースライン(best $R^{2} = 0.24$)および同質なGNN変種より優れている。
関連論文リスト
- Graph-Theoretic Models for the Prediction of Molecular Measurements [0.0]
本研究は,MoneculeNetの5つのベンチマークデータセットのベースラインである$D(G)$-$(G)$モデルを評価する。
リッジ正規化、グラフ記述子の追加、物理化学的特性、グラディエントブースティングによるアンサンブル学習、ラッソ特徴選択、およびモーガン指紋と位相指標を組み合わせたハイブリッドアプローチを取り入れた体系的な拡張フレームワークが提案されている。
論文 参考訳(メタデータ) (2026-04-21T09:27:55Z) - MetagenBERT: a Transformer-based Architecture using Foundational genomic Large Language Models for novel Metagenome Representation [4.470992949474734]
分類学的および機能的アノテーションなしで生のDNA配列から直接エンド・ツー・エンドのメタゲノムを組み込むフレームワークであるMetagenBERTを提案する。
5つのベンチマーク腸内微生物叢(肝硬変, T2D, 肥満, IBD, CRC)に対する本手法の評価を行った。
また,MetagenBERT Glob Mcardisは多種多様なMetaCardisコホートを訓練し,他のデータセットに転送し,未知の表現型を含む予測信号を保持するクロスコホートである。
論文 参考訳(メタデータ) (2026-01-05T19:36:36Z) - Interpretable Perturbation Modeling Through Biomedical Knowledge Graphs [2.9275990558029075]
マルチモーダル・埋め込みは バイオメディカル・ナレッジ・グラフに統合されます
薬物細胞対のランドマーク遺伝子のデルタ表現プロファイルを学習するために,グラフアテンションネットワークを訓練する。
我々の枠組みは、メカニスティックな薬物モデリングへの道筋を提供する。
論文 参考訳(メタデータ) (2025-12-24T04:42:25Z) - Composable Score-based Graph Diffusion Model for Multi-Conditional Molecular Generation [85.58520120011269]
本研究では,具体的スコアを用いてスコアマッチングを離散グラフに拡張するComposable Score-based Graph Diffusion Model (CSGD)を提案する。
CSGDは従来の手法よりも平均15.3%の制御性向上を実現していることを示す。
本研究は, 離散グラフ生成におけるスコアベースモデリングの実用的利点と, フレキシブルでマルチプロパタイトな分子設計のためのキャパシティを強調した。
論文 参考訳(メタデータ) (2025-09-11T13:37:56Z) - Unlasting: Unpaired Single-Cell Multi-Perturbation Estimation by Dual Conditional Diffusion Implicit Bridges [68.98973318553983]
本稿では,Dual Diffusion Implicit Bridges (DDIB) に基づくフレームワークを提案する。
我々は、生物学的に意味のある方法で摂動シグナルを伝達するために遺伝子制御ネットワーク(GRN)情報を統合する。
また、サイレント遺伝子を予測し、生成したプロファイルの品質を向上させるためのマスキング機構も組み込んだ。
論文 参考訳(メタデータ) (2025-06-26T09:05:38Z) - GraphGDel: Constructing and Learning Graph Representations of Genome-Scale Metabolic Models for Growth-Coupled Gene Deletion Prediction [1.0909000338858534]
本稿では,制約に基づくメタボリックモデルからグラフ表現を構築するための体系的なパイプラインを提案する。
第2に,これらのグラフ表現を遺伝子およびメタボライト配列データと統合し,成長に結合した遺伝子削除戦略を予測するディープラーニングフレームワークを開発する。
我々のアプローチは確立されたベースラインを一貫して上回り、全体的な精度で14.04%、16.26%、13.18%の改善を実現している。
論文 参考訳(メタデータ) (2025-04-08T08:07:59Z) - Stacked ensemble\-based mutagenicity prediction model using multiple modalities with graph attention network [0.9736758288065405]
変異原性は、様々なネガティブな結果をもたらす遺伝子変異と関連しているため、懸念される。
本研究では,新しいアンサンブルに基づく変異原性予測モデルを提案する。
論文 参考訳(メタデータ) (2024-09-03T09:14:21Z) - Generation is better than Modification: Combating High Class Homophily Variance in Graph Anomaly Detection [51.11833609431406]
異なるクラス間のホモフィリー分布の差は、ホモフィリックグラフやヘテロフィリックグラフよりも著しく大きい。
我々は、この現象を定量的に記述した、クラスホモフィリーバリアンスと呼ばれる新しい計量を導入する。
その影響を軽減するために,ホモフィリーエッジ生成グラフニューラルネットワーク(HedGe)と呼ばれる新しいGNNモデルを提案する。
論文 参考訳(メタデータ) (2024-03-15T14:26:53Z) - Bi-level Contrastive Learning for Knowledge-Enhanced Molecule Representations [68.32093648671496]
分子に固有の二重レベル構造を考慮に入れたGODEを導入する。
分子は固有のグラフ構造を持ち、より広い分子知識グラフ内のノードとして機能する。
異なるグラフ構造上の2つのGNNを事前学習することにより、GODEは対応する知識グラフサブ構造と分子構造を効果的に融合させる。
論文 参考訳(メタデータ) (2023-06-02T15:49:45Z) - Heterogeneous Graph Neural Networks using Self-supervised Reciprocally
Contrastive Learning [102.9138736545956]
不均一グラフニューラルネットワーク(HGNN)は異種グラフのモデリングと解析において非常に一般的な手法である。
我々は,ノード属性とグラフトポロジの各ガイダンスに関する2つの視点を取り入れた,新規で頑健なヘテロジニアスグラフコントラスト学習手法であるHGCLを初めて開発する。
この新しいアプローチでは,属性とトポロジに関連情報を別々にマイニングする手法として,異なるが最も適した属性とトポロジの融合機構を2つの視点に適用する。
論文 参考訳(メタデータ) (2022-04-30T12:57:02Z) - Generalizing electrocardiogram delineation: training convolutional
neural networks with synthetic data augmentation [63.51064808536065]
ECGのデライン化のための既存のデータベースは小さく、サイズやそれらが表す病態の配列に不足している。
まず、原データベースから抽出した基本セグメントのプールを与えられたECGトレースを確率的に合成し、その整合性のある合成トレースに配置するための一連のルールを考案した。
第二に、2つの新しいセグメンテーションに基づく損失関数が開発され、これは、正確な数の独立構造の予測を強制し、サンプル数の削減に焦点をあてて、より密接なセグメンテーション境界を創出することを目的としている。
論文 参考訳(メタデータ) (2021-11-25T10:11:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。