論文の概要: Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?
- arxiv url: http://arxiv.org/abs/2606.31126v2
- Date: Wed, 08 Jul 2026 06:12:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 16:11:06.583084
- Title: Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?
- Title(参考訳): 語彙内学習者は生体分子特性予測に一般化できるか?
- Abstract要約: 限られたラベル付きデータから生体分子特性を予測することは、タンパク質工学と小分子設計における中心的なボトルネックである。
タブラル基礎モデルは, 表現表現と結合した場合のみ, 強い生体分子予測因子となりうることを示す。
- 参考スコア(独自算出の注目度): 9.660361234692143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predicting biomolecular properties from limited labeled data is a central bottleneck in protein engineering and small-molecule design. As strong pretrained encoders now supply rich fixed-length representations, the difficulty has shifted from representation learning to building a data-efficient predictor for the few-shot regime. Tabular foundation models such as TabPFN and TabICL are unlikely candidates for this role: they are in-context learners pretrained on synthetic tables drawn from random causal graphs, a generative prior with no obvious correspondence to the processes that produce protein sequences or molecular graphs. That this tabular, causal inductive bias should transfer to biomolecular data at all is counter-intuitive, yet we find it does. Treating each method as a predictor-representation pair, we evaluate across two domains. We find that on protein fitness regression tasks these in-context learning models coupled with ESM Cambrian representations achieve or exceed state-of-the-art results on ProteinGym, and outperform task-specific supervised regressors on a diverse esterase catalytic activity dataset. For small-molecule classification with ECFP/RDKit descriptors, no single predictor-representation pairing dominates across TDC ADMET, MoleculeNet, FS-Mol, and DrugOOD, but they are competitive with the existing task-specific state-of-the-art. Crucially, on both protein and small-molecule few-shot tasks, these predictor-representation pairs offer strong performance. We conclude that tabular foundation models can be strong biomolecular predictors, but only when coupled with expressive representations.
- Abstract(参考訳): 限られたラベル付きデータから生体分子特性を予測することは、タンパク質工学と小分子設計における中心的なボトルネックである。
強い事前訓練されたエンコーダがリッチな固定長表現を供給しているため、表現学習から数ショット体制のためのデータ効率予測器の構築へと困難が移っている。
TabPFNやTabICLのようなタブラル基礎モデルは、ランダム因果グラフから抽出された合成表に事前訓練された文脈内学習者であり、タンパク質配列や分子グラフを生成するプロセスと明確な対応を持たない生成前である。
この表に表された因果性誘導バイアスが、生体分子データに全く移行すべきであることは、直感に反するものだが、私たちはそれを発見している。
それぞれの手法を予測器表現ペアとして扱い、2つの領域で評価する。
本研究では,これらのコンテキスト内学習モデルとESM Cambrian表現が組み合わさったタンパク質適合性回帰タスクにおいて,ProteinGymにおける最先端の成果を達成または超過し,多様なエステラーゼ触媒活性データセット上でタスク固有の教師付き回帰器より優れることを示した。
ECFP/RDKitディスクリプタによる小さな分子分類では、TDC ADMET, MoleculeNet, FS-Mol, DrugOODにまたがる単一の予測表現ペアは存在せず、既存のタスク固有の最先端と競合する。
重要なことに、タンパク質と小分子のショットタスクの両方において、これらの予測と表現のペアは強いパフォーマンスを提供する。
表層基底モデルは強い生体分子予測因子でありうるが、表現表現と結合する場合に限られる。
関連論文リスト
- Tabular foundation models for in-context prediction of molecular properties [44.41091354279448]
タブラル基礎モデル(TFM)は、コンテキスト内学習を通じて予測を行い、タスク固有のトレーニングなしで推論を可能にする。
我々は、標準化された医薬品のベンチマークと化学工学のデータセットの両方で、低・中・データ体制におけるTFMを評価した。
ベンチマーク全体を通して、この手法は微調整に比べて計算コストを抑えながら優れた予測性能を示す。
論文 参考訳(メタデータ) (2026-04-17T14:58:43Z) - Molecular Machine Learning Using Euler Characteristic Transforms [12.108680020079925]
分子の形状は、その物理化学的および生物学的性質を決定する。
幾何学的トポロジカル記述子としてEuler Characteristics Transform (ECT)を提案する。
ECTは、マルチスケールの構造的特徴の抽出を可能にし、特徴空間における分子形状を表現およびエンコードする新しい方法を提供する。
論文 参考訳(メタデータ) (2025-07-04T10:57:40Z) - Pre-trained Molecular Language Models with Random Functional Group Masking [54.900360309677794]
SMILESをベースとしたアンダーリネム分子アンダーリネム言語アンダーリネムモデルを提案し,特定の分子原子に対応するSMILESサブシーケンスをランダムにマスキングする。
この技術は、モデルに分子構造や特性をよりよく推測させ、予測能力を高めることを目的としている。
論文 参考訳(メタデータ) (2024-11-03T01:56:15Z) - MultiModal-Learning for Predicting Molecular Properties: A Framework Based on Image and Graph Structures [2.5563339057415218]
MolIGは、画像とグラフ構造に基づいて分子特性を予測するための、新しいMultiModaL分子事前学習フレームワークである。
両者の分子表現の強さを融合させる。
ベンチマークグループ内の分子特性予測に関連する下流タスクでは、パフォーマンスが向上する。
論文 参考訳(メタデータ) (2023-11-28T10:28:35Z) - Bi-level Contrastive Learning for Knowledge-Enhanced Molecule Representations [68.32093648671496]
分子に固有の二重レベル構造を考慮に入れたGODEを導入する。
分子は固有のグラフ構造を持ち、より広い分子知識グラフ内のノードとして機能する。
異なるグラフ構造上の2つのGNNを事前学習することにより、GODEは対応する知識グラフサブ構造と分子構造を効果的に融合させる。
論文 参考訳(メタデータ) (2023-06-02T15:49:45Z) - MolCPT: Molecule Continuous Prompt Tuning to Generalize Molecular
Representation Learning [77.31492888819935]
分子表現学習のための「プリトレイン,プロンプト,ファインチューン」という新しいパラダイム,分子連続プロンプトチューニング(MolCPT)を提案する。
MolCPTは、事前訓練されたモデルを使用して、スタンドアロンの入力を表現的なプロンプトに投影するモチーフプロンプト関数を定義する。
いくつかのベンチマークデータセットの実験により、MollCPTは分子特性予測のために学習済みのGNNを効率的に一般化することが示された。
論文 参考訳(メタデータ) (2022-12-20T19:32:30Z) - Unraveling Key Elements Underlying Molecular Property Prediction: A
Systematic Study [27.56700461408765]
分子特性予測の根底にある重要な要素はほとんど未発見のままである。
我々は,MoreculeNetデータセット上の様々な表現を用いて,代表モデルの広範囲な評価を行う。
合計で62,820モデル、固定表現の50,220モデル、SMILES配列の4,200モデル、分子グラフの8,400モデルを含む訓練を行った。
論文 参考訳(メタデータ) (2022-09-26T14:07:59Z) - Graph neural networks for the prediction of molecular structure-property
relationships [59.11160990637615]
グラフニューラルネットワーク(GNN)は、分子グラフ上で直接動作する新しい機械学習手法である。
GNNは、エンドツーエンドでプロパティを学習できるため、情報記述子の必要性を回避することができる。
本稿では、分子特性予測のための2つの例を通して、GNNの基礎を説明し、GNNの応用を実証する。
論文 参考訳(メタデータ) (2022-07-25T11:30:44Z) - Do Large Scale Molecular Language Representations Capture Important
Structural Information? [31.76876206167457]
本稿では,MoLFormerと呼ばれる効率的なトランスフォーマーエンコーダモデルのトレーニングにより得られた分子埋め込みについて述べる。
実験の結果,グラフベースおよび指紋ベースによる教師付き学習ベースラインと比較して,学習された分子表現が競合的に機能することが確認された。
論文 参考訳(メタデータ) (2021-06-17T14:33:55Z) - ASGN: An Active Semi-supervised Graph Neural Network for Molecular
Property Prediction [61.33144688400446]
本稿では,ラベル付き分子とラベルなし分子の両方を組み込んだ,アクティブ半教師付きグラフニューラルネットワーク(ASGN)を提案する。
教師モデルでは,分子構造や分子分布から情報を共同で活用する汎用表現を学習するための,新しい半教師付き学習手法を提案する。
最後に,分子多様性の観点から,フレームワーク学習全体を通して情報的データを選択するための新しい能動的学習戦略を提案する。
論文 参考訳(メタデータ) (2020-07-07T04:22:39Z) - Self-Supervised Graph Transformer on Large-Scale Molecular Data [73.3448373618865]
分子表現学習のための新しいフレームワークGROVERを提案する。
GROVERは、分子の豊富な構造的および意味的な情報を、巨大な未標識分子データから学習することができる。
分子表現学習において、最大のGNNであり、最大のトレーニングデータセットである、1000万個の未標識分子に1億のパラメータを持つGROVERを事前訓練します。
論文 参考訳(メタデータ) (2020-06-18T08:37:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。