論文の概要: MassSpecGym: A benchmark for the discovery and identification of molecules
- arxiv url: http://arxiv.org/abs/2410.23326v1
- Date: Wed, 30 Oct 2024 15:08:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-11-28 17:07:42.51201
- Title: MassSpecGym: A benchmark for the discovery and identification of molecules
- Title(参考訳): MassSpecGym:分子の発見と同定のためのベンチマーク
- Abstract要約: 我々はMS/MSデータから分子の発見と同定のための最初の包括的なベンチマークであるMassSpecGymを提案する。
当社のベンチマークは,MS/MSスペクトルをラベル付けした高品質な画像集としては最大である。
これは、3つのMS/MSアノテーションの課題を定義している: textitde novo 分子構造の生成、分子検索、スペクトルシミュレーションである。
- 参考スコア(独自算出の注目度): 21.471140898806315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The discovery and identification of molecules in biological and environmental samples is crucial for advancing biomedical and chemical sciences. Tandem mass spectrometry (MS/MS) is the leading technique for high-throughput elucidation of molecular structures. However, decoding a molecular structure from its mass spectrum is exceptionally challenging, even when performed by human experts. As a result, the vast majority of acquired MS/MS spectra remain uninterpreted, thereby limiting our understanding of the underlying (bio)chemical processes. Despite decades of progress in machine learning applications for predicting molecular structures from MS/MS spectra, the development of new methods is severely hindered by the lack of standard datasets and evaluation protocols. To address this problem, we propose MassSpecGym -- the first comprehensive benchmark for the discovery and identification of molecules from MS/MS data. Our benchmark comprises the largest publicly available collection of high-quality labeled MS/MS spectra and defines three MS/MS annotation challenges: \textit{de novo} molecular structure generation, molecule retrieval, and spectrum simulation. It includes new evaluation metrics and a generalization-demanding data split, therefore standardizing the MS/MS annotation tasks and rendering the problem accessible to the broad machine learning community. MassSpecGym is publicly available at \url{https://github.com/pluskal-lab/MassSpecGym}.
- Abstract(参考訳): 生物・環境試料中の分子の発見と同定は、生物医学・化学科学の発展に不可欠である。
タンデム質量分析法(Tandem mass spectrometry, MS/MS)は、分子構造を高速に解明する技術である。
しかし、分子構造を質量スペクトルから復号することは、人間の専門家が行ったとしても非常に難しい。
その結果、取得したMS/MSスペクトルの大部分は未解釈のままであり、それによって基礎となる(バイオ)化学過程の理解が制限される。
MS/MSスペクトルから分子構造を予測する機械学習の応用が何十年にもわたって進歩してきたが、標準データセットや評価プロトコルの欠如により、新しい手法の開発が著しく妨げられている。
この問題に対処するため、MS/MSデータから分子の発見と同定を行うための最初の包括的なベンチマークであるMassSpecGymを提案する。
提案ベンチマークは,MS/MSスペクトルの高画質化と,分子構造生成,分子検索,スペクトルシミュレーションの3つのMS/MSアノテーションの課題を定義した。
新しい評価指標と一般化要求データ分割が含まれており、MS/MSアノテーションのタスクを標準化し、幅広い機械学習コミュニティにアクセス可能な問題をレンダリングする。
MassSpecGym は \url{https://github.com/pluskal-lab/MassSpecGym} で公開されている。
関連論文リスト
- SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception [48.96518000981492]
直接電子イオン化質量分析法(EI-MS)を嗅覚予測のための代替入力モードとして検討する。
我々は、EI-MS表現と予め訓練された化学構造埋め込みを整合させるマルチモーダルコントラスト学習フレームワークであるSpectrum-to-Chemical EmbeddingalignedmeNT(SCENT)を寄贈する。
マルチラベルの匂い記述子予測タスクでは、SCENTはMSのみのベースラインを著しく上回り、構造ベースモデルに匹敵する嗅覚性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T13:28:57Z) - MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification [11.133897813950789]
分子の集合が与えられたMS/MSスペクトルから代謝物の化学構造を復元することからなる分子検索タスクに対処する。
本稿では,表現アライメントとコントラスト学習に基づく最近のアプローチを包含する統合フレームワークを提案する。
MSAlignは実装が簡単で、トレーニングが速く、すべてのベンチマークで既存のアプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-05-19T12:19:35Z) - De novo molecular structure elucidation from mass spectra via flow matching [5.274388013166468]
我々は,2段階のエンコーダデコーダフローマッチング生成モデルであるMSFlowを開発した。
MSFlowは、分子質量スペクトルの最大45%を対応する分子表現に変換することができる。
論文 参考訳(メタデータ) (2026-02-23T14:52:53Z) - Contrastive Domain Generalization for Cross-Instrument Molecular Identification in Mass Spectrometry [3.6398652091809987]
本稿では,物質スペクトルを化学的に有意な分子構造埋め込み空間にマッピングするクロスモーダルアライメントフレームワークを提案する。
本モデルでは,固定256方向ゼロショット検索においてトップ1の精度42.2%を達成し,グローバル検索条件下での強い一般化を示す。
これらの結果は,MSデータから分子同定における一般化ボトルネックを解決するために,物理スペクトル分解能と分子構造埋め込みを明示的に統合することが重要であることを示唆している。
論文 参考訳(メタデータ) (2026-01-31T06:18:47Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Mamba-driven multi-perspective structural understanding for molecular ground-state conformation prediction [69.32436472760712]
本稿では,マンバ駆動型多面的構造理解(MPSU-Mamba)による分子基底状態の局在化手法を提案する。
複雑で多様な分子に対しては、対応する分子構造の包括的認識を構築するために、3種類の専用の走査戦略が検討されている。
QM9 と Molecule3D データセットの実験結果から,MPSU-Mamba が既存の手法よりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-11-10T11:18:32Z) - Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra [60.08608779794957]
本稿では,ジェネレーティブ言語モデルに基づく検索フレームワークであるGLMRを提案する。
検索前の段階では、比較学習に基づくモデルでは、上位候補分子を入力質量スペクトルの文脈的先行として識別する。
生成検索段階において、これらの候補分子は入力質量スペクトルと統合され、精製された分子構造を生成するための生成モデルが導かれる。
論文 参考訳(メタデータ) (2025-11-09T07:25:53Z) - Test-Time Tuned Language Models Enable End-to-end De Novo Molecular Structure Generation from MS/MS Spectra [31.563216077422084]
タンデム質量分析法は、代謝学、天然物発見、環境分析などの重要な分野における未知化合物の同定を可能にする。
テスト時間チューニングを活用することで,事前学習されたトランスフォーマーモデルの学習を向上し,このギャップに対処するフレームワークを導入する。
我々は、NPLIB1とMassSpecGymの2つの人気のあるベンチマークで、DiffMSのデファクトステート・オブ・ザ・アーティカルアプローチを100%と20%上回った。
論文 参考訳(メタデータ) (2025-10-27T18:25:36Z) - KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge [73.51130155601824]
KnowMol-100Kは100Kの微細な分子アノテーションを持つ大規模データセットである。
また,既存の分子表現戦略の限界に効果的に対処する,化学的に不変な分子表現も提案する。
KnowMolは、分子理解および生成タスク間で優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-22T11:23:58Z) - $\ ext{M}^{2}$LLM: Multi-view Molecular Representation Learning with Large Language Models [59.125833618091846]
分子構造ビュー,分子タスクビュー,分子規則ビューの3つの視点を統合した多視点フレームワークを提案する。
実験によると、$textM2$LLMは、分類タスクと回帰タスクをまたいだ複数のベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-12T05:46:47Z) - DiffSpectra: Molecular Structure Elucidation from Spectra using Diffusion Models [66.41802970528133]
スペクトルからの分子構造解明は化学の基礎的な問題である。
従来の手法は専門家の解釈に大きく依存し、拡張性に欠ける。
マルチモーダルスペクトルデータから2次元および3次元分子構造を直接推定する生成フレームワークであるDiffSpectraを提案する。
論文 参考訳(メタデータ) (2025-07-09T13:57:20Z) - Mol-LLaMA: Towards General Understanding of Molecules in Large Molecular Language Model [55.87790704067848]
Mol-LLaMAは、分子を中心とした一般的な知識を把握した大きな分子言語モデルである。
異なる分子エンコーダの相補的な情報を統合するモジュールを導入する。
実験の結果,Moll-LLaMAは分子の一般的な特徴を理解することができることがわかった。
論文 参考訳(メタデータ) (2025-02-19T05:49:10Z) - DiffMS: Diffusion Generation of Molecules Conditioned on Mass Spectra [60.39311767532607]
DiffMSは式制限エンコーダ-デコーダ生成ネットワークである。
我々は、潜伏埋め込みと分子構造を橋渡しする頑健なデコーダを開発する。
実験の結果、DiffMS は $textitde novo$ 分子生成で既存のモデルより優れていることが示された。
論文 参考訳(メタデータ) (2025-02-13T18:29:48Z) - MADGEN: Mass-Spec attends to De Novo Molecular generation [16.89017809745962]
質量分析データを用いたデノボ分子構造生成のための足場に基づく手法を提案する。
MADGENは、足場検索とスペクトル条件分子生成の2段階で動作する。
我々は3つのデータセット(NIST23、CANOPUS、MassSpecGym)上でMADGENを評価する。
論文 参考訳(メタデータ) (2025-01-03T18:54:26Z) - Unraveling Molecular Structure: A Multimodal Spectroscopic Dataset for Chemistry [0.1747623282473278]
このデータセットは、特許データから化学反応から抽出された790k分子の1ドルH-NMR、13ドルC-NMR、HSQC-NMR、赤外線、質量スペクトルからなる。
本研究では, 構造解明, 対象分子のスペクトル予測, 機能群予測などの単一モダリティタスクを評価するためのベンチマークを行う。
論文 参考訳(メタデータ) (2024-07-04T12:52:48Z) - Machine learning meets mass spectrometry: a focused perspective [0.0]
質量分析法 (Mass Spectrometry) は、医学、生命科学、化学、工業製品の品質管理などの分野で広く用いられている方法である。
いくつかの質量分析技術の主な特徴の1つは、広範囲のキャラクタリゼーションレベルと、測定毎に生成される大量のデータである。
機械学習の手法の開発によって、これらのデータの可能性を解き放つ機会が生まれ、これまでアクセス不能だった発見が可能になる。
論文 参考訳(メタデータ) (2024-06-27T14:18:23Z) - Instruction Multi-Constraint Molecular Generation Using a Teacher-Student Large Language Model [49.64512917330373]
本稿では,学生に類似した多制約分子生成大言語モデルTSMMGを紹介する。
TSMMGを訓練するために、これらの「教師」から分子知識を抽出し、大量のテキスト-分子対を構築する。
我々は,TSMMGが複雑で自然言語で記述された特性を満たす分子を生成できることを実験的に明らかにした。
論文 参考訳(メタデータ) (2024-03-20T02:15:55Z) - De-novo Identification of Small Molecules from Their GC-EI-MS Spectra [0.0]
機械学習に基づくエンフデノボ法は、その質量スペクトルから直接分子構造を導出する手法が近年注目されている。
本稿では,GC-EI-MS スペクトルの特定の利用例に対処するアノベル法について述べる。
論文 参考訳(メタデータ) (2023-04-04T08:46:00Z) - Implicit Geometry and Interaction Embeddings Improve Few-Shot Molecular
Property Prediction [53.06671763877109]
我々は, 複雑な分子特性を符号化した分子埋め込みを開発し, 数発の分子特性予測の性能を向上させる。
我々の手法は大量の合成データ、すなわち分子ドッキング計算の結果を利用する。
複数の分子特性予測ベンチマークでは、埋め込み空間からのトレーニングにより、マルチタスク、MAML、プロトタイプラーニング性能が大幅に向上する。
論文 参考訳(メタデータ) (2023-02-04T01:32:40Z) - Multi-modal Molecule Structure-text Model for Text-based Retrieval and
Editing [107.49804059269212]
分子の化学構造とテキスト記述を共同で学習し, マルチモーダルな分子構造テキストモデル, MoleculeSTMを提案する。
実験において、分子STMは、新しい生化学的概念を創出するための最先端の一般化能力を得る。
論文 参考訳(メタデータ) (2022-12-21T06:18:31Z) - Graph-based Molecular Representation Learning [59.06193431883431]
分子表現学習(MRL)は、機械学習と化学科学を結びつけるための重要なステップである。
近年、MRLは、特に深層分子グラフ学習に基づく手法において、かなりの進歩を遂げている。
論文 参考訳(メタデータ) (2022-07-08T17:43:20Z) - MassFormer: Tandem Mass Spectrum Prediction for Small Molecules using
Graph Transformers [3.2951121243459522]
タンデム質量スペクトルは、分子に関する重要な構造情報を提供する断片化パターンをキャプチャする。
70年以上にわたり、スペクトル予測はこの分野において重要な課題であり続けている。
我々はタンデム質量スペクトルを正確に予測する新しいモデルMassFormerを提案する。
論文 参考訳(メタデータ) (2021-11-08T20:55:15Z) - Machine-learning-enhanced time-of-flight mass spectrometry analysis [10.16825220733013]
我々は、現代の機械学習技術を活用して、飛行時間帯の質量スペクトルのピークパターンをマイクロ秒内に同定する手法を提案する。
提案手法は、異なる時間飛行質量分析法(ToF-MS)技術から生成された質量スペクトルをクロスバリデーションし、ToF-MSコミュニティにオープンソースでインテリジェントな質量スペクトル分析を提供する。
論文 参考訳(メタデータ) (2020-10-02T14:35:47Z) - ASGN: An Active Semi-supervised Graph Neural Network for Molecular
Property Prediction [61.33144688400446]
本稿では,ラベル付き分子とラベルなし分子の両方を組み込んだ,アクティブ半教師付きグラフニューラルネットワーク(ASGN)を提案する。
教師モデルでは,分子構造や分子分布から情報を共同で活用する汎用表現を学習するための,新しい半教師付き学習手法を提案する。
最後に,分子多様性の観点から,フレームワーク学習全体を通して情報的データを選択するための新しい能動的学習戦略を提案する。
論文 参考訳(メタデータ) (2020-07-07T04:22:39Z) - Self-Supervised Graph Transformer on Large-Scale Molecular Data [73.3448373618865]
分子表現学習のための新しいフレームワークGROVERを提案する。
GROVERは、分子の豊富な構造的および意味的な情報を、巨大な未標識分子データから学習することができる。
分子表現学習において、最大のGNNであり、最大のトレーニングデータセットである、1000万個の未標識分子に1億のパラメータを持つGROVERを事前訓練します。
論文 参考訳(メタデータ) (2020-06-18T08:37:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。