論文の概要: MS-GPT: Rethinking MS/MS De Novo Structure Elucidation as Spectrum-Induced Posterior Querying of a Molecule-Language Model
- arxiv url: http://arxiv.org/abs/2607.23607v1
- Date: Sun, 26 Jul 2026 11:29:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.169063
- Title: MS-GPT: Rethinking MS/MS De Novo Structure Elucidation as Spectrum-Induced Posterior Querying of a Molecule-Language Model
- Title(参考訳): MS-GPT:MS/MS De Novo構造解明の再考
- Abstract要約: MS-GPTは、条件付き分子言語モデルのスペクトル誘発後クエリーとして指紋によるde novoの解明を再放送する。
NPLIB1とMassSpecGymでは、MS-GPTはTop-1/Top-10の精度が29.8%/41.1%、23.9%/28.7%に達した。
- 参考スコア(独自算出の注目度): 40.63247259280181
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Molecular structure elucidation from tandem mass spectra (MS/MS) is a central inverse problem in analytical chemistry. Most existing approaches to MS/MS identification remain tied to reference libraries or predefined candidate sets, whereas de novo methods aim to generate structures directly from spectra. A common de novo route predicts a molecular fingerprint from the spectrum and then decodes structures from it, enabling decoder pretraining on large molecule-only corpora. However, this paradigm creates a training-inference mismatch: the decoder is trained on oracle fingerprints computed from molecules, but at inference it is queried with a noisy spectrum-induced fingerprint posterior that is typically collapsed to a single thresholded fingerprint. We introduce MS-GPT, which recasts fingerprint-mediated de novo elucidation as spectrum-induced posterior querying of a conditional molecule-language model. MS-GPT conditions a molecule-language model on fingerprints and formulas, then converts the spectrum-induced posterior into a band of fingerprint queries near the oracle-fingerprint manifold through active-bit density calibration. Candidates sampled across this band are pooled and ranked by generation-frequency consensus. A lightweight LoRA adapter further mitigates domain-specific posterior bias while preserving the pretrained molecular prior. On NPLIB1 and MassSpecGym, MS-GPT sets a new state of the art, reaching Top-1/Top-10 exact-match accuracy of 29.8\%/41.1\% and 23.9\%/28.7\%, respectively. Candidate-pool scaling shows that efficient autoregressive molecular generation continues to improve recall with a little additional inference cost. The source code and model checkpoints are available at https://github.com/VIKI623/MS-GPT.
- Abstract(参考訳): タンデム質量スペクトル(MS/MS)からの分子構造解明は分析化学における中心的な逆問題である。
既存のMS/MS識別手法のほとんどは参照ライブラリや事前定義された候補セットと結びついているが、デノボ法はスペクトルから直接構造を生成することを目的としている。
共通のデノボ経路は、スペクトルから分子の指紋を予測し、そこから構造をデコードし、デコーダが大きな分子のみのコーパスで事前学習できるようにする。
しかし、このパラダイムはトレーニングと推論のミスマッチを生み出し、デコーダは分子から計算されたオラクルの指紋で訓練されるが、推論時にはノイズの多いスペクトル誘起の指紋後部でクエリされ、通常は1つの閾値の指紋に崩壊する。
我々は,MS-GPTを導入し,指紋によるde novoの解明を条件付き分子言語モデルのスペクトル誘発後クエリーとして再放送する。
MS-GPTは、指紋と公式の分子言語モデルを作成し、その後、スペクトル誘起後部を、アクティブビット密度のキャリブレーションにより、オラクル・フィンガープリント多様体の近くの指紋クエリのバンドに変換する。
このバンドでサンプリングされた候補は、世代周波数のコンセンサスによってプールされランク付けされる。
軽量のLoRAアダプタは、予め訓練された分子を保存しながら、ドメイン固有の後部バイアスをさらに軽減する。
NPLIB1とMassSpecGymでは、MS-GPTは、それぞれ29.8\%/41.1\%、23.9\%/28.7\%のTop-1/Top-10の精度に達した。
候補プールスケーリングは、効率的な自己回帰分子生成が若干の推論コストでリコールを改善し続けていることを示している。
ソースコードとモデルチェックポイントはhttps://github.com/VIKI623/MS-GPTで入手できる。
関連論文リスト
- SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception [48.96518000981492]
直接電子イオン化質量分析法(EI-MS)を嗅覚予測のための代替入力モードとして検討する。
我々は、EI-MS表現と予め訓練された化学構造埋め込みを整合させるマルチモーダルコントラスト学習フレームワークであるSpectrum-to-Chemical EmbeddingalignedmeNT(SCENT)を寄贈する。
マルチラベルの匂い記述子予測タスクでは、SCENTはMSのみのベースラインを著しく上回り、構造ベースモデルに匹敵する嗅覚性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T13:28:57Z) - FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time [52.735012862324766]
本稿では,質量スペクトルに条件付き構造を生成する新しい拡散言語モデルを用いたフレームワークFRIGIDを提案する。
スペクトル非一貫性フラグメントを同定することにより、前方フラグメンテーションモデルが推論時間スケーリングを実現する方法を示す。
さらなる実証分析により、FRIGIDは推論時間の増大を伴う対数線形性能のスケーリングを示すことが示された。
論文 参考訳(メタデータ) (2026-04-17T19:11:18Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra [60.08608779794957]
本稿では,ジェネレーティブ言語モデルに基づく検索フレームワークであるGLMRを提案する。
検索前の段階では、比較学習に基づくモデルでは、上位候補分子を入力質量スペクトルの文脈的先行として識別する。
生成検索段階において、これらの候補分子は入力質量スペクトルと統合され、精製された分子構造を生成するための生成モデルが導かれる。
論文 参考訳(メタデータ) (2025-11-09T07:25:53Z) - Test-Time Tuned Language Models Enable End-to-end De Novo Molecular Structure Generation from MS/MS Spectra [31.563216077422084]
タンデム質量分析法は、代謝学、天然物発見、環境分析などの重要な分野における未知化合物の同定を可能にする。
テスト時間チューニングを活用することで,事前学習されたトランスフォーマーモデルの学習を向上し,このギャップに対処するフレームワークを導入する。
我々は、NPLIB1とMassSpecGymの2つの人気のあるベンチマークで、DiffMSのデファクトステート・オブ・ザ・アーティカルアプローチを100%と20%上回った。
論文 参考訳(メタデータ) (2025-10-27T18:25:36Z) - MS-BART: Unified Modeling of Mass Spectra and Molecules for Structure Elucidation [20.973121120131875]
大規模事前学習は、他の領域におけるデータの不足に対処するのに有効であることが証明されている。
質量スペクトルと分子構造を共有トークン語彙にマッピングする統合モデリングフレームワークMS-BARTを提案する。
大規模な評価では、MS-BARTはMassSpecGymとNPLIB1の5/12キーメトリクスでSOTA性能を達成している。
論文 参考訳(メタデータ) (2025-10-23T14:45:28Z) - One Small Step with Fingerprints, One Giant Leap for De Novo Molecule Generation from Mass Spectra [2.6427170916831466]
質量スペクトルからのデノボ分子生成問題に対する一般的なアプローチは、2段階のパイプラインである。
我々の研究では、エンコーダとしてMIST、デコーダとしてMolForgeを採用し、パフォーマンスを向上させるために追加のトレーニングデータを活用しています。
この結果、従来の最先端手法よりも10倍改善され、質量スペクトルから分子構造の上位1/上位10 40%を正確に生成する。
論文 参考訳(メタデータ) (2025-08-06T08:05:01Z) - DiffMS: Diffusion Generation of Molecules Conditioned on Mass Spectra [60.39311767532607]
本稿では,DiffMSを提案する。DiffMS,式制限付きエンコーダ・デコーダ生成ネットワークは,このタスクにおける最先端性能を実現する。
遅延埋め込みと分子構造をブリッジするロバストデコーダを開発するために,フィンガー構造対による拡散デコーダの事前訓練を行う。
確立されたベンチマーク実験により、DiffMSはデノボ分子生成における既存のモデルよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-13T18:29:48Z) - MassSpecGym: A benchmark for the discovery and identification of molecules [21.471140898806315]
我々はMS/MSデータから分子の発見と同定のための最初の包括的なベンチマークであるMassSpecGymを提案する。
当社のベンチマークは,MS/MSスペクトルをラベル付けした高品質な画像集としては最大である。
デ・ノボ分子構造生成、分子検索、スペクトルシミュレーションという3つのMS/MSアノテーションの課題を定義している。
論文 参考訳(メタデータ) (2024-10-30T15:08:05Z) - MassFormer: Tandem Mass Spectrum Prediction for Small Molecules using
Graph Transformers [3.2951121243459522]
タンデム質量スペクトルは、分子に関する重要な構造情報を提供する断片化パターンをキャプチャする。
70年以上にわたり、スペクトル予測はこの分野において重要な課題であり続けている。
我々はタンデム質量スペクトルを正確に予測する新しいモデルMassFormerを提案する。
論文 参考訳(メタデータ) (2021-11-08T20:55:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。