論文の概要: Explainable Molecular Structure Inference from GC--MS with Diffusion Models and LLM Reranking
- arxiv url: http://arxiv.org/abs/2610.03066v1
- Date: Fri, 02 Oct 2026 09:48:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.310265
- Title: Explainable Molecular Structure Inference from GC--MS with Diffusion Models and LLM Reranking
- Title(参考訳): 拡散モデルとLLM再構成によるGC--MSからの説明可能な分子構造推定
- Abstract要約: 本稿では,GC--EI--MSからのデノボ構造解明のためのグラフ拡散モデルDiffGCMSを提案する。
大規模言語モデル(LLM)による第2段階推論とDiffGCMSを統合するフレームワークをさらに開発する。
この枠組みは、基準スペクトルライブラリーから欠く化合物の可塑性分子構造を生成することができる。
- 参考スコア(独自算出の注目度): 1.9095697066491348
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: GC--EI--MS is an important technique for analyzing volatile and semivolatile compounds in complex samples. However, conventional methods rely heavily on reference spectral library matching, limiting their ability to identify compounds absent from these libraries and to infer complete molecular structures directly from fragmentation information. Here, we present DiffGCMS, a spectrum-conditioned discrete graph diffusion model for de novo structure elucidation from GC--EI--MS, and further develop a framework that integrates DiffGCMS with second-stage reasoning by a large language model (LLM). In the first stage, DiffGCMS generates candidate molecular structures from input spectra; in the second stage, the LLM uses mass spectral information to validate, repair, and rerank the candidates and provides interpretable analysis of fragment-ion peaks. This framework can generate plausible molecular structures for compounds absent from reference spectral libraries and provide traceable evidence supporting its decisions. On a test set comprising 13,696 spectra from NIST 20, the generative model achieved Acc@1 and Acc@10 of 6.01\% and 15.76\%, respectively. On the test subset containing molecules with no more than 10 heavy atoms, LLM-assisted molecular graph repair and reranking increased Acc@1 from 21.28\% to 21.95\%, Acc@10 from 46.91\% to 47.99\%, and candidate validity from 91.04\% to 100\%. These results demonstrate that spectrum-aware postprocessing can correct errors produced by the generative model while providing auditable and traceable explanations for the final ranking.
- Abstract(参考訳): GC-EI-MSは、複雑な試料中の揮発性および半揮発性化合物を分析するための重要な技術である。
しかし、従来の手法は参照スペクトルライブラリマッチングに大きく依存しており、これらのライブラリから欠落する化合物を同定し、断片化情報から直接完全な分子構造を推測する能力を制限する。
本稿では,GC-EI-MSからデノボ構造を解明するためのスペクトル条件付き離散グラフ拡散モデルであるDiffGCMSについて述べる。
第1段階では、DiffGCMSは入力スペクトルから候補分子構造を生成するが、第2段階では、LLMは質量スペクトル情報を用いて候補を検証、修復、再ランクし、フラグメントイオンピークの解釈可能な解析を行う。
この枠組みは、基準スペクトルライブラリーから欠落する化合物の可溶性分子構造を生成し、その決定を支持するトレース可能な証拠を提供することができる。
NIST20から13,696のスペクトルからなる試験セットにおいて、生成モデルはAcc@1とAcc@10をそれぞれ6.01\%、15.76\%とした。
10個の重原子未満の分子を含む試験サブセットでは、LLMによる分子グラフ修復と再位が21.28\%から21.95\%に増加し、Acc@10は46.91\%から47.99\%に増加し、候補は91.04\%から100\%に増加した。
これらの結果から,スペクトル認識によるポストプロセッシングによって生成モデルが生成した誤りを補正し,最終ランキングのオーディショナブルかつトレース可能な説明を提供することができた。
関連論文リスト
- Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data [41.531262858699925]
我々は、スペクトル証拠を大規模分子前駆体と密に統合するスケーラブルな仮説修正パラダイムを開発する。
我々は、マルチモーダルスペクトル入力に条件付された化学的に有効な分子仮説を提案するスペクトル-構造モデルであるtextbfSpectroMol を紹介する。
また、分子式、正確な質量、不飽和度を統合した高分解能質量制約分子発生器であるtextbfMS-Mol2Mol を開発した。
論文 参考訳(メタデータ) (2026-07-22T06:50:53Z) - FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time [52.735012862324766]
本稿では,質量スペクトルに条件付き構造を生成する新しい拡散言語モデルを用いたフレームワークFRIGIDを提案する。
スペクトル非一貫性フラグメントを同定することにより、前方フラグメンテーションモデルが推論時間スケーリングを実現する方法を示す。
さらなる実証分析により、FRIGIDは推論時間の増大を伴う対数線形性能のスケーリングを示すことが示された。
論文 参考訳(メタデータ) (2026-04-17T19:11:18Z) - FlowMS: Flow Matching for De Novo Structure Elucidation from Mass Spectra [6.255932418151384]
FlowMSは、スペクトル条件付きデノボ分子生成のための最初の離散フローマッチングフレームワークである。
NPLIB1ベンチマークの6つのメトリクスのうち5つで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-19T01:41:52Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra [60.08608779794957]
本稿では,ジェネレーティブ言語モデルに基づく検索フレームワークであるGLMRを提案する。
検索前の段階では、比較学習に基づくモデルでは、上位候補分子を入力質量スペクトルの文脈的先行として識別する。
生成検索段階において、これらの候補分子は入力質量スペクトルと統合され、精製された分子構造を生成するための生成モデルが導かれる。
論文 参考訳(メタデータ) (2025-11-09T07:25:53Z) - Test-Time Tuned Language Models Enable End-to-end De Novo Molecular Structure Generation from MS/MS Spectra [31.563216077422084]
タンデム質量分析法は、代謝学、天然物発見、環境分析などの重要な分野における未知化合物の同定を可能にする。
テスト時間チューニングを活用することで,事前学習されたトランスフォーマーモデルの学習を向上し,このギャップに対処するフレームワークを導入する。
我々は、NPLIB1とMassSpecGymの2つの人気のあるベンチマークで、DiffMSのデファクトステート・オブ・ザ・アーティカルアプローチを100%と20%上回った。
論文 参考訳(メタデータ) (2025-10-27T18:25:36Z) - DiffSpectra: Molecular Structure Elucidation from Spectra using Diffusion Models [68.19129717255053]
本稿では、分子構造解明を条件生成プロセスとして定式化する生成フレームワークであるDiffSpectraについて述べる。
我々の実験では、DiffSpectraが分子構造を正確に解明し、40.76%のトップ-1と99.49%のトップ10を達成している。
論文 参考訳(メタデータ) (2025-07-09T13:57:20Z) - DiffMS: Diffusion Generation of Molecules Conditioned on Mass Spectra [60.39311767532607]
本稿では,DiffMSを提案する。DiffMS,式制限付きエンコーダ・デコーダ生成ネットワークは,このタスクにおける最先端性能を実現する。
遅延埋め込みと分子構造をブリッジするロバストデコーダを開発するために,フィンガー構造対による拡散デコーダの事前訓練を行う。
確立されたベンチマーク実験により、DiffMSはデノボ分子生成における既存のモデルよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-13T18:29:48Z) - Automated fragment identification for electron ionisation mass
spectrometry: application to atmospheric measurements of halocarbons [0.0]
非標的スクリーニングは、疑いまたは未知のすべての現在の物質のサンプルを検索することである。
このアプローチは10年以上前に水分析の分野で導入されたが、室内および大気中の微量ガスの測定には依然として不十分である。
GC-EI-HRMSによる未知化合物の自動同定を可能にするデータ解析ツールを提案する。
論文 参考訳(メタデータ) (2021-03-23T09:35:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。