論文の概要: MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula
- arxiv url: http://arxiv.org/abs/2607.04774v1
- Date: Mon, 06 Jul 2026 08:05:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.082998
- Title: MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula
- Title(参考訳): MARLIN: 基底構造式のないタンデム質量スペクトルからのDe Novo分子構造解明
- Abstract要約: 分子式を持たないスペクトルから直接構造を解明するde novo法であるMARLINを提案する。
確実に安全な質量殻制限は、全ての候補が原子の在庫を固定することなく測定された質量と整合性を保つ。
NPLIB1ベンチマークでは、MARLINは、正確なマッチング精度、構造距離、指紋の類似性にまたがって、地上構造式を使わずに評価される最強の手法である。
- 参考スコア(独自算出の注目度): 3.2243643829769586
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Untargeted tandem mass spectrometry (MS/MS) detects thousands of small molecules per biological sample, yet most go unidentified because they are absent from spectral libraries. These uncharacterized metabolites and natural products are precisely the compounds that matter for drug discovery, biomarker research, and exposomics. Computational de novo structure elucidation could close this gap, but almost all state-of-the-art methods assume the ground-truth molecular formula is known, an oracle that does not exist for genuinely novel compounds and is itself predicted with substantial error. We present MARLIN, a de novo method that elucidates structures directly from a spectrum with no molecular formula at any stage. A self-supervised encoder predicts a molecular fingerprint from the raw peaks, and a block-diffusion language model generates candidate structures conditioned only on the fingerprint and the instrument-measured precursor mass. A provably safe mass-shell constraint keeps every candidate consistent with the measured mass without fixing the atom inventory, and candidates are accepted by exact parts-per-million mass agreement. A symmetric noise objective absorbs encoder error, and a candidate-diversity mechanism keeps the candidates from collapsing to a single structure. On the NPLIB1 benchmark, MARLIN is the strongest method evaluated without a ground-truth formula across exact-match accuracy, structural distance, and fingerprint similarity, and it recovers the correct molecular formula as a byproduct about as often as a dedicated predictor without ever using one. MARLIN enables reliable de novo structure elucidation in the realistic discovery regime where the molecular formula is unavailable.
- Abstract(参考訳): 非標的タンデム質量分析法(MS/MS)は、生物学的サンプル当たり数千個の小さな分子を検出するが、ほとんどはスペクトルライブラリーを欠いているため同定されない。
これらの不活化代謝物や天然物は、まさに薬の発見、バイオマーカーの研究、そして外生生物にとって重要な化合物である。
計算的ド・ノボ構造解明は、このギャップを埋める可能性があるが、ほとんどの最先端の手法は、真に新しい化合物には存在せず、それ自体がかなりの誤差で予測されるオラクルである基底構造式が知られていると仮定する。
分子式を持たないスペクトルから直接構造を解明するde novo法であるMARLINを提案する。
自己監督エンコーダは、原ピークから分子指紋を予測し、ブロック拡散言語モデルは、指紋と計器測定前駆体のみに条件付けられた候補構造を生成する。
確実に安全な質量殻制限は、全ての候補が原子の在庫を固定することなく測定された質量と一致し、候補は百万単位の正確な部品によって受け入れられる。
対称雑音対象物はエンコーダ誤差を吸収し、候補ダイバーシティ機構は候補が単一構造に崩壊しないようにする。
NPLIB1ベンチマークでは、MARLINは、正確なマッチング精度、構造距離、指紋の類似性によらず、基底構造式なしで評価される最強の手法であり、それを用いることなく、専用の予測器と同じくらいの頻度で副産物として正しい分子式を回収する。
MARLINは、分子式が利用できない現実的な発見体制において、信頼できるデノボ構造解明を可能にする。
関連論文リスト
- Multi-Agent Closed-Loop Reasoning for Organic Structure Elucidation from Multimodal Spectra [14.276214371686855]
我々は,専門家の反復的仮説検証をエミュレートし,構造解明を自動化するマルチエージェントシステムMACROSを提案する。
様々な現実世界のサンプルに対して前例のないゼロショットの一般化を実現し、1DNMRで500 Da以上の合成化合物、天然物、代謝物を正しく同定する。
MacROSは化学者が協力して6倍速く、40%精度が向上する。
論文 参考訳(メタデータ) (2026-08-12T05:48:29Z) - Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent [14.26731930385033]
核磁気共鳴分光法は分子構造解明の金標準である。
データベース検索は、新しい足場を特定できない。
本稿では,大規模言語モデルを用いたNMRAgentについて述べる。
論文 参考訳(メタデータ) (2026-06-29T04:38:01Z) - MolLingo: Molecule-Native Representations for LLM-Powered Scientific Agents [57.28652712579434]
分子設計を自動化するために化学者の推論過程をエミュレートするマルチエージェントシステムであるMolLingoを提案する。
MolLingoは、共有メモリモジュールを通じて、文学エージェント、化学エージェント、オーケストレーションをコーディネートすることで、この問題に対処する。
初期治療設計におけるケーススタディとして、MolLingoは、結合部位の幾何学と残基レベルのタンパク質コンテキストにおけるChemist Agentの推論を根拠にしている。
論文 参考訳(メタデータ) (2026-05-27T02:11:23Z) - SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception [48.96518000981492]
直接電子イオン化質量分析法(EI-MS)を嗅覚予測のための代替入力モードとして検討する。
我々は、EI-MS表現と予め訓練された化学構造埋め込みを整合させるマルチモーダルコントラスト学習フレームワークであるSpectrum-to-Chemical EmbeddingalignedmeNT(SCENT)を寄贈する。
マルチラベルの匂い記述子予測タスクでは、SCENTはMSのみのベースラインを著しく上回り、構造ベースモデルに匹敵する嗅覚性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T13:28:57Z) - Contrastive Domain Generalization for Cross-Instrument Molecular Identification in Mass Spectrometry [3.6398652091809987]
本稿では,物質スペクトルを化学的に有意な分子構造埋め込み空間にマッピングするクロスモーダルアライメントフレームワークを提案する。
本モデルでは,固定256方向ゼロショット検索においてトップ1の精度42.2%を達成し,グローバル検索条件下での強い一般化を示す。
これらの結果は,MSデータから分子同定における一般化ボトルネックを解決するために,物理スペクトル分解能と分子構造埋め込みを明示的に統合することが重要であることを示唆している。
論文 参考訳(メタデータ) (2026-01-31T06:18:47Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Mamba-driven multi-perspective structural understanding for molecular ground-state conformation prediction [69.32436472760712]
本稿では,マンバ駆動型多面的構造理解(MPSU-Mamba)による分子基底状態の局在化手法を提案する。
複雑で多様な分子に対しては、対応する分子構造の包括的認識を構築するために、3種類の専用の走査戦略が検討されている。
QM9 と Molecule3D データセットの実験結果から,MPSU-Mamba が既存の手法よりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-11-10T11:18:32Z) - Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra [60.08608779794957]
本稿では,ジェネレーティブ言語モデルに基づく検索フレームワークであるGLMRを提案する。
検索前の段階では、比較学習に基づくモデルでは、上位候補分子を入力質量スペクトルの文脈的先行として識別する。
生成検索段階において、これらの候補分子は入力質量スペクトルと統合され、精製された分子構造を生成するための生成モデルが導かれる。
論文 参考訳(メタデータ) (2025-11-09T07:25:53Z) - Test-Time Tuned Language Models Enable End-to-end De Novo Molecular Structure Generation from MS/MS Spectra [31.563216077422084]
タンデム質量分析法は、代謝学、天然物発見、環境分析などの重要な分野における未知化合物の同定を可能にする。
テスト時間チューニングを活用することで,事前学習されたトランスフォーマーモデルの学習を向上し,このギャップに対処するフレームワークを導入する。
我々は、NPLIB1とMassSpecGymの2つの人気のあるベンチマークで、DiffMSのデファクトステート・オブ・ザ・アーティカルアプローチを100%と20%上回った。
論文 参考訳(メタデータ) (2025-10-27T18:25:36Z) - Exploring molecular assembly as a biosignature using mass spectrometry and machine learning [1.7952155197675588]
理想的なバイオシグナチャは解釈可能で実験的に測定可能でなければならない。
分子組立は、進化によって生み出された物体を測定するために最近開発された手法であり、両方の基準を満たすことを示す。
我々は,分子組立を高精度に予測し,ベースラインモデルと比較して誤差を3倍に削減する機械学習モデルを開発した。
論文 参考訳(メタデータ) (2025-07-25T08:19:15Z) - DiffMS: Diffusion Generation of Molecules Conditioned on Mass Spectra [60.39311767532607]
本稿では,DiffMSを提案する。DiffMS,式制限付きエンコーダ・デコーダ生成ネットワークは,このタスクにおける最先端性能を実現する。
遅延埋め込みと分子構造をブリッジするロバストデコーダを開発するために,フィンガー構造対による拡散デコーダの事前訓練を行う。
確立されたベンチマーク実験により、DiffMSはデノボ分子生成における既存のモデルよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-13T18:29:48Z) - Exploring Chemical Space with Score-based Out-of-distribution Generation [57.15855198512551]
生成微分方程式(SDE)にアウト・オブ・ディストリビューション制御を組み込んだスコアベース拡散方式を提案する。
いくつかの新しい分子は現実世界の薬物の基本的な要件を満たしていないため、MOODは特性予測器からの勾配を利用して条件付き生成を行う。
我々はMOODがトレーニング分布を超えて化学空間を探索できることを実験的に検証し、既存の方法で見いだされた分子、そして元のトレーニングプールの上位0.01%までも生成できることを実証した。
論文 参考訳(メタデータ) (2022-06-06T06:17:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。