論文の概要: Robust small-molecule identification from incomplete, degraded, and inconsistent spectra using multimodal mixed-condition training
- arxiv url: http://arxiv.org/abs/2609.14360v2
- Date: Mon, 21 Sep 2026 08:50:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.34005
- Title: Robust small-molecule identification from incomplete, degraded, and inconsistent spectra using multimodal mixed-condition training
- Title(参考訳): マルチモーダル混合条件トレーニングを用いた不完全・劣化・矛盾スペクトルからのロバスト小分子同定
- Abstract要約: 小分子構造同定のためのマルチモーダル混合条件学習法を提案する。
この戦略は、化学および分光の知識を、欠落した入力構成、モダリティ固有のスペクトル摂動、および化学的に情報を得たスペクトル置換を通じて取り入れている。
提案手法では, 完全入力性能は高く, サンプルレベルのミスマッチ検出も改善された。
- 参考スコア(独自算出の注目度): 11.492759216075974
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable small-molecule identification often requires complementary evidence from multiple spectroscopic measurements. In practice, however, spectra may be unavailable, degraded by measurement-related variations, or even incorrectly associated with a sample, thereby hindering accurate molecular identification. Herein, we propose a multimodal mixed-condition training strategy that accommodates missing, degraded, and mismatched measurements for small-molecule structure identification. The strategy incorporates chemical and spectroscopic knowledge through predefined missing-input configurations, modality-specific spectral perturbations, and chemically informed spectrum replacements. Models were trained on 635,441 samples comprising mass spectrometry (MS), infrared (IR), and nuclear magnetic resonance (NMR) simulated spectra from the Multimodal Spectroscopic Dataset (MSSD). They were then systematically evaluated on 79,462 held-out samples across 30 views designed to represent variations in spectra. A controlled comparison of complete-input and mixed-condition training under concatenation and mixture-of-experts (MoE) fusion showed that the training strategy was the principal source of improvement. For MoE, mixed-condition training increased the mean reciprocal rank (MRR) by 6.08% (from 0.9203 to 0.9763) and the top-1 molecular identification rate by 7.67% (from 89.50% to 96.36%). Notably, under single-modality inputs, IR MRR increased 2.15-fold (from 0.4337 to 0.9307), while MS MRR increased 2.31-fold (from 0.3711 to 0.8575). With the proposed strategy, complete-input performance remained high, while sample-level mismatch detection also improved. Together, these results highlight the potential of multimodal mixed-condition training for practical molecular identification by explicitly addressing incomplete, degraded, and mismatched measurements encountered in real-world analysis.
- Abstract(参考訳): 信頼性の高い小分子の同定は、しばしば複数の分光測定から補完的な証拠を必要とする。
しかし実際には、スペクトルは利用できなくなり、測定関連の変化によって劣化したり、サンプルと誤って関連付けられている場合もあり、正確な分子識別を妨げている。
本稿では,小分子構造同定のための多モード混合条件学習手法を提案する。
この戦略は、予め定義された欠落入力構成、モーダリティ固有のスペクトル摂動、化学情報によるスペクトル置換を通じて、化学的および分光的な知識を取り入れている。
MSSD(Multimodal Spectroscopic Dataset)からの質量分析(MS)、赤外線(IR)、核磁気共鳴(NMR)を模擬した635,441個のサンプルでモデルが訓練された。
そして、スペクトルの変動を表すように設計された30のビューにわたる79,462のホールドアウトサンプルに対して、体系的に評価された。
統合・混合実験(MoE)融合による完全インプット訓練と混合条件訓練の制御比較により, トレーニング戦略が改善の主要因であることが示された。
MoEでは、混合条件トレーニングにより平均相反位(MRR)が6.08%(0.9203から0.9763)、トップ-1分子識別率が7.67%(89.50%から96.36%)増加した。
特にシングルモード入力では、IR MRRは2.15倍(0.4337から0.9307まで)、MS MRRは2.31倍(0.3711から0.8575まで)増加した。
提案手法では, 完全入力性能は高く, サンプルレベルのミスマッチ検出も改善された。
これらの結果は, 実世界分析における不完全性, 劣化性, 不一致性の測定を明確化することにより, 実用分子同定のためのマルチモーダル混合条件トレーニングの可能性を強調した。
関連論文リスト
- CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation [49.0564416580726]
我々は,クロスアテンティブ・リランカの組成判断を埋め込みモデルに蒸留する。
我々は,CORE-RERANKER-8Bが平均82.7%を達成し,Janna-Rerankerを10.7ポイント上回ったことを示す。
改良はCOCOとFlickr30Kでの検索性能を犠牲にすることなくMCMRベンチマークに転送される。
論文 参考訳(メタデータ) (2026-09-03T16:50:29Z) - Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data [41.531262858699925]
我々は、スペクトル証拠を大規模分子前駆体と密に統合するスケーラブルな仮説修正パラダイムを開発する。
我々は、マルチモーダルスペクトル入力に条件付された化学的に有効な分子仮説を提案するスペクトル-構造モデルであるtextbfSpectroMol を紹介する。
また、分子式、正確な質量、不飽和度を統合した高分解能質量制約分子発生器であるtextbfMS-Mol2Mol を開発した。
論文 参考訳(メタデータ) (2026-07-22T06:50:53Z) - SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception [48.96518000981492]
直接電子イオン化質量分析法(EI-MS)を嗅覚予測のための代替入力モードとして検討する。
我々は、EI-MS表現と予め訓練された化学構造埋め込みを整合させるマルチモーダルコントラスト学習フレームワークであるSpectrum-to-Chemical EmbeddingalignedmeNT(SCENT)を寄贈する。
マルチラベルの匂い記述子予測タスクでは、SCENTはMSのみのベースラインを著しく上回り、構造ベースモデルに匹敵する嗅覚性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T13:28:57Z) - FRIGID: Scaling Diffusion-Based Molecular Generation from Mass Spectra at Training and Inference Time [52.735012862324766]
本稿では,質量スペクトルに条件付き構造を生成する新しい拡散言語モデルを用いたフレームワークFRIGIDを提案する。
スペクトル非一貫性フラグメントを同定することにより、前方フラグメンテーションモデルが推論時間スケーリングを実現する方法を示す。
さらなる実証分析により、FRIGIDは推論時間の増大を伴う対数線形性能のスケーリングを示すことが示された。
論文 参考訳(メタデータ) (2026-04-17T19:11:18Z) - Spectral Coherence Index: A Model-Free Metric for Protein Structural Ensemble Quality Assessment [27.622823036293525]
モデルフリーで回転不変な要約であるスペクトルコヒーレンス指数(SCI)を評価した。
SCIは異種タンパク質アンサンブルのためのマルチメトリックQCワークフローに組み込む際に最も有用である。
論文 参考訳(メタデータ) (2026-03-26T20:09:41Z) - From Static Spectra to Operando Infrared Dynamics: Physics Informed Flow Modeling and a Benchmark [67.29937933325849]
Operando IR Predictionは、1つの静的スペクトルからスペクトル指紋の時間分解進化を予測することを目的としている。
OpIRSpec-7Kは、10の異なるバッテリーシステムにわたる7,118の高品質なサンプルで構成されている。
ABCCは最先端の静的、シーケンシャル、および生成的ベースラインを著しく上回る。
論文 参考訳(メタデータ) (2026-02-20T18:58:43Z) - NMRTrans: Structure Elucidation from Experimental NMR Spectra via Set Transformers [41.6373573055135]
我々は化学文献から抽出した実験的な1ドルHと13ドルCのスペクトルの大規模コーパスであるNMRSpecを構築した。
NMRTransは、スペクトルを無秩序なピークセットとしてモデル化し、モデルの帰納バイアスとNMRの物理的性質を一致させる。
論文 参考訳(メタデータ) (2026-02-10T03:37:41Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra [60.08608779794957]
本稿では,ジェネレーティブ言語モデルに基づく検索フレームワークであるGLMRを提案する。
検索前の段階では、比較学習に基づくモデルでは、上位候補分子を入力質量スペクトルの文脈的先行として識別する。
生成検索段階において、これらの候補分子は入力質量スペクトルと統合され、精製された分子構造を生成するための生成モデルが導かれる。
論文 参考訳(メタデータ) (2025-11-09T07:25:53Z) - DiffSpectra: Molecular Structure Elucidation from Spectra using Diffusion Models [68.19129717255053]
本稿では、分子構造解明を条件生成プロセスとして定式化する生成フレームワークであるDiffSpectraについて述べる。
我々の実験では、DiffSpectraが分子構造を正確に解明し、40.76%のトップ-1と99.49%のトップ10を達成している。
論文 参考訳(メタデータ) (2025-07-09T13:57:20Z) - TransPeakNet: Solvent-Aware 2D NMR Prediction via Multi-Task Pre-Training and Unsupervised Learning [5.7279868722119325]
2次元NMRにおけるクロスピーク予測のための教師なしトレーニングフレームワークを提案する。
このアプローチでは、1Hと13Cシフトの注釈付き1Dデータセット上でMLモデルを事前トレーニングし、教師なしの方法で微調整する。
479名のエキスパートアノテートHSQCスペクトルの評価は,従来の手法よりもモデルの方が優れていることを示す。
論文 参考訳(メタデータ) (2024-03-17T21:52:51Z) - AdaNovo: Adaptive \emph{De Novo} Peptide Sequencing with Conditional Mutual Information [46.23980841020632]
本稿では,各アミノ酸/ペプチド間の条件付き相互情報(CMI)を計算する新しいフレームワークであるAdaNovoを提案する。
AdaNovoは翻訳後修飾(PTM)によるアミノ酸の同定に優れ、データノイズに対する堅牢性を示す。
論文 参考訳(メタデータ) (2024-03-09T11:54:58Z) - A Multisensor Hyperspectral Benchmark Dataset For Unmixing of Intimate
Mixtures [3.0314808581426846]
鉱物微粉末を包括的に混合した地中真実データセットを作成した。
13種類の高スペクトルセンサがこれらの混合物の反射スペクトルを取得するために用いられている。
これらのデータは, 非線形アンミックス法および材料組成推定のための高度な手法の検証に有用であると考えている。
論文 参考訳(メタデータ) (2023-08-30T11:48:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。