論文の概要: Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language
- arxiv url: http://arxiv.org/abs/2608.03855v2
- Date: Thu, 06 Aug 2026 12:23:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.732718
- Title: Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language
- Title(参考訳): SMILESと自然言語の連接表現学習のためのバイセマンティックケミカル埋め込み
- Abstract要約: CheMatEは化学指向の埋め込みモデルであり、分子構造とドメイン固有の自然言語を共同でキャプチャする。
我々は、FinWebとChemPileから構築・キュレーションされた、新しい大規模な学術文書のコーパスを用いて、モデルを訓練する。
この設計はSMILESで計算された科学文献にモデルを公開し、バイセマンティックな理解を可能にする。
- 参考スコア(独自算出の注目度): 2.9764168176721992
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformer models have revolutionized natural language processing (NLP), and text-based molecular representations like SMILES have successfully extended these architectures to chemistry. However, domain-adaptive pre-training often causes models to overfit to chemical syntax, catastrophically forgetting their foundational semantic capabilities. To address this challenge, we introduce CheMatE, a chemistry-oriented embedding model that jointly captures molecular structure and domain-specific natural language within the same representation space. Built on a ModernBERT backbone, CheMatE learns bi-semantic representations through a two-stage training procedure: continued masked language modeling (MLM) followed by a Matryoshka contrastive learning stage via Multiple Negative Ranking Loss (MNRL). First, we train the model using MLM on a novel, large-scale corpus of SMILES-annotated, long-context scientific documents that were constructed and curated from FineWeb and ChemPile (comprising 10.4B and 11.5B tokens, respectively). Subsequently, the model undergoes contrastive learning using a synthetic dataset of SMILES-text pairs algorithmically derived from our original training corpus. This design exposes the model to SMILES-enriched scientific literature, enabling bi-semantic understanding. We evaluate CheMatE across a range of downstream tasks covering molecular property prediction and scientific language understanding. Our results demonstrate that coupling our custom-curated datasets with this sequential training strategy yields robust, highly transferable representations. By effectively unifying structural and contextual signals within a single text-based framework, CheMatE achieves competitive performance across both specialized chemistry models and general-purpose language model baselines.
- Abstract(参考訳): トランスフォーマーモデルは自然言語処理(NLP)に革命をもたらし、SMILESのようなテキストベースの分子表現はこれらのアーキテクチャを化学に拡張することに成功している。
しかし、ドメイン適応型事前学習は、しばしばモデルが化学構文に過度に適合し、その基礎的意味論能力を破滅的に忘れてしまう。
この課題に対処するために、同じ表現空間内で分子構造とドメイン固有自然言語を共同でキャプチャする化学指向の埋め込みモデルであるCheMatEを紹介する。
ModernBERTのバックボーン上に構築されたCheMatEは,2段階のトレーニング手順を通じて,双方向表現を学習する。
まず、ファインウェブとChemPile(それぞれ10.4Bと11.5Bのトークンを含む)から作成・キュレーションされたSMILESアノテーション付き長文科学文書の大規模コーパスを用いて、MDMを用いてモデルを訓練する。
その後、SMILES-textペアの合成データセットを用いて、元の学習コーパスからアルゴリズム的に派生したコントラスト学習を行う。
このデザインはSMILESに富んだ科学文献にモデルを公開し、バイセマンティックな理解を可能にした。
我々はCheMatEを分子特性予測と科学的言語理解を含む下流タスクで評価した。
私たちの結果は、このシーケンシャルなトレーニング戦略とカスタムカレーションされたデータセットを結合することで、堅牢で、転送可能な表現が得られることを示す。
単一のテキストベースのフレームワーク内で構造的およびコンテキスト的信号を効果的に統一することにより、CheMatEは、特殊な化学モデルと汎用言語モデルベースラインの両方で競合する性能を達成する。
関連論文リスト
- MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models [21.71979155816693]
分子埋め込みモデルは、計算化学と薬物発見の基盤となる。
マルチモーダル大規模言語モデル(MLLM)が分子組込みモデルとして機能するかどうかを問う。
textbfMolEmbは、分子プロファイルとテキスト記述を共有埋め込み空間で整列させることによりMLLMに適応する軽量なフレームワークである。
論文 参考訳(メタデータ) (2026-08-24T09:21:04Z) - Speaking the Language of Science: Toward a General-Purpose Generative Foundation Model for the Natural Sciences [89.71422932447423]
LOGOSは、自然科学における異種タスクを統一する科学生成言語モデルである。
空間的接触パターンと制約パターンを離散トークンとして表現することにより、モデルは純粋にシーケンシャルな方法で複雑な構造的相互作用をキャプチャする。
多様なタスクにわたって、LOGOSは一貫してドメイン固有のベースラインにマッチまたは性能を向上する。
論文 参考訳(メタデータ) (2026-06-15T16:14:53Z) - Local-Global Multimodal Contrastive Learning for Molecular Property Prediction [0.4349640169711269]
LGM-CLは,分子グラフとテキスト表現を共同でモデル化する,局所的多言語型コントラスト学習フレームワークである。
MoleculeNetベンチマークの実験では、LGM-CLは分類タスクと回帰タスクの両方で一貫した、競争力のあるパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-30T06:06:17Z) - The Tokenization Bottleneck: How Vocabulary Extension Improves Chemistry Representation Learning in Pretrained Language Models [0.0]
トークン化ボトルネック」は、大規模言語モデルの化学への応用を妨げた。
本稿では、自然言語と分子構造の表現を単一のモデルで統一することで、このボトルネックを解決するための原則的手法を提案する。
論文 参考訳(メタデータ) (2025-11-18T11:12:35Z) - Thinking like a CHEMIST: Combined Heterogeneous Embedding Model Integrating Structure and Tokens [42.203344899915464]
本稿では,分子をサブ構造に分解し,これらの断片に対する記述子に基づく表現を計算する新しい手法を提案する。
このサブストラクタと記述子データを言語モデルの入力として使用し、また、この言語モデルとグラフベースのモデルを統合するバイモーダルアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-02-25T08:53:18Z) - Text to Band Gap: Pre-trained Language Models as Encoders for Semiconductor Band Gap Prediction [9.325818199739759]
本稿では,半導体材料のバンドギャップを予測するために,RoBERTa,T5,Llama-3,MatSciBERTなどのトランスフォーマーベース言語モデルについて検討する。
入力は、化学組成、結晶系、空間群、その他の構造的および電子的性質などの重要な材料特性を符号化する。
論文 参考訳(メタデータ) (2025-01-07T00:56:26Z) - Large Concept Models: Language Modeling in a Sentence Representation Space [62.73366944266477]
本稿では,概念を命名した明示的な高レベルな意味表現に基づくアーキテクチャの試みを行う。
概念は言語とモダリティに依存しないものであり、フローにおけるより高いレベルの考えや行動を表している。
本モデルでは,多くの言語に対して,ゼロショットの一般化性能が顕著であることを示す。
論文 参考訳(メタデータ) (2024-12-11T23:36:20Z) - Pre-trained Molecular Language Models with Random Functional Group Masking [54.900360309677794]
SMILESをベースとしたアンダーリネム分子アンダーリネム言語アンダーリネムモデルを提案し,特定の分子原子に対応するSMILESサブシーケンスをランダムにマスキングする。
この技術は、モデルに分子構造や特性をよりよく推測させ、予測能力を高めることを目的としている。
論文 参考訳(メタデータ) (2024-11-03T01:56:15Z) - A Large Encoder-Decoder Family of Foundation Models For Chemical Language [1.1073864511426255]
本稿では,PubChemから得られた9100万個のSMILESサンプルを事前学習した大規模エンコーダ・デコーダ化学基礎モデルを提案する。
複数のベンチマークデータセットにまたがる実験は、様々なタスクに対して最先端の結果を提供する際に提案したモデルのキャパシティを検証する。
論文 参考訳(メタデータ) (2024-07-24T20:30:39Z) - In-Context Language Learning: Architectures and Algorithms [73.93205821154605]
我々は、文脈言語学習(ICLL)において、私たちが用語する新しいモデル問題群(英語版)のレンズを通してICLを研究する。
我々は,通常のICLLタスクにおいて,多種多様なニューラルシーケンスモデルを評価する。
論文 参考訳(メタデータ) (2024-01-23T18:59:21Z) - Learning Contextual Representations for Semantic Parsing with
Generation-Augmented Pre-Training [86.91380874390778]
本稿では,生成モデルを活用して事前学習データを生成することで,自然言語発話と表スキーマの表現を共同で学習するGAPを提案する。
実験結果に基づいて、GAP MODELを利用するニューラルセマンティクスは、SPIDERとCRITERIA-to-generationベンチマークの両方で最新の結果を得る。
論文 参考訳(メタデータ) (2020-12-18T15:53:50Z) - Reprogramming Language Models for Molecular Representation Learning [65.00999660425731]
本稿では,分子学習タスクのための事前学習言語モデルに対して,辞書学習(R2DL)による表現再プログラミングを提案する。
対比プログラムは、k-SVDソルバを用いて、高密度ソースモデル入力空間(言語データ)とスパースターゲットモデル入力空間(例えば、化学および生物学的分子データ)との間の線形変換を学習する。
R2DLは、ドメイン固有のデータに基づいて訓練されたアート毒性予測モデルの状態によって確立されたベースラインを達成し、限られたトレーニングデータ設定でベースラインを上回る。
論文 参考訳(メタデータ) (2020-12-07T05:50:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。