論文の概要: Probing Chemical Language Models: Effects of Pre-training and Fine-tuning
- arxiv url: http://arxiv.org/abs/2607.02140v1
- Date: Thu, 02 Jul 2026 13:16:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.840162
- Title: Probing Chemical Language Models: Effects of Pre-training and Fine-tuning
- Title(参考訳): 化学言語モデルの提案:事前学習と微調整の効果
- Abstract要約: 化学言語モデル(CLM)はSMILESのような線形化表現で訓練される。
どのような化学的に意味のある部分構造をコードしているかは、まだ不明である。
本研究では, 分子サブストラクチャの微調整が分子サブストラクチャの学習表現に与える影響について検討した。
- 参考スコア(独自算出の注目度): 21.971157486965378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chemical language models (CLMs) are trained with linearized representations such as SMILES, yet it remains unclear which chemically meaningful substructures they encode. To foster a better understanding of CLMs, we conduct a systematic study and probe for 78 molecular substructures across eight pre-trained and six randomly initialized models. We furthermore study how fine-tuning on chemical downstream tasks affects the learned representations of molecular substructures. Our results show that pre-training generally improves molecular structure awareness of CLMs, particularly in the upper layers. Moreover, randomly initialized models already encode ring structures well in the first layer. Our analysis on two chemical downstream tasks further reveals that, interestingly, fine-tuning affects task-relevant molecular substructures more than others, indicating that the changes in the representations follow chemical theory.
- Abstract(参考訳): 化学言語モデル(CLM)はSMILESのような線形化表現で訓練されているが、どの化学的に意味のある部分構造をエンコードしているかは定かではない。
CLMの理解を深めるため、8つの事前学習モデルと6つのランダム初期化モデルにまたがる78の分子サブストラクチャの系統的研究と探索を行った。
さらに、化学下流タスクの微調整が分子サブストラクチャの学習表現にどのように影響するかについても検討する。
以上の結果から, プレトレーニングは, 特に上層層において, CLMの分子構造認識を向上させることが明らかとなった。
さらに、ランダムに初期化されたモデルは、既に第1層においてリング構造をうまくエンコードしている。
2つの化学下流タスクに関する分析により、興味深いことに微調整は、他のものよりもタスク関連分子のサブ構造に影響を及ぼし、これらの表現の変化が化学理論に従うことが示された。
関連論文リスト
- SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception [48.96518000981492]
直接電子イオン化質量分析法(EI-MS)を嗅覚予測のための代替入力モードとして検討する。
我々は、EI-MS表現と予め訓練された化学構造埋め込みを整合させるマルチモーダルコントラスト学習フレームワークであるSpectrum-to-Chemical EmbeddingalignedmeNT(SCENT)を寄贈する。
マルチラベルの匂い記述子予測タスクでは、SCENTはMSのみのベースラインを著しく上回り、構造ベースモデルに匹敵する嗅覚性能を達成する。
論文 参考訳(メタデータ) (2026-05-26T13:28:57Z) - Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding [52.499532583297885]
ChemDUは4D分子軌道を解釈可能な自然言語の説明に変換する。
ChemDUは、ガス相と触媒反応を含む基本的な動的シナリオに焦点を当てている。
Chem4DBenchは4D分子軌道と専門家による説明を組み合わせた最初のデータセットである。
論文 参考訳(メタデータ) (2026-03-12T13:36:58Z) - How well can off-the-shelf LLMs elucidate molecular structures from mass spectra using chain-of-thought reasoning? [51.286853421822705]
大規模言語モデル (LLM) は推論集約的な科学的タスクを約束するが、化学的解釈の能力はまだ不明である。
我々は、分子構造を予測するために、LLMが質量スペクトルデータに対してどのように理由を持つかを評価する、Chain-of-Thought(CoT)プロンプトフレームワークとベンチマークを導入する。
SMILESの妥当性, 式整合性, 構造的類似性の指標による評価の結果, LLMは合成学的に有効で, 部分的に可視な構造を生成できるが, 分子予測の正確性やリンク推論を達成できないことがわかった。
論文 参考訳(メタデータ) (2026-01-09T20:08:42Z) - Reasoning-Enhanced Large Language Models for Molecular Property Prediction [19.593493317167646]
分子特性予測は、薬物発見と物質科学にとって不可欠である。
既存のアプローチは、限定的な解釈可能性、クロスタスクの一般化の貧弱、化学的推論能力の欠如に悩まされている。
分子特性予測に化学推論を組み込んだ多モーダル大言語モデルMPPReasonerを提案する。
論文 参考訳(メタデータ) (2025-10-11T15:05:45Z) - Pre-trained Molecular Language Models with Random Functional Group Masking [54.900360309677794]
SMILESをベースとしたアンダーリネム分子アンダーリネム言語アンダーリネムモデルを提案し,特定の分子原子に対応するSMILESサブシーケンスをランダムにマスキングする。
この技術は、モデルに分子構造や特性をよりよく推測させ、予測能力を高めることを目的としている。
論文 参考訳(メタデータ) (2024-11-03T01:56:15Z) - Empirical Evidence for the Fragment level Understanding on Drug
Molecular Structure of LLMs [16.508471997999496]
言語モデルが1次元配列から化学空間構造をどう理解するかについて検討する。
その結果,分子断片の観点から,言語モデルで化学構造が理解できることが示唆された。
論文 参考訳(メタデータ) (2024-01-15T12:53:58Z) - MolCPT: Molecule Continuous Prompt Tuning to Generalize Molecular
Representation Learning [77.31492888819935]
分子表現学習のための「プリトレイン,プロンプト,ファインチューン」という新しいパラダイム,分子連続プロンプトチューニング(MolCPT)を提案する。
MolCPTは、事前訓練されたモデルを使用して、スタンドアロンの入力を表現的なプロンプトに投影するモチーフプロンプト関数を定義する。
いくつかのベンチマークデータセットの実験により、MollCPTは分子特性予測のために学習済みのGNNを効率的に一般化することが示された。
論文 参考訳(メタデータ) (2022-12-20T19:32:30Z) - Improving Molecular Pretraining with Complementary Featurizations [20.86159731100242]
分子プレトレーニング(英: molecular pretraining)は、計算化学と薬物発見における様々な課題を解決するためのパラダイムである。
化学情報を異なる方法で伝達できることが示される。
我々は, 簡易で効果的な分子事前学習フレームワーク(MOCO)を提案する。
論文 参考訳(メタデータ) (2022-09-29T21:11:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。