論文の概要: Molecules Meet Language: Confound-Aware Representation Learning and Chemical Property Steering in Transformer-VAE Latent Spaces
- arxiv url: http://arxiv.org/abs/2605.06303v1
- Date: Thu, 07 May 2026 14:07:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.875874
- Title: Molecules Meet Language: Confound-Aware Representation Learning and Chemical Property Steering in Transformer-VAE Latent Spaces
- Title(参考訳): 言語に接する分子:トランスフォーマー-VAE潜時空間におけるコンファウンド・アウェア表現学習と化学特性ステアリング
- Authors: Zakaria Elabid, Jan Andrzejewski, Bartosz Brzoza, Attila Cangi,
- Abstract要約: 分子生成モデルは、しばしば有意義な潜在幾何学を仮定するが、明らかな特性予測可能性は、シーケンスレベルのショートカットを反映することができる。
本研究では,SELFIESをトレーニングした教師なし自己回帰変換器-VAEを用いて,この問題について検討する。
化学的に有意なステアリングは、絡み合った分子潜在空間に現れるが、デコードされた分子によってのみ検証される。
- 参考スコア(独自算出の注目度): 0.9332987715848714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Molecular generative models often assume meaningful latent geometry, but apparent property predictability can reflect sequence-level shortcuts rather than chemical organization. We study this issue in an unsupervised autoregressive Transformer-VAE trained on SELFIES. After training, we freeze the model, fit linear probes to RDKit descriptors, and use the probe weights as candidate global steering directions. To separate chemical signal from SELFIES artifacts, we introduce a confound-aware evaluation based on residualization, confound-direction alignment analysis, and decoded-molecule traversal. This is necessary because SELFIES length, branch tokens, ring tokens, and token entropy are strongly encoded in the latent space. Under this confound-aware evaluation, we find robust monotonic steering for cLogP, FractionCSP3, HeavyAtomCount, TPSA, BertzCT, and HBA. Nonlinear probes further show that some properties admit stable global directions, while others are better described by local latent gradients. Overall, our results show that chemically meaningful steering can emerge in entangled molecular latent spaces, but only when validated through decoded molecules and controlled for representation-level confounds.
- Abstract(参考訳): 分子生成モデルは、しばしば有意義な潜在幾何学を仮定するが、明らかな特性予測可能性は、化学組織よりもシーケンスレベルのショートカットを反映することができる。
本研究では,SELFIESをトレーニングした教師なし自己回帰変換器-VAEを用いて,この問題について検討する。
トレーニング後、我々はモデルを凍結し、リニアプローブをRDKitディスクリプタに適合させ、プローブ重みをグローバルなステアリングの候補として利用する。
化学信号とSELFIESアーティファクトを分離するために,残留化,方位アライメント解析,デコード・分子トラバーサルに基づくコンフォーン・アウェア評価を導入する。
これは SELFIES の長さ、分岐トークン、リングトークン、トークンエントロピーが潜在空間で強くエンコードされているためである。
この条件下では, cLogP, FractionCSP3, HeavyAtomCount, TPSA, BertzCT, HBAの単調な操舵を行う。
非線形プローブは、いくつかの性質が安定な大域的な方向を持つことを示しているが、他の性質は局所的な潜在勾配によってよりよく説明される。
以上の結果から, 化学的に有意な操舵は, 絡み合った分子潜在空間に現れるが, 復号化分子による検証と, 表現レベルの整合性のために制御される場合に限られることがわかった。
関連論文リスト
- SIGMA: Scalable Spectral Insights for LLM Collapse [51.863164847253366]
SIGMA(Spectral Inequalities for Gram Matrix Analysis)は,モデル崩壊のための統一的なフレームワークである。
行列のスペクトル上の決定論的境界を導出するベンチマークを利用することで、SIGMAは表現空間の収縮を追跡するために数学的に基底化された計量を提供する。
我々は、SIGMAが状態への遷移を効果的に捉え、崩壊のメカニズムに関する理論的知見の両方を提供することを示した。
論文 参考訳(メタデータ) (2026-01-06T19:47:11Z) - Aligned Manifold Property and Topology Point Clouds for Learning Molecular Properties [55.2480439325792]
この研究は、局所量子由来のスカラー場とカスタムトポロジカルディスクリプタを組み合わせた分子表面表現であるAMPTCRを導入する。
分子量については、AMPTCRが物理的に意味のあるデータをコードし、検証R2は0.87であることを確認した。
細菌抑制タスクでは、AMPTCRは大腸菌阻害値の分類と直接回帰の両方を可能にする。
論文 参考訳(メタデータ) (2025-07-22T04:35:50Z) - Pre-trained Molecular Language Models with Random Functional Group Masking [54.900360309677794]
SMILESをベースとしたアンダーリネム分子アンダーリネム言語アンダーリネムモデルを提案し,特定の分子原子に対応するSMILESサブシーケンスをランダムにマスキングする。
この技術は、モデルに分子構造や特性をよりよく推測させ、予測能力を高めることを目的としている。
論文 参考訳(メタデータ) (2024-11-03T01:56:15Z) - Molecule Design by Latent Prompt Transformer [76.2112075557233]
本研究は、分子設計の課題を条件付き生成モデリングタスクとしてフレーミングすることによって検討する。
本研究では,(1)学習可能な事前分布を持つ潜伏ベクトル,(2)プロンプトとして潜伏ベクトルを用いる因果トランスフォーマーに基づく分子生成モデル,(3)潜在プロンプトを用いた分子の目標特性および/または制約値を予測する特性予測モデルからなる新しい生成モデルを提案する。
論文 参考訳(メタデータ) (2024-02-27T03:33:23Z) - Learning Invariant Molecular Representation in Latent Discrete Space [52.13724532622099]
本稿では,分散シフトに対する不変性とロバスト性を示す分子表現を学習するための新しい枠組みを提案する。
我々のモデルは、様々な分布シフトが存在する場合に、最先端のベースラインに対してより強力な一般化を実現する。
論文 参考訳(メタデータ) (2023-10-22T04:06:44Z) - From Peptides to Nanostructures: A Euclidean Transformer for Fast and
Stable Machine Learned Force Fields [5.013279299982324]
本稿では,疎等式表現と自己注意機構を組み合わせたSO3kratesというトランスフォーマーアーキテクチャを提案する。
SO3kratesは精度、安定性、速度の独特な組み合わせを実現し、拡張時間とシステムサイズスケールでの物質の量子特性の洞察に富んだ分析を可能にする。
論文 参考訳(メタデータ) (2023-09-21T09:22:05Z) - CHA2: CHemistry Aware Convex Hull Autoencoder Towards Inverse Molecular
Design [2.169755083801688]
検索空間全体を包括的に探索して、興味のある性質を持つデ・ノヴォ構造を利用することは不可能である。
この課題に対処するために、難解な探索空間を低次元の潜在体積に減らすことで、分子候補をより効果的に調べることができる。
そこで我々は,高いQEDを持つ新規分子を明らかにする効率的な方法として,高いQEDでトップ分子を取り囲む凸ホールを用いて,潜在表現におけるタイトな部分空間を抽出することを提案する。
論文 参考訳(メタデータ) (2023-02-21T21:05:31Z) - Local manifold learning and its link to domain-based physics knowledge [53.15471241298841]
多くの反応系では、熱化学状態空間は低次元多様体(LDM)に近く進化すると仮定される。
局所的データクラスタ(ローカルPCA)に適用されたPCAは,熱化学状態空間の固有パラメータ化を検出することができることを示す。
論文 参考訳(メタデータ) (2022-07-01T09:06:25Z) - Characterizing the Latent Space of Molecular Deep Generative Models with
Persistent Homology Metrics [21.95240820041655]
変分オート(VAE)は、エンコーダとデコーダのネットワークペアをトレーニングデータ分散の再構築のために訓練する生成モデルである。
本研究では, 深部生成モデルの潜伏空間が, 構造的および化学的特徴をエンコードできるかどうかを計測する手法を提案する。
論文 参考訳(メタデータ) (2020-10-18T13:33:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。