論文の概要: Higher-Order Molecular Grammars for Generative and Foundation Models in Chemistry
- arxiv url: http://arxiv.org/abs/2610.02186v1
- Date: Thu, 01 Oct 2026 17:58:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.367512
- Title: Higher-Order Molecular Grammars for Generative and Foundation Models in Chemistry
- Title(参考訳): 化学生成モデルと基礎モデルのための高次分子文法
- Abstract要約: 高階文法表現(英: Higher-order Grammar Representation、HGR)は、分子を複合体に上げ、各複合体をコンパクトな生産規則列に解析する、原則化されたトポロジ対応のフレームワークである。
高次トポロジーを規則列にシリアライズすることで、HGRはこれらの構造を標準シーケンスモデルと直接互換性を持たせる。
表現学習において、HGR-FMは、両方の転送プロトコルの下で7つのMoreculeNetベンチマークで最高平均AUCを達成する。
- 参考スコア(独自算出の注目度): 69.76058403998117
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Molecular learning models are strongly shaped by their underlying representations. Yet standard sequential and graph formalisms struggle to explicitly encode higher-order topology, such as ring systems and recurring motifs. Existing higher-order representations can capture these structures directly, but they are often computationally demanding and difficult to decode into valid molecules. Here, we introduce Higher-order Grammar Representation (HGR), a principled, topology-aware framework that lifts molecules to combinatorial complexes and parses each complex into a compact sequence of production rules under a context-free higher-order grammar. By serialising higher-order topology into rule sequences, HGR makes these structures directly compatible with standard sequence models, avoiding the computational overhead of explicit higher-order encodings while preserving topological expressiveness. To reduce benchmark bias towards simple ring systems, we construct RingDiv, a ring-enriched benchmark containing 1.18 million molecules, including the curated RingDiv300k subset, and introduce the ring diversity index (RDI) to quantify ring-system coverage. In molecular generation, HGR-based models uniquely combine 100% validity by construction with leading distributional alignment, ranking first in FCD on all five generation benchmarks. In representation learning, HGR-FM achieves the highest mean AUC across seven MoleculeNet benchmarks under both transfer protocols, improving on the strongest baseline by 8.3 and 3.3 AUC points under probing and full fine-tuning, respectively. Collectively, these results establish HGR as an efficient higher-order representation for molecular generation and transferable representation learning.
- Abstract(参考訳): 分子学習モデルは、その基礎となる表現によって強く形作られています。
しかし、標準的な逐次形式やグラフ形式は、環系や繰り返しモチーフのような高階位相を明示的に符号化するのに苦労する。
既存の高階表現はこれらの構造を直接キャプチャすることができるが、しばしば計算的に要求され、有効な分子に復号することが困難である。
本稿では,高階文法表現(Higher-order Grammar Representation, HGR)を紹介する。これは,分子を合成複合体に上げ,各複合体を文脈自由な高階文法の下で生産規則のコンパクトな列に解析する,原則付きトポロジ対応フレームワークである。
高階トポロジを規則列にシリアライズすることで、HGRはこれらの構造を標準シーケンスモデルと直接互換性を持たせ、トポロジ的表現性を維持しつつ、明示的な高階エンコーディングの計算オーバーヘッドを回避する。
単純なリングシステムに対するベンチマークバイアスを低減するため、リング密度を118万分子を含むリングリッチベンチマークRingDivを構築し、リングの多様性指数(RDI)を導入してリングシステムカバレッジを定量化する。
分子生成において、HGRベースのモデルは、構成によって100%の妥当性を、主要な分布アライメントと一意に組み合わせ、全5世代ベンチマークでFCDにランクインする。
表現学習において、HGR-FMは、両方の転送プロトコルの下で7つのMoreculeNetベンチマークで最高平均AUCを達成し、それぞれ探索および完全な微調整の下で8.3と3.3のAUCポイントを最強のベースラインで改善した。
これらの結果は、分子生成と伝達可能な表現学習のための効率的な高次表現としてHGRを確立している。
関連論文リスト
- Representation-Guided Discrete Molecular Graph Retrosynthesis [50.11269464321367]
GRGは58.6 / 77.2 / 83.4 / 87.1 top-1 / 3 / 5 / 10 accuracy on USPTO-50k。
GRGは、アウト・オブ・ディストリビューション設定ですべてのトップkメトリクスを一貫して改善する。
GRGはエポックの数を35%減らし、ウォールクロックの時間を30%減らして同等のパフォーマンスを得る。
論文 参考訳(メタデータ) (2026-05-23T06:49:17Z) - Toward Better Geometric Representations for Molecule Generative Models [34.04020604759628]
LENSEsは、表現条件付き生成法における分子表現の可能性をうまく活用するフレームワークである。
分子生成タスクによるこれらの改善の有効性を実証する。
論文 参考訳(メタデータ) (2026-05-08T13:02:58Z) - Multi-Scale Reversible Chaos Game Representation: A Unified Framework for Sequence Classification [4.970277730082774]
マルチスケールカオスゲーム表現(Multi-Scale Chaos Game Representation:MS-RCGR)を新たに導入する。
MS-RCGRは、生物学的配列を可逆性を保証する多次元幾何学的表現に変換する。
以上の結果から,MS-RCGRは生物学的配列解析の柔軟性,解釈性,高性能な基盤を提供することが明らかとなった。
論文 参考訳(メタデータ) (2026-04-20T16:28:28Z) - RiboSphere: Learning Unified and Efficient Representations of RNA Structures [57.40815107640066]
RNAのバックボーンは非常に柔軟で、非カノニカル相互作用が一般的であり、実験的に決定された3D構造は比較的少ない。
本稿では,ベクトル量子化とフローマッチングを組み合わせることで,RNAの固有な幾何学的表現を学習するフレームワークであるemphRiboSphereを紹介する。
論文 参考訳(メタデータ) (2026-03-20T04:36:35Z) - ZeroGR: A Generalizable and Scalable Framework for Zero-Shot Generative Retrieval [125.19156877994612]
生成検索(GR)は、情報検索(IR)を文書識別子(ドシデント)の生成としてフレーミングすることによって再構成する
我々は、自然言語命令を利用して幅広いIRタスクにわたってGRを拡張するゼロショット生成検索フレームワークであるtextscZeroGRを提案する。
具体的には、textscZeroGRは、3つのキーコンポーネントで構成されている: (i)不均一な文書を意味的に意味のあるドシデントに統一するLMベースのドシデントジェネレータ; (ii)自然言語タスク記述から様々なタイプのクエリを生成し、拡張する命令チューニングクエリジェネレータ。
論文 参考訳(メタデータ) (2025-10-12T03:04:24Z) - HOPSE: Scalable Higher-Order Positional and Structural Encoder for Combinatorial Representations [7.494692635491467]
トポロジカルディープラーニング(TDL)は、高次相互作用に対応するためにより一般的な表現を使用する。
既存のTDLメソッドは、しばしば高次メッセージパッシング(HOMP)を通してGNNを拡張する。
本研究は,高次関係相互作用を含む課題を解決する方法として,HOPSEを提案する。
論文 参考訳(メタデータ) (2025-05-21T11:47:40Z) - RFL: Simplifying Chemical Structure Recognition with Ring-Free Language [66.47173094346115]
化学構造を階層的に記述する新しいリング自由言語(RFL)を提案する。
RFLは複雑な分子構造を複数の部分に分解し、特異性と簡潔性の両方を保証する。
分子骨格と個々の環を段階的に予測する骨格生成モジュールからなる普遍的な分子骨格デコーダ(MSD)を提案する。
論文 参考訳(メタデータ) (2024-12-10T15:29:32Z) - Geometric Representation Condition Improves Equivariant Molecule Generation [24.404588237915732]
我々は、幾何学的表現条件と証明可能な理論的保証を統合することにより、分子生成モデルを改善するための一般的な枠組みを導入する。
生成過程を2つの段階に分解する。まず,情報的幾何学的表現を生成する。
我々は、広く使われているQM9およびGEOM-DRUGデータセット上で、無条件分子生成の大幅な品質改善を観察した。
論文 参考訳(メタデータ) (2024-10-04T17:57:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。