論文の概要: Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation
- arxiv url: http://arxiv.org/abs/2607.03007v1
- Date: Fri, 03 Jul 2026 06:41:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.494108
- Title: Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation
- Title(参考訳): Back to Basics:SMILES-GraphによるLCMの分子理解の改善
- Abstract要約: MolBasicはSMILES-Graph変換による構造理解を強化する構造ファーストフレームワークである。
MolBasic は構造的理解を著しく改善し,下流タスクにおいて堅牢なゲインが得られることを示す。
- 参考スコア(独自算出の注目度): 26.51718381944246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in molecular large language models have led to strong performance on molecular understanding and generation tasks, yet these gains often come without reliable structural grounding. In particular, existing approaches conflict with the chemistry principle that structure determines function: despite their downstream success, current molecular LLMs perform poorly on basic structure recognition, suggesting that they fail to capture molecular graphs from canonical SMILES. To remedy this, we propose MolBasic, a structure-first framework that strengthens structural comprehension via SMILES-Graph translation. MolBasic is built around a multi-level structure perception benchmark, where bidirectional SMILES-Graph conversion serves as the core task to align sequential and topological representations. On top of this foundation, we employ a progressive learning scheme with a standardized Chain-of-Thought (CoT) to steer models from structure acquisition toward higher-level molecular reasoning. Experiments show that MolBasic substantially improves structural understanding and yields robust gains on downstream tasks, including property prediction and objective optimization, supporting our structure-first paradigm.
- Abstract(参考訳): 分子言語モデルの最近の進歩は、分子理解と生成のタスクに強いパフォーマンスをもたらしたが、これらは信頼性の高い構造的基盤を持たないことが多い。
特に、既存のアプローチは、構造が機能を決定するという化学原理と矛盾する: 下流での成功にもかかわらず、現在の分子LLMは基本的な構造認識では性能が悪く、標準SMILESから分子グラフを取得できないことを示唆している。
これを解決するために,SMILES-Graph 変換による構造理解を強化する構造ファーストフレームワークである MolBasic を提案する。
MolBasicはマルチレベル構造知覚ベンチマークに基づいて構築されており、双方向SMILES-Graph変換がシーケンシャルおよびトポロジ的表現を整列するためのコアタスクとして機能する。
この基礎の上に、我々は、構造獲得から高レベルの分子推論へモデルをステアリングするために、標準化されたChain-of-Thought(CoT)を用いた進歩的学習スキームを採用している。
実験の結果, モルバシックは構造理解を大幅に改善し, 特性予測や客観最適化などの下流タスクにおいて, 強靭な利得が得られることがわかった。
関連論文リスト
- SLASH the Sink: Sharpening Structural Attention Inside LLMs [55.75072688988806]
大規模言語モデル(LLM)は目覚ましい意味的理解を示すが、連続化されたフォーマットでグラフトポロジを処理する際に構造的理解に苦慮する。
本稿では,StructuraL Attention SHarpening (SLASH)を提案する。
論文 参考訳(メタデータ) (2026-05-11T12:59:07Z) - Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding [13.814119721533508]
分子理解は、科学的発見のような進歩する領域の中心である。
既存のグラフ-LLMブリッジは、固定長の静的トークンでQ-Formerスタイルのコネクタを適応することが多い。
本稿では,エントロピー誘導型動的トークン変換器であるETT-Formerを紹介した。
論文 参考訳(メタデータ) (2026-02-02T19:56:21Z) - Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression [55.51959317490934]
大規模言語モデル(LLM)は、テキスト分散グラフ(TAG)理解において有望な能力を示している。
グラフは本来、構造情報や意味情報を豊富に含むものであり、それらの有効利用はLLMの推論性能の潜在的な利益を解放する可能性があると論じる。
グラフホモフィリーの活用を目的としたフレームワーク LLMs (HS2C) のホモフィリー対応構造とセマンティック圧縮を提案する。
論文 参考訳(メタデータ) (2026-01-13T03:35:18Z) - Do We Really Need GNNs with Explicit Structural Modeling? MLPs Suffice for Language Model Representations [50.45261187796993]
グラフニューラルネットワーク(GNN)は構造情報を十分に活用できないが、MLP(Multi-Layer Perceptrons)は構造認識タスクにおいて驚くべき能力を示す。
本稿では,情報理論の観点から総合的な探索フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-26T18:10:28Z) - Improving Chemical Understanding of LLMs via SMILES Parsing [18.532188836688928]
CLEANMOLは、SMILES解析をクリーンで決定論的タスクのスイートに定式化する新しいフレームワークである。
適応的難易度スコアリングを伴う分子事前学習データセットを構築し,これらの課題に対してオープンソースのLCMを事前学習する。
以上の結果から,CLEANMOLは構造的理解を高めるだけでなく,Moll-Instructionsベンチマークのベースラインと競合する。
論文 参考訳(メタデータ) (2025-05-22T07:54:39Z) - Pre-trained Molecular Language Models with Random Functional Group Masking [54.900360309677794]
SMILESをベースとしたアンダーリネム分子アンダーリネム言語アンダーリネムモデルを提案し,特定の分子原子に対応するSMILESサブシーケンスをランダムにマスキングする。
この技術は、モデルに分子構造や特性をよりよく推測させ、予測能力を高めることを目的としている。
論文 参考訳(メタデータ) (2024-11-03T01:56:15Z) - Structural Reasoning Improves Molecular Understanding of LLM [18.532188836688928]
大規模言語モデル (LLM) は分子構造情報を用いた推論に依然として苦戦していることを示す。
本稿では,分子構造を推論のためにスケッチする手法を提案する。
対象分子が未知あるいは未知のシナリオのための2つのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T01:49:48Z) - Large Language Model-driven Meta-structure Discovery in Heterogeneous Information Network [29.149367323751413]
進化過程に推論を統合するメタ構造探索フレームワークReStructを提案する。
ReStructは推薦タスクとノード分類タスクの両方で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-02-18T09:21:12Z) - Physics of Language Models: Part 1, Learning Hierarchical Language Structures [51.68385617116854]
トランスフォーマーベースの言語モデルは効率的だが複雑であり、内部の動作や推論メカニズムを理解することは大きな課題である。
本稿では,長文を生成可能な階層規則を生成する合成CFGのファミリーを紹介する。
我々は、GPTのような生成モデルがCFG定義階層を正確に学習し、推論し、それに基づいて文を生成することを実証する。
論文 参考訳(メタデータ) (2023-05-23T04:28:16Z) - Autoregressive Structured Prediction with Language Models [73.11519625765301]
本稿では, PLM を用いた自己回帰的手法を用いて, モデル構造を行動列として記述する。
我々のアプローチは、私たちが見てきた全ての構造化予測タスクにおいて、新しい最先端を実現する。
論文 参考訳(メタデータ) (2022-10-26T13:27:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。