論文の概要: MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition
- arxiv url: http://arxiv.org/abs/2607.28532v1
- Date: Thu, 30 Jul 2026 17:03:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.686028
- Title: MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition
- Title(参考訳): MarkushGlyphとOCSRGlyph:化学構造認識の改善
- Abstract要約: 化学構造は特許や科学文献に画像として現れる。
データベースのインデックス化や機械学習モデルのトレーニングセットの構築といったプログラムの使用には、行表記に変換する必要がある。
本研究では,両タスクを画像からテキストへの変換問題として扱う。
本稿では,最新のOCSRモデルであるOCSRGlyphを提案する。
Markushタスクには、Markush構造全体をイメージとして読む視覚言語モデルであるMarkushGlyphを導入する。
- 参考スコア(独自算出の注目度): 3.930866087901632
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chemical structures appear in patents and the scientific literature as images. For programmatic usage, such as indexing in databases or constructing machine learning model training sets, they must be transformed into line notations. The two common forms of this task are translating an image of a single molecule (optical chemical structure recognition - OCSR) and translating a Markush structure that represents a family of molecules. While prior work in the former case is quite mature, Markush structure parsing remains a challenging task. In this work, we treat both tasks as an image-to-text translation problem. We then propose OCSRGlyph, a state-of-the-art OCSR model, improving performance over prior methods by carefully considering stereochemistry. For the Markush task, we introduce MarkushGlyph, a vision-language model that reads the entire Markush structure as an image. This contrasts with prior systems, which often use multiple stages to separately process visual and text input content. Finally, we introduce a new metric for determining the accuracy of Markush structure translations, handling failure modes present in prior metrics.
- Abstract(参考訳): 化学構造は特許や科学文献に画像として現れる。
データベースのインデックス化や機械学習モデルのトレーニングセットの構築といったプログラムの使用には、行表記に変換する必要がある。
このタスクの2つの一般的な形態は、単一の分子(光学化学構造認識 - OCSR)の画像の翻訳と、分子群を表すマークシュ構造の翻訳である。
前者のケースでの以前の作業はかなり成熟しているが、Markush構造解析は依然として難しい課題である。
本研究では,両タスクを画像からテキストへの変換問題として扱う。
そこで我々は,最先端のOCSRモデルであるOCSRGlyphを提案する。
Markushタスクには、Markush構造全体をイメージとして読む視覚言語モデルであるMarkushGlyphを導入する。
これは、視覚的およびテキスト入力コンテンツを別々に処理するために、しばしば複数のステージを使用する以前のシステムとは対照的である。
最後に,Markush構造変換の精度を決定するための新しいメトリクスを導入し,先行メトリクスに存在する障害モードを扱う。
関連論文リスト
- Bi-semantic Chemical Embedder for Joint Representation Learning of SMILES and Natural Language [2.9764168176721992]
CheMatEは化学指向の埋め込みモデルであり、分子構造とドメイン固有の自然言語を共同でキャプチャする。
我々は、FinWebとChemPileから構築・キュレーションされた、新しい大規模な学術文書のコーパスを用いて、モデルを訓練する。
この設計はSMILESで計算された科学文献にモデルを公開し、バイセマンティックな理解を可能にする。
論文 参考訳(メタデータ) (2026-08-04T15:57:38Z) - MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures [2.7994101180516133]
MarkushGrapher-2は文書中の化学構造のマルチモーダル認識のためのエンドツーエンドのアプローチである。
実世界のマルコシュ構造の大規模データセットを構築するための自動パイプラインを導入する。
提案手法はマルチモーダルマークシュ構造認識における最先端モデルを大幅に上回る。
論文 参考訳(メタデータ) (2026-03-30T15:11:17Z) - RTMol: Rethinking Molecule-text Alignment in a Round-trip View [4.597922051722059]
分子キャプションとテキストからSMILES生成を自己教師付きラウンドトリップ学習により統合する双方向アライメントフレームワークであるRTMolを提案する。
実験により、RTMolは様々なLLMに対して、双方向アライメント性能を最大47%向上させることが示された。
論文 参考訳(メタデータ) (2025-11-15T09:55:55Z) - RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning [51.393018266721576]
化学反応図解析(RxnDP)のためのRxnCaptionフレームワークを提案する。
本フレームワークは,従来の座標予測による解析処理を画像キャプション問題に再構成する。
我々は,BBox and Index as Visual Prompt (BIVP) という,最先端の分子検出器である MolYOLO を用いて,分子境界ボックスやインデックスを直接入力画像上に描画する戦略を紹介した。
論文 参考訳(メタデータ) (2025-11-04T09:08:44Z) - GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition [60.76623665324548]
GTR-Mol-VLMは、2つの重要な革新を特徴とする新しいフレームワークである。
シーケンシャルな原子結合予測を通じて分子グラフを段階的に解析することで、人間の推論をエミュレートする。
MolRec-BenchはOCSRにおけるグラフパーシング精度の詳細な評価のために設計された最初のベンチマークである。
論文 参考訳(メタデータ) (2025-06-09T08:47:10Z) - MarkushGrapher: Joint Visual and Textual Recognition of Markush Structures [47.41884299076947]
MarkushGrapherは、ドキュメント内のMarkush構造を認識するためのマルチモーダルアプローチである。
本稿では,多種多様な現実的なマルコシュ構造を生成する合成データ生成パイプラインを提案する。
M2Sは、実世界のMarkush構造の最初の注釈付きベンチマークである。
論文 参考訳(メタデータ) (2025-03-20T12:40:38Z) - OCSU: Optical Chemical Structure Understanding for Molecule-centric Scientific Discovery [4.905515668299634]
光化学構造理解(OCSU)タスクは、化学構造図を機械と化学の双方で読みやすい文字列に変換することを目的としている。
局所無明な原子に対する注意的特徴強調によるOCSR性能向上のためのDoubleCheckを提案する。
また,最初の大規模OCSUデータセットであるVis-Chebi20を構築した。
論文 参考訳(メタデータ) (2025-01-26T06:14:29Z) - RFL: Simplifying Chemical Structure Recognition with Ring-Free Language [66.47173094346115]
化学構造を階層的に記述する新しいリング自由言語(RFL)を提案する。
RFLは複雑な分子構造を複数の部分に分解し、特異性と簡潔性の両方を保証する。
分子骨格と個々の環を段階的に予測する骨格生成モジュールからなる普遍的な分子骨格デコーダ(MSD)を提案する。
論文 参考訳(メタデータ) (2024-12-10T15:29:32Z) - Story Visualization by Online Text Augmentation with Context Memory [64.86944645907771]
オンラインテキスト拡張による双方向トランスフォーマーフレームワークのための新しいメモリアーキテクチャを提案する。
提案手法は, FID, キャラクタF1, フレーム精度, BLEU-2/3, R精度など, 様々な指標において, 芸術の状態を著しく上回っている。
論文 参考訳(メタデータ) (2023-08-15T05:08:12Z) - Learning to Exploit Temporal Structure for Biomedical Vision-Language
Processing [53.89917396428747]
視覚言語処理における自己教師あり学習は、画像とテキストのモダリティのセマンティックアライメントを利用する。
トレーニングと微調整の両方で利用できる場合、事前のイメージとレポートを明示的に説明します。
我々のアプローチはBioViL-Tと呼ばれ、テキストモデルと共同で訓練されたCNN-Transformerハイブリッドマルチイメージエンコーダを使用する。
論文 参考訳(メタデータ) (2023-01-11T16:35:33Z) - Enhanced Modality Transition for Image Captioning [51.72997126838352]
MTM(Modality Transition Module)を構築し、言語モデルに転送する前に視覚的機能をセマンティック表現に転送します。
トレーニング段階では、モダリティ遷移ネットワークは提案されたモダリティ損失によって最適化される。
提案手法の有効性を示すMS-COCOデータセットを用いて実験を行った。
論文 参考訳(メタデータ) (2021-02-23T07:20:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。