論文の概要: MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures
- arxiv url: http://arxiv.org/abs/2603.28550v1
- Date: Mon, 30 Mar 2026 15:11:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.467658
- Title: MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures
- Title(参考訳): MarkushGrapher-2: 化学構造のエンドツーエンドマルチモーダル認識
- Abstract要約: MarkushGrapher-2は文書中の化学構造のマルチモーダル認識のためのエンドツーエンドのアプローチである。
実世界のマルコシュ構造の大規模データセットを構築するための自動パイプラインを導入する。
提案手法はマルチモーダルマークシュ構造認識における最先端モデルを大幅に上回る。
- 参考スコア(独自算出の注目度): 2.7994101180516133
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatically extracting chemical structures from documents is essential for the large-scale analysis of the literature in chemistry. Automatic pipelines have been developed to recognize molecules represented either in figures or in text independently. However, methods for recognizing chemical structures from multimodal descriptions (Markush structures) lag behind in precision and cannot be used for automatic large-scale processing. In this work, we present MarkushGrapher-2, an end-to-end approach for the multimodal recognition of chemical structures in documents. First, our method employs a dedicated OCR model to extract text from chemical images. Second, the text, image, and layout information are jointly encoded through a Vision-Text-Layout encoder and an Optical Chemical Structure Recognition vision encoder. Finally, the resulting encodings are effectively fused through a two-stage training strategy and used to auto-regressively generate a representation of the Markush structure. To address the lack of training data, we introduce an automatic pipeline for constructing a large-scale dataset of real-world Markush structures. In addition, we present IP5-M, a large manually-annotated benchmark of real-world Markush structures, designed to advance research on this challenging task. Extensive experiments show that our approach substantially outperforms state-of-the-art models in multimodal Markush structure recognition, while maintaining strong performance in molecule structure recognition. Code, models, and datasets are released publicly.
- Abstract(参考訳): 文書から化学構造を自動的に抽出することは、化学文献の大規模解析に不可欠である。
自動パイプラインは、図形またはテキストで表される分子を独立して認識するために開発された。
しかし,マルチモーダルな記述(マルコシュ構造)から化学構造を認識する手法は精度が低いため,大規模自動処理には使用できない。
本稿では,文書中の化学構造のマルチモーダル認識のためのエンドツーエンドアプローチであるMarkushGrapher-2を提案する。
まず、化学画像からテキストを抽出するために専用のOCRモデルを用いる。
第2に、テキスト、画像、レイアウト情報は、ビジョンテキストレイアウトエンコーダと光学化学構造認識ビジョンエンコーダを介して共同で符号化される。
最後に、得られたエンコーディングは、2段階のトレーニング戦略を通じて効果的に融合され、Markush構造の表現を自動回帰的に生成するために使用される。
トレーニングデータの欠如に対処するため,実世界のMarkush構造を大規模に構築するための自動パイプラインを導入する。
さらに,実世界のMarkush構造を手動で注釈付けした大規模なベンチマークであるIP5-Mを提案する。
その結果,本手法は分子構造認識において高い性能を維持しつつ,マルチモーダルマークシュ構造認識における最先端モデルを大幅に上回ることを示した。
コード、モデル、データセットが公開されている。
関連論文リスト
- MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition [3.930866087901632]
化学構造は特許や科学文献に画像として現れる。
データベースのインデックス化や機械学習モデルのトレーニングセットの構築といったプログラムの使用には、行表記に変換する必要がある。
本研究では,両タスクを画像からテキストへの変換問題として扱う。
本稿では,最新のOCSRモデルであるOCSRGlyphを提案する。
Markushタスクには、Markush構造全体をイメージとして読む視覚言語モデルであるMarkushGlyphを導入する。
論文 参考訳(メタデータ) (2026-07-30T17:03:05Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning [51.393018266721576]
化学反応図解析(RxnDP)のためのRxnCaptionフレームワークを提案する。
本フレームワークは,従来の座標予測による解析処理を画像キャプション問題に再構成する。
我々は,BBox and Index as Visual Prompt (BIVP) という,最先端の分子検出器である MolYOLO を用いて,分子境界ボックスやインデックスを直接入力画像上に描画する戦略を紹介した。
論文 参考訳(メタデータ) (2025-11-04T09:08:44Z) - GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition [60.76623665324548]
GTR-Mol-VLMは、2つの重要な革新を特徴とする新しいフレームワークである。
シーケンシャルな原子結合予測を通じて分子グラフを段階的に解析することで、人間の推論をエミュレートする。
MolRec-BenchはOCSRにおけるグラフパーシング精度の詳細な評価のために設計された最初のベンチマークである。
論文 参考訳(メタデータ) (2025-06-09T08:47:10Z) - SubGrapher: Visual Fingerprinting of Chemical Structures [45.2191459937801]
SubGrapherは化学構造画像の視覚的フィンガープリントの手法である。
機能基と炭素骨格を識別し、サブ構造に基づく指紋を構成する。
本手法は最先端のOCSRおよびフィンガープリント法に対して評価される。
論文 参考訳(メタデータ) (2025-04-28T11:45:46Z) - MarkushGrapher: Joint Visual and Textual Recognition of Markush Structures [47.41884299076947]
MarkushGrapherは、ドキュメント内のMarkush構造を認識するためのマルチモーダルアプローチである。
本稿では,多種多様な現実的なマルコシュ構造を生成する合成データ生成パイプラインを提案する。
M2Sは、実世界のMarkush構造の最初の注釈付きベンチマークである。
論文 参考訳(メタデータ) (2025-03-20T12:40:38Z) - OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models [58.45517851437422]
VsTP(Visually-situated text parsing)は、自動化された文書理解の需要が高まり、最近顕著な進歩を遂げている。
既存のソリューションは、タスク固有のアーキテクチャと個々のタスクの目的に依存していることが多い。
本稿では,テキストスポッティング,キー情報抽出,テーブル認識,レイアウト解析など,VsTPの典型的なタスクを統一する汎用モデルであるOmni V2を紹介する。
論文 参考訳(メタデータ) (2025-02-22T09:32:01Z) - MolParser: End-to-end Visual Recognition of Molecule Structures in the Wild [17.846545370594452]
両端から端までの新しい化学構造認識法であるモールについて述べる。
SMILES符号化法を用いて,最大のアノテート分子画像データセットである Mol-7M をアノテートする。
我々は、カリキュラム学習アプローチを用いて、エンドツーエンドの分子画像キャプションモデル、Molを訓練した。
論文 参考訳(メタデータ) (2024-11-17T15:00:09Z) - Exploring Optimal Transport-Based Multi-Grained Alignments for Text-Molecule Retrieval [24.061535843472427]
最適TRansportに基づく多粒度アライメントモデル(ORMA)を導入する。
ORMAは、テキスト記述と分子間の多義的なアライメントを促進する新しいアプローチである。
ChEBI-20データセットとPCdesデータセットの実験結果から、ORMAが既存のSOTA(State-of-the-art)モデルを大幅に上回っていることが示されている。
論文 参考訳(メタデータ) (2024-11-04T06:30:52Z) - MolGrapher: Graph-based Visual Recognition of Chemical Structures [50.13749978547401]
化学構造を視覚的に認識するためにMolGrapherを導入する。
すべての候補原子と結合をノードとして扱い、それらをグラフ化する。
グラフニューラルネットワークを用いてグラフ内の原子と結合ノードを分類する。
論文 参考訳(メタデータ) (2023-08-23T16:16:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。