論文の概要: Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition
- arxiv url: http://arxiv.org/abs/2608.09100v1
- Date: Mon, 10 Aug 2026 04:01:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.076928
- Title: Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition
- Title(参考訳): 光学化学構造認識における合成対リアルギャップのリアルタイム化
- Authors: Yani Guan, Dengpan Dong, Zi Wei, Shuang Luo, Dan Hannah, Yumin Zhang, Kang Xu,
- Abstract要約: OCSRは合成画像ではほとんど解決されていないが、実際の文書では難しい。
21の認識者は、合成された構造の混合物を微調整し、特許、雑誌、手描きのコレクションから実際の描写をラベル付けした。
- 参考スコア(独自算出の注目度): 7.493576538485066
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Millions of chemical structures appear in patents and papers only as drawings, and using that information at scale requires reading the drawings. OCSR appears nearly solved on synthetic images yet remains difficult on real documents: the starting recognizer, Qwen2.5-VL-7B, exceeds 91% accuracy on synthetic renders but falls below 16% on three real-world benchmarks (ACS, CLEF-IP, USPTO). To identify the main source of improvement, 21 recognizers were fine-tuned on mixtures of synthetically rendered structures and labeled real depictions from patents, journal figures, and hand-drawn collections, varying the vision language model (VLM) base, the fraction of real training data, and the vision-tower adaptation strategy. Labeled real training images make the largest difference. For Qwen2.5-VL, ACS exact match rises from 0.15 with no real data to 0.37 at 9.5% and 0.46 at 50.2%; a controlled experiment across three base models reproduces the trend. A vision-tower LoRA, in contrast, does nothing for Qwen (+0.00, paired p=1.00), substantially helps InternVL3-8B (+22.8 to +34.6 pt), and modestly helps GLM-4.1V-9B (+1.0 to +9.6 pt), so its value depends on the base model. The best configuration reaches 0.96 exact match on clean renders and 0.49, 0.65, 0.84, and 0.76 on ACS, CLEF-IP, UOB, and USPTO, respectively. Gaps between base models are largest without real data (0.21), shrink to 0.06 at 70% real data, and reorder the ranking; base model and real-data mixture must therefore be selected together. Small-scale experiments on handwritten image-to-LaTeX recognition and chart-to-table conversion show that base-model rankings also vary beyond chemistry. More generally, model and adaptation choices for visual structure recognition should be evaluated on the target task.
- Abstract(参考訳): 何百万もの化学構造が特許や論文に現れるのは、図面のみであり、その情報を大規模に利用するには、図面を読む必要がある。
開始認識器であるQwen2.5-VL-7Bは合成レンダリングの精度は91%を超え、実際の3つのベンチマーク(ACS、CLEF-IP、USPTO)では16%以下である。
改良の主源を特定するため、21の認識者は、合成された構造と特許、ジャーナルフィギュア、手描きコレクションの実際の描写の混合物を微調整し、視覚言語モデル(VLM)ベース、実際の訓練データの割合、および視覚-聴取適応戦略を変化させた。
ラベル付けされた実際の訓練画像は最大の違いだ。
Qwen2.5-VLでは、ACSの正確なマッチは0.15から、実際のデータは9.5%で0.37、50.2%で0.46まで上昇する。
対照的に、ビジョントウワーのLoRAはQwen (+0.00, paired p=1.00), InternVL3-8B (+22.8 - +34.6 pt), GLM-4.1V-9B (+1.0 - +9.6 pt) には何の役にも立たないため、その値は基本モデルに依存する。
ACS、CLEF-IP、UOB、USPTOでは0.49、0.65、0.84、0.76となる。
ベースモデル間のギャップは、実データなしで最大(0.21)、実データで0.06に縮小し、ランキングをリオーダーする。
手書き画像からLaTeX認識とチャートからテーブルへの変換に関する小規模な実験は、基礎モデルのランク付けが化学以外でも異なることを示している。
より一般的には、視覚構造認識のためのモデルと適応の選択を目標タスク上で評価する必要がある。
関連論文リスト
- Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization [0.44787896002954924]
広範に使われている5つの視覚言語モデル(VLM)を評価する。
本実験では, エンゲージメント認識のためのゼロショットVLMの3つの主要な故障モードを明らかにした。
論文 参考訳(メタデータ) (2026-06-20T03:53:40Z) - Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering [3.7117716372644693]
本稿では,医療用視覚質問応答(VQA)とプライバシ保存合成データの生成に対処する二重パイプラインPEFTモデルを提案する。
低ランク適応(LoRA)と安定拡散(Stable Diffusion)2.1を併用して,患者のプライバシを侵害することなく,トレーニングデータベースを強化した高品質なGI画像を生成する。
論文 参考訳(メタデータ) (2026-05-24T00:33:54Z) - From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models [7.782282985072339]
本研究では,強い識別モデルとマルチモーダルな説明を組み合わせた方法論を提案する。
そこで我々はGrad-CAM++の視覚属性マップと短いテキスト論理式を作成した。
説明の質のために、Grad-CAM++は可塑性だが粗いローカライゼーションを提供し、VLMの合理性は概してグレード一貫性がある。
論文 参考訳(メタデータ) (2026-04-25T00:21:11Z) - Pose Matters: Evaluating Vision Transformers and CNNs for Human Action Recognition on Small COCO Subsets [0.0]
本研究では,COCO画像コーパスの3クラスサブセットを用いた人間の認識について検討する。
バイナリビジョン変換器(ViT)は90%の平均テスト精度を達成した。
論文 参考訳(メタデータ) (2025-06-13T11:16:50Z) - CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification [65.46685389276443]
画像とテキストプロンプトをマッチングすることでゼロショット分類を行うことができる、視覚言語で事前訓練されたエンコーダモデルであるCLIPについて検討する。
次に, 共分散精製プロセス間のKL分散として精製リスクを定式化する。
画像の潜伏ベクトルの確率をモデル化するCLI-Diffと、画像の埋め込みとaの写真とのコサイン類似度をモデル化するCLI-Cosの2つのバリエーションを提案する。
論文 参考訳(メタデータ) (2025-02-25T13:09:34Z) - Learning from Synthetic Data for Visual Grounding [55.21937116752679]
そこで本研究では,SynGroundが市販のビジョン・アンド・ランゲージモデルのローカライズ能力を向上できることを示す。
SynGroundで生成されたデータは、事前訓練されたALBEFモデルとBLIPモデルのポインティングゲーム精度をそれぞれ4.81%、絶対パーセンテージポイント17.11%向上させる。
論文 参考訳(メタデータ) (2024-03-20T17:59:43Z) - Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data [122.282521548393]
コントラスト言語-画像事前学習 (CLIP) は, クロスモーダルな画像-テキスト表現学習の標準となっている。
HELIPは、CLIPモデルを改善するためのコスト効率のよい戦略であり、継続的なトレーニングにおいて既存のデータセット内の挑戦的なテキストイメージペアを利用することで、CLIPモデルを改善する。
論文 参考訳(メタデータ) (2023-05-09T07:00:17Z) - Treatment classification of posterior capsular opacification (PCO) using
automated ground truths [0.0]
本稿では,PCO画像をまず分類し,必要なテキスト処理と不要なテキスト処理に分類する,深層学習(DL)に基づく手法を提案する。
モデルのトレーニングには, (i) マニュアルと (ii) 自動の2つの戦略から得られるグラウンド・真実(GT)をセットしたトレーニング画像を作成する。
論文 参考訳(メタデータ) (2022-11-11T10:36:42Z) - Improving Visual Grounding by Encouraging Consistent Gradient-based
Explanations [58.442103936918805]
注意マスク整合性は,従来の方法よりも優れた視覚的グラウンドリング結果が得られることを示す。
AMCは効率的で実装が容易であり、どんな視覚言語モデルでも採用できるため一般的である。
論文 参考訳(メタデータ) (2022-06-30T17:55:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。