論文の概要: VERDICT: Agreement Beats Pixel-Space Verification in Real-Document OCSR
- arxiv url: http://arxiv.org/abs/2608.22183v1
- Date: Sun, 23 Aug 2026 02:41:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.644622
- Title: VERDICT: Agreement Beats Pixel-Space Verification in Real-Document OCSR
- Title(参考訳): VERDICT: リアルドキュメントOCSRでピクセルスペースの検証を破る契約
- Authors: Yani Guan, Dengpan Dong, Shuang Luo, Zi Wei, Joah Han, Dan Hannah, Yumin Zhang, Qichao Hu, Kang Xu,
- Abstract要約: VERDICTは、分子記録の検索と検索のための画像ベースのインタフェースである。
構造画像、機械可読表現、およびソース公開情報をリンクするマルチモーダル分子データベースの検証済みラベルを可能にする。
- 参考スコア(独自算出の注目度): 6.923778751564602
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optical Chemical Structure Recognition (OCSR) converts 2D molecular depictions in the published literature into SMILES, and is increasingly important for constructing large-scale chemical training datasets. Automation at that scale requires identifying unreliable predictions in the absence of ground truth. Three families of label-free signals were compared on $263$ ACS journal depictions with verified ground truth: model confidence, re-rendering similarity, and agreement among recognizers. Pixel-space re-rendering performed little better than chance (AUROC $0.547$, $95\%$ CI $[0.465,0.629]$), and an oracle-tuned threshold on it reduced correct labels per image from $0.745$ to $0.205$. Agreement among four architecturally distinct recognizers instead reached an AUROC of $0.916$ ($[0.880,0.952]$). The two-of-four rule accepted $81.7\%$ of images at $88.8\%$ precision, the three-of-four rule $52.1\%$ at $98.5\%$. The same pattern held on CLEF-IP, UOB, and USPTO. This distinction is obscured on synthetic benchmarks, where re-rendered predictions naturally resemble their inputs. A substance filter removed $2{,}193$ false agreements on wildcards and R-group fragments, after which the three-of-four rule rejected all $68$ generic depictions. VERDICT was then applied to PMC Open Access, producing $6{,}146$ structure labels for $4{,}833$ molecules; chemist adjudication of $400$ released labels in two independent samples yielded precisions of $0.995$ for the three-of-four tier and $0.958$ for the two-of-four tier. VERDICT therefore enables validated labels for multimodal molecular databases linking structure images, machine-readable representations, and source-publication information. In SES AI's Molecular Universe platform, VERDICT further serves as an image-based interface for searching and retrieving molecular records.
- Abstract(参考訳): 光化学構造認識(OCSR)は、出版物中の2次元分子描写をSMILESに変換し、大規模化学訓練データセットを構築する上でますます重要である。
そのスケールでの自動化には、根拠のない信頼できない予測を特定する必要があります。
ラベルなし信号の3つのファミリは、263ドル(約2,300円)のACSジャーナルの描写と、モデルの信頼性、再レンダリングの類似性、認識者間の合意の検証とを比較した。
AUROC $0.547$, 9,5\%$ CI $[0.465,0.629]$)と、画像あたりの正確なラベルを0.745$から0.205$に削減した。
アーキテクチャ的に異なる4人の認識者の間での合意は、代わりに0.916ドル([0.880,0.952]$)のAUROCに達した。
4分の2ルールは8.7.%のイメージを8.8.%の精度で8.8.%の精度で受け入れ、3分の3ルールは5.2.1.%のイメージを9.8.5.%の精度で受け入れた。
CLEF-IP、UOB、USPTOも同様のパターンである。
この区別は、再レンダリングされた予測が入力と自然に類似している合成ベンチマークでは曖昧である。
物質フィルターはワイルドカードとRグループの断片に関する2,193ドルの偽の合意を取り除き、その後3対4の規則は68ドルの一般的な描写を全て拒絶した。
その後、VERDICT は PMC Open Access に適用され、6{,}146$構造ラベルを4{,}833$分子に対して生成した。
したがって、VERDICTは構造画像、機械可読表現、およびソース公開情報をリンクするマルチモーダル分子データベースの検証済みラベルを可能にする。
SES AIの分子宇宙プラットフォームでは、VERDICTはさらに、分子記録の検索と検索のためのイメージベースのインターフェースとして機能する。
関連論文リスト
- Fixed-order postselected CHSH reference acquisition for parity-constrained spatial-mode qubits on a commercial cloud photonic processor [0.0]
我々は,Quandelaの商用クラウドアクセス可能なベレノスプロセッサ上で,2つの符号化されたフォトニックキュービットに対して,Clauser-Horne-Shimony-Holt (CHSH) の取得と報告を行う。
各論理キュービットは、8モードの単一光子レジスタの7次元ゼロサムセクターにおける2次元空間モード部分空間である。
論文 参考訳(メタデータ) (2026-08-13T01:08:02Z) - Cross-View Variance Correlation in Path-Traced Stereo:A Hidden Shortcut in Synthetic Training Data [0.0]
パストレーシングされた合成ステレオデータは、多くの不均一推定訓練パイプラインを実現する。
基礎となる共分散場は, 地道不均等ワープに整列すると, 高い相関関係を示す。
この信号はMCレンダリングデータに特有であり、候補のsim-to-realショートカットを構成する。
論文 参考訳(メタデータ) (2026-06-24T07:13:00Z) - A Closed-Form Adaptive-Landmark Kernel for Certified Point-Cloud and Graph Classification [0.0]
PALACEはOrbitHS5k(91.3pm 1.0%$, matching Persformer)上で最強の閉形式ダイアグラムベースの方法である
ドメインインフレーションが8ドルになると、均等グリッドが崩壊する一方、プレースメントは94%$を維持している(4クラスデータでは25%$)
PALACEはOrbitHS5k(91.3pm 1.0%$, matching Persformer)上で最強の閉形式ダイアグラムベースの手法である。
論文 参考訳(メタデータ) (2026-05-05T17:59:18Z) - Learning Hippo: Multi-attractor Dynamics and Stability Effects in a Biologically Detailed CA3 Extension of Hopfield Networks [0.0]
本稿では,CA3における古典ホップフィールド/マーの自動連想メモリモデルの拡張について述べる。
われわれは10個体群(非対称錐体サブタイプ2種,GABA作動性インターニューロンクラス8種),4つのコンパートメント,複数ルール可塑性,およびバイモーダルコリン作動性エンコーディング/コンソリデーションサイクルを実装した。
論文 参考訳(メタデータ) (2026-04-22T15:28:17Z) - A High-Accuracy Optical Music Recognition Method Based on Bottleneck Residual Convolutions [0.036971941442545786]
光音楽認識は、印刷または手書きの楽譜画像を編集可能な記号表現に変換することを目的としている。
本稿では、残差ボトルネック畳み込みと双方向ゲート再帰ユニット(BiGRU)に基づくシーケンスモデリングを組み合わせたエンドツーエンドのOMRフレームワークを提案する。
Camera-PrIMuSとPrIMuSデータセットの実験結果から,提案フレームワークの有効性が示された。
論文 参考訳(メタデータ) (2026-04-07T14:32:16Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - Information-Guided Diffusion Sampling for Dataset Distillation [44.216998537570866]
拡散モデル(DM)はこのタスクを約束しているが、低画像/クラス(IPC)設定で苦労している。
蒸留データセットが保持しなければならない2つの重要な種類の情報を特定する。
Tiny ImageNetおよびImageNetサブセットの実験では、情報誘導拡散サンプリング(IGDS)が既存の手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-07-07T02:27:08Z) - Reasoning to Attend: Try to Understand How <SEG> Token Works [44.33848900059659]
我々は、$texttSEG>$トークンが、画像とテキストのペア内のセマンティックな類似性に寄与していることを示す。
本稿では,高活性点の誘導の下で,LMMの高強度な$textbfREA$soning機能を実現するREADを提案する。
論文 参考訳(メタデータ) (2024-12-23T17:44:05Z) - Robust Distortion-free Watermarks for Language Models [85.55407177530746]
本稿では,自動回帰言語モデルからテキストに透かしを植え付ける手法を提案する。
言語モデルから乱数列をサンプルにマッピングすることで、透かし付きテキストを生成する。
論文 参考訳(メタデータ) (2023-07-28T14:52:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。