論文の概要: When Active Learning Falls Short: An Empirical Study on Chemical Reaction Extraction
- arxiv url: http://arxiv.org/abs/2604.19335v1
- Date: Tue, 21 Apr 2026 11:10:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.73261
- Title: When Active Learning Falls Short: An Empirical Study on Chemical Reaction Extraction
- Title(参考訳): 能動学習が短くなったとき--化学反応抽出に関する実証的研究
- Authors: Simin Yu, Sufia Fathima,
- Abstract要約: 化学反応抽出のための能動的学習の体系的研究を行う。
我々は6つの不確実性と多様性に基づく戦略を事前訓練されたトランスフォーマーCRFアーキテクチャと統合する。
分析の結果,従来の能動学習戦略の安定性は,事前学習,構造化されたCRF復号化,ラベルの分散性に制限があることが示唆された。
- 参考スコア(独自算出の注目度): 0.7734726150561088
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The rapid growth of chemical literature has generated vast amounts of unstructured data, where reaction information is particularly valuable for applications such as reaction predictions and drug design. However, the prohibitive cost of expert annotation has led to a scarcity of training data, severely hindering the performance of automatic reaction extraction. In this work, we conduct a systematic study of active learning for chemical reaction extraction. We integrate six uncertainty- and diversity-based strategies with pretrained transformer-CRF architectures, and evaluate them on product extraction and role labeling task. While several methods approach full-data performance with fewer labeled instances, learning curves are often non-monotonic and task-dependent. Our analysis shows that strong pretraining, structured CRF decoding, and label sparsity limit the stability of conventional active learning strategies. These findings provide practical insights for the effective use of active learning in chemical information extraction.
- Abstract(参考訳): 化学文献の急速な成長は膨大な量の非構造データを生み出しており、反応予測や薬物設計といった応用には反応情報が特に有用である。
しかし、専門家アノテーションの禁止コストは、トレーニングデータの不足を招き、自動反応抽出の性能を著しく損なうことになる。
本研究では,化学反応抽出のための能動的学習の体系的研究を行う。
我々は6つの不確実性と多様性に基づく戦略を事前訓練されたトランスフォーマーCRFアーキテクチャと統合し、製品抽出とロールラベリングタスクで評価する。
いくつかの手法がラベル付きインスタンスの少ないフルデータパフォーマンスにアプローチする一方で、学習曲線は非単調でタスクに依存しないことが多い。
分析の結果,従来の能動学習戦略の安定性は,事前学習,構造化されたCRF復号化,ラベルの分散性に制限があることが示唆された。
これらの知見は,化学情報抽出における能動的学習の有効活用の実践的洞察を与えるものである。
関連論文リスト
- Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing [52.825281124618535]
反応図解析(RxnDP)は、文献から化学合成情報を抽出するために重要である。
近年の視覚言語モデル(VLM)はこの複雑な視覚的推論タスクを自動化するための有望なパラダイムとして登場した。
この研究はVLMベースのRxnDPを2つの相補的視点、すなわち表現の促進と学習パラダイムから強化する。
論文 参考訳(メタデータ) (2026-03-16T09:17:05Z) - Modular Multi-Task Learning for Chemical Reaction Prediction [1.443416244644791]
低ランク適応(LoRA)は、有機反応予測のための完全な微調整に代わるパラメータ効率の代替である。
LoRAは完全な微調整に匹敵する精度を達成し、破滅的な忘れを効果的に軽減し、マルチタスク性能を向上する。
論文 参考訳(メタデータ) (2026-02-11T01:17:06Z) - AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature [55.66036140125613]
本稿では,化学工学論文から触媒反応データを抽出し,解析する大規模言語モデル (LLM) エージェントであるAgentCATを提案する。
AgentCATは、化学工学分野における長年のデータボトルネックを克服する代替手段として機能する。
論文 参考訳(メタデータ) (2026-02-10T04:30:11Z) - Chemical knowledge-informed framework for privacy-aware retrosynthesis learning [72.39098405805318]
現在の機械学習に基づくレトロシンセシスは、複数のソースからの反応データを1つのエッジに集め、予測モデルを訓練する。
このパラダイムは、組織の境界を越えた広範なデータ可用性を必要とするため、かなりのプライバシーリスクをもたらす。
本研究では, 化学知識インフォームド・フレームワーク (CKIF) について紹介する。
論文 参考訳(メタデータ) (2025-02-26T13:13:24Z) - A Self-feedback Knowledge Elicitation Approach for Chemical Reaction Predictions [24.80165173525286]
本稿では,データ処理による自己フィードバック型知識抽出手法を提案する。
我々は、事前知識を大規模言語モデルに注入するために適応的な即時学習を採用する。
この研究は、科学研究における知識の活用のための新しいパラダイムを提供する。
論文 参考訳(メタデータ) (2024-04-15T09:26:33Z) - Revealing the Relationship Between Publication Bias and Chemical Reactivity with Contrastive Learning [13.299207805882755]
CAS Content Collection$textTM$で20,798 aryl halidesをトレーニングし,2010年から2015年にかけて数千の出版物を対象とした。
この研究は、新しい方法でデータ文学から学ぶための化学固有の機械学習訓練戦略を示すだけでなく、出版物における基質選択の傾向に反映される化学反応性の傾向を明らかにするためのユニークなアプローチを示す。
論文 参考訳(メタデータ) (2024-02-19T02:21:20Z) - ReactIE: Enhancing Chemical Reaction Extraction with Weak Supervision [27.850325653751078]
構造化化学反応情報は、実験とコンピュータ支援医薬品設計のような先進的な取り組みに携わる化学者にとって重要な役割を担っている。
科学的文献から構造的反応を抽出することが重要であるにもかかわらず、この目的のためのデータアノテーションは、ドメインの専門家が必要とする多大な労力のためにコストを抑えることができる。
本稿では,2つの弱教師付き事前学習手法を組み合わせたReactIEを提案する。本手法では,テキスト内の頻繁なパターンを言語的手がかりとして用いて,化学反応の特異な特性を同定する。
論文 参考訳(メタデータ) (2023-07-04T02:52:30Z) - MetaRF: Differentiable Random Forest for Reaction Yield Prediction with
a Few Trails [58.47364143304643]
本稿では,反応収率予測問題に焦点をあてる。
筆者らはまず,数発の収量予測のために特別に設計された,注意に基づく識別可能なランダム森林モデルであるMetaRFを紹介した。
数発の学習性能を改善するために,さらに次元還元に基づくサンプリング手法を導入する。
論文 参考訳(メタデータ) (2022-08-22T06:40:13Z) - Deep Learning for Virtual Screening: Five Reasons to Use ROC Cost
Functions [80.12620331438052]
深層学習は サイリコの何十億もの分子を 迅速にスクリーニングする 重要なツールとなりました
その重要性にもかかわらず、厳密なクラス不均衡、高い決定しきい値、いくつかのデータセットにおける基底真理ラベルの欠如など、これらのモデルのトレーニングにおいて重大な課題が続いている。
このような場合、クラス不均衡に対するロバスト性から、レシーバ動作特性(ROC)を直接最適化することを好んで論じる。
論文 参考訳(メタデータ) (2020-06-25T08:46:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。