論文の概要: Agentic schema-guided extraction of materials process knowledge from scientific literature
- arxiv url: http://arxiv.org/abs/2610.06322v1
- Date: Mon, 05 Oct 2026 13:36:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 09:11:02.007143
- Title: Agentic schema-guided extraction of materials process knowledge from scientific literature
- Title(参考訳): エージェント型スキーマ誘導による科学文献からの材料プロセス知識の抽出
- Abstract要約: SciKGExtractは、大規模言語モデル抽出と化学正規化とエージェントベースの評価と改善を組み合わせたスキーマ誘導フレームワークである。
酸化亜鉛 (ZnO) および酸化インジウム-ガリウム-亜鉛 (IGZO) を記述した176原子層成膜紙の組織評価を行った。
- 参考スコア(独自算出の注目度): 0.8193467416247519
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Materials literature contains detailed experimental knowledge, but procedures, chemical entities and measurements remain difficult to aggregate because they are reported in heterogeneous forms and depend on process-specific context. We present SciKGExtract, a schema-guided framework that combines large-language-model extraction with chemical normalization and agent-based evaluation and refinement before knowledge-graph integration. We evaluate the framework on 176 atomic-layer-deposition papers describing zinc oxide (ZnO) and indium--gallium--zinc oxide (IGZO), together with an expert-annotated full-schema subset. PubChem normalization improves exact-match extraction F1 for every tested model. For ZnO, the best F1 increases from 0.591 for direct normalized extraction to 0.805 with agentic refinement, whereas the best IGZO result is 0.344, revealing the greater difficulty of multicomponent supercycle processes. Evaluation against a deeply nested schema containing 65 experimental properties and 155 quantitative measurement nodes further exposes errors in process segmentation and numerical assignment. These results show that chemical canonicalization and targeted agentic verification provide complementary controls for converting complex materials literature into reusable, machine-actionable experimental knowledge.
- Abstract(参考訳): 材料文献には詳細な実験知識が含まれているが、プロセス固有の文脈に依存し、異質な形態で報告されるため、手順、化学物質、測定を集約することは困難である。
本稿では,SciKGExtractについて述べる。SciKGExtractは,大規模言語モデル抽出と化学正規化と,知識グラフ統合前のエージェントベース評価と改良を組み合わせた,スキーマ誘導型フレームワークである。
酸化亜鉛 (ZnO) および酸化インジウム-ガリウム-亜鉛 (IGZO) を主成分とする176個の原子層成膜紙と, 専門家によるフルスキーマサブセットについて検討した。
PubChem正規化は、テストされたモデル毎の正確なマッチング抽出F1を改善する。
ZnOでは, 直接正規化抽出では0.591から, エージェント精製では0.805に, IGZOでは0.344に増加し, 多成分スーパーサイクルプロセスの難易度が向上した。
65の実験的特性と155の定量的な測定ノードを含む深くネストされたスキーマに対する評価は、プロセスセグメンテーションおよび数値割り当てにおけるエラーをさらに露呈する。
これらの結果から, 化学正準化と目的エージェント検証は, 複雑な資料を再利用可能な機械操作可能な実験知識に変換するための相補的制御を提供することを示した。
関連論文リスト
- DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents [77.19284650368924]
大規模できめ細かい有機反応データプラットフォームであるDianShi-RxnDBについて述べる。
完全に自動化された抽出と正規化パイプラインを通じて構築される。
このプラットフォームは、検索、フィルタリング、比較、およびソース検証レコードのためのWebリサーチワークベンチを提供する。
論文 参考訳(メタデータ) (2026-09-06T16:20:43Z) - Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent [14.26731930385033]
核磁気共鳴分光法は分子構造解明の金標準である。
データベース検索は、新しい足場を特定できない。
本稿では,大規模言語モデルを用いたNMRAgentについて述べる。
論文 参考訳(メタデータ) (2026-06-29T04:38:01Z) - Reactivity-Informed Machine Learning for Performance Prediction and Design Space Exploration of Alkali-Activated Slag [0.0]
これまでで最大の文献由来のアルカリ活性スラグデータセットをキュレートした。
3100以上の強度記録、155個の化学的に区別された破砕炉スラグと、前駆体化学、微細度、反応性を組み込んだ24の属性を含む。
論文 参考訳(メタデータ) (2026-06-04T23:04:54Z) - AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature [55.66036140125613]
本稿では,化学工学論文から触媒反応データを抽出し,解析する大規模言語モデル (LLM) エージェントであるAgentCATを提案する。
AgentCATは、化学工学分野における長年のデータボトルネックを克服する代替手段として機能する。
論文 参考訳(メタデータ) (2026-02-10T04:30:11Z) - ChemActor: Enhancing Automated Extraction of Chemical Synthesis Actions with LLM-Generated Data [53.78763789036172]
ケミカルエグゼキュータとして完全微調整された大規模言語モデル(LLM)であるChemActorを紹介し,非構造化実験手順と構造化動作シーケンスを変換する。
このフレームワークは、分散分散に基づくデータ選択モジュールと汎用LLMを統合し、単一の分子入力からマシン実行可能なアクションを生成する。
反応記述(R2D)と記述記述処理(D2A)のタスクの実験により、ChemActorは最先端のパフォーマンスを達成し、ベースラインモデルよりも10%高い性能を示した。
論文 参考訳(メタデータ) (2025-06-30T05:11:19Z) - EnzChemRED, a rich enzyme chemistry relation extraction dataset [3.6124226106001]
EnzChemREDは1,210名の専門家によるPubMed抽象体から構成され、そこでは酵素と触媒する化学反応がアノテートされる。
EnzChemREDを用いた微調整済み言語モデルは、テキスト中のタンパク質や化学物質の言及を識別する能力を著しく向上させることができることを示す。
本稿では,EnzChemREDを微調整して,テキストから知識を抽出するエンド・ツー・エンド・エンドのパイプラインを作成する。
論文 参考訳(メタデータ) (2024-04-22T14:18:34Z) - OpenChemIE: An Information Extraction Toolkit For Chemistry Literature [37.23189665773341]
OpenChemIEは化学文献から反応データを抽出するツールである。
我々は、化学情報抽出の特定のタスクに対処する専門的なニューラルモデルを採用する。
我々は、パイプライン全体を評価するために、Rグループによる反応スキームの挑戦的なデータセットを慎重に注釈付けする。
論文 参考訳(メタデータ) (2024-04-01T20:16:21Z) - ChemMiner: A Large Language Model Agent System for Chemical Literature Data Mining [56.15126714863963]
ChemMinerは、文学から化学データを抽出するエンドツーエンドのフレームワークである。
ChemMinerには、コア参照マッピングのためのテキスト分析エージェント、非テキスト情報抽出のためのマルチモーダルエージェント、データ生成のための合成分析エージェントの3つの特殊エージェントが組み込まれている。
実験の結果,ヒト化学者に匹敵する反応同定率を示すとともに,高い精度,リコール,F1スコアで処理時間を著しく短縮した。
論文 参考訳(メタデータ) (2024-02-20T13:21:46Z) - Extracting Structured Seed-Mediated Gold Nanorod Growth Procedures from
Literature with GPT-3 [52.59930033705221]
1,137枚の紙から抽出した11,644個のエンティティのデータセットを作成した。
1,137枚の紙から抽出した11,644個のエンティティのデータセットを作成した。
論文 参考訳(メタデータ) (2023-04-26T22:21:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。