Fugu-MT 論文翻訳(概要): Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy

論文の概要: Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy

arxiv url: http://arxiv.org/abs/2606.00065v1
Date: Tue, 19 May 2026 23:55:19 GMT
ステータス: 翻訳完了
システム内更新日: 2026-06-07 20:42:22.536976
Title: Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy
Title（参考訳）: テキストとテーブルを超えて: 高精度な科学的図形から資料データを抽出するComProScannerにおける視覚言語モデルの統合
Authors: Aritra Roy, Enrico Grisan, Chiara Gattinoni, John Buckeridge,
Abstract要約: ComProScannerは、自動コンポジションプロパティデータベース構築のためのエンドツーエンドフレームワークである。 VLMを統合したComProScannerは、材料に特化した、完全に自動化された、マルチモーダルな文献採掘プラットフォームである。
参考スコア（独自算出の注目度）: 0.2447206672789868
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Automated extraction of materials composition-property data from scientific literature has advanced considerably with the development of large language model-based pipelines; however, existing frameworks remain limited to textual and tabular content, overlooking the substantial proportion of quantitative property data reported exclusively in scientific figures. Here, we extend ComProScanner, a fully end-to-end multi-agent framework for automated composition-property database construction, with a native vision-language model (VLM) based figure extraction capability. The extension introduces a FigureExtractor utility for caption-keyword-based figure filtering across all supported publishers, and a GraphExtractorTool agent that passes extracted figures to a configurable VLM to recover composition-property pairs from scientific charts and plots. Four VLMs are selected for evaluation on the basis of the LMArena Diagram leaderboard with an input cost criterion of less than \$1.50 per million tokens. Benchmarking on 50 piezoelectric ceramic articles from the established $d_{33}$ test corpus demonstrates that Gemini-3-Flash-Preview achieves the highest performance with a composition accuracy of 0.97 and a normalised F1 score of 0.97, whilst remaining the most cost-effective model among the four evaluated. We additionally introduce a range-based value error threshold parameter into the evaluation framework, providing a more physically meaningful assessment of numeric property values extracted from figures than exact value matching. These contributions establish VLM-integrated ComProScanner as the first materials-specific, fully automated, multimodal literature mining platform capable of extracting structured composition-property data from text, tables, and figures within a single unified pipeline.
Abstract（参考訳）: 大規模言語モデルに基づくパイプラインの発達に伴い, 学術文献からの材料組成不適切データの自動抽出が著しく進んでいるが, 既存のフレームワークは, 学術文献にのみ報告される量的財産データのかなりの割合を見越して, テキストコンテンツと表象コンテンツに限られている。本稿では,ComProScannerの拡張について述べる。ComProScannerは自動合成・プロパティデータベース構築のための完全なエンドツーエンドのマルチエージェントフレームワークであり,ネイティブビジョン言語モデル(VLM)に基づく図形抽出機能を備えている。この拡張では、サポートするすべてのパブリッシャーでキャプションキーワードベースのフィギュアフィルタリングを行うFinalExtractorユーティリティと、抽出されたフィギュアを構成可能なVLMに渡すGraphExtractorToolエージェントを導入し、科学チャートやプロットから合成-プロパティペアを復元する。 LMArena Diagramのリーダーボードに基づいて4つのVLMが選択され、入力コスト基準は1.50万トークン未満である。確立された$d_{33}$テストコーパスから50個の圧電セラミックス物品をベンチマークした結果,Gemini-3-Flash-Previewは合成精度0.97,正規化F1スコア0.97で最高性能を達成し,評価された4つの中で最もコスト効率の良いモデルを維持した。さらに、評価フレームワークに範囲ベースの値誤差閾値パラメータを導入し、正確な値マッチングよりも数字から抽出した数値特性値について、より物理的に意味のある評価を行う。これらの貢献により、VLM統合されたComProScannerは、単一の統一パイプライン内のテキスト、テーブル、図形から構造化された合成プロパティデータを抽出できる、最初の材料特異的で完全に自動化されたマルチモーダルな文献マイニングプラットフォームとして確立される。

関連論文リスト

ComProScanner: A multi-agent based framework for composition-property structured data extraction from scientific literature [0.2447206672789868]
ComProScannerは、化学組成や性質の抽出、検証、分類、可視化を容易にする、自律的なマルチエージェントプラットフォームである。オープンソースとプロプライエタリの両方のモデルを含む10の異なるLCMに対して,100のジャーナル記事を用いたフレームワークの評価を行った。 DeepSeek-V3-0324は全てのモデルで0.82の精度で性能を上げた。
論文参考訳（メタデータ） (2025-10-23T09:01:44Z)
Text to Band Gap: Pre-trained Language Models as Encoders for Semiconductor Band Gap Prediction [9.325818199739759]
本稿では,半導体材料のバンドギャップを予測するために,RoBERTa,T5,Llama-3,MatSciBERTなどのトランスフォーマーベース言語モデルについて検討する。入力は、化学組成、結晶系、空間群、その他の構造的および電子的性質などの重要な材料特性を符号化する。
論文参考訳（メタデータ） (2025-01-07T00:56:26Z)
MatViX: Multimodal Information Extraction from Visually Rich Articles [6.349779979863784]
材料科学では、研究論文から構造化情報を抽出することで、新しい素材の発見を加速することができる。 textscMatViXは、324ドルのフル長の調査記事と1688ドルの複雑な構造化ファイルからなるベンチマークです。これらのファイルは、テキスト、テーブル、フィギュアからフル長の文書から抽出され、MIEにとって包括的な課題となる。
論文参考訳（メタデータ） (2024-10-27T16:13:58Z)
Towards Enhancing Coherence in Extractive Summarization: Dataset and Experiments with LLMs [70.15262704746378]
我々は,5つの公開データセットと自然言語ユーザフィードバックのためのコヒーレントな要約からなる,体系的に作成された人間アノテーションデータセットを提案する。 Falcon-40BとLlama-2-13Bによる予備的な実験では、コヒーレントなサマリーを生成するという点で大幅な性能向上(10%ルージュ-L)が見られた。
論文参考訳（メタデータ） (2024-07-05T20:25:04Z)
Text2Topic: Multi-Label Text Classification System for Efficient Topic Detection in User Generated Content with Zero-Shot Capabilities [2.7311827519141363]
マルチラベル分類性能の高いText to Topic(Text2Topic)を提案する。 Text2Topicはゼロショット予測をサポートし、ドメイン固有のテキスト埋め込みを生成し、プロダクションスケールのバッチ推論を可能にする。このモデルは現実世界のストリーム処理プラットフォームにデプロイされ、92.9%のマイクロmAPで他のモデルより優れている。
論文参考訳（メタデータ） (2023-10-23T11:33:24Z)
ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value Extraction [51.87391234815163]
電子商取引プラットフォームは、属性と値のペアという形で構造化された製品データを必要とする。 BERTベースの抽出法では,タスク固有の大量のトレーニングデータを必要とする。本稿では,大規模言語モデル (LLM) を,より訓練的かつ堅牢な代替手段として活用することを検討する。
論文参考訳（メタデータ） (2023-10-19T07:39:00Z)
MultiSChuBERT: Effective Multimodal Fusion for Scholarly Document Quality Prediction [2.900522306460408]
マルチモーダリティは学術文書品質予測タスクの性能を向上させることが示されている。マルチモーダル予測モデルであるMultiSChuBERTを提案する。視覚的サブモデルの重みの段階的凍結は、そのデータに適合する傾向を減少させることを示す。
論文参考訳（メタデータ） (2023-08-15T18:18:34Z)
Zero-shot Composed Text-Image Retrieval [72.43790281036584]
合成画像検索(CIR)の問題点を考察する。テキストや画像などのマルチモーダル情報を融合し、クエリにマッチする画像を正確に検索し、ユーザの表現能力を拡張できるモデルをトレーニングすることを目的としている。
論文参考訳（メタデータ） (2023-06-12T17:56:01Z)
Revisiting the Evaluation of Image Synthesis with GANs [55.72247435112475]
本研究では, 合成性能の評価に関する実証的研究を行い, 生成モデルの代表としてGAN(Generative Adversarial Network)を用いた。特に、表現空間におけるデータポイントの表現方法、選択したサンプルを用いた公平距離の計算方法、各集合から使用可能なインスタンス数など、さまざまな要素の詳細な分析を行う。
論文参考訳（メタデータ） (2023-04-04T17:54:32Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。