論文の概要: ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures
- arxiv url: http://arxiv.org/abs/2607.26848v1
- Date: Wed, 29 Jul 2026 12:35:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.666588
- Title: ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures
- Title(参考訳): ICDAR 2026 原子層堆積・エッチング(ALD/E)科学図からの情報抽出に関するコンペティション
- Authors: Fahad Ahmed, Sören Auer, Jennifer D'Souza,
- Abstract要約: 最先端のマルチモーダルモデルは、分類と要約タスクでうまく機能するが、データ抽出と科学的推論に苦労する。
これらの発見は、ドメイン対応マルチモーダルAIシステムを改善するための重要な制限と課題と機会を明らかにしている。
全体として、Sci-ImageMinerベンチマークとコンペティションは、科学的図形理解と推論の研究を進めるための厳格なプラットフォームを確立している。
- 参考スコア(独自算出の注目度): 3.285768608836696
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Scientific figure comprehension and reasoning using multimodal AI requires integrating visual perception with domain-specific reasoning to extract meaningful knowledge, often not presented in the text of a research publication. The Sci-ImageMiner benchmark dataset, accompanied by a community-driven competition, raises the bar over prior scientific competitions by curating a comprehensive, expert-annotated dataset across four end-to-end complementary tasks. The competition attracted 68 active participants and 1,263 public/private submissions from 9th January 2026 to 8th April 2026. Our results show that state-of-the-art multimodal models perform well on classification and summarization tasks but struggle with data extraction and scientific reasoning, particularly in visual question-answering. These findings reveal key limitations and highlight challenges and opportunities for improving domain-aware multimodal AI systems. Overall, the Sci-ImageMiner benchmark and competition establish a rigorous platform for advancing research in scientific figure comprehension and reasoning and demonstrate the potential of state-of-the-art approaches for a challenging and complex research area.
- Abstract(参考訳): マルチモーダルAIを用いた科学的フィギュア理解と推論は、しばしば研究論文のテキストに示されていない有意義な知識を抽出するために、視覚知覚とドメイン固有の推論を統合する必要がある。
Sci-ImageMinerベンチマークデータセットには、コミュニティ主導のコンペティションが伴い、4つのエンドツーエンド補完タスクにまたがる包括的な専門家アノテートデータセットをキュレーションすることで、以前の科学コンペティションよりも優位性を高めている。
2026年1月9日から4月8日までに68人の参加者と1,263人の公募が行われた。
以上の結果から,現状のマルチモーダルモデルでは分類や要約作業は良好だが,データ抽出や科学的推論,特に視覚的質問応答に苦慮していることが明らかとなった。
これらの発見は、ドメイン対応マルチモーダルAIシステムを改善するための重要な制限と課題と機会を明らかにしている。
全体として、Sci-ImageMinerベンチマークとコンペティションは、科学的フィギュア理解と推論の研究を進めるための厳格なプラットフォームを確立し、挑戦的で複雑な研究領域に対する最先端のアプローチの可能性を示す。
関連論文リスト
- A Data-Driven Analysis for Engineering Conferences: The Institute of Industrial and Systems Engineering (IISE) Annual Conference Proceedings (2002-2025) [0.0]
本稿では,2002年から2025年までのIISE手順の計算解析について述べる。
我々は、テーマの進化を、支配的、新興、そして後退する研究トピックを特定するためにマッピングする。
この発見は分野の知的資産を照らし、ISEの将来を導くためのデータインフォームドマップを提供する。
論文 参考訳(メタデータ) (2026-02-28T01:10:46Z) - Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows [203.3527268311731]
PIM(Practical Inquiry Model)に基づく運用SGI定義を提案する。
深層研究、アイデア生成、ドライ/ウェット実験、実験推論の4つのタスクを通じて運用しています。
私たちのPIMによる定義、ワークフロー中心のベンチマーク、実証的な洞察は、真に科学的な発見に参加するAIシステムの基盤を確立します。
論文 参考訳(メタデータ) (2025-12-18T12:44:36Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - Benchmarking Robustness and Generalization in Multi-Agent Systems: A
Case Study on Neural MMO [50.58083807719749]
IJCAI 2022で開催されている第2回Neural MMOチャレンジの結果を報告する。
この競合はマルチエージェントシステムの堅牢性と一般化をターゲットにしている。
環境ラッパー、ベースライン、可視化ツール、そしてさらなる研究のための選択されたポリシーを含むベンチマークをオープンソースにします。
論文 参考訳(メタデータ) (2023-08-30T07:16:11Z) - ICDAR 2023 Competition on Hierarchical Text Detection and Recognition [60.68100769639923]
このコンペティションは、テキストの検出と認識を共同で行うディープラーニングモデルとシステムの研究を促進することを目的としている。
提案するコンペティション組織の詳細について,タスク,データセット,評価,スケジュールなどを紹介する。
大会期間中(2023年1月2日から2023年4月1日まで)、20チーム以上から少なくとも50人が提案された2つのタスクで応募された。
論文 参考訳(メタデータ) (2023-05-16T18:56:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。