論文の概要: SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
- arxiv url: http://arxiv.org/abs/2606.30124v1
- Date: Mon, 29 Jun 2026 10:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.199385
- Title: SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
- Title(参考訳): SciIR:科学画像推論生成のための大規模トレーニングデータセットとベンチマーク
- Authors: Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou,
- Abstract要約: 我々は科学画像生成の訓練と評価のための総合的なリソースであるSciIR(SciIR)を紹介する。
SciIR-82kは、最先端の出版物から8万以上の高品質の科学画像テキストペアを含む大規模なデータセットである。
評価のために,SciIR-Benchを提案する。SciIR-Benchは,これら3つのセミオティックレベルに整合し,結果指向の科学的精度をプロセス指向の,検証可能な,きめ細かい質問に変換するためのアトミックチェックリストを使用している。
- 参考スコア(独自算出の注目度): 20.904891491567664
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Text-to-Image (T2I) models have shown remarkable success in generating photorealistic visual content, they still struggle with the rigorous semantic alignment and logical reasoning required for scientific imagery. Inspired by Peirce's Semiotic Triad, we introduce Scientific Image Reasoning (SciIR), a comprehensive resource for training and evaluation of scientific image generation. We formalize scientific reasoning into three core dimensions: Entity Structure (Icon), Scientific Process (Index), and Scientific Law (Symbol). Specifically, to overcome the scarcity of training data in scientific image generation, we elaborately create SciIR-82k, a large-scale dataset containing over 80,000 high-quality scientific image-text pairs from cutting-edge publications. The dataset is hierarchically organized according to the semiotic dimensions and incorporates a Scientific Reasoning Chain-of-Thought (Sci-RCoT) to explicitly model underlying visual logic. For evaluation, we propose SciIR-Bench, which aligns with these three semiotic levels and employs an Atomic Checklist to convert the outcome-oriented scientific accuracy into process-oriented, verifiable, fine-grained questions. Our extensive experiments reveal significant deficiencies in current models' scientific reasoning capabilities. Furthermore, by fine-tuning on the SciIR-82k dataset, we developed the Qwen-Image-SciIR model, which achieves a substantial improvement on the SciIR-Bench, increasing the final score from 35\% to 43\%, laying a solid foundation for future advances in scientific image generation.
- Abstract(参考訳): テキスト・トゥ・イメージ(T2I)モデルは、フォトリアリスティックな視覚コンテンツを生成することに顕著な成功を収めている一方で、科学的画像に必要な厳密なセマンティックアライメントと論理的推論に苦慮している。
パースのセミオティックトライアドにインスパイアされた我々は、科学画像生成のトレーニングと評価のための総合的なリソースであるSciIR(SciIR)を紹介した。
我々は、科学的推論を、エンティティ構造(Icon)、科学プロセス(Index)、科学法(Symbol)の3つの中核次元に定式化する。
具体的には、科学画像生成におけるトレーニングデータの不足を克服するために、最先端の出版物から8万以上の高品質の科学画像テキストペアを含む大規模データセットであるSciIR-82kを精巧に作成する。
データセットは、セミオティック次元に従って階層的に整理され、基礎となるビジュアルロジックを明示的にモデル化するためにSci-RCoT(Sci-RCoT)が組み込まれている。
評価のために,SciIR-Benchを提案する。SciIR-Benchは,これら3つのセミオティックレベルに整合し,結果指向の科学的精度をプロセス指向の,検証可能な,きめ細かい質問に変換するためのアトミックチェックリストを使用している。
我々の広範な実験により、現在のモデルの科学的推論能力に重大な欠陥が明らかとなった。
さらに,SciIR-82kデータセットの微調整により,SciIR-Benchを大幅に改善したQwen-Image-SciIRモデルを開発した。
関連論文リスト
- S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing [25.725824689793402]
本稿では,科学画像の理解,生成,編集のためのオープンウェイト統一マルチモーダルモデルを提案する。
S1-Omni-Imageは、バックボーンS1-VL-32Bの科学的なマルチモーダル推論に基づいている。
統一されたフレームワークで、科学的な画像理解、生成、編集をサポートする。
論文 参考訳(メタデータ) (2026-06-23T11:19:34Z) - Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models [49.93401412148884]
FEPBenchは、慎重に選択された高品質な科学イラストから構築されたベンチマークである。
我々は,T2Iモデルについて,命令忠実度,推論エンリッチメント,意味的精度の3つの次元に沿って評価する。
その結果、GPT Image 2やNano Banana Proのような最先端のクローズドソースモデルでさえ、テキストレンダリングのボトルネック、推論のリッチ化の制限、生成のリッチネスと精度のバランスの難しさに悩まされていることがわかった。
論文 参考訳(メタデータ) (2026-06-04T09:49:02Z) - Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility [57.83550091882176]
生成パラダイム,評価,下流利用における科学的画像合成について検討する。
本稿では,情報の有用性と論理的妥当性に基づいて生成した画像を評価するSciGenBenchを紹介する。
厳密に検証された合成科学画像上の微調整された大規模マルチモーダルモデルにより、一貫した推論ゲインが得られることを示す。
論文 参考訳(メタデータ) (2026-01-17T14:18:36Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model [21.81341169834812]
SridBenchは、科学フィギュア生成のための最初のベンチマークである。
これは13の自然科学とコンピュータ科学の分野にわたる主要な科学論文から1,120の事例で構成されている。
その結果、GPT-4o画像のような最上位モデルでさえ、人間のパフォーマンスに遅れがあることが判明した。
論文 参考訳(メタデータ) (2025-05-28T08:51:01Z) - Science-T2I: Addressing Scientific Illusions in Image Synthesis [29.376938884546764]
そこで,Science-T2Iは,9kプロンプトを持つ20k画像対からなる,エキスパートアノテートされた敵対的データセットである。
我々は、科学的知識に基づいて生成された画像の評価を洗練させるエンドツーエンド報酬モデルであるSciScoreを提案する。
論文 参考訳(メタデータ) (2025-04-17T17:44:19Z) - SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models [57.96527452844273]
我々はSciInstructを紹介した。SciInstructは、大学レベルの科学的推論が可能な科学言語モデルを訓練するための科学指導スイートである。
我々は、物理学、化学、数学、公式な証明を含む多種多様な高品質なデータセットをキュレートした。
SciInstructの有効性を検証するため、SciInstruct、すなわちChatGLM3(6Bと32B)、Llama3-8B-Instruct、Mistral-7B: MetaMathを用いて言語モデルを微調整した。
論文 参考訳(メタデータ) (2024-01-15T20:22:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。