論文の概要: From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding
- arxiv url: http://arxiv.org/abs/2609.00948v1
- Date: Tue, 01 Sep 2026 09:07:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.490676
- Title: From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding
- Title(参考訳): 用語からダイアグラムへ:科学ダイアグラム理解のためのビジュアルインストラクション生成
- Authors: Raul Ortega, José Manuel Gómez-Pérez,
- Abstract要約: 視覚言語モデル(VLM)は,自然画像を用いた視覚的質問応答において高い性能を示した。
本稿では,学術カリキュラムから派生した用語を活用することで,大規模図表基底命令データを生成するフレームワークを提案する。
SciGramは、194K以上の図と1.4Mの視覚的指示のデータセットで、生命、地球、物理科学を横断する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) have demonstrated strong performance in visual question answering with natural images. However, they continue to struggle with scientific diagrams, which are designed to convey functional or relational meaning rather than literal scenes. We therefore introduce a framework for generating large-scale diagram-grounded instruction data by leveraging terminology derived from scientific curricula. Our approach systematically extracts domain concepts, synthesizes atomic facts, retrieves relevant diagrams from the web, and generates multimodal supervision in the form of diagram captions and multiple-choice questions. Using this pipeline, we construct SciGram, a dataset of over 194K diagrams and 1.4M visual instructions across life, earth, and physical sciences. Despite relying on noisy web data and synthetic annotations, models fine-tuned on SciGram achieve substantial improvements on diagram-centric benchmarks, including TQA, ScienceQA, and AI2D, outperforming or matching state-of-the-art VLMs while using fewer training instances. Furthermore, augmenting existing models such as LLaVA OneVision with SciGram establishes new state-of-the-art performance on diagram question answering. Our results highlight the effectiveness of terminology-grounded instruction generation as a general strategy for improving vision-language reasoning in scientific domains. To support future research in scientific diagram understanding, we release both the SciGram dataset and models.
- Abstract(参考訳): 視覚言語モデル(VLM)は,自然画像を用いた視覚的質問応答において高い性能を示した。
しかし、彼らはリテラルシーンよりも機能的またはリレーショナルな意味を伝えるように設計された科学図に苦戦し続けている。
そこで本稿では,学術カリキュラムから派生した用語を活用して,大規模図表基底命令データを生成するフレームワークを提案する。
提案手法は,ドメイン概念を体系的に抽出し,アトミックな事実を合成し,Webから関連図を検索し,ダイアグラムキャプションや複数選択質問の形式でマルチモーダル監視を生成する。
このパイプラインを用いて、SciGramという194K以上の図と、生命、地球、物理科学を横断する1.4Mの視覚的指示のデータセットを構築します。
ノイズの多いWebデータと合成アノテーションに依存しているにも関わらず、SciGramに微調整されたモデルは、TQA、SciQA、AI2Dといったダイアグラム中心のベンチマークで大幅に改善され、より少ないトレーニングインスタンスを使用しながら、最先端のVLMのパフォーマンスや適合性が向上した。
さらに、LLaVA OneVisionのような既存のモデルをSciGramで拡張することで、ダイアグラム質問応答における新しい最先端のパフォーマンスが確立される。
本研究は,理科領域における視覚言語推論を改善するための一般的な戦略として,用語基底命令生成の有効性を強調した。
科学図理解における今後の研究を支援するため、SciGramデータセットとモデルの両方をリリースする。
関連論文リスト
- Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models [49.93401412148884]
FEPBenchは、慎重に選択された高品質な科学イラストから構築されたベンチマークである。
我々は,T2Iモデルについて,命令忠実度,推論エンリッチメント,意味的精度の3つの次元に沿って評価する。
その結果、GPT Image 2やNano Banana Proのような最先端のクローズドソースモデルでさえ、テキストレンダリングのボトルネック、推論のリッチ化の制限、生成のリッチネスと精度のバランスの難しさに悩まされていることがわかった。
論文 参考訳(メタデータ) (2026-06-04T09:49:02Z) - DiagramRAG: A Lightweight Framework to Retrieve Scientific Diagram for Figure Generation [9.701968199439387]
スケッチに基づく科学図作成のための軽量な検索拡張フレームワークであるDiagramRAGを紹介する。
ユーザスケッチが与えられたら、DiagramRAGは、スケッチの内容に意味的に関連し、その構造とトポロジ的に互換性のある参照ダイアグラムを検索する。
実験の結果,DigramRAG は DiagramBank と FigureBench でそれぞれ 0.848 と 0.802 の F1 スコアを獲得し,VLM-as-a-Judge スコア 7.170 で生成品質を向上させることがわかった。
論文 参考訳(メタデータ) (2026-05-27T04:03:22Z) - OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward [8.227370271724162]
ビジュアル・インターロゲーション・エフェクト・オール(textscViva)という新しい視覚フィードバック戦略を導入する。
textscVivaは、生成的アプローチを通じて描画された図形の視覚構造に報酬を与える。
最初の大規模図形コード生成データセットであるM3$2$Diagramを構築した。
論文 参考訳(メタデータ) (2026-04-07T07:10:24Z) - SciDoc2Diagrammer-MAF: Towards Generation of Scientific Diagrams from Documents guided by Multi-Aspect Feedback Refinement [22.07623299712134]
本稿では,学術論文から関連情報を抽出し,図を生成するSciDoc2Diagramを提案する。
中間コード生成を用いたユーザ意図に基づく図を生成するパイプラインSciDoc2Diagrammerを開発した。
論文 参考訳(メタデータ) (2024-09-28T05:10:39Z) - From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models [81.92098140232638]
シーングラフ生成(SGG)は、下流の推論タスクのための中間グラフ表現に視覚シーンを解析することを目的としている。
既存の手法は、新しい視覚的関係の概念を持つシーングラフを生成するのに苦労している。
シークエンス生成に基づく新しいオープン語彙SGGフレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-01T04:21:01Z) - RL-CSDia: Representation Learning of Computer Science Diagrams [25.66215925641988]
コンピュータサイエンスダイアグラム(csdia)という,図形図の新しいデータセットを構築する。
1200以上の図とオブジェクトと関係の完全なアノテーションを含んでいる。
図中の様々な表現に起因する視覚ノイズを考慮して,図形のトポロジーを導入し,位相構造を解析する。
論文 参考訳(メタデータ) (2021-03-10T07:01:07Z) - Object Relational Graph with Teacher-Recommended Learning for Video
Captioning [92.48299156867664]
本稿では,新しいモデルと効果的なトレーニング戦略の両方を含む完全なビデオキャプションシステムを提案する。
具体的には,オブジェクトリレーショナルグラフ(ORG)に基づくエンコーダを提案する。
一方,教師推薦学習(TRL)手法を設計し,成功した外部言語モデル(ELM)をフル活用し,豊富な言語知識をキャプションモデルに統合する。
論文 参考訳(メタデータ) (2020-02-26T15:34:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。