論文の概要: DiagramBank: A Large-scale Dataset of Diagram Design Exemplars with Paper Metadata for Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2604.20857v1
- Date: Sat, 28 Feb 2026 04:17:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-04 02:32:14.117861
- Title: DiagramBank: A Large-scale Dataset of Diagram Design Exemplars with Paper Metadata for Retrieval-Augmented Generation
- Title(参考訳): DiagramBank: 大規模ダイアグラム設計実践者のデータベース
- Authors: Tingwen Zhang, Ling Yue, Zhen Xu, Shaowu Pan,
- Abstract要約: 89,422の図からなる大規模データセットであるDiagramBankについて紹介する。
DiagramBankは私たちの自動キュレーションパイプラインを通じて開発され、数字と対応するテキスト内参照を抽出します。
我々はダイアグラムバンクをインデクシング可能な形式でリリースし、ティーザーフィギュアの模範条件による合成を実証するための検索拡張世代を提供する。
- 参考スコア(独自算出の注目度): 4.248969416909163
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in autonomous ``AI scientist'' systems have demonstrated the ability to automatically write scientific manuscripts and codes with execution. However, producing a publication-grade scientific diagram (e.g., teaser figure) is still a major bottleneck in the ``end-to-end'' paper generation process. For example, a teaser figure acts as a strategic visual interface and serves a different purpose than derivative data plots. It demands conceptual synthesis and planning to translate complex logic workflow into a compelling graphic that guides intuition and sparks curiosity. Existing AI scientist systems usually omit this component or fall back to an inferior alternative. To bridge this gap, we present DiagramBank, a large-scale dataset consisting of 89,422 schematic diagrams curated from existing top-tier scientific publications, designed for multimodal retrieval and exemplar-driven scientific figure generation. DiagramBank is developed through our automated curation pipeline that extracts figures and corresponding in-text references, and uses a CLIP-based filter to differentiate schematic diagrams from standard plots or natural images. Each instance is paired with rich context from abstract, caption, to figure-reference pairs, enabling information retrieval under different query granularities. We release DiagramBank in a ready-to-index format and provide a retrieval-augmented generation codebase to demonstrate exemplar-conditioned synthesis of teaser figures. DiagramBank is publicly available at https://huggingface.co/datasets/zhangt20/DiagramBank with code at https://github.com/csml-rpi/DiagramBank.
- Abstract(参考訳): 自律型「AI科学者」システムの最近の進歩は、実行とともに科学的な写本やコードを自動的に書ける能力を示している。
しかし、出版段階の科学図(例えば、ティーザー図)を作成することは、 'end-to-end' 紙生成プロセスにおいて依然として大きなボトルネックとなっている。
例えば、ティーザーフィギュアは戦略的視覚インターフェースとして機能し、派生データプロットとは異なる目的を果たす。
それは概念的な合成と計画を必要とし、複雑な論理ワークフローを直感を導き、好奇心を喚起する説得力のあるグラフィックに変換する。
既存のAI科学者システムは、通常、このコンポーネントを省略するか、劣った選択肢に戻す。
このギャップを埋めるために、DiagramBankは89,422のスキーマ図からなる大規模なデータセットで、既存のトップレベルの科学出版物からキュレートされ、マルチモーダル検索と典型的な科学的人物生成のために設計されている。
DiagramBankは、図と対応するテキストの参照を抽出する自動キュレーションパイプラインを通じて開発され、CLIPベースのフィルタを使用して、標準的なプロットや自然画像とスキーマ図を区別します。
各インスタンスは、抽象的、キャプションから図形参照のペアまで、リッチなコンテキストとペアリングされ、クエリの粒度の異なる情報検索が可能になる。
我々はダイアグラムバンクをインデクシング可能なフォーマットでリリースし、ティーザーフィギュアの模範条件による合成を実証するための検索拡張された生成コードベースを提供する。
DiagramBankはhttps://huggingface.co/datasets/zhangt20/DiagramBankで公開されており、コードもhttps://github.com/csml-rpi/DiagramBankで公開されている。
関連論文リスト
- Multi-Agent GraphRAG: A Text-to-Cypher Framework for Labeled Property Graphs [7.943264761730892]
Multi-Agent GraphRAGはLPGベースのグラフデータに対する自然言語インタフェースとして機能する。
繰り返しコンテンツ認識の修正と正規化は、集約されたフィードバックループによって強化され、生成されたクエリのセマンティックおよび構文的改善の両方を保証する。
このことは、このようなアプローチがAIを大規模に現実世界のアプリケーションにブリッジする方法を強調し、産業用デジタル自動化のユースケースを可能にしている。
論文 参考訳(メタデータ) (2025-11-11T14:04:00Z) - RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning [51.393018266721576]
化学反応図解析(RxnDP)のためのRxnCaptionフレームワークを提案する。
本フレームワークは,従来の座標予測による解析処理を画像キャプション問題に再構成する。
我々は,BBox and Index as Visual Prompt (BIVP) という,最先端の分子検出器である MolYOLO を用いて,分子境界ボックスやインデックスを直接入力画像上に描画する戦略を紹介した。
論文 参考訳(メタデータ) (2025-11-04T09:08:44Z) - ChartMaster: Advancing Chart-to-Code Generation with Real-World Charts and Chart Similarity Reinforcement Learning [64.4193334712998]
チャートからコードへの生成タスクでは、チャートイメージを実行可能なコードに変換するMLLMが必要である。
このタスクは、データ多様性の制限と、生成されたチャートと元のチャートの間の視覚的一貫性を維持することの難しさという、2つの大きな課題に直面する。
本稿では,arXiv論文から抽出した実世界の人間設計チャートをプロンプトとして活用するReChartPromptを提案する。
また,GRPOに基づく強化学習アルゴリズムであるChartSimRLを提案する。
論文 参考訳(メタデータ) (2025-08-25T02:32:56Z) - SciDoc2Diagrammer-MAF: Towards Generation of Scientific Diagrams from Documents guided by Multi-Aspect Feedback Refinement [22.07623299712134]
本稿では,学術論文から関連情報を抽出し,図を生成するSciDoc2Diagramを提案する。
中間コード生成を用いたユーザ意図に基づく図を生成するパイプラインSciDoc2Diagrammerを開発した。
論文 参考訳(メタデータ) (2024-09-28T05:10:39Z) - DiagrammerGPT: Generating Open-Domain, Open-Platform Diagrams via LLM Planning [62.51232333352754]
テキスト・ツー・イメージ(T2I)世代はここ数年で著しい成長を遂げている。
それにもかかわらず、T2Iモデルでダイアグラムを生成する作業はほとんど行われていない。
本稿では,新しい2段階のテキスト・ツー・ダイアグラム生成フレームワークであるDiagrammerGPTを紹介する。
我々のフレームワークは、既存のT2Iモデルを上回る精度で、より正確なダイアグラムを生成する。
論文 参考訳(メタデータ) (2023-10-18T17:37:10Z) - A Robust Stacking Framework for Training Deep Graph Models with
Multifaceted Node Features [61.92791503017341]
数値ノード特徴とグラフ構造を入力とするグラフニューラルネットワーク(GNN)は,グラフデータを用いた各種教師付き学習タスクにおいて,優れた性能を示した。
IID(non-graph)データをGNNに簡単に組み込むことはできない。
本稿では、グラフ認識の伝播をIDデータに意図した任意のモデルで融合するロバストな積み重ねフレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-16T22:46:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。