論文の概要: SciFigure2Code: An AI-Reconstructed Benchmark for Scientific Figure-to-Code
- arxiv url: http://arxiv.org/abs/2609.08155v1
- Date: Tue, 08 Sep 2026 02:39:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:27:11.688816
- Title: SciFigure2Code: An AI-Reconstructed Benchmark for Scientific Figure-to-Code
- Title(参考訳): SciFigure2Code: 科学的フィギュア・トゥ・コードのためのAI再構成ベンチマーク
- Abstract要約: SciFigure2Codeは、プレゼンテーションリカバリを評価するAI再構成ベンチマークである。
科学パネルの配置や読み方を保存するPythonプログラムを生成する。
その結果得られたリソースには、6,740個のレビューパネルとバランスの取れた337パネルテストセットであるSciFigureBenchが含まれている。
- 参考スコア(独自算出の注目度): 8.228994604154646
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Scientific figures are the interface through which research claims are inspected and reused, but final published panels rarely expose the data or plotting code that produced them. Recovering this hidden provenance from pixels is therefore underdetermined. We introduce SciFigure2Code, an AI-reconstructed benchmark that instead evaluates presentation recovery: generating editable Python programs that preserve how a scientific panel is arranged and read. Role-specialized Codex agents generate, execute, visually refine, and audit silver-standard presentation programs that capture geometry, visual hierarchy, encodings, annotations, and typography without claiming to recover original measurements or author source code. This reconstruction-and-audit protocol turns final published panels into auditable reference packages; the resulting resource contains 6,740 reviewed panels and SciFigureBench, a balanced 337-panel test set across 31 chart subtypes, five domains, and three complexity levels. Across 14 zero-shot models in image-only and caption-assisted settings, execution, multi-component layouts, axes, legends, and scientific labels remain weak. Claude Opus 4.7 achieves the highest image-only Overall score, Claude Opus 4.6 leads caption-assisted reconstruction, and two-stage plan-then-code prompting improves Overall for all four tested models. SciFigure2Code provides an auditable testbed for agents that construct editable, visually faithful scientific figure presentations.
- Abstract(参考訳): 科学的な数字は、研究のクレームを検査して再利用するインターフェースであるが、最終的な公表されたパネルは、データを公開するか、それを生成したコードをプロットすることは滅多にない。
したがって、この隠された前駆体をピクセルから取り除くことは過小評価される。
我々はSciFigure2Codeを紹介した。これはAI再構成されたベンチマークで、代わりにプレゼンテーションのリカバリを評価する。
ロールスペシャライズされたコーデックスエージェントは、オリジナルの測定や著者のソースコードの復元を主張することなく、幾何学、視覚的階層、エンコーディング、アノテーション、タイポグラフィーをキャプチャする銀標準のプレゼンテーションプログラムを作成し、実行し、視覚的に洗練し、監査する。
6,740のレビューパネルとSciFigureBenchが含まれており、31のチャートサブタイプ、5つのドメイン、5つの複雑さレベルからなるバランスのとれた337パネルのテストセットである。
画像専用およびキャプション支援設定、実行、複数コンポーネントレイアウト、軸、伝説、科学ラベルの14のゼロショットモデルが依然として弱いままである。
Claude Opus 4.7は画像のみの総合スコアが最も高く、Claude Opus 4.6はキャプションアシストの再構築をリードし、2段階の計画コードプロンプトは4つのテストモデル全体で改善されている。
SciFigure2Codeは、編集可能で視覚的に忠実な科学的フィギュアプレゼンテーションを構成するエージェントのための監査可能なテストベッドを提供する。
関連論文リスト
- EdiTikZ: Scientific Figure Editing from Revision Trajectories [26.228378638070627]
391KのTikZ編集ペアをarXiv, GitHub, SEからマイニングすることで構築した,最初の大規模な科学的フィギュア編集データセットであるDaEdiTikZを紹介した。
また、790のインスタンスを持つ人間仕様のベンチマークであるDaEdiTikZ-Benchを導入し、2つのコンパクトQwen3.5ベースのEdiTikZモデルを再構築と編集を共同で学習することで訓練する。
論文 参考訳(メタデータ) (2026-09-01T15:29:52Z) - Figures as Programs: Recursive Generation of Editable Scientific Figures [79.78366479117878]
最近の画像生成モデルは、視覚的に魅力的な図形を合成することができるが、人間の満足な結果を生み出すことは、単一の生成段階において難しいままである。
textscFigTreeは、科学論文を構造化ベクトル図形に自動的に変換するテキストマルチエージェントシステムである。
レンダリングクリティカルリファインメントループは、レンダリングされたフィギュアとその基礎となるプログラムを共同で検査し、視覚的欠陥を特定のステートメントにトレースし、正確に修復することを可能にする。
論文 参考訳(メタデータ) (2026-09-01T09:53:47Z) - Benchmarking Frontier Text-to-Image Models on Image-Description Prompts [0.4078247440919473]
我々は,Hunyuan 3.0,Gemini 3 Pro Image(Nano Banana Pro),Black Forest Labs FLUX.2,Ideogram 3.0の4つの生産用テキスト・ツー・イメージシステムを評価した。
論文 参考訳(メタデータ) (2026-08-15T01:59:13Z) - Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ [18.407009909616598]
本稿では,科学的フィギュア編集タスクの総合的なベンチマークであるEdit2TikZを紹介する。
14のメインストリームMLLMを評価し,現在のシステムは信頼性が低いことを確認した。
我々は、TikZEditMixの混合学習セットを構築し、コンパクトモデルのための再構築編集カリキュラム学習を採用する。
論文 参考訳(メタデータ) (2026-08-13T16:27:18Z) - SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions [66.46898035008782]
SciDiagramEditは、自然論文の改訂から学習する、ベンチマークおよびスキル進化フレームワークである。
エージェント提案者は、複数のエポック上の実行トレースからエージェントのスキル仕様を継続的に洗練する。
得られたスキルは、保持された検証セットの編集精度を段階的に引き上げる。
論文 参考訳(メタデータ) (2026-07-16T17:58:36Z) - PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark [7.957250777212916]
テキストリッチな画像モデルは、現在、ポスタースケールのレイアウトを設計できますが、それらが科学的コミュニケーション契約を尊重するかどうかを測定する方法はありません。
本稿では、評価可能な指示追従タスクとして、監査可能なハーネスリフレーミングポスター生成であるPOSTERHARNESSを提案する。
論文 参考訳(メタデータ) (2026-07-03T06:39:56Z) - Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs [62.54193387399707]
我々は,学術的な図形から出版品質のイラストを自動生成するシステムを開発した。
Crafterは、アーキテクチャの変更なしにフィギュアタイプを一般化するマルチエージェントのハーネスフィギュア生成である。
CraftEditorは、出力を編集可能なSVGに変換する。
論文 参考訳(メタデータ) (2026-05-28T22:04:30Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code [49.610331036334316]
我々はNeRF研究論文をトレーニング可能なNerfstudioプラグインに確実に変換するフレームワークであるNERFIFYを紹介する。
コード、データ、実装が公開される。
論文 参考訳(メタデータ) (2026-02-28T20:57:32Z) - Charts Are Not Images: On the Challenges of Scientific Chart Editing [66.38730113476677]
textitFigEditは、3万以上のサンプルからなる科学的フィギュア編集のベンチマークである。
私たちのベンチマークでは、ピクセルレベルの操作の重大な制限が示されています。
textitFigEdit をリリースすることにより,構造対応図形編集の体系的な進歩の実現を目指す。
論文 参考訳(メタデータ) (2025-11-30T06:13:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。