論文の概要: SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation
- arxiv url: http://arxiv.org/abs/2609.33399v2
- Date: Tue, 29 Sep 2026 03:03:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.664438
- Title: SciGen-Verifier: A Multimodal Reasoner for Explainable Verification in Scientific Image Generation
- Title(参考訳): SciGen-Verifier:科学画像生成における説明可能な検証のためのマルチモーダル推論器
- Abstract要約: 我々は、科学的画像生成、後続命令の分散化、多分野推論、世界知識ドメインの説明可能な検証のためのベンチマークを構築した。
我々は,冷間開始制御による微調整と,カリキュラムに基づく2段階強化学習パイプラインによる推論駆動型マルチモーダル検証を開発した。
SciGen-Verifyでは、SciGen-Verifierはより大規模なプロプライエタリモデルと競合するパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 17.596265927784746
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In realistic education, a solution is often expressed not only in words but in a drawing--a circuit, a geometric construction, a function plot--and a teacher must grade the drawing as carefully as the text. Recent advances in unified multimodal models have enabled scientific image generation, yet verifying the correctness of these specialized visual outputs remains a critical bottleneck: errors often arise from intricate domain knowledge, structural reasoning, and multi-step instruction rather than surface-level artifacts. Existing verifiers mainly target natural images and compress judgement into scalar scores, leaving scientific coverage and explainable feedback for error correction underexplored. To bridge this gap, we make three main contributions. (1) We construct SciGen-Verify, a benchmark dedicated to explainable verification of scientific image generation, spanning instruction following, multidisciplinary reasoning, and world knowledge domains. It contains a three-tier hierarchical protocol over the binary judgement, supporting explanation, and corrective editing instruction. (2) We develop SciGen-Verifier, a reasoning-driven multimodal verifier trained via cold-start supervised fine-tuning followed by a curriculum-based two-stage reinforcement learning pipeline. The rubric-guided process rewards first strengthen scientific reasoning exploration and outcome rewards subsequently align output with ground-truth annotation. (3) On SciGen-Verify, SciGen-Verifier achieves competitive performance against much larger proprietary models. It further serves as a practical online critic for iterative image rectification.
- Abstract(参考訳): 現実的な教育では、解は言葉だけでなく、回路、幾何学的構成、関数プロットなどでもしばしば表現される。
統合マルチモーダルモデルの最近の進歩により、科学的画像生成が可能になったが、これらの特殊な視覚出力の正確性を検証することは、依然として重大なボトルネックとなっている。
既存の検証者は、主に自然画像をターゲットにし、判断をスカラースコアに圧縮し、科学的カバレッジと説明可能な誤り訂正のためのフィードバックを残した。
このギャップを埋めるために、主な貢献は3つあります。
1)SciGen-Verifyは、科学画像生成、後続命令、多分野推論、世界知識領域の検証が可能なベンチマークである。
バイナリ判断に関する3層階層プロトコル、説明のサポート、修正編集命令を含んでいる。
2) SciGen-Verifierは, 冷間開始制御による微調整と, カリキュラムベースの2段階強化学習パイプラインによって訓練された, 推論駆動型マルチモーダル検証器である。
ルーリック誘導プロセスの報酬はまず科学的推論の探索を強化し、結果の報酬はその後、出力を地味なアノテーションと整合させる。
(3) SciGen-Verifyでは、SciGen-Verifierはより大規模なプロプライエタリモデルと競合する性能を達成する。
さらに、反復的な画像修正の実践的なオンライン批評家としての役割も果たした。
関連論文リスト
- DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing [65.66783293569955]
本稿では,テキスト・ツー・イメージ生成と画像編集をサポートする100万規模のデータセットであるDisciplineGen-1Mを紹介する。
数学、物理学、化学、生物学、地理、コンピュータ科学、経済学、歴史、音楽、スポーツにまたがる1.2Mのサンプルを含んでいる。
DisciplineGen-1M をベースとして,テキスト・画像生成と画像編集の両面での規律インフォームド推論モデルを提案する。
論文 参考訳(メタデータ) (2026-07-02T15:07:47Z) - S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing [25.725824689793402]
本稿では,科学画像の理解,生成,編集のためのオープンウェイト統一マルチモーダルモデルを提案する。
S1-Omni-Imageは、バックボーンS1-VL-32Bの科学的なマルチモーダル推論に基づいている。
統一されたフレームワークで、科学的な画像理解、生成、編集をサポートする。
論文 参考訳(メタデータ) (2026-06-23T11:19:34Z) - A Three-Layer Framework for AI in Scientific Discovery [0.609170287691728]
本稿では,発見におけるAIの3層ビューを提案する。
レイヤ1は、大きな言語モデルによる検索と検索である。
層2は定性的推論によるモデル形成である。
論文 参考訳(メタデータ) (2026-06-11T16:56:27Z) - Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models [49.93401412148884]
FEPBenchは、慎重に選択された高品質な科学イラストから構築されたベンチマークである。
我々は,T2Iモデルについて,命令忠実度,推論エンリッチメント,意味的精度の3つの次元に沿って評価する。
その結果、GPT Image 2やNano Banana Proのような最先端のクローズドソースモデルでさえ、テキストレンダリングのボトルネック、推論のリッチ化の制限、生成のリッチネスと精度のバランスの難しさに悩まされていることがわかった。
論文 参考訳(メタデータ) (2026-06-04T09:49:02Z) - LECTOR: Joint Optimization of Scientific Reasoning Graphs and Introduction Generation [57.70907667652966]
序文は特に難解であり、論理的な健全さと検証可能な忠実さを要求する。
ほとんどのAI支援手法は、推論や構造化ではなく、タスクをテキスト生成として扱うため、深刻な欠点が生じる。
我々は,科学者の論理を厳格に追従し,高品質な引用を加え,構造化された表現を維持できる新しい論理表現協調強化学習フレームワークであるLECTORを提案する。
論文 参考訳(メタデータ) (2026-05-25T15:41:16Z) - Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling [183.5907213030813]
我々は、この分野は外観合成を超えて知的視覚生成へと進むべきであると論じている。
本稿では, 原子生成, 条件生成, インコンテキスト生成, エージェント生成, 世界モデル生成という5段階の分類法を紹介する。
我々は、フローマッチング、統合された理解・生成モデル、視覚表現の改善、後トレーニング、報酬モデリング、データキュレーション、サンプリングアクセラレーションなど、主要な技術ドライバを解析する。
論文 参考訳(メタデータ) (2026-04-30T17:59:02Z) - Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility [57.83550091882176]
生成パラダイム,評価,下流利用における科学的画像合成について検討する。
本稿では,情報の有用性と論理的妥当性に基づいて生成した画像を評価するSciGenBenchを紹介する。
厳密に検証された合成科学画像上の微調整された大規模マルチモーダルモデルにより、一貫した推論ゲインが得られることを示す。
論文 参考訳(メタデータ) (2026-01-17T14:18:36Z) - SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model [21.81341169834812]
SridBenchは、科学フィギュア生成のための最初のベンチマークである。
これは13の自然科学とコンピュータ科学の分野にわたる主要な科学論文から1,120の事例で構成されている。
その結果、GPT-4o画像のような最上位モデルでさえ、人間のパフォーマンスに遅れがあることが判明した。
論文 参考訳(メタデータ) (2025-05-28T08:51:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。