論文の概要: Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2604.06079v1
- Date: Tue, 07 Apr 2026 16:58:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.945024
- Title: Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning
- Title(参考訳): 双対自己整合強化学習による科学グラフィックプログラムの合成
- Authors: Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu,
- Abstract要約: 我々は,我々のExecution-Centric Data Engineの大規模かつ高品質なデータセットであるSciTikZ-230Kを特徴とするクローズドループフレームワークを提案する。
訓練されたSciTikZer-8Bは最先端のパフォーマンスを実現し、Gemini-2.5-ProやQwen3-VL-235B-A22B-Instructのような巨大なモデルなど、プロプライエタリな巨人を一貫して上回ります。
- 参考スコア(独自算出の注目度): 36.86798995699176
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Graphics Program Synthesis is pivotal for interpreting and editing visual data, effectively facilitating the reverse-engineering of static visuals into editable TikZ code. While TikZ is the de facto standard for scientific schematics due to its programmatic flexibility, its requirement for rigorous spatial precision presents a significant challenge for Multimodal Large Language Models. Progress is currently stifled by two primary gaps: (1) Data Quality Gap: existing image-TikZ corpora often lack strict executability and reliable visual alignment; (2) Evaluation Gap: a lack of benchmarks for both structural and visual fidelity. To address these, we present a closed-loop framework featuring: SciTikZ-230K, a large-scale, high-quality dataset from our Execution-Centric Data Engine covering 11 diverse scientific disciplines; SciTikZ-Bench, a multifaceted benchmark spanning from basic geometric constructs to intricate hierarchical schematics to evaluate both visual fidelity and structural logic. To further broaden the scope of visual-code optimization methodology, we introduce a novel Dual Self-Consistency Reinforcement Learning optimization paradigm, which utilizes Round-Trip Verification to penalize degenerate code and boost overall self-consistency. Empowered by these, our trained model SciTikZer-8B achieves state-of-the-art performance, consistently outperforming proprietary giants like Gemini-2.5-Pro and massive models like Qwen3-VL-235B-A22B-Instruct.
- Abstract(参考訳): グラフィックプログラム合成は、視覚データを解釈し、編集するために重要であり、静的な視覚を編集可能なTikZコードへのリバースエンジニアリングを効果的に促進する。
TikZはそのプログラム的柔軟性のため、科学的スキーマ学のデファクトスタンダードであるが、厳密な空間精度の要求は、マルチモーダル大言語モデルにとって重要な課題である。
データ品質ギャップ:既存のイメージ-TikZコーパスは厳格な実行可能性と信頼性のある視覚アライメントを欠くことが多く、(2)評価ギャップ:構造的および視覚的忠実性のベンチマークが欠如している。
SciTikZ-230Kは、我々のExecution-Centric Data Engineの大規模で高品質なデータセットで、11の科学分野をカバーしています。
視覚的コード最適化手法の範囲をさらに広げるために, ラウンドトリップ検証を利用して, 縮退コードのペナルティ化と全体的な自己整合性向上を行う, 新たな自己整合性強化学習パラダイムを導入する。
トレーニングされたモデルSciTikZer-8Bは最先端のパフォーマンスを実現し、Gemini-2.5-ProやQwen3-VL-235B-A22B-Instructのような巨大なモデルなど、プロプライエタリな巨人を一貫して上回ります。
関連論文リスト
- Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation [59.87131391492088]
我々は,複雑な構造化デジタルグラフィックスを実行可能なコードに変換する上で,LMM(Large Multimodal Models)の能力を評価するために設計されたベンチマークであるOmni-I2Cを提案する。
真のユーザソースのケースを組み込むことで、このベンチマークは広範囲のデジタルコンテンツにまたがる。
評価の結果,主要なLMM間の性能差が顕著であることがわかった。
論文 参考訳(メタデータ) (2026-03-18T09:10:04Z) - Thinking with Programming Vision: Towards a Unified View for Thinking with Images [23.596757163808906]
最先端のMLLMでさえ驚くほど不安定であり、単純な向きの変化や自然破壊を伴う画像の性能劣化が顕著であることを示す。
我々は,モデルが任意のイメージ操作を実行するユニバーサルインターフェースとしてコードを生成する,フレキシブルでスケーラブルなコード・アズ・ツール・フレームワークであるCodeVisionを提案する。
論文 参考訳(メタデータ) (2025-12-03T12:44:15Z) - IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction [77.06211178777939]
IAR2は、階層的なセマンティックディーテール合成プロセスを可能にする高度な自己回帰フレームワークである。
我々は、IAR2が自動回帰画像生成のための新しい最先端技術を設定し、ImageNet上で1.50のFIDを達成することを示す。
論文 参考訳(メタデータ) (2025-10-08T12:08:21Z) - Robust Diagram Reasoning: A Framework for Enhancing LVLM Performance on Visually Perturbed Scientific Diagrams [0.81996963503528]
LLM(Large Language Models)とLVLM(Large Language Models)は、科学と工学の応用を大いに約束する。
既存の評価ベンチマークはこの課題を概ね見落としており、LVLMの堅牢な推論能力は過小評価されている。
本稿では,ロバストダイアグラム推論(RDR)フレームワークについて紹介する。
論文 参考訳(メタデータ) (2025-08-23T09:50:58Z) - Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation [12.822184232115333]
本稿では,マルチモーダル構造化強化学習(MSRL)を提案する。
実世界のarXivテーブルから300万のチャートコードペアを含む,これまでで最大のトレーニングコーパスを構築した。
MSRLはSFT高原を著しく破壊し、ChartMimicとReachQAのベンチマークでそれぞれ6.2%と9.9%の高水準のメトリクスを改善した。
論文 参考訳(メタデータ) (2025-08-19T07:40:18Z) - Boosting Chart-to-Code Generation in MLLM via Dual Preference-Guided Refinement [16.22363384653305]
MLLM(Multimodal Large Language Models)は、きめ細かい視覚解析、正確なコード合成、堅牢なクロスモーダル推論を行う。
本稿では、フィードバック駆動の2つのモダリティ報酬機構と反復的な嗜好学習を組み合わせた2つの嗜好誘導改善フレームワークを提案する。
本フレームワークは汎用MLLMの性能を大幅に向上させ,高品質なプロットコードを生成する。
論文 参考訳(メタデータ) (2025-04-03T07:51:20Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - SGTR+: End-to-end Scene Graph Generation with Transformer [42.396971149458324]
シーングラフ生成(SGG)は、その構成特性のため、困難な視覚的理解課題である。
これまでのほとんどの作業ではボトムアップ、2段階またはポイントベースの1段階のアプローチを採用していた。
本稿では、上記の問題に対処する新しいSGG法を提案し、そのタスクを二部グラフ構築問題として定式化する。
論文 参考訳(メタデータ) (2024-01-23T15:18:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。