論文の概要: EdiTikZ: Scientific Figure Editing from Revision Trajectories
- arxiv url: http://arxiv.org/abs/2609.01409v1
- Date: Tue, 01 Sep 2026 15:29:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.803011
- Title: EdiTikZ: Scientific Figure Editing from Revision Trajectories
- Title(参考訳): EdiTikZ:リビジョンの軌跡から科学的フィギュアを編集
- Authors: Christian Greisinger, Zhixue Zhao, Steffen Eger,
- Abstract要約: 391KのTikZ編集ペアをarXiv, GitHub, SEからマイニングすることで構築した,最初の大規模な科学的フィギュア編集データセットであるDaEdiTikZを紹介した。
また、790のインスタンスを持つ人間仕様のベンチマークであるDaEdiTikZ-Benchを導入し、2つのコンパクトQwen3.5ベースのEdiTikZモデルを再構築と編集を共同で学習することで訓練する。
- 参考スコア(独自算出の注目度): 26.228378638070627
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vision-language models (VLMs) have shown strong performance in generating scientific figures from text or images. However, producing publication-ready figures requires iterative refinement, making scientific figure editing an important yet largely unexplored task. Existing approaches rely on costly proprietary agentic systems, focus primarily on evaluation, or construct training supervision from synthetically generated edits. Instead, we leverage naturally occurring scientific revision and development trajectories as a scalable source of supervision. To this end, we introduce DaEdiTikZ, the first large-scale dataset of revision-derived scientific figure edits, constructed by mining 391K plausible TikZ edit pairs from arXiv, GitHub, and TeX SE and inferring 781K directed edit instructions with a VLM conditioned on rendered figures and TikZ code. We further introduce DaEdiTikZ-Bench, a human-refined benchmark with 790 instances, and train two compact Qwen3.5-based EdiTikZ models (4B and 9B) by jointly learning reconstruction and editing, followed by reinforcement learning (RL) with complementary rewards for rendered fidelity and edit application. Automatic evaluation places our 9B model above all tested baselines, while human evaluation with 9 annotators and 4,320 ratings places it above GPT-5.6-Sol and on par with Gemini-3.1-Pro. Under severe out-of-distribution shifts, it remains competitive with GPT-5.6-Sol near its 2K training sequence-length regime. Models and datasets will be released.
- Abstract(参考訳): 視覚言語モデル(VLM)は、テキストや画像から科学的人物を生成する上で、強い性能を示している。
しかし、出版可能な人物の制作には反復的な改良が必要であり、科学的な人物編集は重要で、ほとんど探索されていない課題である。
既存のアプローチは、高価なプロプライエタリなエージェントシステムに依存しており、主に評価に焦点を当てている。
代わりに、自然発生の科学的修正と開発の軌跡を、スケーラブルな監視源として活用する。
この目的のために, 391KのTikZ編集ペアをarXiv, GitHub, TeX SEからマイニングし, 描画された図形とTikZコードに基づくVLMによる781Kの編集命令を推測することによって構築された, 修正由来の科学図形編集の最初の大規模データセットであるDaEdiTikZを紹介した。
さらに、790のインスタンスを持つ人為的なベンチマークであるDaEdiTikZ-Benchを導入し、2つのコンパクトなQwen3.5ベースのEdiTikZモデル(4Bと9B)を、共同で再構築と編集を学習し、続いて補足学習(RL)により、描画の忠実さと編集を補完する。
9つのアノテータと4,320のレーティングによる人間の評価は、GPT-5.6-SolとGemini-3.1-Proと同等である。
激しいアウト・オブ・ディストリビューションシフトの下では、2Kトレーニングシーケンスに近いGPT-5.6-Solと競合する。
モデルとデータセットがリリースされる。
関連論文リスト
- Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ [18.407009909616598]
本稿では,科学的フィギュア編集タスクの総合的なベンチマークであるEdit2TikZを紹介する。
14のメインストリームMLLMを評価し,現在のシステムは信頼性が低いことを確認した。
我々は、TikZEditMixの混合学習セットを構築し、コンパクトモデルのための再構築編集カリキュラム学習を採用する。
論文 参考訳(メタデータ) (2026-08-13T16:27:18Z) - Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence [86.61561123749011]
Apodex Discovery(アポデックスディスカバリー)は、重度解法を用いて発見的AIを構築し評価するためのフレームワークである。
まず16のセクターで511の業界を調査し、423の高価値現実問題を集め、最初のリリースで20を選定した。
第二に、共通の環境-タスク-エピソード抽象化は、データ、ツール、制約、フィードバック、軌跡記録、中間成果物と最終提出物の検証を提供する。
論文 参考訳(メタデータ) (2026-08-11T18:48:40Z) - ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning [86.61218827780675]
本稿では,テキスト誘導画像編集のための評価ツールReasonEditを紹介する。
Re-Reward と Group Relative Policy Optimization (GRPO) アルゴリズムから得られる報奨信号を用いて訓練する。
高品質な解釈可能な評価テキストを生成することができ、画像編集の透明性と信頼性を高めることができる。
論文 参考訳(メタデータ) (2026-05-08T09:23:26Z) - EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement [76.76247443244293]
EditRefinerは、編集後の修正を人間のような認識・推論・行動評価ループとして再構成するエージェントフレームワークである。
歪み、診断精度、人間の知覚アライメントにおいて、最先端の手法を一貫して上回る。
論文 参考訳(メタデータ) (2026-05-08T09:05:08Z) - Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning [36.86798995699176]
我々は,我々のExecution-Centric Data Engineの大規模かつ高品質なデータセットであるSciTikZ-230Kを特徴とするクローズドループフレームワークを提案する。
訓練されたSciTikZer-8Bは最先端のパフォーマンスを実現し、Gemini-2.5-ProやQwen3-VL-235B-A22B-Instructのような巨大なモデルなど、プロプライエタリな巨人を一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-07T16:58:14Z) - MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale [92.09717763663873]
我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
論文 参考訳(メタデータ) (2026-04-06T15:44:18Z) - Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation [67.26349227500084]
現在の報酬モデルは、強化学習の時に批評家として機能し、しばしば幻覚に悩まされ、うるさいスコアを割り当てる。
我々は、忠実な画像生成と編集のための正確で信頼性の高いガイダンスを提供するために、堅牢な報酬モデルを開発する包括的フレームワークFIRMを提案する。
FIRMは幻覚を緩和し、既存の一般的なモデルに対する忠実さと命令順守の新しい標準を確立した。
論文 参考訳(メタデータ) (2026-03-12T17:57:21Z) - Learning to Generate 4D LiDAR Sequences [28.411253849111755]
本稿では,自由形式言語を編集可能なLiDARシーケンスに変換する統一フレームワークLiDARCrafterを提案する。
LiDARCrafterは最先端の忠実さ、コントロール可能性、時間的一貫性を実現し、LiDARベースのシミュレーションとデータ拡張の基礎を提供する。
論文 参考訳(メタデータ) (2025-09-15T14:14:48Z) - From Editor to Dense Geometry Estimator [77.21804448599009]
密度幾何予測のための拡散変換器(DiT)アーキテクチャに基づく高度な編集モデルを適用するフレームワークである textbfFE2E を紹介する。
FE2EはETH3Dデータセットで35%以上のパフォーマンス向上を実現し、100$times$データでトレーニングされたDepthAnythingシリーズを上回っている。
論文 参考訳(メタデータ) (2025-09-04T15:58:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。