論文の概要: SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation
- arxiv url: http://arxiv.org/abs/2608.01977v1
- Date: Mon, 03 Aug 2026 09:41:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.474045
- Title: SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation
- Title(参考訳): SVGEval: テキストからSVG生成における知覚品質ベンチマークと評価のためのビジョングラウンドフレームワーク
- Authors: Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni,
- Abstract要約: 拡張性ベクターグラフィックス(SVG)を生成するために,マルチモーダルな大規模モデルがますます利用されている
既存のプロトコルはSVGをレンダリングした後、しばしばコード中心または借用イメージのメトリクスである。
SVGEvalは,人手によるSVG品質評価のためのマルチモーダル・ベンチマークである。
- 参考スコア(独自算出の注目度): 49.00672742747506
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large models are increasingly used to generate scalable vector graphics (SVG), but reliable evaluation remains underexplored. Existing protocols are often code-centric or borrow raster-image metrics after rendering SVGs, which fail to reflect human perception and overlook SVG-specific qualities such as geometry and spatial composition. We introduce SVGEval, a vision-grounded multimodal benchmark for human-aligned SVG quality assessment. SVGEval explicitly incorporates visual renderings to evaluate whether models can judge the rendered outcome rather than only inspect SVG code, and provides high-quality annotations obtained via multi-round human labeling with expert refinement. Systematic evaluations across representative multimodal models reveal a clear gap: models perform relatively well on semantic alignment and aesthetics, yet struggle on geometry- and layout-related judgments. Building on SVGEval, we train an explainable SVG quality scorer that outputs multi-aspect scores with textual rationales. Ablations show that explicit visual grounding and reasoning supervision are crucial, especially for spatial and geometric assessment. SVGEval offers a reliable testbed and practical scorer for evaluating and improving SVG generation in the era of multimodal models.
- Abstract(参考訳): 拡張性ベクターグラフィックス (SVG) を生成するために, マルチモーダルな大規模モデルがますます使用されているが, 信頼性は低い。
既存のプロトコルは、SVGをレンダリングした後、コード中心またはラスタイメージのメトリクスを借りることが多いが、それは人間の知覚を反映せず、幾何学や空間構成のようなSVG固有の性質を見落としている。
SVGEvalは,人手によるSVG品質評価のためのマルチモーダル・ベンチマークである。
SVGEvalは、SVGコードのみを検査するのではなく、モデルが結果を判断できるかどうかを評価するために視覚的レンダリングを明示的に取り入れており、専門家の洗練を伴うマルチラウンドの人間ラベルによる高品質なアノテーションを提供する。
モデルはセマンティックアライメントや美学において比較的よく機能するが、幾何やレイアウトに関する判断では苦戦する。
SVGEval上に構築したSVG品質スコアラは,テキストの有理数を用いた多アスペクトスコアを出力する。
アブレーションは、特に空間的および幾何学的評価において、視覚的根拠と推論の監督が重要であることを示している。
SVGEvalは、マルチモーダルモデルの時代において、SVG生成を評価し改善するための信頼性の高いテストベッドと実用的なスコアラを提供する。
関連論文リスト
- Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning [15.21004381065588]
本稿では,SVG生成時のモデル推論プロセスを公開する統一的なフレームワークであるSVGのためのChain-of-Thought-Reinforcement Learningを提案する。
SVGモデルをトレーニングしてグループレベルのコードを生成することにより、構造的コヒーレンスと視覚的忠実度を大幅に改善する。
提案手法は,全体の生成能力を体系的に向上し,タスク成功率の向上,SVGのコード品質の向上,視覚的忠実度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-17T07:16:30Z) - WildSVG: Towards Reliable SVG Generation Under Real-Word Conditions [15.299111837234678]
本稿では,画像からの視覚的入力をスケーラブルなベクトルグラフィックスに変換するSVG抽出の課題を紹介する。
既存のマルチモーダルモデルは、クリーンなレンダリングやテキスト記述からSVGを生成する際に強力な結果を得るが、自然画像がノイズ、乱雑、ドメインシフトをもたらす現実のシナリオでは不足する。
我々は、最先端のマルチモーダルモデルをベンチマークし、現在の手法が実際のシナリオで信頼できるSVG抽出に必要なものよりはるかに低い性能を発揮することを発見した。
論文 参考訳(メタデータ) (2026-02-24T22:42:55Z) - DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance [48.98604326855894]
本稿では,画像トークンと対応するSVGトークンをエンドツーエンドで共同生成する統合マルチモーダルモデルであるDuetSVGを紹介する。
提案手法は,SVGデコードの品質向上のためのガイダンスとして,モデルのネイティブな視覚的予測を活用する新しいテストタイムスケーリング戦略を適用する。
論文 参考訳(メタデータ) (2025-12-11T18:23:03Z) - SVGen: Interpretable Vector Graphics Generation with Large Language Models [61.62816031675714]
本稿では,自然言語記述と組み合わせた高品質なSVGの大規模データセットであるSVG-1Mを紹介する。
我々は、セマンティックガイダンスを強化するために、Chain of Thoughtアノテーション付きのサブセットを含む、SVGトレーニングペアに整合したテキストを作成する。
このデータセットに基づいて,自然言語入力からSVGコードを生成するエンド・ツー・エンド・モデルであるSVGenを提案する。
論文 参考訳(メタデータ) (2025-08-06T15:00:24Z) - OmniSVG: A Unified Scalable Vector Graphics Generation Model [69.59073636922287]
我々は、エンドツーエンドのマルチモーダルSVG生成に事前訓練されたビジョンランゲージモデルを活用する統一フレームワークであるOmniSVGを提案する。
SVGコマンドと座標を離散トークンにパラメタ化することにより、OmniSVGは複雑なSVG構造の合成を維持しながら、低レベルの幾何学から構造論理を分離し、効率的なトレーニングを行う。
本稿では,200万の注釈付きSVGアセットを持つマルチモーダルデータセットMMSVG-2Mと,条件付きSVG生成タスクの標準化された評価プロトコルを紹介する。
論文 参考訳(メタデータ) (2025-04-08T17:59:49Z) - NeuralSVG: An Implicit Representation for Text-to-Vector Generation [54.4153300455889]
本稿では,テキストプロンプトからベクトルグラフィックスを生成する暗黙的なニューラル表現であるNeuralSVGを提案する。
生成したSVGの層構造を促進するために,ドロップアウトに基づく正規化手法を導入する。
ニューラルSVGは、構造化された柔軟なSVGを生成する際に、既存の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-01-07T18:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。