論文の概要: RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation
- arxiv url: http://arxiv.org/abs/2607.27699v1
- Date: Thu, 30 Jul 2026 05:30:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.404863
- Title: RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation
- Title(参考訳): RefineSVG:画像からSVG生成のためのビジュアルフィードバック駆動型強化学習
- Abstract要約: RefineSVGはワンステップクローズドループ視覚フィードバックフレームワークである。
マルチモーダルな大言語モデル(MLLM)により、自己補正により高忠実な画像-SVG生成を行うことができる。
- 参考スコア(独自算出の注目度): 2.1124849856688064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose RefineSVG, a single-step closed-loop visual feedback framework that enables multimodal large language models (MLLMs) to perform high-fidelity image-to-SVG generation through self-correction. Existing MLLM-based approaches rely on single-pass open-loop inference, where the model receives visual input only once and must generate thousands of SVG code tokens without intermediate verification. This paradigm inevitably leads to geometric drift, error accumulation, and visual hallucination on complex images. RefineSVG overcomes this limitation by invoking an external rendering engine after an initial SVG generation pass to compare the rendered output against the target image. The comparison yields a multi-dimensional visual residual map (Diff-Map) that is fed back to the model as a ReAct-style correction signal, driving a targeted correction step. To support this render-observe-correct interaction, we further introduce an SVG-oriented semantic vocabulary that compresses token sequences by over 52%. A progressive training pipeline spanning supervised fine-tuning, rejection-sampling cold-start data construction, and end-to-end agentic reinforcement learning aligns the model with closed-loop visual correction. Extensive experiments show that RefineSVG consistently outperforms existing baselines in reconstruction fidelity, structural accuracy, and code efficiency.Code is available at https://github.com/liuxiaobo66/RefineSVG.
- Abstract(参考訳): 本稿では,マルチモーダル大規模言語モデル(MLLM)による自己補正による高忠実な画像-SVG生成を実現するための,ワンステップクローズドループ視覚フィードバックフレームワークであるRefineSVGを提案する。
既存のMLLMベースのアプローチはシングルパスのオープンループ推論に依存しており、モデルが一度だけ視覚入力を受け取り、中間検証なしで数千のSVGコードトークンを生成する必要がある。
このパラダイムは必然的に、複雑な画像上の幾何学的ドリフト、エラー蓄積、視覚幻覚をもたらす。
RefineSVGはこの制限を克服し、初期SVG生成後に外部レンダリングエンジンを起動し、出力された出力を目標画像と比較する。
比較は、ReActスタイルの補正信号としてモデルにフィードバックされ、ターゲットの修正ステップを駆動する多次元視覚残差マップ(Diff-Map)を生成する。
このレンダリング-オブザーバ-正しい相互作用をサポートするために、SVG指向のセマンティックボキャブラリを導入し、トークンシーケンスを52%以上圧縮する。
教師付き微調整、拒絶サンプリング型コールドスタートデータ構築、エンドツーエンドのエージェント強化学習にまたがるプログレッシブトレーニングパイプラインは、モデルにクローズドループの視覚的補正を施す。
大規模な実験により、RefineSVGはリコンストラクションの忠実さ、構造精度、コード効率において、既存のベースラインを一貫して上回り、コードはhttps://github.com/liuxiaobo66/RefineSVGで入手できる。
関連論文リスト
- SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation [62.7676301168359]
テキスト間SVG生成のためのヒューマンアライメント評価フレームワークである textbfours を紹介する。
CLIPベースのスコアは、SVGジェネレータが実際に行うエラー、例えば色、数、空間関係にほとんど反応しないことを示す。
次に、テキストセマンティックアライメントのための人間注釈付きデータセットを導入し、生成したSVGがそのキャプションをいかに忠実に反映するかを測定する。
論文 参考訳(メタデータ) (2026-09-03T13:12:37Z) - Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs [50.541990269155484]
市販の視覚言語モデル(VLM)におけるSVG生成能力を推定時で解き放つことができるかどうかを評価する。
本研究は,SVG生成に汎用VLMを適用するために,推論時間法を用いることの約束と現在の制限の両方を強調した。
論文 参考訳(メタデータ) (2026-08-26T00:51:10Z) - Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback [29.19392406217364]
本稿では,SVG合成を段階的に視覚的に認識するプロセスとして再構成する新しい生成パラダイムを提案する。
中間のコードを累積キャンバスにレンダリングすることで、モデルは各ステップで進化する視覚的コンテキストを明示的に観察する。
このビジュアルループを市販のモデルに適用することは、インクリメンタルなビジュアルコードマッピングを活用できないため、最適ではないことを示す。
論文 参考訳(メタデータ) (2026-04-22T16:15:28Z) - IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework [20.964700751378547]
既存のテキスト間SVG生成法では、最終的なレンダリング画像の視覚的認識は組み込まれていない。
本稿では,イントロスペクティブSVG生成フレームワーク(IntroSVG)を提案する。
提案手法は,いくつかの重要な評価指標にまたがって,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-10T07:44:51Z) - DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance [48.98604326855894]
本稿では,画像トークンと対応するSVGトークンをエンドツーエンドで共同生成する統合マルチモーダルモデルであるDuetSVGを紹介する。
提案手法は,SVGデコードの品質向上のためのガイダンスとして,モデルのネイティブな視覚的予測を活用する新しいテストタイムスケーリング戦略を適用する。
論文 参考訳(メタデータ) (2025-12-11T18:23:03Z) - SVGThinker: Instruction-Aligned and Reasoning-Driven Text-to-SVG Generation [47.390332111383294]
本稿では,SVGコードの生成を可視化プロセスと整合させる推論駆動型フレームワークであるSVGThinkerを紹介する。
パイプラインはまず各プリミティブをシーケンスでレンダリングし、マルチモーダルモデルを使用して画像とコードを注釈付けします。
最先端のベースラインに対する実験では、SVGThinkerはより安定し、編集可能で、高品質なSVGを生成する。
論文 参考訳(メタデータ) (2025-09-29T05:25:00Z) - SVGen: Interpretable Vector Graphics Generation with Large Language Models [61.62816031675714]
本稿では,自然言語記述と組み合わせた高品質なSVGの大規模データセットであるSVG-1Mを紹介する。
我々は、セマンティックガイダンスを強化するために、Chain of Thoughtアノテーション付きのサブセットを含む、SVGトレーニングペアに整合したテキストを作成する。
このデータセットに基づいて,自然言語入力からSVGコードを生成するエンド・ツー・エンド・モデルであるSVGenを提案する。
論文 参考訳(メタデータ) (2025-08-06T15:00:24Z) - Rendering-Aware Reinforcement Learning for Vector Graphics Generation [15.547843461605746]
視覚言語モデル(VLM)におけるSVG生成を向上させるRLRF(Reinforcement Learning from Rendering Feedback)を導入する。
入力画像が与えられた場合、モデルがレンダリングされたSVGロールアウトを生成し、元の画像と比較して報酬を計算する。
この視覚的忠実度フィードバックは、より正確で効率的でセマンティックにコヒーレントなSVGを生成するためにモデルを導く。
論文 参考訳(メタデータ) (2025-05-27T06:56:00Z) - OmniSVG: A Unified Scalable Vector Graphics Generation Model [69.59073636922287]
我々は、エンドツーエンドのマルチモーダルSVG生成に事前訓練されたビジョンランゲージモデルを活用する統一フレームワークであるOmniSVGを提案する。
SVGコマンドと座標を離散トークンにパラメタ化することにより、OmniSVGは複雑なSVG構造の合成を維持しながら、低レベルの幾何学から構造論理を分離し、効率的なトレーニングを行う。
本稿では,200万の注釈付きSVGアセットを持つマルチモーダルデータセットMMSVG-2Mと,条件付きSVG生成タスクの標準化された評価プロトコルを紹介する。
論文 参考訳(メタデータ) (2025-04-08T17:59:49Z) - SuperSVG: Superpixel-based Scalable Vector Graphics Synthesis [66.44553285020066]
SuperSVGは、高速かつ高精度な画像ベクトル化を実現するスーパーピクセルベースのベクトル化モデルである。
本稿では,2段階の自己学習フレームワークを提案する。そこでは,粗い段階モデルを用いて主構造を再構築し,細部を充実させるために改良段階モデルを用いる。
再現精度と推定時間の観点から, 最先端手法と比較して, 提案手法の優れた性能を示す実験を行った。
論文 参考訳(メタデータ) (2024-06-14T07:43:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。