論文の概要: Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs
- arxiv url: http://arxiv.org/abs/2608.28678v1
- Date: Wed, 26 Aug 2026 00:51:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.706951
- Title: Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs
- Title(参考訳): オフザシェルフVLMを用いたスケーラブルベクトルグラフ生成のための制約付き反復精細化の評価
- Abstract要約: 市販の視覚言語モデル(VLM)におけるSVG生成能力を推定時で解き放つことができるかどうかを評価する。
本研究は,SVG生成に汎用VLMを適用するために,推論時間法を用いることの約束と現在の制限の両方を強調した。
- 参考スコア(独自算出の注目度): 50.541990269155484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scalable Vector Graphics (SVGs) power much of the modern visual ecosystem, yet state-of-the-art generative models focus almost entirely on rasterized images. We explore whether inference-time methods can unlock SVG generation capabilities in off-the-shelf vision-language models (VLMs). We systematically evaluate a constrained iterative refinement harness that combines visual feedback, structured editing, and constrained decoding to characterize the capabilities and limitations of current VLMs for SVG generation. Across multiple VLMs and generation settings, we find that constrained decoding improves compilation success rates, while iterative refinement reveals a deficit in visual reasoning and self-correction. Our results highlight both the promise and current limitations of using inference-time methods to adapt general-purpose VLMs for SVG generation.
- Abstract(参考訳): スケーラブルベクターグラフィックス(SVG)は現代の視覚生態系の多くを支えているが、最先端の生成モデルはラスタライズされたイメージに集中している。
市販の視覚言語モデル(VLM)において,推論時手法がSVG生成能力を解き放つことができるかどうかを検討する。
SVG 生成における現在の VLM の機能と限界を特徴付けるために,視覚フィードバック,構造化編集,制約付き復号化を組み合わせた制約付き反復改良ハーネスを体系的に評価する。
複数のVLMと生成設定において、制約付き復号化はコンパイル成功率を改善する一方、反復的洗練は視覚的推論と自己補正の欠如を明らかにする。
本研究は,SVG生成に汎用VLMを適用するために,推論時間法を用いることの約束と現在の制限の両方を強調した。
関連論文リスト
- SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation [62.7676301168359]
テキスト間SVG生成のためのヒューマンアライメント評価フレームワークである textbfours を紹介する。
CLIPベースのスコアは、SVGジェネレータが実際に行うエラー、例えば色、数、空間関係にほとんど反応しないことを示す。
次に、テキストセマンティックアライメントのための人間注釈付きデータセットを導入し、生成したSVGがそのキャプションをいかに忠実に反映するかを測定する。
論文 参考訳(メタデータ) (2026-09-03T13:12:37Z) - RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation [2.1124849856688064]
RefineSVGはワンステップクローズドループ視覚フィードバックフレームワークである。
マルチモーダルな大言語モデル(MLLM)により、自己補正により高忠実な画像-SVG生成を行うことができる。
論文 参考訳(メタデータ) (2026-07-30T05:30:14Z) - Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback [29.19392406217364]
本稿では,SVG合成を段階的に視覚的に認識するプロセスとして再構成する新しい生成パラダイムを提案する。
中間のコードを累積キャンバスにレンダリングすることで、モデルは各ステップで進化する視覚的コンテキストを明示的に観察する。
このビジュアルループを市販のモデルに適用することは、インクリメンタルなビジュアルコードマッピングを活用できないため、最適ではないことを示す。
論文 参考訳(メタデータ) (2026-04-22T16:15:28Z) - IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework [20.964700751378547]
既存のテキスト間SVG生成法では、最終的なレンダリング画像の視覚的認識は組み込まれていない。
本稿では,イントロスペクティブSVG生成フレームワーク(IntroSVG)を提案する。
提案手法は,いくつかの重要な評価指標にまたがって,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-10T07:44:51Z) - Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure [57.89872230703339]
本稿では,信頼性の高いSVGアニメーションに必要なセマンティック構造を復元するフレームワークを提案する。
SVGをセマンティックグループに再編成することにより、VLMはより深いコヒーレンスを持つアニメーションを作成できる。
論文 参考訳(メタデータ) (2025-12-16T12:03:46Z) - DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance [48.98604326855894]
本稿では,画像トークンと対応するSVGトークンをエンドツーエンドで共同生成する統合マルチモーダルモデルであるDuetSVGを紹介する。
提案手法は,SVGデコードの品質向上のためのガイダンスとして,モデルのネイティブな視覚的予測を活用する新しいテストタイムスケーリング戦略を適用する。
論文 参考訳(メタデータ) (2025-12-11T18:23:03Z) - Visual Generation Tuning [84.50113837230333]
視覚言語モデルにおける視覚生成の基盤となる能力を刺激する新しいパラダイムであるVGT, Visual Generation Tuningを提案する。
画像再構成タスクでは、26.67 PSNRと0.50 rFIDを28倍圧縮比で達成し、特殊VAEよりも優れていた。
提案するVGTは,拡張性を示すとともに,マルチモーダル理解のために訓練されたVLMを視覚的生成能力で実現するためにも有用である。
論文 参考訳(メタデータ) (2025-11-28T18:57:13Z) - SVGen: Interpretable Vector Graphics Generation with Large Language Models [61.62816031675714]
本稿では,自然言語記述と組み合わせた高品質なSVGの大規模データセットであるSVG-1Mを紹介する。
我々は、セマンティックガイダンスを強化するために、Chain of Thoughtアノテーション付きのサブセットを含む、SVGトレーニングペアに整合したテキストを作成する。
このデータセットに基づいて,自然言語入力からSVGコードを生成するエンド・ツー・エンド・モデルであるSVGenを提案する。
論文 参考訳(メタデータ) (2025-08-06T15:00:24Z) - Rendering-Aware Reinforcement Learning for Vector Graphics Generation [15.547843461605746]
視覚言語モデル(VLM)におけるSVG生成を向上させるRLRF(Reinforcement Learning from Rendering Feedback)を導入する。
入力画像が与えられた場合、モデルがレンダリングされたSVGロールアウトを生成し、元の画像と比較して報酬を計算する。
この視覚的忠実度フィードバックは、より正確で効率的でセマンティックにコヒーレントなSVGを生成するためにモデルを導く。
論文 参考訳(メタデータ) (2025-05-27T06:56:00Z) - Leveraging Large Language Models For Scalable Vector Graphics Processing: A Review [0.0]
従来のベクトル化技術は、長い処理時間と過剰な出力の複雑さに悩まされている。
大規模言語モデル(LLM)の出現により、ベクトルグラフィックスの生成、編集、解析の新しい可能性が生まれた。
論文 参考訳(メタデータ) (2025-03-06T21:23:17Z) - NeuralSVG: An Implicit Representation for Text-to-Vector Generation [54.4153300455889]
本稿では,テキストプロンプトからベクトルグラフィックスを生成する暗黙的なニューラル表現であるNeuralSVGを提案する。
生成したSVGの層構造を促進するために,ドロップアウトに基づく正規化手法を導入する。
ニューラルSVGは、構造化された柔軟なSVGを生成する際に、既存の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-01-07T18:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。