論文の概要: GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios
- arxiv url: http://arxiv.org/abs/2607.28073v1
- Date: Thu, 30 Jul 2026 11:47:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.542357
- Title: GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios
- Title(参考訳): GVR-Coder:複雑なドキュメントとミーティングシナリオにおける構造化SVG生成のためのビジュアルフィードバックフレームワーク
- Authors: Yiming Xu, Jihua Kang, Chunsai Du, Qifan Zhang, Wangqiu Zhou, Yiting Wu, Tianqi Li, Qi Song,
- Abstract要約: ドキュメントのオーサリングと会議のレビューシナリオに適した大規模SVGデータセットであるDocMeetSVG-100Kを紹介する。
モデルレベルでは、長文のプロテキストから高品質な論理図を生成するために設計された新しいフレームワークであるGVR-Coderを提案する。
さらに,2つのレンダリングフィードバックからの強化学習を導入する。これは,構造的複雑性と視覚美学を協調的に最適化するための報酬信号による暗黙的なフィードバックを提供するメカニズムである。
- 参考スコア(独自算出の注目度): 11.811188580823126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In demanding professional environments and meeting review scenarios, lengthy text often imposes a high cognitive load. To facilitate efficient information communication, transforming verbose text into logically clear diagrams is essential. Scalable Vector Graphics (SVG) provide an effective representation for this purpose due to their editability and resolution independence. However, current research on Text-to-SVG generation remains hindered by three major challenges: (1) the scarcity of datasets for complex, logic-rich diagrams; (2) the absence of explicit layout priors, which leads to chaotic spatial arrangements; and (3) the lack of fine-grained visual feedback to validate rendered outputs and correct aesthetic defects. To address these challenges, at the data level, we introduce DocMeetSVG-100K, a large-scale SVG dataset tailored for document authoring and meeting review scenarios. At the model level, we propose GVR-Coder, a novel framework designed to generate high-quality logical diagrams from lengthy professional texts. Specifically, we adopt a curriculum-driven rejection sampling fine-tuning to progressively enhance the model's capability in modeling complex structures, while explicitly incorporating layout constraint knowledge during training. In addition, we introduce reinforcement learning from dual rendering feedback, a mechanism that provides implicit feedback through reward signals to jointly optimize structural complexity and visual aesthetics. Furthermore, we design a generate-verify-repair agent loop, which improves generation quality through explicit, fine-grained feedback and targeted refinement. Extensive experiments demonstrate that GVR-Coder outperforms competitive baselines and reliably produces logically coherent and visually appealing diagrams. Code and data are available at https://github.com/CurryaNa/GVR-Coder.
- Abstract(参考訳): 専門的な環境や会議のレビューシナリオを要求する場合、長いテキストは高い認知負荷を課すことが多い。
効率的な情報通信を容易にするためには、冗長テキストを論理的に明確な図形に変換することが不可欠である。
スケーラブルベクトルグラフィックス(SVG)は、編集可能性と解像度の独立性のために、この目的のために効果的な表現を提供する。
しかし、テキストからSVG生成に関する現在の研究は、(1)複雑で論理に富んだ図表のためのデータセットの不足、(2)カオス的な空間配置につながる明示的なレイアウト事前の欠如、(3)評価された出力を検証し、美的欠陥を正すためのきめ細かい視覚フィードバックの欠如、の3つの大きな課題によって妨げられている。
これらの課題に対処するため、データレベルではドキュメントのオーサリングやレビューシナリオのミーティングに適した大規模なSVGデータセットであるDocMeetSVG-100Kを導入する。
モデルレベルでは、長文のプロテキストから高品質な論理図を生成するために設計された新しいフレームワークであるGVR-Coderを提案する。
具体的には、複雑な構造をモデル化する際のモデルの能力を徐々に向上させながら、トレーニング中にレイアウト制約知識を明示的に取り入れるために、カリキュラム駆動のリジェクションサンプリングファインタニングを採用する。
さらに,2つのレンダリングフィードバックからの強化学習を導入する。これは,構造的複雑性と視覚美学を協調的に最適化するための報酬信号による暗黙的なフィードバックを提供するメカニズムである。
さらに、明示的できめ細かいフィードバックと対象の洗練により、生成品質を向上させる生成検証エージェントループを設計する。
大規模な実験により、GVR-Coderは競争基準よりも優れ、論理的に一貫性があり視覚的に魅力的な図を確実に生成することを示した。
コードとデータはhttps://github.com/CurryaNa/GVR-Coder.comで入手できる。
関連論文リスト
- GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation [29.64540884592851]
レイアウト制約付きテキスト・ツー・SVG生成のための特殊強化学習フレームワークGeoSVG-RLを紹介する。
モデルはまず、SVGコードの後の世代のための幾何学的契約として機能する構造化レイアウト計画を生成する。
GeoSVG-RLは、特にアローアンカー精度とテキスト・イン・ボックスレートにおいて、構造的信頼性を大幅に向上させる。
論文 参考訳(メタデータ) (2026-05-25T05:56:44Z) - OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward [8.227370271724162]
ビジュアル・インターロゲーション・エフェクト・オール(textscViva)という新しい視覚フィードバック戦略を導入する。
textscVivaは、生成的アプローチを通じて描画された図形の視覚構造に報酬を与える。
最初の大規模図形コード生成データセットであるM3$2$Diagramを構築した。
論文 参考訳(メタデータ) (2026-04-07T07:10:24Z) - VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models [43.3181510471477]
実際には、元のベクトルソースファイルは頻繁に失われるか、アクセス不能になる。
複雑かつ高忠実な図形-SVG変換のために訓練された視覚言語モデルのファミリーであるVFIGを提案する。
VFIGはオープンソースのモデル間で最先端のパフォーマンスを達成し、GPT-5.2と同等に動作する。
論文 参考訳(メタデータ) (2026-03-25T17:52:23Z) - IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework [20.964700751378547]
既存のテキスト間SVG生成法では、最終的なレンダリング画像の視覚的認識は組み込まれていない。
本稿では,イントロスペクティブSVG生成フレームワーク(IntroSVG)を提案する。
提案手法は,いくつかの重要な評価指標にまたがって,最先端の性能を実現する。
論文 参考訳(メタデータ) (2026-03-10T07:44:51Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - Agentic Planning with Reasoning for Image Styling via Offline RL [66.10749901925941]
直接的なプロンプトベースの編集は複雑な変換では失敗するが、なぜなら曖昧で主観的なプロンプトは、画像に何を変更するべきかを微妙に理解する必要がしばしばあるからである。
ツールベースのエージェントRLポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T11:14:37Z) - SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D [51.32219731589742]
3Dシーングラフは、オブジェクトエンティティとその関連性の構造化された表現を提供する。
3次元シーングラフ生成のための既存のアプローチは、通常、シーン再構成とグラフニューラルネットワーク(GNN)を組み合わせる。
本研究では,3次元のSGR3モデルを用いたScene Graph Retrieval-Reasoning Modelを提案する。
論文 参考訳(メタデータ) (2026-03-04T21:19:54Z) - EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution [46.35311453619801]
EvoDiagramは中間キャンバススキーマを通じてオブジェクトレベルの編集可能なダイアグラムを生成するエージェントフレームワークである。
EvoDiagramは、セマンティックインテントをレンダリングロジックから切り離すために、コーディネートされたマルチエージェントシステムを使用している。
さらにcanvasベースのダイアグラムのためのデータとメトリクスからなるベンチマークであるCanvasBenchをリリースしています。
論文 参考訳(メタデータ) (2026-02-20T11:11:02Z) - SVGen: Interpretable Vector Graphics Generation with Large Language Models [61.62816031675714]
本稿では,自然言語記述と組み合わせた高品質なSVGの大規模データセットであるSVG-1Mを紹介する。
我々は、セマンティックガイダンスを強化するために、Chain of Thoughtアノテーション付きのサブセットを含む、SVGトレーニングペアに整合したテキストを作成する。
このデータセットに基づいて,自然言語入力からSVGコードを生成するエンド・ツー・エンド・モデルであるSVGenを提案する。
論文 参考訳(メタデータ) (2025-08-06T15:00:24Z) - ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning [57.767536707234036]
本稿では,イベントストリームシーンのテキスト認識フレームワークESTR-CoTを提案する。
具体的には、まず視覚エンコーダEVA-CLIPを採用し、入力イベントストリームをトークンに変換し、Llamaトークン化器を使用して与えられた生成プロンプトをエンコードする。
Qフォーマーは、事前訓練された大言語モデルVicuna-7Bにビジョントークンを整列させ、応答とチェーン・オブ・シークレット(CoT)推論プロセスの両方を同時に出力する。
論文 参考訳(メタデータ) (2025-07-02T23:41:31Z) - Structure-Augmented Text Representation Learning for Efficient Knowledge
Graph Completion [53.31911669146451]
人為的な知識グラフは、様々な自然言語処理タスクに重要な支援情報を提供する。
これらのグラフは通常不完全であり、自動補完を促す。
グラフ埋め込みアプローチ(例えばTransE)は、グラフ要素を密度の高い埋め込みに表現することで構造化された知識を学ぶ。
テキストエンコーディングアプローチ(KG-BERTなど)は、グラフトリプルのテキストとトリプルレベルの文脈化表現を利用する。
論文 参考訳(メタデータ) (2020-04-30T13:50:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。