論文の概要: Multimodal Thinking with Renderable Programs
- arxiv url: http://arxiv.org/abs/2609.30130v1
- Date: Thu, 24 Sep 2026 17:03:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.136477
- Title: Multimodal Thinking with Renderable Programs
- Title(参考訳): レンダリング可能なプログラムによるマルチモーダル思考
- Abstract要約: SVGLMは、スケーラブルなグラフィックスプリミティブを使用して、推論タスクでテキストとイメージを接続するフレームワークである。
我々はSVGの双対性を画像記述とテキスト命令の両方として利用し、よりコンパクトで解釈可能な解を得る。
以上の結果から,より堅牢なデジタルドメインエージェント構築に適したメディアとしてSVGが注目され,テキストベースの思考画素画像間のギャップを埋めることができた。
- 参考スコア(独自算出の注目度): 48.70508379100136
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Current vision-language models (VLMs) excel at visual content understanding and text-based reasoning, yet their structure limits the advancement of incorporating images into the reasoning chain. Though Omnimodal models have made efforts in unifying text and image generation, they focus on visual tasks in the open-domain, lacking tractability due to rasterized or latent representations of images. We introduce SVGLM, a framework that uses scalable vector graphics (SVG) primitives to connect text and image in reasoning tasks. We exploit the duality of SVG as both image description and text instructions, yielding a more compact, interpretable solution to equip general VLMs with the capability of generating images within the reasoning process. We provide a large curated dataset of SVG-based image editing dataset, as well as the paradigm to tune open-source VLMs. Experiments on a mathematical reasoning benchmark demonstrate that SVGLM achieves strong SVG generation power as well as think-with-image intelligence. Our results highlight SVG as a suitable medium for building more robust digital domain agents, bridging the gap between text-based thinking and pixel-based images.
- Abstract(参考訳): 現在の視覚言語モデル(VLM)は、視覚的コンテンツ理解とテキストベースの推論に優れるが、その構造は推論連鎖にイメージを組み込むことの進歩を制限している。
Omnimodalモデルは、テキストと画像生成を統一する努力をしてきたが、それらはオープンドメインにおける視覚的なタスクに焦点を当てており、画像のラスタ化や遅延表現によるトラクタビリティを欠いている。
SVGLMは、スケーラブルなベクトルグラフィックス(SVG)プリミティブを使用して、推論タスクでテキストとイメージを接続するフレームワークである。
我々は、SVGの双対性を画像記述とテキスト命令の両方として利用し、推論プロセス内で画像を生成する能力を備えた一般的なVLMに、よりコンパクトで解釈可能なソリューションを提供する。
SVGベースの画像編集データセットの大規模なキュレートデータセットと、オープンソースのVLMをチューニングするためのパラダイムを提供する。
数理推論ベンチマークの実験では、SVGLMは思考とイメージの知性だけでなく、強力なSVG生成能力を達成することが示されている。
以上の結果から,より堅牢なデジタルドメインエージェント構築に適したメディアとしてSVGが注目され,テキストベース思考とピクセルベースイメージのギャップを埋めることができた。
関連論文リスト
- DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance [48.98604326855894]
本稿では,画像トークンと対応するSVGトークンをエンドツーエンドで共同生成する統合マルチモーダルモデルであるDuetSVGを紹介する。
提案手法は,SVGデコードの品質向上のためのガイダンスとして,モデルのネイティブな視覚的予測を活用する新しいテストタイムスケーリング戦略を適用する。
論文 参考訳(メタデータ) (2025-12-11T18:23:03Z) - SVGThinker: Instruction-Aligned and Reasoning-Driven Text-to-SVG Generation [47.390332111383294]
本稿では,SVGコードの生成を可視化プロセスと整合させる推論駆動型フレームワークであるSVGThinkerを紹介する。
パイプラインはまず各プリミティブをシーケンスでレンダリングし、マルチモーダルモデルを使用して画像とコードを注釈付けします。
最先端のベースラインに対する実験では、SVGThinkerはより安定し、編集可能で、高品質なSVGを生成する。
論文 参考訳(メタデータ) (2025-09-29T05:25:00Z) - Visually Descriptive Language Model for Vector Graphics Reasoning [76.42082386029206]
低レベル視覚知覚と高レベル言語推論のギャップを埋めるための視覚記述型言語モデル(VDLM)を提案する。
VDLMは,様々なマルチモーダル認識および推論タスクにおいて,GPT-4oのような最先端のLMMを大幅に改善することを示す。
論文 参考訳(メタデータ) (2024-04-09T17:30:18Z) - Beyond Pixels: Exploring Human-Readable SVG Generation for Simple Images
with Vision Language Models [19.145503353922038]
本稿では,Simple-SVG-Generation (Stextsuperscript2VGtextsuperscript2)を提案する。
本手法は,正確かつ簡便なSVGの生成と,人間の可読性と理解の整合性に重点を置いている。
その結果,従来のSVG生成手法よりも明らかに改善された結果が得られた。
論文 参考訳(メタデータ) (2023-11-27T05:20:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。