論文の概要: Editable Visual Design
- arxiv url: http://arxiv.org/abs/2609.04034v1
- Date: Thu, 03 Sep 2026 16:10:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.151557
- Title: Editable Visual Design
- Title(参考訳): 編集可能なビジュアルデザイン
- Authors: Junyan Ye, Wei Liu, Dongzhi Jiang, Zichen Wen, HaoDong Li, Zhutao Lv, Jiaxin Lin, Jinhua Yu, Jun He, Zilong Huang, Rui Chen, Weijia Li,
- Abstract要約: コーディングエージェントによって駆動される新しいパラダイムであるEditable Visual Designを提案する。
我々は,要求理解,課題計画,美的判断のために「創造的脳」を指定する。
エージェントデザイン リプレイ(Agent Design Replay)は、プロの人間デザイナーと同様の創造性と推論の軌跡を忠実に再現する。
- 参考スコア(独自算出の注目度): 32.993324966532235
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While diffusion base models such as GPT-Image-2 and Nano-Banana exhibit remarkable visual expressiveness, their end-to-end generation inherently yields flattened bitmaps with error-prone text, precluding layer-wise post-editing. Conversely, code-based visual generation via Coding Agents provides precise layout control and decoupled layers, yet remains constrained by a lack of global aesthetic intuition and the difficulty of coding complex visual assets. To address this, we propose Editable Visual Design, a new paradigm driven by a Coding Agent. We designate the VLM as the ``creative brain'' for requirement comprehension, task planning, and aesthetic judgment, while utilizing the image generation model as an on-demand ``visual world simulator'' to synthesize standalone visual assets. Operating under an ``imagine first, then act'' closed-loop workflow, the agent generates isolated assets, writes native HTML/CSS, and iteratively refines the design against visual rendering feedback. Furthermore, Agent Design Replay faithfully reproduces the creative and reasoning trajectory akin to that of professional human designers. Ultimately, the system delivers editable artifacts with decoupled layers and real text, enabling users to perform intuitive mouse dragging and layout adjustments on a graphical user interface. Validations on posters, infographics, and other scenarios show that this paradigm successfully achieves both refined aesthetics and production-grade editability.
- Abstract(参考訳): GPT-Image-2やNano-Bananaのような拡散ベースモデルは目覚しい視覚表現性を示すが、そのエンド・ツー・エンド生成は本質的に、レイヤーワイドの後編集を前に、エラーを起こしやすいテキストでフラット化されたビットマップを生成する。
逆に、Coding Agentsによるコードベースのビジュアル生成は、正確なレイアウト制御と分離されたレイヤを提供するが、グローバルな美的直観の欠如と複雑なビジュアルアセットのコーディングの難しさに制約されている。
そこで我々は,コーディングエージェントによって駆動される新しいパラダイムであるEditable Visual Designを提案する。
我々は,VLMを要件理解,課題計画,審美判断のための「創造的脳」として指定するとともに,画像生成モデルをオンデマンドの「視覚世界シミュレータ」として利用して,スタンドアロンの視覚資産を合成する。
クローズドループワークフローの下で動作し、エージェントは独立したアセットを生成し、ネイティブHTML/CSSを書き、視覚的なレンダリングフィードバックに対する設計を反復的に洗練する。
さらに、エージェントデザイン・リプレイは、プロの人間デザイナーと同様の創造性と推論の軌跡を忠実に再現する。
最終的に、システムは分離されたレイヤーと実際のテキストで編集可能なアーティファクトを提供し、ユーザーはグラフィカルなユーザーインターフェイス上で直感的なマウスドラッグとレイアウト調整を行うことができる。
ポスター、インフォグラフィック、その他のシナリオに対する検証は、このパラダイムが洗練された美学とプロダクショングレードの編集性の両方をうまく達成していることを示している。
関連論文リスト
- DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation [21.789797121277896]
DesignAsCodeはHTML/CSSを使ったプログラミングタスクとしてグラフィックデザインを再定義する新しいフレームワークである。
DesignAsCodeは、構造的妥当性と美的品質の両方において、最先端のレンダリングベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-02-06T05:10:19Z) - MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues [106.02577891104079]
本稿では,生成画像編集のための合成パラダイムであるMagicQuill V2を提案する。
本手法は,創造性を制御可能な視覚的手がかりのスタックに分解する。
論文 参考訳(メタデータ) (2025-12-02T18:59:58Z) - IGD: Instructional Graphic Design with Multimodal Layer Generation [83.31320209596991]
レイアウト生成に大きく依存する2段階の手法は創造性とインテリジェンスに欠けており、グラフィックデザインは依然として労働集約的である。
自然言語命令のみで編集可能な柔軟性を持つマルチモーダル層を高速に生成するインストラクショナルグラフィックデザイナ(IGD)を提案する。
論文 参考訳(メタデータ) (2025-07-14T04:31:15Z) - Rethinking Layered Graphic Design Generation with a Top-Down Approach [76.33538798060326]
図形デザインは、アイデアやメッセージを伝えるのに不可欠である。デザイナーは通常、編集を簡単にするために、オブジェクト、背景、ベクトル化されたテキスト層に作業を整理する。
GenAI方式の登場により、ピクセルフォーマットにおける高品質なグラフィックデザインの無限の供給がよりアクセスしやすくなってきた。
これにもかかわらず、非層型設計は人間の設計を刺激し、レイアウトやテキストスタイルの選択に影響を与え、最終的に層型設計を導いた。
本稿では,AI生成したデザインを編集可能な階層化設計に変換する最初の試みとして,グラフィックデザイン生成フレームワークであるAccordionを提案する。
論文 参考訳(メタデータ) (2025-07-08T02:26:08Z) - Generative Image Layer Decomposition with Visual Effects [49.75021036203426]
LayerDecompは、イメージ層分解のための生成フレームワークである。
清潔な背景と、忠実に保存された視覚効果を持つ高品質な透明な前景を作り出す。
本手法は,オブジェクト除去や空間編集作業において,既存の手法よりも優れた分解特性を実現する。
論文 参考訳(メタデータ) (2024-11-26T20:26:49Z) - MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models [51.1034358143232]
概念内の個々のコンポーネントをカスタマイズし、再構成する新しいタスクである、コンポーネント制御可能なパーソナライゼーションを導入する。
この課題は、望ましくない要素が対象概念を阻害する意味汚染と、対象概念と構成要素を不均等に学習する意味不均衡という2つの課題に直面する。
動的マスケド・デグラデーション(Dynamic Masked Degradation, 動的マスケド・デグラデーション, 動的マスケド・デグラデーション)を用いて、望まない視覚的セマンティクスを適応的に摂動し、望まれる視覚的セマンティクスをよりバランスよく学習するために、デュアルストリーム・バランシング(Dual-Stream Balancing)を設計する。
論文 参考訳(メタデータ) (2024-10-17T09:22:53Z) - BlenderAlchemy: Editing 3D Graphics with Vision-Language Models [4.852796482609347]
ビジョンベースの編集生成器と状態評価器が協力して、目標を達成するための正しいアクションのシーケンスを見つける。
人間のデザインプロセスにおける視覚的想像力の役割に触発されて、視覚言語モデルの視覚的推論能力を「想像された」参照画像で補う。
論文 参考訳(メタデータ) (2024-04-26T19:37:13Z) - LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer [80.61492265221817]
グラフィックレイアウトデザインは視覚コミュニケーションにおいて重要な役割を担っている。
しかし、手作りのレイアウトデザインは、スキルを要求し、時間がかかり、バッチプロダクションではスケールできない。
ジェネレーティブモデルは、設計自動化をスケーラブルにするために出現するが、デザイナの欲求に沿うデザインを作成することは、未だに容易ではない。
論文 参考訳(メタデータ) (2022-12-19T21:57:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。