論文の概要: UniWorld-Design: From Pixel Generation to Layer-Native Design
- arxiv url: http://arxiv.org/abs/2608.03971v1
- Date: Tue, 04 Aug 2026 17:39:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.302348
- Title: UniWorld-Design: From Pixel Generation to Layer-Native Design
- Title(参考訳): UniWorld-Design: ピクセル生成からレイヤネイティブ設計へ
- Authors: Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan,
- Abstract要約: フラットなピクセル合成から構造化された視覚合成へ画像生成を再定義するフレームワークであるUniWorld-Designを紹介する。
私たちの重要な洞察は、ピクセルが画像のレンダリング方法を定義するのに対して、レイヤは画像の作成、理解、編集方法を定義することです。
- 参考スコア(独自算出の注目度): 33.991198949217164
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce UniWorld-Design, a framework that redefines image generation from flat pixel synthesis to structured visual composition, with semantic RGBA layers as the atomic units of generation, understanding, and editing. Our key insight is that pixels define how an image is rendered, whereas layers define how an image is created, understood, and edited. Just as human designers create and manipulate visual content through layers rather than raw pixels, UniWorld-Design equips multimodal generative models with a layer-native design space. UniWorld-Design comprises two models. The Text-to-RGBA (T2RGBA) model generates standalone RGBA assets directly from text. The Image-to-Layer (I2L) model conditions on a finished image, a global instruction and per-layer prompts, and jointly produces ordered, complete semantic RGBA layers. Its instruction interface supports top-level decomposition, recursive decomposition and targeted extraction, making layering an instruction-addressable operation for agentic editing. Because I2L learns complete semantic objects rather than visible-pixel partitions, its layers stay usable when moved or removed. On the Crello benchmark, I2L reduces per-layer RGB L1 error by 37% and achieves a 34% relative improvement in Alpha Soft IoU over Qwen-Image-Layered. Separately, T2RGBA achieves the highest CLIP Score, outperforming LayerDiffuse and OmniAlpha.
- Abstract(参考訳): フラットなピクセル合成から構造化された視覚合成へのイメージ生成を再定義するフレームワークであるUniWorld-Designを導入し,生成,理解,編集の原子単位として意味的RGBA層を導入する。
私たちの重要な洞察は、ピクセルが画像のレンダリング方法を定義するのに対して、レイヤは画像の作成、理解、編集方法を定義することです。
人間のデザイナが生のピクセルではなく層を通して視覚コンテンツを作成・操作するのと同じように、UniWorld-Designはレイヤネイティブなデザイン空間を持つマルチモーダル生成モデルを装備する。
UniWorld-Designには2つのモデルがある。
Text-to-RGBA(T2RGBA)モデルは、テキストから直接スタンドアロンのRGBA資産を生成する。
I2L(Image-to-Layer)モデル条件は、完了した画像、グローバル命令、層ごとのプロンプト、および順序付き完全なRGBA層を共同で生成する。
その命令インターフェイスは、トップレベルの分解、再帰的な分解、ターゲット抽出をサポートし、エージェント編集のための命令調整可能な操作を階層化する。
I2Lは可視画素パーティションではなく、完全なセマンティックオブジェクトを学習するため、そのレイヤは移動または削除時に使用することができる。
Crelloベンチマークでは、I2Lは層ごとのRGB L1エラーを37%削減し、Qwen-Image-LayeredよりもAlpha Soft IoUを34%改善した。
T2RGBAは最も高いCLIPスコアを獲得し、LayerDiffuseとOmniAlphaを上回っている。
関連論文リスト
- Bunraku: Turning a Single Illustration into an Editable Live2D Character [25.17979482882208]
我々はLive2Dランタイムが消費する構造化情報全てを生成する最初のシステムを提案する。
ステージ1は、Live2Dを意識した臓器レベルの分類の下で、層状分解を層状拡散過程としてキャストする。
ステージ2は、アルファチャネルのみから各層に対してコンテンツコンフォーメーショントライアングルメッシュを構築し、すべての層のキーポジション変位場を共同で予測する。
論文 参考訳(メタデータ) (2026-07-29T18:06:17Z) - LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition [4.794064830289192]
そこで我々はLaDeを提案する。LaDeはフレキシブルな多くの意味論的意味のある層を生成する潜在拡散フレームワークである。
LaDeは3つのコンポーネントを組み合わせる: LLMベースのプロンプト拡張器で、短いユーザインテントを階層単位の記述に変換する。
トレーニング中にレイヤサンプルを条件付けすることにより,テキスト・ツー・イメージ生成,テキスト・ツー・レイヤ・メディア設計生成,メディア設計の分解という3つのタスクをサポートする。
論文 参考訳(メタデータ) (2026-03-18T17:34:07Z) - Referring Layer Decomposition [25.128453386102887]
単一のRGB画像から完全なRGBA層を予測するRLD(Referring Layer Decomposition)タスクを導入する。
コアとなるRefLadeは、スケーラブルなデータエンジンによって生成される1.11Mイメージ層プロンプトトリプレットからなる大規模なデータセットです。
本稿では,プロンプト条件付き層分解のためのシンプルなベースラインRefLayerを提案し,高い視覚的忠実度とセマンティックアライメントを実現する。
論文 参考訳(メタデータ) (2026-02-22T22:05:17Z) - Controllable Layered Image Generation for Real-World Editing [49.81321254149423]
LASAGNAは、その構成層と共同で画像を生成する、新しく統合されたフレームワークである。
クリーンな背景とRGBAフォアグラウンドからなる新しいデータセットであるLASAGNA-48Kを紹介した。
LASAGNAは複数の画像層にまたがって高度に一貫性があり一貫性のある結果を生成するのに優れていることを示す。
論文 参考訳(メタデータ) (2026-01-21T22:29:33Z) - Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition [73.43121650616804]
単一のRGB画像を複数の意味的不整合RGBA層に分解するエンドツーエンド拡散モデルである textbfQwen-Image-Layered を提案する。
本手法は,分解品質の既存手法を大幅に上回り,一貫した画像編集のための新しいパラダイムを確立する。
論文 参考訳(メタデータ) (2025-12-17T17:12:42Z) - UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation [51.31795451147935]
本稿では,単一のピクセル間拡散フレームワーク内での視覚的理解と視覚的生成を支援する統合生成モデルを提案する。
私たちのゴールは、モデル、タスク、表現の3つの軸に沿った統一を達成することです。
画像間合成と画像間理解の実験は、強いモーダルアライメントを示す。
論文 参考訳(メタデータ) (2025-11-21T03:02:10Z) - RAM++: Robust Representation Learning via Adaptive Mask for All-in-One Image Restoration [94.49712266736141]
RAM++はオールインワンイメージ復元のための2段階のフレームワークである。
高レベルのセマンティック理解と低レベルのテクスチャ生成を統合する。
極端なシナリオでは、既存の劣化指向のメソッドの制限に対処します。
論文 参考訳(メタデータ) (2025-09-15T15:24:15Z) - MULAN: A Multi Layer Annotated Dataset for Controllable Text-to-Image Generation [54.64194935409982]
44K MUlti-Layer-wise RGBA 分解からなる新しいデータセット MuLAn を紹介する。
MuLAnは、高品質な画像のインスタンス分解と空間情報を提供する最初のフォトリアリスティックなリソースである。
我々は,新しい生成・編集技術,特にレイヤワイドソリューションの開発を促進することを目的としている。
論文 参考訳(メタデータ) (2024-04-03T14:58:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。