論文の概要: Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models
- arxiv url: http://arxiv.org/abs/2607.16409v1
- Date: Fri, 17 Jul 2026 18:02:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.14441
- Title: Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models
- Title(参考訳): 思考、計画、絵画:統一モデルにおける制御可能な画像生成のためのレイアウト認識推論
- Authors: Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo,
- Abstract要約: ATLASはMLLMに人間のような"Think, Plan, and Paint"パラダイムを取り入れた統一的なフレームワークである。
我々はATLASを7Bおよび80Bスケールでインスタンス化し、画像生成ベンチマーク上でMLLMの最先端性能を達成する。
同じレイアウトインターフェースを通じて、ATLASは命令誘導編集とマルチモーダルグラウンドもサポートする。
- 参考スコア(独自算出の注目度): 25.35377729350739
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified Multimodal Large Language Models (MLLMs) offer a promising paradigm for unifying visual understanding and generation, yet they still struggle to follow complex spatial instructions and logical constraints in controllable image generation. To address this gap, we present ATLAS, a unified framework that equips MLLMs with a human-like "Think, Plan, and Paint" paradigm. We adopt layout as the shared representation that connects the three stages, enabling the model to reason about spatial requirements, plan explicit object arrangements, and render the final image. We further improve plan-to-image fidelity with reinforcement-learning-based layout alignment. We instantiate ATLAS at 7B and 80B scales, achieving state-of-the-art performance among MLLMs on image generation benchmarks and an average 65.31% improvement over existing layout-based unified MLLMs. On spatially related tasks, ATLAS obtains an average 23.06% gain over the base models. Through the same layout interface, ATLAS also supports instruction-guided editing and multimodal grounding. We further introduce ATLAS-Reasoning, a benchmark for evaluating generation under complex spatial instructions.
- Abstract(参考訳): MLLM(Unified Multimodal Large Language Models)は、視覚的理解と生成を統一するための有望なパラダイムを提供するが、制御可能な画像生成において複雑な空間的命令や論理的制約に従うのに苦慮している。
このギャップに対処するため、我々は、MLLMに人間のような"Think, Plan, and Paint"パラダイムを組み込んだ統合フレームワークATLASを提案する。
我々は3つのステージを接続する共有表現としてレイアウトを採用し、モデルが空間的要求を推論し、明示的なオブジェクト配置を計画し、最終的な画像を描画することを可能にする。
我々は、強化学習に基づくレイアウトアライメントにより、プラン・ツー・イメージの忠実度をさらに向上する。
我々はATLASを7Bおよび80Bスケールでインスタンス化し、画像生成ベンチマークにおけるMLLMの最先端性能と、既存のレイアウトベースの統一MLLMよりも平均65.31%改善した。
空間的関連タスクでは、ATLASはベースモデルよりも平均23.06%のゲインを得る。
同じレイアウトインターフェースを通じて、ATLASは命令誘導編集とマルチモーダルグラウンドもサポートする。
さらに、複雑な空間的指示の下で生成を評価するためのベンチマークであるATLAS-Reasoningを紹介する。
関連論文リスト
- Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence [63.11502936651325]
本稿では,空間知能のための二経路幾何対応MLLMであるGAMSIを提案する。
RGB画像のみを入力とし、両方の幾何学的形態を統一された自己回帰バックボーン内に内包する。
GAMSIは、7つの空間インテリジェンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-25T01:33:19Z) - SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness [62.38746300197673]
本稿では、3次元幾何学的認識を統合画像生成モデルに内包する新しいフレームワークを提案する。
具体的には、まずMixture-of-Transformers (MoT)アーキテクチャを用いて、MLLMを並列空間変換器で拡張する。
自己注意をMLLMと共有することにより、空間変換器は、リッチなセマンティックコンテキストからターゲット画像の計量深度マップを導出することを学ぶ。
これらの明示的な幾何学的足場は、特殊深度アダプターを介して拡散バックボーンに注入される。
論文 参考訳(メタデータ) (2026-04-29T06:46:59Z) - SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding [66.74446220401296]
画像の理解と生成の両方が可能なシンプルだが強力なエンコーダのないMLLMであるSynerGen-VLを提案する。
トークンの折り畳み機構と,高分解能画像理解を効果的に支援するビジョンエキスパートベースのプログレッシブアライメント事前学習戦略を導入する。
コードとモデルはリリースされます。
論文 参考訳(メタデータ) (2024-12-12T18:59:26Z) - ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance [47.53085562765585]
本稿では,一大言語モデルにマルチモーダル理解と生成機能をシームレスに統合する統合型マルチモーダル言語モデル (MLLM) であるILLUMEを紹介する。
画像テキストアライメントに通常必要となる大規模なデータセットサイズに対処するため,視覚トークン化器の設計によるデータ効率の向上を提案する。
従来の研究で探索されていない理解と生成能力の相乗的向上を促進するために,我々は,新しい自己向上型マルチモーダルアライメント方式を導入する。
論文 参考訳(メタデータ) (2024-12-09T17:11:50Z) - REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models [67.55362046790512]
視覚言語モデルには、空間的関係を正しく推論する能力がない。
視覚言語モデルにおける空間忠実度を改善するREVISIONフレームワークを開発した。
本研究の結果から,レンダリングベースのフレームワークは空間認識モデルの開発に有効な手法であることが示唆された。
論文 参考訳(メタデータ) (2024-08-05T04:51:46Z) - SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form
Layout-to-Image Generation [68.42476385214785]
本稿では,レイアウトから派生した特徴写像を用いた空間意味マップガイド(SSMG)拡散モデルを提案する。
SSMGは,従来の研究に比べて空間的,意味的な制御性に優れた生成品質を実現する。
また,RSA(Relation-Sensitive Attention)機構とLSA(Location-Sensitive Attention)機構を提案する。
論文 参考訳(メタデータ) (2023-08-20T04:09:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。