論文の概要: SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2609.01582v1
- Date: Tue, 01 Sep 2026 17:47:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.920681
- Title: SpatialGuard: Harness-Guided Verifiable Spatial Reasoning for Text-to-Image Generation
- Title(参考訳): SpaceGuard:テキストから画像生成のためのハーネスガイド付き検証可能な空間推論
- Authors: Ziyun Qian, Zizhi Chen, Yizhou Liu, Mingyang Sun, Dingkang Yang, Lihua Zhang,
- Abstract要約: 複雑な3次元空間テキストから画像生成には、自然言語を安定した視覚幾何学に変換するモデルが必要である。
本稿では,複雑な3次元空間テキスト・画像生成のための構造化レイアウト誘導フレームワークであるSpatialGuardを提案する。
- 参考スコア(独自算出の注目度): 47.693838969607704
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Complex 3D spatial text to image generation requires models to convert natural language into stable visual geometry, not merely semantic appearance. Existing prompt-driven or layout-conditioned methods improve controllability, but often lack an optimizable and verifiable spatial intermediary before visual sampling. As a result, object relations, occlusion, visibility, and camera constraints can decay during multi-round generation. This paper presents SpatialGuard, a structured layout-guided framework for complex 3D spatial text-to-image generation. SpatialGuard parses prompts into image synthesis-oriented 3D layouts through a Spatial Layout Architect, realizes them as visual conditions and candidate images through a Visual Realizer, and uses a Visual Alignment Critic to validate consistency among prompt, layout, and image. To keep constraints stable across iterations, SpatialGuard introduces a Layout Harness that organizes rule constraints, tool invocation, shared knowledge, and feedback loops around the editable layout state. This design turns complex spatial generation from implicit prompt following into a verifiable process of planning, realization, validation, and repair. Comprehensive experiments show that SpatialGuard achieves state-of-the-art performance in complex 3D spatial layout generation and improves spatial faithfulness over existing text-to-image and layout control baselines.
- Abstract(参考訳): 複雑な3次元空間テキストから画像生成には、自然言語を単に意味的な外観ではなく、安定した視覚幾何学に変換するモデルが必要である。
既存のプロンプト駆動またはレイアウト条件付き手法は制御性を改善するが、視覚的なサンプリングの前に最適化可能で検証可能な空間中間体を欠くことが多い。
結果として、オブジェクト関係、オクルージョン、可視性、カメラ制約は、多ラウンド生成中に崩壊する可能性がある。
本稿では,複雑な3次元空間テキスト・画像生成のための構造化レイアウト誘導フレームワークであるSpatialGuardを提案する。
SpaceGuardは、Spatial Layout Architectを通じて画像合成指向の3Dレイアウトにプロンプトを解析し、Visual Realizerを通じて視覚条件と候補イメージとして認識し、Visual Alignment Criticを使用してプロンプト、レイアウト、イメージ間の一貫性を検証する。
イテレーション間で制約を安定させるために、SpatialGuardはルール制約、ツール呼び出し、共有知識、編集可能なレイアウト状態に関するフィードバックループを整理するLayout Harnessを導入した。
この設計は、暗黙のプロンプトに続く複雑な空間生成を、計画、実現、検証、修復の検証可能なプロセスに変える。
包括的実験により,SpatialGuardは複雑な3次元空間レイアウト生成における最先端性能を実現し,既存のテキスト・ツー・イメージ・レイアウト制御ベースラインよりも空間忠実性を向上させることが示された。
関連論文リスト
- SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions [71.54559024212976]
短いテキスト記述を前提とした室内3次元シーン生成は,インタラクティブな3次元環境構築に有望な道を提供する。
既存の作品は、そのような意味的凝縮の場合、身体的妥当性の低下と詳細性の不足に悩まされている。
SDesc3Dは,マルチビュー構造と地域機能を考慮した,短文条件付き屋内シーン生成フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T12:33:01Z) - RoomCraft: Controllable and Complete 3D Indoor Scene Generation [51.19602078504066]
RoomCraftは、実際の画像、スケッチ、テキスト記述をコヒーレントな3D屋内シーンに変換するマルチステージパイプラインである。
このアプローチでは,シーン生成パイプラインと制約駆動最適化フレームワークを組み合わせる。
RoomCraftは、リアルでセマンティックなコヒーレントで視覚的に魅力的な部屋レイアウトを生成する上で、既存の方法よりもはるかに優れています。
論文 参考訳(メタデータ) (2025-06-27T15:03:17Z) - Direct Numerical Layout Generation for 3D Indoor Scene Synthesis via Spatial Reasoning [30.400355766831307]
3D屋内シーン合成は、AIとデジタルコンテンツ作成の具体化に不可欠である。
既存のメソッドは、オープン語彙であり、きめ細かいユーザー指示に一致したシーンを生成するのに失敗する。
テキスト記述から数値的な3Dレイアウトを直接生成するフレームワークであるDirectを導入する。
論文 参考訳(メタデータ) (2025-06-05T17:59:42Z) - DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images [28.48453375674059]
DanceTextは、画像の多言語テキスト編集のためのトレーニング不要のフレームワークである。
複雑な幾何学的変換をサポートし、シームレスに前景と背景の統合を実現する。
論文 参考訳(メタデータ) (2025-04-18T23:46:32Z) - LayoutGPT: Compositional Visual Planning and Generation with Large
Language Models [98.81962282674151]
大規模言語モデル(LLM)は、テキスト条件からレイアウトを生成することで視覚的なプランナーとして機能する。
本稿では,スタイルシート言語におけるコンテキスト内視覚的デモンストレーションを構成する手法であるLayoutGPTを提案する。
論文 参考訳(メタデータ) (2023-05-24T17:56:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。