論文の概要: OverLay++: Dense-Overlap Layout-to-Image Generation Dataset
- arxiv url: http://arxiv.org/abs/2610.09071v1
- Date: Tue, 06 Oct 2026 20:16:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.595395
- Title: OverLay++: Dense-Overlap Layout-to-Image Generation Dataset
- Title(参考訳): OverLay++: Dense-Overlap Layout-to-Image Generationデータセット
- Abstract要約: 構造的に複雑なシーンを持つ大規模なLayout-to-ImageデータセットであるOverLay++を紹介します。
OverLay++は、画像当たり平均6.6オブジェクトの約500Kイメージを含み、既存のデータセットを1.67倍のアノテーション密度で上回る。
データセット生成パイプラインはシンプルで、オブジェクトごとのリッチなキャプションで重なり合うオブジェクトアノテーションを生成します。
- 参考スコア(独自算出の注目度): 35.15720984583863
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Layout-to-Image generation has made substantial progress in spatial and object-level control. However, existing methods still struggle with complex scenes containing many overlapping and interacting objects. We argue that training data is a particular bottleneck: existing datasets lack examples with dense, complex object interactions. To address this gap, we introduce OverLay++, a large-scale Layout-to-Image dataset with structurally complex scenes. OverLay++ contains approximately 500K images with an average of 6.6 objects per image, exceeding existing datasets by 1.67 times in annotation density. Beyond annotation density, OverLay++ provides rich semantic detail with object captions over six times longer than in current datasets. Our dataset generation pipeline is simple and produces dense, overlapping object annotations with rich per-object captions. Across multiple benchmarks, state-of-the-art Layout-to-Image methods trained on the OverLay++ dataset show consistent improvement and faster convergence, demonstrating the importance of dense, overlap-aware, and caption-rich supervision for controllable image generation.
- Abstract(参考訳): レイアウト・トゥ・イメージ生成は空間的・オブジェクトレベルの制御において大きく進歩した。
しかし、既存の手法は、多くの重複や相互作用するオブジェクトを含む複雑なシーンに苦戦している。
既存のデータセットには、密集した複雑なオブジェクトインタラクションの例が欠けているのです。
このギャップに対処するために、構造的に複雑なシーンを持つ大規模なLayout-to-ImageデータセットであるOverLay++を紹介します。
OverLay++は、画像当たり平均6.6オブジェクトの約500Kイメージを含み、既存のデータセットを1.67倍のアノテーション密度で上回る。
アノテーション密度以外にも、OverLay++は、現在のデータセットの6倍以上の長いオブジェクトキャプションで、リッチなセマンティックディテールを提供します。
データセット生成パイプラインはシンプルで、オブジェクトごとのリッチなキャプションで重なり合うオブジェクトアノテーションを生成します。
複数のベンチマークを通じて、OverLay++データセットでトレーニングされた最先端のLayout-to-Imageメソッドは、一貫した改善とより高速な収束を示し、制御可能な画像生成のための高密度、重複認識、キャプションリッチな監視の重要性を示している。
関連論文リスト
- PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes [32.05027130743237]
PoseAdapterは、2.5D制御可能な高忠実度画像生成のためのフレームワークである。
個々のオブジェクトキャプション、2Dバウンディングボックス、3Dアングルを使用して正確な空間角アンカーを確立する。
空間的精度、向きの精度、多目的視力において最先端のベースラインを上回ります。
論文 参考訳(メタデータ) (2026-08-16T07:18:58Z) - StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling [112.49355973930555]
マルチ参照画像生成は、テキスト命令下で複数の参照画像からの属性を統合することで、画像を合成することを目的としている。
既存のアプローチは、自然言語の命令にのみ依存しているが、複雑な意図を正確に捉えることができないことが多い。
複数の参照画像をエンコードするために構造化された辞書のような形式を用いるStructGenを提案する。
論文 参考訳(メタデータ) (2026-07-17T04:35:36Z) - Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation [43.338311770275745]
我々は、Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlantという3つのオブジェクト中心のデータセットリソースの共有可能なコレクションを提示します。
このコレクションは256-by-256オブジェクト中心のクロップとバウンディングボックスアノテーションを3つのレシエーションで標準化している。
このコレクションは、ラベルと分割検査、サブセットの作成、上流データからの再構成、および共有レコード上でのオブジェクト中心の画像生成または合成データ拡張方法の評価をサポートする。
論文 参考訳(メタデータ) (2026-06-19T05:32:30Z) - ObjectMate: A Recurrence Prior for Object Insertion and Subject-Driven Generation [33.91045409317844]
本稿では,オブジェクト挿入と主観的生成の両方のためのチューニング不要な手法を提案する。
このタスクでは、複数のビューを与えられたオブジェクトを、画像またはテキストによって指定されたシーンにコンパイルする。
我々は,オブジェクト挿入と主観的生成の最先端手法と比較し,単一の参照や複数参照を用いて比較した。
論文 参考訳(メタデータ) (2024-12-11T18:59:53Z) - Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling [81.69474860607542]
画像とテキストの両方にインスタンスレベルのアノテーションを追加する大規模データセットであるOpenstory++を提示する。
また、長いマルチモーダルコンテキストが提供される際に、画像生成タスクを評価するための先駆的なベンチマークフレームワークであるCohere-Benchについても紹介する。
論文 参考訳(メタデータ) (2024-08-07T11:20:37Z) - Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation [58.09421301921607]
我々は、主観的画像編集と生成のための最初の大規模データセットを構築した。
データセットは、以前の最大のデータセットの5倍のサイズですが、コストは、何万時間も低いです。
論文 参考訳(メタデータ) (2024-06-13T16:40:39Z) - Zero-shot spatial layout conditioning for text-to-image diffusion models [52.24744018240424]
大規模テキスト・画像拡散モデルでは、生成画像モデリングにおける技術の現状が大幅に改善されている。
画像キャンバスのセグメントに関連付けられたテキストからの画像生成を考察し、直感的な自然言語インタフェースと生成されたコンテンツの正確な空間制御を組み合わせた。
ZestGuideは,事前学習したテキスト・画像拡散モデルにプラグイン可能なゼロショットセグメンテーション誘導手法である。
論文 参考訳(メタデータ) (2023-06-23T19:24:48Z) - DALL-E for Detection: Language-driven Context Image Synthesis for Object
Detection [18.276823176045525]
本稿では,大規模なコンテキスト画像の自動生成のための新しいパラダイムを提案する。
我々のアプローチの核心は、文脈の言語記述と言語駆動画像生成の相互作用を利用することである。
本研究では,4つのオブジェクト検出データセットに対する事前の文脈画像生成手法に対するアプローチの利点を実証する。
論文 参考訳(メタデータ) (2022-06-20T06:43:17Z) - DatasetGAN: Efficient Labeled Data Factory with Minimal Human Effort [117.41383937100751]
現在のディープネットワークは、大規模なデータセットのトレーニングの恩恵を受ける、非常にデータハングリーです。
GAN潜入コードがどのようにデコードされ、イメージのセマンティックセグメンテーションを生成するかを示す。
これらの生成されたデータセットは、実際のデータセットと同じように、コンピュータビジョンアーキテクチャのトレーニングに使用できます。
論文 参考訳(メタデータ) (2021-04-13T20:08:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。