論文の概要: StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling
- arxiv url: http://arxiv.org/abs/2607.15619v1
- Date: Fri, 17 Jul 2026 04:35:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.749252
- Title: StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling
- Title(参考訳): StructGen:構造化コンテキストモデリングによるマルチ参照画像生成の曖昧化
- Authors: Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei,
- Abstract要約: マルチ参照画像生成は、テキスト命令下で複数の参照画像からの属性を統合することで、画像を合成することを目的としている。
既存のアプローチは、自然言語の命令にのみ依存しているが、複雑な意図を正確に捉えることができないことが多い。
複数の参照画像をエンコードするために構造化された辞書のような形式を用いるStructGenを提案する。
- 参考スコア(独自算出の注目度): 112.49355973930555
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-reference image generation aims to synthesize images by integrating attributes from multiple reference images under textual instructions. As the number of references increases, the task necessitates complex semantic comprehension, such as correctly associating attributes with the intended subjects and planing out coherent spatial arrangement between subjects and their environments. Existing approaches, which rely solely on natural language instruction, often fail to capture these complex intentions precisely, leading to semantic misalignment and inconsistent generation. We identify two key factors behind these limitations: natural language instructions are often verbose and ambiguous, and high-quality multi-reference data is scarce. To address these issues, we propose StructGen, which employs a structured, dictionary-like format to encode multiple reference images, thereby enabling explicit and unambiguous specification of generation intentions. To support this design, we construct a structured dataset based on high-quality real images and develop a corresponding training framework, along with a dedicated benchmark for challenging multi-reference scenarios. Extensive experiments on both public benchmarks and our proposed benchmark demonstrate that StructGen consistently outperforms existing methods on both semantic alignment and detailed reference-generation consistency, especially under complex instructions with multiple references. The code is available at \href{https://jianingpeng0382.github.io/StructGen/}{https://jianingpeng0382.github.io/StructGen/}.
- Abstract(参考訳): マルチ参照画像生成は、テキスト命令下で複数の参照画像からの属性を統合することで、画像を合成することを目的としている。
参照数が増えるにつれて、タスクは、属性を意図した対象と正しく関連付けることや、対象と環境の間の一貫性のある空間配置を計画するなど、複雑な意味的理解を必要とする。
既存のアプローチは、自然言語の命令にのみ依存しているが、しばしばこれらの複雑な意図を正確に捉えることができず、意味的なミスアライメントと一貫性のない生成につながる。
自然言語命令はしばしば冗長で曖昧であり、高品質なマルチ参照データが不足している。
そこで本研究では,複数の参照画像のエンコードに構造化された辞書型フォーマットを用いたStructGenを提案する。
この設計を支援するために、高品質な実画像に基づいて構造化データセットを構築し、それに対応するトレーニングフレームワークを開発し、マルチ参照シナリオに挑戦するための専用のベンチマークを作成する。
公的なベンチマークと提案したベンチマークの両方において、StructGenは、特に複数の参照を持つ複雑な命令の下で、セマンティックアライメントと詳細な参照生成の整合性の両方において、既存のメソッドよりも一貫して優れていることを示す。
コードは \href{https://jianingpeng0382.github.io/StructGen/}{https://jianingpeng0382.github.io/StructGen/} で公開されている。
関連論文リスト
- Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation [19.404516863003057]
INSETは、テキスト命令内にネイティブ語彙として画像をシームレスに埋め込む統合生成モデルである。
本稿では,標準画像およびビデオデータセットから1500万件の高品質なインターリーブ付きサンプルを合成するスケーラブルなデータエンジンを提案する。
InterleaveBenchの結果は、INSETがマルチイメージの一貫性とテキストアライメントにおいて最先端の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-12T15:54:49Z) - Semantic-Structural Alignment for Generative Pictorial Charts [59.45629259524998]
画像チャートの自動合成のための生成フレームワークを提案する。
2つの並列外部制御信号によって誘導される二重条件生成タスクとしてこの問題をモデル化する。
本手法は,芸術的に魅力的で構造的に整合性のある図表を生成する。
論文 参考訳(メタデータ) (2026-05-05T05:20:46Z) - StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation [72.84181869780627]
StructDiffは、単一画像生成のための単一スケール拡散モデルに基づく生成フレームワークである。
3次元位置符号化(PE)を空間的先行として組み込んでおり、生成されたオブジェクトの位置、スケール、局所的な詳細を柔軟に制御することができる。
また、テキスト誘導画像生成、画像編集、アウトペインティング、ペイント・ツー・イメージ合成など、下流タスクにも幅広い適用性を示す。
論文 参考訳(メタデータ) (2026-04-14T10:55:43Z) - MoGen: A Unified Collaborative Framework for Controllable Multi-Object Image Generation [76.94658056824422]
MoGenは、ユーザフレンドリーなマルチオブジェクト画像生成方法である。
まず、言語記述中のフレーズ単位を対応する画像領域に正確に固定する地域意味アンカー(RSA)モジュールを設計する。
適応型マルチモーダルガイダンス(AMG)モジュールを導入し,マルチソース制御信号の様々な組み合わせを適応的に解析・統合する。
論文 参考訳(メタデータ) (2026-01-09T05:57:48Z) - MultiBanana: A Challenging Benchmark for Multi-Reference Text-to-Image Generation [38.21587139161503]
$textbfMultiBanana$は、大規模なマルチ参照固有の問題を広くカバーすることによって、モデル機能のエッジを評価するように設計されている。
分析の結果、優れたパフォーマンス、典型的な障害モード、改善すべき領域が明らかになりました。
MultiBananaはオープンなベンチマークとしてリリースされ、バウンダリをプッシュし、マルチ参照画像生成における公正な比較のための標準化された基盤を確立する。
論文 参考訳(メタデータ) (2025-11-28T08:49:55Z) - TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement [87.82338951215131]
TokenARは、参照ID混乱問題に対処するための、単純だが効果的なトークンレベル拡張機構である。
Token Injectionのインストラクションは、参照トークンの詳細なおよび補完的な事前を注入する、余分な視覚的特徴コンテナの役割として機能する。
Identity-token disentanglement Strategy(ITD)は、トークン表現を個々のアイデンティティの特徴を独立に表現するために明示的にガイドする。
論文 参考訳(メタデータ) (2025-10-18T03:36:26Z) - Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation [9.978181430065987]
LongBench-T2Iは、複雑な命令の下でテキスト・トゥ・イメージ(T2I)モデルを評価するためのベンチマークである。
LongBench-T2Iは9つの視覚的評価次元にまたがる500の複雑なプロンプトで構成されている。
Plan2Genは複雑な命令駆動の画像生成を容易にするフレームワークで、追加のモデルトレーニングを必要としない。
論文 参考訳(メタデータ) (2025-05-30T16:48:14Z) - Local and Global GANs with Semantic-Aware Upsampling for Image
Generation [201.39323496042527]
ローカルコンテキストを用いて画像を生成することを検討する。
セマンティックマップをガイダンスとして用いたクラス固有の生成ネットワークを提案する。
最後に,セマンティック・アウェア・アップサンプリング手法を提案する。
論文 参考訳(メタデータ) (2022-02-28T19:24:25Z) - Structured Multi-modal Feature Embedding and Alignment for
Image-Sentence Retrieval [12.050958976545914]
現在の最先端画像文検索手法は、視覚的テクスチャの断片を暗黙的に整列させる。
画像文検索のための構造的マルチモーダル特徴埋め込みとアライメントモデルを提案する。
特に、ビジュアルコンテキスト対応構造化木エンコーダ(VCS-Tree)とテキストコンテキスト対応構造化木エンコーダ(TCS-Tree)を共有ラベルで構築することにより、視覚的およびテキスト的フラグメントの関係をモデル化する。
論文 参考訳(メタデータ) (2021-08-05T07:24:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。