論文の概要: Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
- arxiv url: http://arxiv.org/abs/2605.20807v1
- Date: Wed, 20 May 2026 06:58:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.54004
- Title: Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
- Title(参考訳): 中間構造予測による被写体駆動画像生成の分解
- Authors: Hanzhong Guo, Yizhou Yu,
- Abstract要約: 本稿では、まずCannyマップを予測し、次に、ソースの外観と予測された構造の両方に条件付けされた最終像をレンダリングすることで、構造を外観から切り離す2段階のフレームワークを提案する。
テキストハンドリングを改善するために,100kペアのテキスト認識データセットを構築する完全自動パイプラインを導入した。
- 参考スコア(独自算出の注目度): 43.32803972800948
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subject-driven text-to-image generation still struggles to preserve high-frequency identity details such as logos, patterns, and text. Existing methods typically operate directly in RGB space, which often leads to detail degradation under substantial edits. We propose a two-stage framework that decouples structure from appearance by first predicting a Canny map and then rendering the final image conditioned on both the source appearance and the predicted structure. To improve text handling, we further introduce a fully automatic pipeline that constructs a 100k-pair text-aware dataset with cross-view textual consistency. Experiments, including GPT-4.1-based evaluation and a knowledge distillation study, show clear gains over selected baselines and suggest that intermediate structural prediction is an effective route for high-fidelity subject-driven generation. Our dataset and code will be made publicly available.
- Abstract(参考訳): 主題駆動のテキスト・ツー・イメージ生成は、ロゴやパターン、テキストなど、高周波のアイデンティティの保存に苦慮している。
既存のメソッドは通常、RGB空間で直接動作するため、かなりの編集で詳細が劣化することが多い。
本稿では、まずCannyマップを予測し、次に、ソースの外観と予測された構造の両方に条件付けされた最終像をレンダリングすることで、構造を外観から切り離す2段階のフレームワークを提案する。
テキストハンドリングを改善するため,100kペアのテキスト認識データセットを構築する完全自動パイプラインも導入した。
GPT-4.1に基づく評価と知識蒸留研究を含む実験は、選択された基準線よりも明確な利得を示し、中間構造予測が高忠実な主観的生成に有効な経路であることを示唆している。
データセットとコードは公開されます。
関連論文リスト
- JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation [10.00677022779314]
画像とキャプションを個別の視覚的およびテキスト的トークンに符号化する統合マルチモーダルフレームワークを提案する。
タスク非依存のバックボーンを維持しながら条件付き認知のための特徴予測器のクロスアテンションを組み込んだ。
提案手法は, トークンベースのT2Iにおいて, 遅延アーキテクチャ融合と目的レベルのアライメントを組み合わせることで, コンディショニング強度とバックボーンの汎用性とを効果的にバランスできることを示す。
論文 参考訳(メタデータ) (2025-10-01T14:51:10Z) - Beyond Flat Text: Dual Self-inherited Guidance for Visual Text Generation [17.552733309504486]
現実のイメージでは、斜めまたは湾曲したテキスト、特に缶、バナー、バッジは、芸術的なデザインやレイアウトの制約により、平らなテキストのように頻繁に現れる。
難易度の高いシナリオで視覚テキストを正確に生成する新しいトレーニングフリーフレームワークSTGenを導入する。
論文 参考訳(メタデータ) (2025-01-10T11:44:59Z) - Leveraging Structure Knowledge and Deep Models for the Detection of Abnormal Handwritten Text [19.05500901000957]
構造知識と手書きテキストの深層モデルを組み合わせた2段階検出アルゴリズムを提案する。
新たな半教師付きコントラストトレーニング戦略によって訓練された形状回帰ネットワークを導入し、文字間の位置関係を十分に活用する。
2つの手書きテキストデータセットを用いた実験により,提案手法は検出性能を大幅に向上できることが示された。
論文 参考訳(メタデータ) (2024-10-15T14:57:10Z) - Generating Intermediate Representations for Compositional Text-To-Image Generation [16.757550214291015]
2つの段階に基づくテキスト・画像生成のための合成手法を提案する。
第1段階では,テキストに条件付けされた1つ以上の中間表現を生成する拡散に基づく生成モデルを設計する。
第2段階では、これらの表現をテキストとともに、別個の拡散ベース生成モデルを用いて最終出力画像にマッピングする。
論文 参考訳(メタデータ) (2024-10-13T10:24:55Z) - Advancing Visual Grounding with Scene Knowledge: Benchmark and Method [74.72663425217522]
ビジュアルグラウンドディング(VG)は、視覚と言語の間にきめ細かいアライメントを確立することを目的としている。
既存のVGデータセットの多くは、単純な記述テキストを使って構築されている。
我々は、アンダーラインScene underline-guided underlineVisual underlineGroundingの新たなベンチマークを提案する。
論文 参考訳(メタデータ) (2023-07-21T13:06:02Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - TextDiffuser: Diffusion Models as Text Painters [118.30923824681642]
我々は、背景に忠実な視覚的に魅力的なテキストで画像を生成することに焦点を当てたTextDiffuserを紹介した。
我々は,OCRアノテーションを用いた最初の大規模テキスト画像データセットであるMARIO-10Mに,1000万の画像テキストペアをコントリビュートする。
テキストプロンプトのみまたはテキストテンプレート画像と併用して高品質なテキスト画像を作成し,テキストによる不完全な画像の再構成を行う,テキストディフューザは柔軟かつ制御可能であることを示す。
論文 参考訳(メタデータ) (2023-05-18T10:16:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。