論文の概要: Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis
- arxiv url: http://arxiv.org/abs/2608.00440v1
- Date: Sat, 01 Aug 2026 04:39:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.661045
- Title: Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis
- Title(参考訳): Poplar: 人中心画像データセット合成のためのスケーラブルパイプライン
- Authors: Zhishan Zou,
- Abstract要約: 人間中心のデータセットは、さまざまな人やコンテキストをカバーし、予測できない属性の組み合わせを避け、日常的な写真特性を保持し、大規模に品質管理の決定を公開する必要がある。
人中心画像データセット合成のための再現可能なパイプラインであるPoplarを提案する。
我々は、パイプライン、構成、不変生成プロンプト、監査可能な検査記録とともに、カスタマイズ可能な人間中心コレクションを構築するためのコンパクトなリソースとしてデータセットをリリースする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent image generators can synthesize convincing human-centric images, yet producing a useful collection remains different from producing a single successful image. A human-centric dataset must cover varied people and contexts, avoid implausible attribute combinations, preserve an everyday photographic character, and expose quality-control decisions at scale. We present Poplar, a reproducible Specify--Render--Inspect pipeline for human-centric image dataset synthesis. Specify samples structured attributes under commonsense constraints and verbalizes them as photography-oriented prompts. Render uses a realism-adapted image generator across composition-aware aspect ratios and retries obvious technical failures. Inspect applies a single structured vision--language review to each candidate, preserving the original prompt while rejecting intrinsic image defects or material prompt mismatches. Using Poplar, we construct Poplar-9K: 9,401 curated human-centric image--text pairs retained from 11,765 reviewed candidates (79.9\% acceptance). We release the dataset together with the pipeline, configurations, immutable generation prompts, and auditable inspection records as a compact resource for building customizable human-centric collections.
- Abstract(参考訳): 最近の画像生成装置は、説得力のある人間中心の画像を合成することができるが、有用なコレクションは、単一の成功画像と異なるままである。
人間中心のデータセットは、さまざまな人やコンテキストをカバーし、予測できない属性の組み合わせを避け、日常的な写真特性を保持し、大規模に品質管理の決定を公開する必要がある。
我々は、人間中心の画像データセット合成のための再現可能な特定-レンダー-インスペクションパイプラインであるPoplarを提案する。
コモンセンス制約の下で構造化された属性を指定し、写真指向のプロンプトとして言語化する。
Renderは、構成対応アスペクト比をまたいだリアリズム適応イメージジェネレータを使用して、明らかな技術的失敗をリトライする。
Inspectは、各候補に対して単一の構造化された視覚-言語レビューを適用し、固有の画像欠陥や物質的プロンプトのミスマッチを拒絶しながら、元のプロンプトを保存する。
Poplarを用いてPoplar-9K: 9,401キュレートされた人中心画像テキストペアを11,765人の審査済み候補(79.9\%)から保持する。
我々は、パイプライン、構成、不変生成プロンプト、監査可能な検査記録とともに、カスタマイズ可能な人間中心コレクションを構築するためのコンパクトなリソースとしてデータセットをリリースする。
関連論文リスト
- Chimera: Compositional Image Generation using Part-based Concepting [62.66883021706129]
我々は、異なるソース画像から特定部分を組み合わせることで、新しいオブジェクトを生成するパーソナライズされた画像生成モデルであるChimeraを紹介する。
我々は,イメージコンディショニング機能を活用し,セマンティック・アイデンティティと空間的レイアウトの両方を強制する,部分条件誘導を用いたカスタム拡散事前モデルを訓練する。
人間の評価と測定値から,キメラは他の基準線を14%上回り,構成精度は21%,視力は21%向上した。
論文 参考訳(メタデータ) (2025-10-20T20:20:47Z) - Human Body Restoration with One-Step Diffusion Model and A New Benchmark [74.66514054623669]
本稿では,高品質な自動収穫・フィルタリング(HQ-ACF)パイプラインを提案する。
このパイプラインは、既存のオブジェクト検出データセットやその他のラベル付けされていないイメージを活用して、高品質な人間の画像を自動的にトリミングし、フィルタリングする。
また,人体修復のための新しい1段階拡散モデルであるemphOSDHumanを提案する。
論文 参考訳(メタデータ) (2025-02-03T14:48:40Z) - ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions [74.30040551058319]
ComposeAnyoneはマルチモーダル条件を分離した制御可能なレイアウト・ツー・ヒューマン生成手法である。
我々のデータセットは、各人間の画像の異なるコンポーネントに対して、分離されたテキストと参照画像アノテーションを提供する。
複数のデータセットの実験では、ComposeAnyoneが所定のレイアウトに整合して人間の画像を生成することが示されている。
論文 参考訳(メタデータ) (2025-01-21T14:32:47Z) - Stellar: Systematic Evaluation of Human-Centric Personalized
Text-to-Image Methods [52.806258774051216]
我々は,個々のイメージを入力し,生成プロセスの基盤となるテキストと,所望の視覚的コンテキストを記述したテキストに焦点をあてる。
我々は,既存の関連するデータセットよりも桁違いの大きさの個人画像と,リッチなセマンティックな接地真実アノテーションが容易に利用できるパーソナライズされたプロンプトを含む標準化データセット(Stellar)を紹介した。
被験者ごとにテストタイムの微調整を必要とせず,新しいSoTAを定量的かつ人為的に設定した,シンプルで効率的でパーソナライズされたテキスト・ツー・イメージのベースラインを導出する。
論文 参考訳(メタデータ) (2023-12-11T04:47:39Z) - DIAR: Deep Image Alignment and Reconstruction using Swin Transformers [3.1000291317724993]
画像歪みのある画像を含むデータセットを作成する。
我々は、対応する地平線ホモグラフをラベルとして、視点歪みを生成する。
データセットを使用して、Swinトランスフォーマーモデルをトレーニングし、シーケンシャルな画像データを分析します。
論文 参考訳(メタデータ) (2023-10-17T21:59:45Z) - Likelihood-Based Text-to-Image Evaluation with Patch-Level Perceptual
and Semantic Credit Assignment [48.835298314274254]
生成した画像の可能性を直接推定し,テキスト・画像生成性能を評価する。
高い確率は、知覚品質が向上し、テキスト画像のアライメントが向上することを示している。
これらのモデルの生成能力を、数百のサンプルで評価することができる。
論文 参考訳(メタデータ) (2023-08-16T17:26:47Z) - Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images [60.34381768479834]
近年の拡散モデルの発展により、自然言語のテキストプロンプトから現実的なディープフェイクの生成が可能になった。
我々は、最先端拡散モデルにより生成されたディープフェイク検出に関する体系的研究を開拓した。
論文 参考訳(メタデータ) (2023-04-02T10:25:09Z) - Semantically Consistent Person Image Generation [18.73832646369506]
文脈認識型人物画像生成のためのデータ駆動型アプローチを提案する。
本手法では,生成した人物の位置,規模,外観を,現場の既存人物に対して意味的に条件付けする。
論文 参考訳(メタデータ) (2023-02-28T16:34:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。