論文の概要: AnyMaker: Zero-shot General Object Customization via Decoupled Dual-Level ID Injection
- arxiv url: http://arxiv.org/abs/2406.11643v1
- Date: Mon, 17 Jun 2024 15:26:22 GMT
- ステータス: 処理完了
- システム内更新日: 2024-06-18 14:12:50.348910
- Title: AnyMaker: Zero-shot General Object Customization via Decoupled Dual-Level ID Injection
- Title(参考訳): AnyMaker: Decoupled Dual-Level ID注入によるゼロショット汎用オブジェクトのカスタマイズ
- Authors: Lingjie Kong, Kai Wu, Xiaobin Hu, Wenhui Han, Jinlong Peng, Chengming Xu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yanwei Fu,
- Abstract要約: 我々は,高ID忠実度とフレキシブルテキスト編集性を備えた汎用オブジェクトを生成するフレームワークであるAnyMakerを紹介する。
AnyMakerの有効性は、新しい一般ID抽出、二重レベルID注入、およびID認識デカップリングに起因している。
我々のアプローチを検証し、汎用オブジェクトのカスタマイズの研究を促進するため、我々は最初の大規模汎用IDデータセットを作成します。
- 参考スコア(独自算出の注目度): 72.41427550339296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image based object customization, aiming to generate images with the same identity (ID) as objects of interest in accordance with text prompts and reference images, has made significant progress. However, recent customizing research is dominated by specialized tasks, such as human customization or virtual try-on, leaving a gap in general object customization. To this end, we introduce AnyMaker, an innovative zero-shot object customization framework capable of generating general objects with high ID fidelity and flexible text editability. The efficacy of AnyMaker stems from its novel general ID extraction, dual-level ID injection, and ID-aware decoupling. Specifically, the general ID extraction module extracts sufficient ID information with an ensemble of self-supervised models to tackle the diverse customization tasks for general objects. Then, to provide the diffusion UNet with the extracted ID as much while not damaging the text editability in the generation process, we design a global-local dual-level ID injection module, in which the global-level semantic ID is injected into text descriptions while the local-level ID details are injected directly into the model through newly added cross-attention modules. In addition, we propose an ID-aware decoupling module to disentangle ID-related information from non-ID elements in the extracted representations for high-fidelity generation of both identity and text descriptions. To validate our approach and boost the research of general object customization, we create the first large-scale general ID dataset, Multi-Category ID-Consistent (MC-IDC) dataset, with 315k text-image samples and 10k categories. Experiments show that AnyMaker presents remarkable performance in general object customization and outperforms specialized methods in corresponding tasks. Code and dataset will be released soon.
- Abstract(参考訳): テキスト・ツー・イメージ・オブジェクトのカスタマイズは、テキストのプロンプトや参照画像に応じて、同じID(ID)で画像を生成することを目的としており、大きな進歩を遂げている。
しかし、近年のカスタマイズ研究は、人間のカスタマイズや仮想試行のような特殊なタスクに支配されており、一般的なオブジェクトのカスタマイズにギャップが残されている。
この目的のために、AnyMakerという革新的なゼロショットオブジェクトカスタマイズフレームワークを導入し、高いID忠実度と柔軟なテキスト編集性を持つ汎用オブジェクトを生成する。
AnyMakerの有効性は、新しい一般ID抽出、二重レベルID注入、およびID認識デカップリングに起因している。
具体的には、汎用ID抽出モジュールは、汎用オブジェクトの多様なカスタマイズタスクに取り組むために、自己教師付きモデルのアンサンブルで十分なID情報を抽出する。
そして, 生成プロセスにおけるテキスト編集性を損なうことなく, 抽出したIDを拡散するUNetを提供するために, グローバルなローカルなデュアルレベルIDインジェクションモジュールを設計し, グローバルレベルのセマンティックIDをテキスト記述に注入し, ローカルレベルのID詳細を新たに付加したクロスアテンションモジュールを通じてモデルに直接注入する。
さらに,非ID要素からID関連情報を非ID要素から切り離すためのID対応デカップリングモジュールを提案する。
提案手法の検証と汎用オブジェクトのカスタマイズの研究を促進するため,315kのテキストイメージサンプルと10kのカテゴリを持つ,最初の大規模汎用IDデータセットであるMC-IDC(Multi-Category ID-Consistent)データセットを構築した。
実験により、AnyMakerは一般的なオブジェクトのカスタマイズにおいて顕著なパフォーマンスを示し、対応するタスクにおける特殊なメソッドよりも優れています。
コードとデータセットはまもなくリリースされる。
関連論文リスト
- Synthesizing Efficient Data with Diffusion Models for Person Re-Identification Pre-Training [51.87027943520492]
本稿では,既知の同一性に基づく多様な画像の効率向上と生成を行う新しいパラダイムDiffusion-ReIDを提案する。
提案したパラダイムに適合して,まず,5,183個のIDから777K以上の画像で構成された,大規模なRe-IDデータセットDiff-Personを新たに作成する。
論文 参考訳(メタデータ) (2024-06-10T06:26:03Z) - Infinite-ID: Identity-preserved Personalization via ID-semantics Decoupling Paradigm [31.06269858216316]
アイデンティティ保存型パーソナライゼーションのためのID-セマンティックデカップリングパラダイムであるInfinite-IDを提案する。
我々は、十分なID情報を取得するために、追加のイメージクロスアテンションモジュールを組み込んだアイデンティティ強化トレーニングを導入する。
また、2つのストリームをシームレスにマージするために、混合アテンションモジュールとAdaIN平均演算を組み合わせた機能相互作用機構を導入する。
論文 参考訳(メタデータ) (2024-03-18T13:39:53Z) - Magic-Me: Identity-Specific Video Customized Diffusion [72.05925155000165]
本稿では、VCD(Video Custom Diffusion)と呼ばれる、制御可能な被写体識別制御可能なビデオ生成フレームワークを提案する。
いくつかの画像によって定義された特定IDにより、VCDはアイデンティティ特性を強化し、安定したビデオ出力のためにフレームワイズ相関を注入する。
我々は、VCDがベースラインよりも優れたIDで安定した動画を生成可能であることを検証するために、広範囲な実験を行った。
論文 参考訳(メタデータ) (2024-02-14T18:13:51Z) - PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding [102.07914175196817]
PhotoMakerは、効率的なパーソナライズされたテキスト・ツー・イメージ生成方法である。
任意の数の入力ID画像をスタックID埋め込みに符号化し、ID情報を保存する。
論文 参考訳(メタデータ) (2023-12-07T17:32:29Z) - Zero-Shot In-Distribution Detection in Multi-Object Settings Using
Vision-Language Foundation Models [37.36999826208225]
本稿では,ゼロショット・イン・ディストリビューション(ID)検出と呼ばれる新しい問題設定を提案する。
我々は、IDオブジェクトを含むイメージを(OODオブジェクトを含む場合でも)IDイメージとして識別し、IDオブジェクトを持たないイメージをOODイメージとしてトレーニングせずに識別する。
本稿では,CLIP機能のグローバルおよびローカルな視覚テキストアライメントに基づく,シンプルで効果的な概念マッチング手法であるGlobal-Local Concept Matchingを提案する。
論文 参考訳(メタデータ) (2023-04-10T11:35:42Z) - Multi-Stage Spatio-Temporal Aggregation Transformer for Video Person
Re-identification [78.08536797239893]
本稿では,2つの新しいプロキシ埋め込みモジュールを設計したMSTAT(Multi-Stage Space-Temporal Aggregation Transformer)を提案する。
MSTATは、属性関連、アイデンティティ関連、および属性関連情報をビデオクリップからエンコードする3つのステージから構成される。
MSTATは様々な標準ベンチマークで最先端の精度を達成できることを示す。
論文 参考訳(メタデータ) (2023-01-02T05:17:31Z) - Identity-Aware Multi-Sentence Video Description [105.13845996039277]
本稿では,一組のクリップ内に一貫した人物の身元を予測することを目的とした,身元確認の補助的タスクを提案する。
鍵となるコンポーネントの1つは、性別を意識したテキスト表現であり、メインモデルにおける追加の性別予測目標である。
実験の結果,提案したフィリング・イン・ザ・アイデンティティ・モデルは,いくつかのベースラインや最近の研究よりも優れていることがわかった。
論文 参考訳(メタデータ) (2020-08-22T09:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。