論文の概要: AnimeAdapter: Fine-grained and Consistent Zero-shot Anime Character Generation
- arxiv url: http://arxiv.org/abs/2605.20237v1
- Date: Sun, 17 May 2026 07:40:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.223588
- Title: AnimeAdapter: Fine-grained and Consistent Zero-shot Anime Character Generation
- Title(参考訳): AnimeAdapter:微細で一貫性のあるゼロショットアニメキャラクタ生成
- Authors: Yixuan Han,
- Abstract要約: 安定拡散のための軽量な外装アダプタを提案する。
本手法は,単一の参照画像から微細な視覚特徴を拡散過程に注入する。
そこで本研究では,Danbooruプロンプトのキュレートと再構成に基づく高品質なアニメキャラクタデータセットを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a lightweight appearance adapter for Stable Diffusion that enables controllable and consistent anime character generation under diverse editing conditions. Instead of relying on large-scale vision-language models or per-subject fine-tuning, our method injects fine-grained visual features from a single reference image into the diffusion process. Based on CLIP emergent local spatialization, we develop semantic-selective local attention. To further disentangle character appearance from spatial layout, we incorporate pose-aware conditioning during adapter training. The resulting pretrained adapter remains compact, modular, and fully compatible with Stable Diffusion community workflows, while requiring no additional fine-tuning at deployment time. Furthermore, we present a high-quality anime character dataset based on curated and restructured Danbooru prompts, and evaluate our method across several practical character editing scenarios. Our code, model weights, and dataset will be publicly released upon acceptance.
- Abstract(参考訳): 本稿では,様々な編集条件下で制御可能で一貫したアニメキャラクタ生成を可能にする,安定拡散のための軽量な外観アダプタを提案する。
大規模な視覚言語モデルやオブジェクトごとの微調整に頼るのではなく、単一の参照画像から微細な視覚特徴を拡散過程に注入する。
CLIPの創発的局所空間化に基づいて,意味選択的局所的注意を発達させる。
空間的レイアウトからキャラクタの外観をさらに遠ざけるために、アダプタトレーニング中にポーズ認識条件を組み込む。
トレーニング済みのアダプタはコンパクトでモジュール化されており、デプロイ時に追加の微調整を必要とせず、Stable Diffusionコミュニティワークフローと完全に互換性がある。
さらに,Danbooruプロンプトのキュレートと再構成に基づく高品質なアニメキャラクタデータセットを提案する。
私たちのコード、モデルウェイト、データセットは、受け入れ次第公開されます。
関連論文リスト
- PokeFusion Attention: Enhancing Reference-Free Style-Conditioned Generation [0.0]
テキスト・画像拡散モデルにおける参照不要なスタイル条件付き文字生成について検討する。
既存のアプローチでは、テキストのみのプロンプトや、推論時に外部イメージに依存する参照ベースのアダプタを導入している。
軽量デコーダレベルのクロスアテンション機構であるPokeFusion Attentionを提案する。
論文 参考訳(メタデータ) (2026-02-03T07:44:01Z) - V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping [42.87624197744494]
V-Warperは、トランスフォーマーベースのビデオ拡散モデルのためのトレーニング不要な粗いパーソナライズフレームワークである。
追加のビデオトレーニングを必要とせずに、きめ細かいアイデンティティの忠実度を高める。
即時アライメントと動きのダイナミクスを保ちながら、外観の忠実度を著しく向上させる。
論文 参考訳(メタデータ) (2025-12-13T16:05:52Z) - DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models [6.1625435030904745]
Dreamingsはレイアウト対応のストーリービジュアライゼーションフレームワークである。
文字の一貫性は29.2%向上し,スタイルの類似性も36.2%向上した。
論文 参考訳(メタデータ) (2025-12-01T13:51:41Z) - CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model [50.93869080795228]
3Dシーンを再構築し、スパースインプットビューから新しいビューを合成することは、非常に難しい作業である。
ビデオ拡散モデルの最近の進歩は、強い時間的推論能力を示している。
点条件付きビデオ拡散によるスパース入力からのクローズアップ新規ビュー合成のための拡散に基づくフレームワークであるCloseUpShotを提案する。
論文 参考訳(メタデータ) (2025-11-17T08:20:06Z) - DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation [32.24143157812589]
textbfDiffSenseiは動的マルチ文字制御でマンガを生成するために特別に設計されたフレームワークである。
DiffSenseiは、拡散ベースのイメージジェネレータと、テキスト互換のIDアダプタとして機能するマルチモーダル大言語モデル(MLLM)を統合している。
提案手法では,文字特徴をシームレスに組み込むためにマスク付きクロスアテンションを用いることで,直接ピクセル転送を行うことなく正確なレイアウト制御が可能となる。
論文 参考訳(メタデータ) (2024-12-10T15:24:12Z) - VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation [79.99551055245071]
時間的安定性を向上するエンドツーエンドパイプラインであるVividPoseを提案する。
識別対応外見制御器は、他の外見の詳細を損なうことなく、追加の顔情報を統合する。
SMPL-Xからの高密度レンダリングマップとスパーススケルトンマップの両方を利用する幾何対応のポーズコントローラ。
VividPoseは、提案したWildデータセットに優れた一般化能力を示す。
論文 参考訳(メタデータ) (2024-05-28T13:18:32Z) - Scenimefy: Learning to Craft Anime Scene via Semi-Supervised
Image-to-Image Translation [75.91455714614966]
そこで我々は,新しい半教師付き画像-画像間翻訳フレームワークであるScenimefyを提案する。
提案手法は,構造に一貫性のある擬似ペアデータによる学習を導く。
スタイル化と細部を改善するために、パッチワイドのコントラストスタイルロスが導入されている。
論文 参考訳(メタデータ) (2023-08-24T17:59:50Z) - Zero-shot Pose Transfer for Unrigged Stylized 3D Characters [87.39039511208092]
我々は、訓練において広く利用可能な非スティル化アバターのみを必要とするゼロショットアプローチを提案する。
我々は局所的な変形のパワーを利用するが、明示的な対応ラベルは必要としない。
我々のモデルは、スタイル化された四重奏法のような、アノテーションの少ないカテゴリに一般化する。
論文 参考訳(メタデータ) (2023-05-31T21:39:02Z) - Spatial Steerability of GANs via Self-Supervision from Discriminator [123.27117057804732]
本稿では,GANの空間的ステアビリティを向上させるための自己教師型アプローチを提案する。
具体的には、空間帰納バイアスとして生成モデルの中間層に符号化されるランダムなガウス熱マップを設計する。
推論中、ユーザは直感的に空間のヒートマップと対話し、シーンのレイアウトを調整したり、移動したり、オブジェクトを削除したりすることで、出力画像を編集することができる。
論文 参考訳(メタデータ) (2023-01-20T07:36:29Z) - Learning Skeletal Articulations with Neural Blend Shapes [57.879030623284216]
あらかじめ定義された骨格構造を有するエンベロープを用いて3次元文字を表現できるニューラルテクニックを開発している。
我々のフレームワークは、同じ調音構造を持つリグとスキンキャラクタを学習する。
関節領域の変形品質を向上させるニューラルブレンディング形状を提案します。
論文 参考訳(メタデータ) (2021-05-06T05:58:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。