論文の概要: Vera: Identity-Faithful Human Subject-to-Video Generation
- arxiv url: http://arxiv.org/abs/2607.20247v1
- Date: Wed, 22 Jul 2026 15:08:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.121213
- Title: Vera: Identity-Faithful Human Subject-to-Video Generation
- Title(参考訳): Vera: アイデンティティに忠実な人間対ビデオ生成
- Authors: Yulong Xu, Xinyue Liu, Shujuan Li, huafeng shi, Yan Zhou, Jiwen Liu, Xintao Wang, Yu Shen Liu, Huaibo Huang,
- Abstract要約: 単対複数対人生成のための統合人間中心型S2VフレームワークであるVeraを提案する。
まず、人物レベルのクロスクリップ検索により、100万対のアイデンティティに整合した人間の画像画像データセットを構築した。
We show that Vera improves human identity consistency, multi-person subject binding, and motion naturalness, while reduce identity confusion and excess reference-image copying。
- 参考スコア(独自算出の注目度): 66.45205582225942
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Subject-to-video (S2V) generation has made substantial progress in preserving reference subjects across diverse categories, yet generic subject consistency remains insufficient for human-centric generation. A video may appear globally consistent while identity-critical human details still drift across frames, poses, and interactions. This issue becomes more severe in multi-person scenarios, where incorrect identity-role binding leads to subject confusion, attribute swapping, and excessive copying of reference-specific appearance cues. We propose Vera, a unified human-centric S2V framework for single- and multi-person generation. We first construct a million-pair identity-aligned human image-video dataset through person-level cross-clip retrieval, providing explicit identity correspondence and diverse references. Built on this dataset, Vera introduces two complementary designs. Identity-Focal Masked Supervision (IFMS) strengthens identity-aware learning with spatially focused supervision while reducing interference from irrelevant artifacts. Reference-Aware Layer-wise Attention (RALA) regulates how video tokens interact with reference identity cues in the DiT backbone, preserving stable identity anchors and enhancing layer-aware identity readout. Extensive experiments demonstrate that Vera improves human identity consistency, multi-person subject binding, and motion naturalness, while reducing identity confusion and excessive reference-image copying.
- Abstract(参考訳): S2V 生成は様々なカテゴリーにまたがって参照対象の保存において大きな進歩を遂げているが,人間中心生成においては一般的な対象の整合性は依然として不十分である。
ビデオは世界規模で一貫したように見えるかもしれないが、アイデンティティクリティカルな人間の細部は、フレーム、ポーズ、インタラクションにまたがっている。
この問題は、不正なIDロールバインディングが対象の混乱、属性スワップ、参照固有の外観の過剰なコピーにつながる、複数の個人シナリオでより深刻になる。
単対複数対人生成のための統合人間中心型S2VフレームワークであるVeraを提案する。
まず、人物レベルのクロスクリップ検索により、100万対のアイデンティティに整合した人間の画像画像データセットを構築し、明示的なアイデンティティ対応と多様な参照を提供する。
このデータセットに基づいて構築されたVeraは、2つの補完的な設計を導入している。
IFMS(Identity-Focal Masked Supervision)は、無関係な人工物からの干渉を軽減しつつ、空間的に集中した監視によってアイデンティティ認識学習を強化する。
Reference-Aware Layer-wise Attention (RALA)は、DiTバックボーン内の参照IDキューとビデオトークンのインタラクションを規制し、安定したIDアンカーを保存し、レイヤ認識IDの読み出しを強化する。
大規模な実験により、Veraはアイデンティティの整合性、マルチパーソナライズド・サブジェクト・バインド、モーション・ナチュラルネスを改善し、アイデンティティの混乱と過剰な参照イメージのコピーを減らすことが示されている。
関連論文リスト
- Customizing Video Portraits via Identity-ActionDecoupling [32.57069491938664]
IPT2V(Identity-Preserving Text-to-Video Generation)は、参照画像とテキスト記述から時間的コヒーレントな映像を合成する。
この問題を解決するために、ID-Action Decouplingフレームワークと2つの損失関数Identity Decoupling LossとText Alignment Lossを導入します。
論文 参考訳(メタデータ) (2026-06-21T05:56:28Z) - HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation [21.0568663910476]
HarmoViewは、アイデンティティ一貫性のあるビデオ生成のための堅牢なフレームワークである。
3つのアーキテクチャの洗練と、段階的なトレーニングカリキュラムを通じて、マルチビューのキューを統合している。
HarmoViewは、オープンソースベースラインを著しく上回り、主要なクローズドソースエンジンとマッチする。
論文 参考訳(メタデータ) (2026-06-09T13:26:39Z) - FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation [28.523984146967805]
アイデンティティ保存型テキスト・ツー・ビデオ生成(IPT2V)は、ユーザに対して、一貫した人間の顔認証を備えた多様な想像力のあるビデオの作成を可能にする。
複雑な動的シーンにおいて、PT2Vを改善するために、ポーズ忠実な顔認証学習フレームワークである textitFaithfulFaces を提案する。
論文 参考訳(メタデータ) (2026-05-06T09:54:09Z) - AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation [55.94507360511886]
我々は,任意の文字にスケール可能なトランスフォーマーベースのビデオ生成フレームワークであるAnyCrowdを提案する。
具体的には、まず、DiT処理に先立って文字インスタンスを独立してエンコードするIILR(Instance-Isolated Latent Representation)を導入し、遅延IDの絡み込みを防止する。
この不整合表現に基づいて、さらに、(i)インスタンス認識フォアグラウンドアテンション、(ii)背景中心の相互作用、(iii)世界背景調整に自己注意を分解することで、運転ポーズにアイデンティティを結合するトリステージデカップリングアテンション(TSDA)を提案する。
論文 参考訳(メタデータ) (2026-03-16T15:25:04Z) - IdentityStory: Taming Your Identity-Preserving Generator for Human-Centric Story Generation [75.09818147405898]
IdentityStoryは人間中心のストーリー生成のためのフレームワークで、シーケンシャルな画像間で一貫した文字識別を保証する。
アイデンティティ保存ジェネレータを使用することで、フレームワークはIterative Identity DiscoveryとRe-denoising Identity Injectionという2つの重要なコンポーネントを備えている。
論文 参考訳(メタデータ) (2025-12-29T14:54:44Z) - WithAnyone: Towards Controllable and ID Consistent Image Generation [83.55786496542062]
アイデンティティ・一貫性・ジェネレーションは、テキスト・ツー・イメージ研究において重要な焦点となっている。
マルチパーソンシナリオに適した大規模ペアデータセットを開発する。
本稿では,データと多様性のバランスをとるためにペアデータを活用する,対照的なアイデンティティ損失を持つ新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:54Z) - StableIdentity: Inserting Anybody into Anywhere at First Sight [57.99693188913382]
一つの顔画像で同一性に一貫性のある再テクスチャ化を可能にするStableIdentityを提案する。
私たちは、1つの画像から学んだアイデンティティを直接、微調整なしでビデオ/3D生成に注入する最初の人です。
論文 参考訳(メタデータ) (2024-01-29T09:06:15Z) - T-Person-GAN: Text-to-Person Image Generation with Identity-Consistency
and Manifold Mix-Up [16.165889084870116]
テキストのみに条件付けされた高解像度の人物画像を生成するためのエンドツーエンドアプローチを提案する。
2つの新しいメカニズムで人物画像を生成するための効果的な生成モデルを開発する。
論文 参考訳(メタデータ) (2022-08-18T07:41:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。