論文の概要: Avatar V: Scaling Video-Reference Avatar Video Generation
- arxiv url: http://arxiv.org/abs/2606.13872v1
- Date: Thu, 11 Jun 2026 19:55:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.627144
- Title: Avatar V: Scaling Video-Reference Avatar Video Generation
- Title(参考訳): Avatar V: ビデオ参照アバタービデオ生成のスケールアップ
- Authors: Benjamin Liang, Ce Chen, Desmond Lin, Ivan Somov, Jiajun Zhao, Jiewei Yuan, Jingfeng Zhang, Junhao Huang, Nik Nolte, Pedram Haqiqi, Penghan Wang, Rong Yan, Rui Zhang, Sam Prokopchuk, Sivan Wang, Viktor Goriachko, Yi Ren, Yuanming Li, Yutao Chen, Zhenhui Ye, Zhibin Hong, Zilong Nie, Zujin Guo,
- Abstract要約: Avatar Vは、アバタービデオを生成するためのプロダクションスケールのフレームワークである。
静的なアイデンティティ属性(界面形状、肌のテクスチャ)と動的行動パターン(トークリズム、マイクロ表現)の両方を、参照コンテキストに注意して再現することを学ぶ。
1080pの動画を無制限に生成し、最先端のアイデンティティ保存、唇の同期、そして我々のクロスシーンベンチマークで生成品質を実現します。
- 参考スコア(独自算出の注目度): 31.339851516906137
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generating avatar videos that are not merely visually similar to a target individual but behaviorally recognizable, faithfully reproducing their talking rhythm, gestural tendencies, and expression dynamics, remains an open challenge. Existing methods predominantly condition on single static images, which provide insufficient identity information and cannot capture dynamic motion traits, while standard pixel-level objectives underserve the perceptually critical facial regions that determine avatar fidelity. We present Avatar V, a production-scale framework that addresses these limitations through video-reference-conditioned identity modeling. Rather than compressing identity into fixed-size embeddings, the model conditions directly on the full token sequence of a reference video, learning to reproduce both static identity attributes (facial geometry, skin texture) and dynamic behavioral patterns (talking rhythm, micro-expressions) through attention over the reference context. We introduce Sparse Reference Attention, an asymmetric mechanism achieving linear-complexity conditioning on arbitrarily long references; a motion representation stream enabling closed-loop talking style transfer; and an identity-aware super-resolution refiner inheriting the full reference conditioning. These are supported by a data engine curating 100M+ training clips from 50M raw videos, and a five-stage training pipeline with flow matching pre-training, personality fine-tuning, two-phase distillation (>10x acceleration), and RLHF alignment, deployed across thousands of GPUs. Avatar V generates 1080p videos of unlimited duration, achieving state-of-the-art identity preservation, lip synchronization, and generation quality on our cross-scene benchmark, consistently outperforming leading systems including Seedance 2.0, Kling O3 Pro, Veo 3.1, and OmniHuman 1.5 in both automated metrics and human evaluation.
- Abstract(参考訳): アバタービデオの生成は、単に対象の個人と視覚的に似ているだけでなく、行動的に認識可能であり、話しのリズム、ジェスチャーの傾向、表現のダイナミクスを忠実に再現する。
既存の手法は主に単一静止画像に条件を定めており、識別情報が不十分であり、動特性を捉えることができないが、標準的な画素レベルの目的はアバターの忠実度を決定する知覚的に重要な顔領域を控えている。
本稿では,ビデオ参照型IDモデリングにより,これらの制約に対処する実運用規模のフレームワークであるAvatar Vを提案する。
固定サイズの埋め込みにアイデンティティを圧縮するのではなく、モデル条件は参照ビデオのトークンシーケンスに直接依存し、参照コンテキストに注意して静的なアイデンティティ属性(界面形状、肌のテクスチャ)と動的行動パターン(トークリズム、マイクロ表現)を再現することを学ぶ。
任意長の参照に対して線形複雑条件を実現する非対称機構であるスパース参照注意(Sparse Reference Attention)と、閉ループ通信スタイルの転送を可能にする動作表現ストリーム(Motion representation stream)と、全参照条件を継承するID対応超解像精細器(Sparse Reference Attention)を導入する。
これらは、5000万の生のビデオから100万以上のトレーニングクリップをキュレートするデータエンジンと、フローマッチング前トレーニング、パーソナリティの微調整、二相蒸留(>10倍の加速)、RLHFアライメントを備えた5段階のトレーニングパイプラインによってサポートされている。
Avatar Vは1080pのビデオを無制限に生成し、最先端のアイデンティティ保存、リップ同期、生成品質を我々のクロスシーンベンチマークで達成し、Seedance 2.0、Kling O3 Pro、Veo 3.1、OmniHuman 1.5といった先進的なシステムにおいて、自動測定と人的評価の両方で一貫して上回っている。
関連論文リスト
- Generate Your Talking Avatar from Video Reference [54.88475181123363]
既存の会話アバター法は、通常、ターゲット生成と同じシーン内の静的参照画像に条件付きイメージ・ツー・ビデオパイプラインを採用する。
本稿では,ビデオレファレンス(TAVR)からのトークアバター生成について紹介する。
論文 参考訳(メタデータ) (2026-04-30T14:22:27Z) - Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding [30.62635724018122]
拡散変圧器ビデオジェネレータの同一条件の変種について述べる。
短いクリップでは、ポーズや照明を横切る笑顔の作り方など、主題固有のパターンが明らかになっている。
このアプローチは、大きなポーズの変化と表現力のある顔行動の下で、恒常的にアイデンティティの保持を改善する。
論文 参考訳(メタデータ) (2026-01-04T03:41:55Z) - Audio-Driven Universal Gaussian Head Avatars [66.56656075831954]
本稿では,音声駆動型ユニバーサルフォトリアリスティックアバター合成法について紹介する。
個人に依存しない音声モデルと私たちの小説Universal Head Avatar Priorを組み合わせたものです。
我々の手法は、外観の詳細なモデリングとレンダリングを考慮に入れた最初の一般的なオーディオ駆動アバターモデルである。
論文 参考訳(メタデータ) (2025-09-23T12:46:43Z) - SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers [30.06494915665044]
ポートレート画像アニメーションを容易にするために,ビデオ拡散トランスフォーマを基盤としたSkyReels-A1を提案する。
SkyReels-A1は、ビデオDiTの強力な生成能力を活用し、顔の動き伝達精度、アイデンティティ保持、時間的コヒーレンスを向上させる。
仮想アバター、リモート通信、デジタルメディア生成などの領域に適用可能である。
論文 参考訳(メタデータ) (2025-02-15T16:08:40Z) - PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation [36.21554597804604]
カスタマイズされたID画像を持つアイデンティティ固有のヒューマンビデオ生成はまだ未調査である。
鍵となる課題は、元の動きのダイナミックさとセマンティックスを保ちながら、ハイIDの忠実さを一貫して維持することである。
我々は、合成ビデオに報酬監督の混合を適用する、$textbfPersonalVideo$と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-26T02:25:38Z) - MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes [74.82911268630463]
トーキングフェース生成(TFG)は、ターゲットアイデンティティーの顔をアニメーション化し、リアルなトーキングビデオを作成することを目的としている。
MimicTalkは、個人別TFGの効率性と堅牢性を改善するために、NeRFベースの個人非依存のジェネリックモデルから豊富な知識を活用する。
私たちのMimicTalkは、ビデオの品質、効率、表現性に関して、これまでのベースラインを超えていることが実験によって示されています。
論文 参考訳(メタデータ) (2024-10-09T10:12:37Z) - WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models [132.77237314239025]
ビデオ仮想トライオンは、衣料品のアイデンティティを維持し、ソースビデオにおける人のポーズと身体の形に適応する現実的なシーケンスを生成することを目的としている。
従来の画像ベースの手法は、ワープとブレンディングに依存しており、複雑な人間の動きや閉塞に苦しむ。
衣料品の説明や人間の動きを条件とした映像生成のプロセスとして,映像試行を再認識する。
私たちのソリューションであるWildVidFitは、画像ベースで制御された拡散モデルを用いて、一段階の合理化を図っている。
論文 参考訳(メタデータ) (2024-07-15T11:21:03Z) - VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation [79.99551055245071]
時間的安定性を向上するエンドツーエンドパイプラインであるVividPoseを提案する。
識別対応外見制御器は、他の外見の詳細を損なうことなく、追加の顔情報を統合する。
SMPL-Xからの高密度レンダリングマップとスパーススケルトンマップの両方を利用する幾何対応のポーズコントローラ。
VividPoseは、提案したWildデータセットに優れた一般化能力を示す。
論文 参考訳(メタデータ) (2024-05-28T13:18:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。