論文の概要: AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars
- arxiv url: http://arxiv.org/abs/2607.24013v1
- Date: Mon, 27 Jul 2026 05:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.319845
- Title: AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars
- Title(参考訳): AptAvatar:生産可能なアバターのための高速で生き生きとしたオーディオ駆動ビデオ生成
- Authors: Hengyuan Zhang, Jingna Sun, Meiguang Jin, Junfeng Ma,
- Abstract要約: AptAvatarは、高速かつ表現力のある推論を提供する、オーディオ駆動アバター生成フレームワークである。
実験では、AptAvatarは2 NFEで720pの鮮やかな長ビデオを生成し、60倍のスピードアップを達成した。
- 参考スコア(独自算出の注目度): 8.684276604886032
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Production-ready audio-driven avatar generation requires efficient inference without sacrificing fidelity or motion expressiveness. However, existing acceleration methods often compromise quality through restrictive architectural choices, such as causal attention and short temporal horizons, or by reducing model capacity and resolution. Without such compromises, we propose AptAvatar, a 14B-parameter long-form audio-driven avatar generation framework that delivers fast and expressive inference. For efficiency in production-level applications, AptAvatar addresses the extreme two-step generation challenge. To bridge the gap between the multi-step teacher model and the two-step student model, we introduce Endpoint-Anchored Distribution Distillation. It augments vanilla distribution matching with a dedicated Anchor Score Estimator trained on the trajectory-endpoint distribution defined from a frozen pretrained 4-step bridge generator. This provides an attainable endpoint-level anchor for the evolving two-step student. To improve long-horizon consistency, we further introduce Self-Generated History Replay, which reuses cached outputs from earlier generator checkpoints as history conditions during chunk-wise training. This approximates inference-time conditioning on self-generated histories without costly online rollouts, mitigating quality degradation from accumulated history errors. Extensive experiments demonstrate that AptAvatar generates vivid 720p long-form avatar videos with only 2 NFEs, achieving a 60x speedup while preserving visual fidelity and long-horizon identity. Code is available at https://github.com/TaoLiveAIGC/AptAvatar
- Abstract(参考訳): 生産可能なオーディオ駆動アバター生成は、忠実さや動きの表現性を犠牲にすることなく効率的な推論を必要とする。
しかし、既存の加速法は、因果的注意や短い時間的地平線といった限定的なアーキテクチャ選択や、モデルの容量と解像度を減少させることによって品質を損なうことが多い。
このような妥協がなければ、高速かつ表現力のある推論を提供する14Bパラメータ長形式のオーディオ駆動アバター生成フレームワークであるAptAvatarを提案する。
プロダクションレベルのアプリケーションの効率性のために、AptAvatarは極端な2ステップ生成課題に対処する。
多段階の教師モデルと2段階の学生モデルとのギャップを埋めるために,エンドポイント・アンコール分布蒸留を導入する。
凍結した4段階のブリッジジェネレータから定義された軌跡-端点分布に基づいて訓練した専用アンカースコア推定器とバニラ分布をマッチングする。
これにより、進化する2ステップの学生に対して、達成可能なエンドポイントレベルのアンカーを提供する。
さらに,時間軸整合性を改善するために,初期ジェネレータチェックポイントからのキャッシュ出力をチャンクワイズトレーニング中の履歴条件として再利用するセルフジェネレーションヒストリプレイを導入する。
これにより、コストのかかるオンラインロールアウトのない自己生成履歴の推測時間条件が近似され、蓄積した履歴エラーによる品質劣化が軽減される。
大規模な実験により、AptAvatarは2NFEで鮮やかな720pの長めのアバタービデオを生成し、60倍のスピードアップを実現した。
コードはhttps://github.com/TaoLiveAIGC/AptAvatarで入手できる。
関連論文リスト
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators [68.69611976783243]
OPSD-Vは、数ステップの自己回帰(AR)ビデオ拡散モデルの訓練後の自己蒸留パラダイムである。
鍵となるアイデアは、トレーニング中の時間的文脈として実際の長時間ビデオデータを導入し、それを高密度な軌跡レベルの監視に使用することである。
実験では、視覚的品質、運動力学、VBenchLongスコアが一貫した改善を示している。
論文 参考訳(メタデータ) (2026-07-09T17:59:11Z) - FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching [68.01498128172214]
本稿では,アーキテクチャに依存しない,追加のトレーニングを必要としない長大なビデオ生成のための,斬新でシンプルな推論時間アプローチを提案する。
提案手法では,隣接するウィンドウからのクリーンサンプルをemphTweedieマッチングでブレンドし,テキストbfmanifoldの制約と重複領域間の時間的一貫性を強制する。
本手法は, 時間的一貫性と視覚的品質において, トレーニング不要, 自己回帰ベースラインを両立させながら, ネイティブウィンドウ長よりも数倍長大のビデオを生成する。
論文 参考訳(メタデータ) (2026-05-20T08:55:37Z) - Generate Your Talking Avatar from Video Reference [54.88475181123363]
既存の会話アバター法は、通常、ターゲット生成と同じシーン内の静的参照画像に条件付きイメージ・ツー・ビデオパイプラインを採用する。
本稿では,ビデオレファレンス(TAVR)からのトークアバター生成について紹介する。
論文 参考訳(メタデータ) (2026-04-30T14:22:27Z) - KlingAvatar 2.0 Technical Report [43.949604396366425]
本モデルは,マルチモーダル・アライメントの長めの高解像度ビデオ生成における課題を効果的に解決する。
視覚的明瞭度の向上、正確な唇同期によるリアルな唇歯のレンダリング、強力なアイデンティティ保存、そしてコヒーレントなマルチモーダル・インストラクションを提供する。
論文 参考訳(メタデータ) (2025-12-15T13:30:51Z) - JoyAvatar: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion [19.420963062956222]
JoyAvatarは、リアルタイム推論と無限長のビデオ生成が可能なオーディオ駆動の自己回帰モデルである。
我々のモデルは、視覚的品質、時間的一貫性、唇同期の競合的な結果を達成する。
論文 参考訳(メタデータ) (2025-12-12T10:06:01Z) - Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length [57.458450695137664]
提案するLive Avatarは,効率的,高忠実,無限長アバター生成のためのアルゴリズム設計のフレームワークである。
ライブアバターは、このスケールで実用的でリアルタイムで高忠実なアバター生成を実現するのが最初である。
論文 参考訳(メタデータ) (2025-12-04T11:11:24Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。