論文の概要: LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
- arxiv url: http://arxiv.org/abs/2608.11745v2
- Date: Thu, 13 Aug 2026 06:21:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.780918
- Title: LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time
- Title(参考訳): LiveAnimate: 人間のアニメーションをリアルタイムでストリーミングできる安定型長編アニメーション
- Authors: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang,
- Abstract要約: 本稿では,リアルタイムストリーミングと安定な長周期生成を10億スケールで組み合わせたアニメーションシステムを提案する。
LiveAnimateは、最初の30秒から最終分まで、知覚品質とアイデンティティをほぼ一定に維持する。
これらの結果は、インタラクティブなフルボディアニメーションのための品質、レイテンシ、持続時間において、新たな操作ポイントを確立する。
- 参考スコア(独自算出の注目度): 26.186924581106087
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pose-driven human animation synthesizes a video of a target person from a single reference image and a driving pose stream. Real-time generation is essential for interactive applications such as live streaming, telepresence, and virtual avatars, yet diffusion-based systems require minutes to hours per clip, precluding responsive interaction. We present LiveAnimate, to our knowledge the first animation system to combine real-time streaming with stable long-form generation at billion scale, built on a 14B-parameter video Diffusion Transformer (DiT). A two-stage training pipeline first adapts a pretrained bidirectional DiT into a block-causal autoregressive generator through Reference-Anchored Teacher-Forcing Adaptation, and then reduces the sampling budget to three steps through Block-wise Self-Forcing Distillation. To preserve appearance over extended streams, we introduce Pose-Retrieval Sink Attention (PR-Sink), a bounded KV-cache mechanism combining a Static Sink that permanently anchors the first generated block, a Dynamic Sink that holds a pose-retrieved historical block, and a three-slot Rolling Window. When a pose recurs, PR-Sink restores the relevant appearance context without retaining the entire sequence, so memory and per-block latency remain constant regardless of stream duration. Together with Ulysses sequence parallelism and operator fusion, these designs enable 19.63\,FPS streaming inference on two NVIDIA H100 GPUs. On a three-minute benchmark, LiveAnimate maintains nearly constant perceptual quality and identity from the first 30 seconds to the final minute, while prior systems degrade substantially or require hours of offline computation for the same rollout. These results establish a new operating point in quality, latency, and duration for interactive full-body animation.
- Abstract(参考訳): 詩駆動の人間アニメーションは、単一の参照画像と駆動ポーズストリームから対象者のビデオを合成する。
リアルタイム生成は、ライブストリーミング、テレプレゼンス、仮想アバターのようなインタラクティブなアプリケーションには不可欠である。
そこで本研究では,14Bパラメータビデオ拡散変換器(DiT)をベースとした,リアルタイムストリーミングと安定な長文生成を10億スケールで組み合わせたアニメーションシステムLiveAnimateについて述べる。
2段階の訓練パイプラインは、まず、予め訓練された双方向のDiTを参照アンコール教師強制適応を介してブロック因果自己回帰生成器に適応させ、次に、Block-wise Self-Forcing Distillationを介してサンプリング予算を3ステップに短縮する。
拡張ストリーム上での出現を維持するため,Pose-Retrieval Sink Attention (PR-Sink) を導入し,第1生成ブロックを永久にアンカーする静的シンクと,ポーズ検索履歴ブロックを保持する動的シンクと,3スロットローリングウィンドウを組み合わせた境界KVキャッシュ機構を導入する。
ポーズが再帰すると、PR-Sinkはシーケンス全体を保持することなく、関連する外観コンテキストを復元する。
これらの設計はUlyssesシーケンス並列性と演算子融合と共に、2つのNVIDIA H100 GPU上で19.63\,FPSストリーミング推論を可能にする。
3分間のベンチマークでは、LiveAnimateは最初の30秒から最終分まで知覚品質とアイデンティティをほぼ一定に維持し、以前のシステムは大幅に劣化するか、同じロールアウトに数時間のオフライン計算を必要とする。
これらの結果は、インタラクティブなフルボディアニメーションのための品質、レイテンシ、持続時間において、新たな操作ポイントを確立する。
関連論文リスト
- Wan-Animate-2: Pushing the Application Boundaries of Character Animation [26.88580952829003]
Wan-Animate-2は、Diffusion Transformerで動画を直接消費するエンドツーエンドのキャラクターアニメーションフレームワークである。
本アーキテクチャは,中間運動抽出器を完全に取り除き,動きの忠実度とアイデンティティの保存性が向上する。
We present Wan-Animate-2-Lite, a efficientvariant that inference latency to real-time thresholds。
論文 参考訳(メタデータ) (2026-08-06T13:13:10Z) - LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams [59.485485426790966]
このLiveStarProは、長時間のストリーミング上でのプロアクティブなビデオ理解のために設計されたライブストリーミングアシスタントである。
LiveStarProは既存のメソッドを一貫して上回り、セマンティックな正確性は28.9%向上した。
そのストリーミングキーバリューキャッシュは、キャッシュなしで同じモデル上で1.58倍の推論速度を得る。
論文 参考訳(メタデータ) (2026-06-16T11:18:05Z) - EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration [74.49189147054337]
本研究では,長軸アニメーション映像生成のための効率的なポストトレーニング手法であるEverAnimateを提案する。
EverAnimateは、ジェネレーションを永続的な潜在コンテキストメモリにアンカーすることで、ドリフトしたフロートラジェクトリを復元する。
ライトウェイトなLoRAチューニングだけで、EverAnimateは最先端のロングアニメーションメソッドをショート・ホライズンとロング・ホライズンの両方で上回ります。
論文 参考訳(メタデータ) (2026-05-14T16:36:34Z) - Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation [16.692450893925148]
リアルタイム・ポートレート・アニメーションのためのKnot Forcingという新しいストリーミング・フレームワークを提案する。
Kノットフォーシングは、無限列上の高忠実で時間的に一貫性があり、インタラクティブなポートレートアニメーションを可能にする。
論文 参考訳(メタデータ) (2025-12-25T16:34:56Z) - StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation [65.90400162290057]
生成モデルは、コンテンツの作り方、スタイル、配信方法を再定義することで、ライブストリーミング業界を変革している。
ビデオ拡散の最近の進歩は、オフライン生成のための時間的一貫性とサンプリング効率を著しく改善した。
ライブオンラインストリーミングは厳しいサービスレベル(SLO)の下で動作します。 タイム・ツー・ファーストフレームは最小限でなければなりません。
論文 参考訳(メタデータ) (2025-11-10T18:51:28Z) - MotionStream: Real-Time Video Generation with Interactive Motion Controls [60.403597895657505]
単一GPU上で最大29FPSのストリーミング生成が可能なサブ秒レイテンシを実現するMotionStreamを提案する。
提案手法は,グローバルなテキストプロンプトとローカルなモーションガイダンスに準拠する高品質なビデオを生成するが,リアルタイムでは推論を行わないモーションコントロールによるテキスト・ツー・ビデオモデルの拡張から始まる。
我々のモデルでは、動きの追従と映像の質を2桁高速化し、無限長のストリーミングを可能にする。
論文 参考訳(メタデータ) (2025-11-03T06:37:53Z) - Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation [75.71558917038838]
Lookahead Anchoringは、時間的自己回帰生成におけるアイデンティティドリフトを防ぐ。
固定境界から方向ビーコンに変形する。
セルフキーフレーミングも可能で、参照イメージがルックアヘッドターゲットとして機能する。
論文 参考訳(メタデータ) (2025-10-27T17:50:19Z) - UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation [53.16986875759286]
We present a UniAnimate framework to enable efficient and long-term human video generation。
我々は、姿勢案内やノイズビデオとともに参照画像を共通の特徴空間にマッピングする。
また、ランダムノイズ入力と第1フレーム条件入力をサポートする統一ノイズ入力を提案する。
論文 参考訳(メタデータ) (2024-06-03T10:51:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。