論文の概要: Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation
- arxiv url: http://arxiv.org/abs/2608.13602v1
- Date: Fri, 07 Aug 2026 15:34:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.155635
- Title: Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation
- Title(参考訳): Omni-Live Avatar: 短時間でリアルタイムストリーミングできるオーディオ-ビジュアルアバター
- Authors: Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang,
- Abstract要約: 我々はOmni-LiveAvatarについて紹介する。Omni-LiveAvatarは、マイクロレベル、リアルタイムストリーミング共同オーディオビデオアバター生成のための最初のフレームワークである。
実験により、Omni-LiveAvatarは高品質で同期された微小なアバターをリアルタイムで生成することが示された。
- 参考スコア(独自算出の注目度): 26.625772912688387
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Joint audio-video generative models serve as foundation for immersive and interactive digital-human generation. Nevertheless, most existing models rely on bidirectional attention and multi-step denoising and can generate only short clips, making them unsuitable for real-time interaction over extended durations. We present Omni-LiveAvatar, the first framework for minute-level, real-time streaming joint audio-video avatar generation. Specifically, we propose (1) a progressive autoregressive distillation pipeline that transfers a large bidirectional joint audio-video diffusion model into a few-step autoregressive generator without auxiliary stabilization mechanisms; (2) a synchronized audio-video long-short-term memory that preserves global consistency under a bounded memory budget; and (3) a hierarchical rolling prompt planning strategy that enables coherent semantic evolution and seamless prompt transitions. Extensive experiments show that Omni-LiveAvatar generates high-quality, synchronized minute-level avatars in real time. In terms of speed, it achieves a 33$\times$ generation speedup over its teacher, LTX-2, on a single NVIDIA H200 GPU; in terms of generation quality, it outperforms accelerated baselines across visual quality, audio quality, cross-modal synchronization, and human fidelity. Our code is available at https://github.com/Aoko955/Omni-LiveAvatar.
- Abstract(参考訳): ジョイントオーディオ・ビデオ生成モデルは没入的でインタラクティブなデジタル・ヒューマン・ジェネレーションの基礎となる。
しかし、既存のほとんどのモデルは双方向の注意とマルチステップの認知に依存しており、短いクリップしか生成できないため、長期間にわたるリアルタイムインタラクションには適さない。
我々はOmni-LiveAvatarについて紹介する。Omni-LiveAvatarは、マイクロレベル、リアルタイムストリーミング共同オーディオビデオアバター生成のための最初のフレームワークである。
具体的には,(1)大規模な双方向関節型ビデオ拡散モデルを補助安定化機構のない数ステップの自己回帰生成器に転送する進行性自己回帰蒸留パイプライン,(2)境界メモリ予算の下でグローバルな一貫性を維持する同期型オーディオビデオ長期記憶,(3)コヒーレントなセマンティック進化とシームレスな即時遷移を可能にする階層的なローリングプロンプト計画戦略を提案する。
大規模な実験により、Omni-LiveAvatarは高品質で同期された微小なアバターをリアルタイムで生成することが示された。
スピードに関しては、1つのNVIDIA H200 GPU上で、教師のLTX-2よりも33$\times$ジェネレーションスピードアップを実現している。
私たちのコードはhttps://github.com/Aoko955/Omni-LiveAvatar.comから入手可能です。
関連論文リスト
- Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation [29.637920236800394]
本稿では,共同音声・視覚アバター生成のためのストリーミングフレームワークであるHolo-Liveを紹介する。
Future-Expanding Attentionでは、各ビデオブロックが同期オーディオにアクセスでき、将来的な音声のヒントも短い。
HP-DMDは、視覚的忠実度、音声の自然性、音声と視覚の同期による報酬を用いて、トレーニングサンプルを再重み付けする。
論文 参考訳(メタデータ) (2026-04-26T09:46:58Z) - Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model [52.79436545460808]
本稿では,人中心生成のためのオープンソースオーディオビデオ生成基盤モデルdaVinci-MagiHumanを紹介する。
DaVinci-MagiHumanは、単一ストリームトランスフォーマーを使用して、同期ビデオとオーディオを共同で生成する。
中国語(マンダリン語とカントン語)、英語、日本語、韓国語、ドイツ語、フランス語の多言語音声生成をサポートする。
論文 参考訳(メタデータ) (2026-03-23T13:49:06Z) - ALIVE: Animate Your World with Lifelike Audio-Video Generation [50.693986608051716]
ALIVEは、Soraスタイルのオーディオビデオ生成とアニメーションに事前訓練されたテキスト・トゥ・ビデオ(T2V)モデルを適用する世代モデルである。
音声-視覚同期と参照アニメーションをサポートするため,共用音声-ビデオブランチによるMMDiTアーキテクチャの強化を行った。
ALIVEは優れたパフォーマンスを示し、一貫してオープンソースモデルを上回り、最先端の商用ソリューションにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-02-09T14:06:03Z) - Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length [57.458450695137664]
提案するLive Avatarは,効率的,高忠実,無限長アバター生成のためのアルゴリズム設計のフレームワークである。
ライブアバターは、このスケールで実用的でリアルタイムで高忠実なアバター生成を実現するのが最初である。
論文 参考訳(メタデータ) (2025-12-04T11:11:24Z) - SoundReactor: Frame-level Online Video-to-Audio Generation [39.113214321291586]
Video-to-Audio生成モデルは、ビデオシーケンス全体やフレームのチャンクが事前に用意されていることを前提として、オフラインで動作する。
本稿では,フレームレベルのオンラインV2A生成の新たな課題を紹介する。
SoundReactorは、このタスク用に明示的に調整された、最初のシンプルで効果的なフレームワークである。
論文 参考訳(メタデータ) (2025-10-02T15:18:00Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。