論文の概要: Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
- arxiv url: http://arxiv.org/abs/2608.05663v2
- Date: Fri, 07 Aug 2026 03:30:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.107637
- Title: Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
- Title(参考訳): Vorch-Streamer:人間のオーディオ・ビジュアル・ジェネレーションをリアルタイムのロングフォーム・ストリーミングに拡張
- Authors: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang,
- Abstract要約: Vorch-Streamerは、リアルタイム・ロングフォームのText-to-Audio-Video(T2AV)ストリーミングを可能にするポストトレーニングフレームワークである。
12~21秒にまたがる80Kアバタークリップの合成コーパスを構築し、まず教師強制と拡散強制を混合した因果生成器を訓練する。
コンテキスト境界と4段階のデノベーションにより、Vorch-Streamerはテキストから27.12 FPSで音声とビデオを共同生成し、24-FPSのリアルタイム再生速度を超える。
- 参考スコア(独自算出の注目度): 24.73791931334844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time long-form avatar audio-video generation requires causal, continuous synthesis while maintaining audiovisual synchronization and visual consistency. Adapting a pretrained bidirectional model to this setting presents two key dilemmas. First, autoregressively reusing generated blocks as context creates exposure bias, causing errors and visual drift to accumulate over long rollouts. Second, a global speech utterance does not indicates a causal generator which portion should be spoken next when only limited local audio-video context is available. We present Vorch-Streamer, a post-training framework that addresses these challenges and enables real-time long-form Text-to-Audio-Video (T2AV) streaming. We construct a synthetic corpus of 80K avatar clips spanning 12-21 seconds and first train a causal generator with mixed Teacher Forcing and Diffusion Forcing. We then apply long-horizon Self Forcing with DMD distillation, exposing the model to its own rollout distribution while preserving the quality of the pretrained bidirectional teacher. To explicitly control speech progression, an external language model predicts discrete 25-Hz speech-planning tokens, whose continuous features condition the audio diffusion branch and align each causal block with the content it should speak. With bounded causal context and four-step denoising, Vorch-Streamer jointly generates audio and video from text at 27.12 FPS, exceeding the 24-FPS real-time playback rate while maintaining competitive audio-lip synchronization and strong identity preservation over long-form generation.
- Abstract(参考訳): リアルタイムのロングフォームなアバターオーディオビデオ生成には因果的かつ連続的な合成が必要であり、オーディオ視覚同期と視覚的整合性は維持される。
この設定に事前訓練された双方向モデルを適用すると、2つの重要なジレンマが現れる。
まず、コンテキストが露出バイアスを発生させ、エラーと視覚的ドリフトが長時間のロールアウトで蓄積されるため、生成されたブロックを自動回帰的に再利用する。
第二に、グローバルな音声発話は、ローカルな音声・ビデオのコンテキストに制限がある場合に、次に話すべき部分を示す因果生成器を指し示さない。
本稿では,これらの課題に対処し,リアルタイムのテキスト・トゥ・オーディオ・ビデオ(T2AV)ストリーミングを可能にするポストトレーニングフレームワークであるVorch-Streamerを紹介する。
12~21秒にまたがる80Kアバタークリップの合成コーパスを構築し、まず教師強制と拡散強制を混合した因果生成器を訓練する。
次に,DMD蒸留を併用した長期セルフフォースを適用し,事前学習した双方向教師の質を維持しながら,モデルを自作のロールアウト分布に露出させる。
音声の進行を明示的に制御するために、外部言語モデルは、連続的な特徴を持つ25Hzの音声プランニングトークンを予測し、それぞれの因果ブロックを話すべき内容と整合させる。
コンテキスト境界と4段階のデノベーションにより、Vorch-Streamerはテキストから27.12 FPSで音声とビデオを生成する。
関連論文リスト
- Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration [16.23723735702324]
StreamCharは,短時間のオーディオビデオから長期のオーケストレーションを分離するストリーミングフレームワークである。
ショートクリップおよびロングホライゾンプロトコルの実験は、StreamCharが1つのH100 GPU上でリアルタイムに実行されることを示している。
論文 参考訳(メタデータ) (2026-05-25T10:04:52Z) - DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization [16.192222723269925]
ビデオダビングは、映画製作、マルチメディア制作、補助音声技術に広く応用されている。
既存のアプローチでは、限られたダビングデータセットを直接トレーニングするか、事前トレーニングされたテキスト音声(TTS)モデルに適応する2段階のパイプラインを採用する。
本稿では,事前学習したTSモデルからビデオ駆動ダビングへの知識伝達を効果的に行う,新しい2段階トレーニングフレームワークであるDiFlowDubberを提案する。
2つの主要なベンチマークデータセットの実験では、DiFlowDubberは、複数のメトリクスで過去のメソッドより優れていることが示されている。
論文 参考訳(メタデータ) (2026-03-15T07:53:23Z) - LTX-2: Efficient Joint Audio-Visual Foundation Model [3.1804093402153506]
LTX-2は、時間的に同期されたオーディオヴィジュアルコンテンツを生成できるオープンソースモデルである。
より広範な理解のために多言語テキストエンコーダを用いる。
LTX-2は、各シーンのキャラクター、環境、スタイル、感情に従うリッチでコヒーレントなオーディオトラックを生成する。
論文 参考訳(メタデータ) (2026-01-06T18:24:41Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z) - READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation [55.58089937219475]
本稿では,最初のリアルタイム拡散変換器を用いた音声ヘッド生成フレームワークREADを提案する。
提案手法はまず,VAEを用いて高度に圧縮されたビデオ潜時空間を学習し,音声生成におけるトークン数を大幅に削減する。
また,READは,実行時間を大幅に短縮した競合する音声ヘッドビデオを生成することにより,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-05T13:57:03Z) - Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities [67.89368528234394]
マルチモーダル学習の主な課題の1つは、異質なモダリティを組み合わせる必要があることである。
ビデオとオーディオはテキストよりもはるかに高いレートで取得され、ほぼ時間内に整列される。
我々の手法は、確立されたマルチモーダルベンチマークの最先端性を達成し、はるかに大きなモデルより優れている。
論文 参考訳(メタデータ) (2023-11-09T19:15:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。