論文の概要: Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
- arxiv url: http://arxiv.org/abs/2608.05663v1
- Date: Thu, 06 Aug 2026 07:00:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.828163
- Title: Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming
- Title(参考訳): Vorch-Streamer:人間のオーディオ・ビジュアル・ジェネレーションをリアルタイムのロングフォーム・ストリーミングに拡張
- Abstract要約: Vorch-Streamerはリアルタイムのテキスト・ツー・オーディオビデオストリーミングのためのフレームワークである。
テキストから27.12FPSの音声とビデオを生成し、24FPSのリアルタイム再生速度を超える。
- 参考スコア(独自算出の注目度): 24.73791931334844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time long-form avatar audio--video generation requires causal, continuous synthesis while maintaining audiovisual synchronization and visual consistency. Adapting a pretrained bidirectional model to this setting presents two key dilemmas. First, autoregressively reusing generated blocks as context creates exposure bias, causing errors and visual drift to accumulate over long rollouts. Second, a global speech utterance does not indicates a causal generator which portion should be spoken next when only limited local audio--video context is available. We present \textbf{Vorch-Streamer}, a post-training framework that addresses these challenges and enables real-time long-form Text-to-Audio-Video (T2AV) streaming. We construct a synthetic corpus of 80K avatar clips spanning 12--21 seconds and first train a causal generator with mixed Teacher Forcing and Diffusion Forcing. We then apply long-horizon Self Forcing with DMD distillation, exposing the model to its own rollout distribution while preserving the quality of the pretrained bidirectional teacher. To explicitly control speech progression, an external language model predicts discrete 25-Hz speech-planning tokens, whose continuous features condition the audio diffusion branch and align each causal block with the content it should speak. With bounded causal context and four-step denoising, Vorch-Streamer jointly generates audio and video from text at 27.12 FPS, exceeding the 24-FPS real-time playback rate while maintaining competitive audio--lip synchronization and strong identity preservation over long-form generation.
- Abstract(参考訳): リアルタイム長めのアバター音声-ビデオ生成は、音声の同期と視覚的一貫性を維持しながら因果的かつ連続的な合成を必要とする。この設定に事前訓練された双方向モデルを適用すると、2つの重要なジレンマが現れる。第1に、コンテキストが露出バイアスを発生させ、エラーと視覚的ドリフトが長時間のロールアウトに蓄積されるように、生成されたブロックを自動回帰的に再利用する。第2に、グローバルな音声発声は、局所的な音声-ビデオコンテキストが限られている場合に、次に話すべき部分を示す因果的生成元を示すものではない。
本稿では,これらの課題に対処し,リアルタイムのテキスト・トゥ・オーディオ・ビデオ(T2AV)ストリーミングを可能にするポストトレーニングフレームワークである‘textbf{Vorch-Streamer} を紹介する。
12~21秒にまたがる80Kアバタークリップの合成コーパスを構築し、まず教師強制と拡散強制を混合した因果生成器を訓練する。
次に,DMD蒸留を併用した長期セルフフォースを適用し,事前学習した双方向教師の質を維持しながら,モデルを自作のロールアウト分布に露出させる。
音声の進行を明示的に制御するために、外部言語モデルは、連続的な特徴を持つ25Hzの音声プランニングトークンを予測し、それぞれの因果ブロックを話すべき内容と整合させる。
コンテキスト境界と4段階のデノベーションにより、Vorch-Streamerはテキストから27.12 FPSで音声とビデオを生成する。
関連論文リスト
- DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution [16.570672947240855]
7Bジェネレータをベースとしたコンパクトなジョイントビデオ生成システムであるDreamX-Creator 1.0について述べる。
統合されたオーディオビデオデータシステムは、時間的に一貫性のあるクリップを構築し、フィルタし、構造化されたマルチモーダルアノテーションを生成し、クリップを機能指向のデータプールに整理する。
高分解能出力のために、我々のAutoregressive 1-Step 2K Refinement Pipelineは、双方向多段階教師を自動回帰多段階精錬器に適応させる。
論文 参考訳(メタデータ) (2026-08-31T17:11:05Z) - Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration [16.23723735702324]
StreamCharは,短時間のオーディオビデオから長期のオーケストレーションを分離するストリーミングフレームワークである。
ショートクリップおよびロングホライゾンプロトコルの実験は、StreamCharが1つのH100 GPU上でリアルタイムに実行されることを示している。
論文 参考訳(メタデータ) (2026-05-25T10:04:52Z) - DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization [16.192222723269925]
ビデオダビングは、映画製作、マルチメディア制作、補助音声技術に広く応用されている。
既存のアプローチでは、限られたダビングデータセットを直接トレーニングするか、事前トレーニングされたテキスト音声(TTS)モデルに適応する2段階のパイプラインを採用する。
本稿では,事前学習したTSモデルからビデオ駆動ダビングへの知識伝達を効果的に行う,新しい2段階トレーニングフレームワークであるDiFlowDubberを提案する。
2つの主要なベンチマークデータセットの実験では、DiFlowDubberは、複数のメトリクスで過去のメソッドより優れていることが示されている。
論文 参考訳(メタデータ) (2026-03-15T07:53:23Z) - LTX-2: Efficient Joint Audio-Visual Foundation Model [3.1804093402153506]
LTX-2は、時間的に同期されたオーディオヴィジュアルコンテンツを生成できるオープンソースモデルである。
より広範な理解のために多言語テキストエンコーダを用いる。
LTX-2は、各シーンのキャラクター、環境、スタイル、感情に従うリッチでコヒーレントなオーディオトラックを生成する。
論文 参考訳(メタデータ) (2026-01-06T18:24:41Z) - StreamingTalker: Audio-driven 3D Facial Animation with Autoregressive Diffusion Model [73.30619724574642]
音声駆動型3D顔アニメーションは、音声入力によって駆動される現実的で同期された顔の動きを生成することを目的としている。
近年,3次元顔アニメーションに音声条件拡散モデルが採用されている。
本稿では,ストリーミング方式で音声を処理する自己回帰拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-11-18T07:55:16Z) - StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation [91.45910771331741]
オーディオ駆動型アバタービデオ生成のための現在の拡散モデルでは、自然な音声同期とアイデンティティの整合性を備えた長ビデオの合成が困難である。
本稿では,無限長高画質映像を後処理なしで合成する最初のエンドツーエンドビデオ拡散変換器であるStableAvatarについて述べる。
論文 参考訳(メタデータ) (2025-08-11T17:58:24Z) - READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation [55.58089937219475]
本稿では,最初のリアルタイム拡散変換器を用いた音声ヘッド生成フレームワークREADを提案する。
提案手法はまず,VAEを用いて高度に圧縮されたビデオ潜時空間を学習し,音声生成におけるトークン数を大幅に削減する。
また,READは,実行時間を大幅に短縮した競合する音声ヘッドビデオを生成することにより,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-08-05T13:57:03Z) - Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities [67.89368528234394]
マルチモーダル学習の主な課題の1つは、異質なモダリティを組み合わせる必要があることである。
ビデオとオーディオはテキストよりもはるかに高いレートで取得され、ほぼ時間内に整列される。
我々の手法は、確立されたマルチモーダルベンチマークの最先端性を達成し、はるかに大きなモデルより優れている。
論文 参考訳(メタデータ) (2023-11-09T19:15:12Z) - Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion
Models [65.18102159618631]
マルチモーダル生成モデリングは、テキスト・ツー・イメージとテキスト・ツー・ビデオ生成においてマイルストーンを生み出した。
高品質のテキストオーディオペアを備えた大規模データセットの欠如、長期連続的なオーディオデータのモデリングの複雑さ、という2つの主な理由から、オーディオへの適用は依然として遅れている。
本稿では,これらのギャップに対処する急激な拡散モデルを用いたMake-An-Audioを提案する。
論文 参考訳(メタデータ) (2023-01-30T04:44:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。