論文の概要: OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
- arxiv url: http://arxiv.org/abs/2607.23855v1
- Date: Sun, 26 Jul 2026 21:51:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.254223
- Title: OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
- Title(参考訳): OmniVAE:ジョイントジェネレーションのためのクロスモーダルアライメント付きオーディオビデオVAE
- Abstract要約: OmniVAEは、音声とビデオの潜伏表現の微粒なセマンティックアライメントを学習する、共同で訓練されたオーディオビデオVAEである。
実験により、両方の目的が常に潜在空間の学習性を改善することが示された。
- 参考スコア(独自算出の注目度): 73.57253966578186
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent generative models are moving beyond silent video or standalone audio synthesis toward the joint generation of synchronized audio and video. Despite this progress, jointly generating audio and video with fine-grained cross-modal correspondence remains challenging due to their fundamental structural differences. Most existing methods use audio and video VAEs trained separately. As a result, the two latent spaces lack cross-modal alignment, leaving the downstream generative model to learn cross-modal synchronization from scratch. We present OmniVAE, a jointly trained audio-video VAE that learns fine-grained semantic alignment between audio and video latent representations. Beyond reconstruction, OmniVAE uses a segment-level audio-video contrastive objective to capture temporal-semantic correspondence and align the two latent spaces. In parallel, it distills features from pretrained modality-specific semantic encoders into each modality, improving the downstream learnability of both latent spaces. Extensive experiments show that both objectives consistently improve the learnability of the latent spaces, translating into higher generation quality and more accurate cross-modal synchronization in downstream text-to-audio-video generation. These findings underscore the importance of learning unified representations as a foundation for omnimodal modeling.1
- Abstract(参考訳): 最近の生成モデルは、サイレントビデオやスタンドアローンオーディオ合成を超えて、同期オーディオとビデオのジョイントジェネレーションへと移行している。
この進歩にもかかわらず、基本的構造的差異のため、細粒度のクロスモーダル対応による音声とビデオの同時生成は依然として困難である。
既存のほとんどの方法は、個別に訓練されたオーディオとビデオのVAEを使用する。
その結果、2つの潜伏空間はクロスモーダルアライメントを欠き、下流生成モデルはスクラッチからクロスモーダル同期を学習する。
OmniVAEは、音声とビデオの潜伏表現の微粒なセマンティックアライメントを学習する、共同で訓練されたオーディオビデオVAEである。
再構成の他に、OmniVAEは、セグメントレベルの音声とビデオのコントラストの目的を用いて、時間-意味の対応を捉え、2つの潜在空間を整列させる。
並行して、事前訓練されたモダリティ固有のセマンティックエンコーダから各モダリティに特徴を抽出し、両方の潜在空間の下流学習性を向上させる。
広汎な実験により、両方の目的が、下流のテキスト-オーディオ-ビデオ生成において、より高品質でより正確な相互モーダル同期に変換することで、潜伏空間の学習性を一貫して改善することが示された。
これらの知見は、一様モデルの基礎としての統一表現の学習の重要性を浮き彫りにする。
関連論文リスト
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation [47.70199516002865]
音声ビデオ生成のための新しい統一トークンである textbfAVTok を提案する。
AVTokは、共有エンコーダデコーダとモーダル固有の学習可能なクエリを備えたデュアルストリームトランスフォーマーベースのアーキテクチャを備えている。
AVTokは、オーディオ・ビデオ再生と、オーディオ・トゥ・ビデオ、ビデオ・トゥ・オーディオ、およびクラス条件のジョイント・オーディオ・ビデオ生成のための下流パイプラインに統合された場合の両方に優れることを示した。
論文 参考訳(メタデータ) (2026-06-29T18:35:17Z) - Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation [50.411841997631484]
We present Unison, a unified framework that promote coherence across the motion, speech, and sound modalities。
We show that Unison achieves state-of-the-art performance in audio perceptual quality and cross-modal synchro。
論文 参考訳(メタデータ) (2026-05-09T06:32:54Z) - Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling [59.97930201616015]
本研究では,共有バックボーン内で高レベルなクロスモーダルモデリングを行う自己回帰拡散フレームワークであるTalker-T2AVを提案する。
共有自己回帰言語モデルは、統一されたパッチレベルのトークン空間において、オーディオとビデオに対して共同で原因となる。
ポートレートベンチマークの実験では、Talker-T2AVはリップシンク精度、ビデオ品質、オーディオ品質において、デュアルブランチベースラインを上回っている。
論文 参考訳(メタデータ) (2026-04-26T07:48:47Z) - ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions [34.27531187147479]
UniAVGenは、ジョイントオーディオとビデオ生成のための統一されたフレームワークである。
UniAVGenは、オーディオオーディオ同期、音色、感情の一貫性において全体的なアドバンテージを提供する。
論文 参考訳(メタデータ) (2025-11-05T10:06:51Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation [24.799628787198397]
AudioGen-Omniは、入力ビデオとコヒーレントに同期した高忠実度オーディオ、音声、歌を生成する。
ジョイントトレーニングパラダイムは、大規模ビデオテキストオーディオコーパスを統合している。
密度フレームレベルの表現は、AdaLNベースのジョイントアテンション機構を用いて融合する。
推測時間は8秒間1.91秒であり、効率と一般性の両方で大幅に改善されている。
論文 参考訳(メタデータ) (2025-08-01T16:03:57Z) - STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment [61.83340833859382]
様々な音声・ビデオの意味を時間とともに継続的に学習することは、音声関連推論タスクに不可欠である。
これは非時間的問題であり、オーディオとビデオのペア間のスパース時間相関と、オーディオとビデオの関係を忘れるマルチモーダル相関オーバーライトという2つの重要な課題を提起する。
本稿では,2つの新しいアイデアを取り入れた連続的なオーディオビデオ事前学習手法を提案する。
論文 参考訳(メタデータ) (2023-10-12T10:50:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。