論文の概要: Improving Joint Audio-Video Generation with Cross-Modal Context Learning
- arxiv url: http://arxiv.org/abs/2603.18600v1
- Date: Thu, 19 Mar 2026 08:17:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.026946
- Title: Improving Joint Audio-Video Generation with Cross-Modal Context Learning
- Title(参考訳): クロスモーダルコンテキスト学習による共同音声映像生成の改善
- Abstract要約: クロスモーダルコンテキスト学習(CCL)には、慎重に設計されたモジュールがいくつか備えられている。
CCLは、最近の学術手法と比較して最先端のパフォーマンスを達成し、リソースは大幅に少ない。
- 参考スコア(独自算出の注目度): 27.65649507418871
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The dual-stream transformer architecture-based joint audio-video generation method has become the dominant paradigm in current research. By incorporating pre-trained video diffusion models and audio diffusion models, along with a cross-modal interaction attention module, high-quality, temporally synchronized audio-video content can be generated with minimal training data. In this paper, we first revisit the dual-stream transformer paradigm and further analyze its limitations, including model manifold variations caused by the gating mechanism controlling cross-modal interactions, biases in multi-modal background regions introduced by cross-modal attention, and the inconsistencies in multi-modal classifier-free guidance (CFG) during training and inference, as well as conflicts between multiple conditions. To alleviate these issues, we propose Cross-Modal Context Learning (CCL), equipped with several carefully designed modules. Temporally Aligned RoPE and Partitioning (TARP) effectively enhances the temporal alignment between audio latent and video latent representations. The Learnable Context Tokens (LCT) and Dynamic Context Routing (DCR) in the Cross-Modal Context Attention (CCA) module provide stable unconditional anchors for cross-modal information, while dynamically routing based on different training tasks, further enhancing the model's convergence speed and generation quality. During inference, Unconditional Context Guidance (UCG) leverages the unconditional support provided by LCT to facilitate different forms of CFG, improving train-inference consistency and further alleviating conflicts. Through comprehensive evaluations, CCL achieves state-of-the-art performance compared with recent academic methods while requiring substantially fewer resources.
- Abstract(参考訳): デュアルストリームトランスアーキテクチャをベースとしたジョイントオーディオビデオ生成方式が,現在研究の主流となっている。
事前訓練されたビデオ拡散モデルとオーディオ拡散モデルと、モーダル間インタラクションアテンションモジュールを組み込むことで、高品質で時間的に同期されたオーディオ映像コンテンツを、最小限のトレーニングデータで生成することができる。
本稿では、まず、マルチストリームトランスフォーマーのパラダイムを再検討し、その制約を更に分析する。例えば、交叉モーダル相互作用を制御するゲーティング機構によるモデル多様体の変動、クロスモーダルアテンションによって導入されたマルチモーダル背景領域のバイアス、トレーニングと推論中のマルチモーダル分類器フリーガイダンス(CFG)の不整合、および複数の条件間の矛盾などである。
これらの問題を緩和するため、慎重に設計されたモジュールを複数備えたクロスモーダルコンテキスト学習(CCL)を提案する。
TARP(Temporally Aligned RoPE and Partitioning)は、音声潜時表現とビデオ潜時表現の時間的アライメントを効果的に向上させる。
クロスモーダルコンテキスト注意(CCA)モジュールにおける学習可能なコンテキストトークン(LCT)と動的コンテキストルーティング(DCR)は、異なるトレーニングタスクに基づいて動的ルーティングを行い、モデルの収束速度と生成品質をさらに向上させる。
推論中、 Unconditional Context Guidance (UCG) は LCT が提供する無条件サポートを活用して、CFG の異なる形態を容易にし、列車の干渉一貫性を改善し、矛盾を緩和する。
総合的な評価を通じて、CCLは最新の学術手法と比較して最先端のパフォーマンスを達成し、資源は大幅に少ない。
関連論文リスト
- Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning [46.57717326362359]
TCA-Captionerは、音声映像キャプションのためのテンポラルアライメントとクロスモーダルアライメントを強化するために特別に設計されたフレームワークである。
キュレートされた高密度のヒューマンインタラクションデータセットを活用して、TCA-Captionerは洗練されたオーディオ視覚インタラクションをモデル化するように最適化されている。
広汎な実験により、TCA-Captionerは時間的コヒーレントで同期化されたオーディオ視覚的物語の新しい標準を定めている。
論文 参考訳(メタデータ) (2026-07-02T03:47:45Z) - Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval [59.55233913340214]
ビデオ言語モデルは、時間的ビデオシーケンスとテキスト意味論の間の動的で非線形な相互作用を捉えるのに苦労することが多い。
反応拡散過程としてビデオ言語アライメントを再現する新しいフレームワークである textbfReaction-Diffusion Multimodal Fusion (RDMF) を提案する。
予備実験は、有能なビデオモーメントを識別する既存の手法より優れている可能性を実証している。
論文 参考訳(メタデータ) (2026-06-01T03:02:35Z) - Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos [70.78278988781882]
ビデオ,音声,深度マップ,その他のモダリティ入力間で命令認識融合を行う,UniMVUという統合マルチモーダルビデオ理解フレームワークを提案する。
解析の結果,ゲーティング機構は人間と解釈可能なモダリティの関連性に一致し,アブレーションは内部モダリティとモダリティレベルのゲーティングの寄与を示すことがわかった。
論文 参考訳(メタデータ) (2026-05-25T18:02:20Z) - AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers [51.016506778535025]
単一モダリティ教師モデルから高品質な音声視覚推論トレースを生成するフレームワークを開発する。
クロスモーダルトレーニングも単一モーダルタスクに移行することを示す。
論文 参考訳(メタデータ) (2026-04-17T18:13:27Z) - GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining [64.72014392166625]
GMS-CAVPは、マルチスケールビデオ・オーディオアライメントとマルチスケール空間時間拡散に基づく事前学習目的を組み合わせた、新しいフレームワークである。
まず、GMS-CAVPは、様々な粒度にわたる意味的および時間的関係をキャプチャするマルチスケールのコントラスト学習戦略を導入する。
第2に、拡散に基づく生成目的を組み込むことにより、従来のコントラスト学習を超越し、ビデオとオーディオ間のモダリティ変換と合成を可能にする。
論文 参考訳(メタデータ) (2026-01-27T13:43:32Z) - Residual Cross-Modal Fusion Networks for Audio-Visual Navigation [17.19858148800535]
本稿では、補間モデリングと微粒化アライメントを実現するために、音声と視覚ストリーム間の残差相互作用を導入するクロスモーダル残差融合ネットワークを提案する。
ReplicaとMatterport3Dデータセットの実験では、CRFNは最先端の核融合ベースラインを著しく上回り、より強力なクロスドメインの一般化を実現している。
論文 参考訳(メタデータ) (2026-01-11T12:11:36Z) - Beyond Boundary Frames: Audio-Visual Semantic Guidance for Context-Aware Video Interpolation [14.00347197658315]
BBFは、音声/視覚のセマンティクスによってガイドされるコンテキスト対応のビデオフレームフレームワークである。
BBFは、汎用的タスクとオーディオ視覚同期タスクの両方において、最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-12-03T09:22:13Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models [35.86252379746625]
本研究の目的は、音声・視覚大言語モデル(AV-LLM)におけるバランスの取れたマルチモーダル理解を強化することである。
現在のAV-LLMでは、オーディオとビデオの機能はデコーダで共同で処理されるのが一般的である。
Fork-Merge Decoding (FMD) は、追加のトレーニングやアーキテクチャの変更を必要としない、シンプルで効果的な推論時間戦略である。
論文 参考訳(メタデータ) (2025-05-27T08:22:56Z) - Improving Audio-Visual Speech Recognition by Lip-Subword Correlation
Based Visual Pre-training and Cross-Modal Fusion Encoder [58.523884148942166]
本稿では,事前学習および微調整訓練の枠組みの下で,音声視覚音声認識(AVSR)を改善するための2つの新しい手法を提案する。
まず, マンダリンにおける口唇形状と音節レベルサブワード単位の相関について検討し, 口唇形状から良好なフレームレベル音節境界を確立する。
次に,音声誘導型クロスモーダルフュージョンエンコーダ(CMFE)ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2023-08-14T08:19:24Z) - Connecting Multi-modal Contrastive Representations [50.26161419616139]
マルチモーダルコントラスト表現学習は、異なるモダリティを意味的に共有された空間に符号化することを目的としている。
本稿では,C-MCR(Connecting Multi-Modal Contrastive Representations)と呼ばれるペアデータなしでMCRを学習するための,新たな学習効率向上手法を提案する。
C-MCRは、オーディオ画像検索、オーディオ画像のソースローカライゼーション、および対実的なオーディオ画像認識タスクにおいて、最先端のオーディオ映像のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-05-22T09:44:39Z) - Multi-Modulation Network for Audio-Visual Event Localization [138.14529518908736]
本研究では,映像中の可聴性と可視性の両方を有する音声視覚事象のローカライズの問題について検討する。
既存の作業は、セグメントレベルでのオーディオと視覚機能のエンコーディングと調整に重点を置いている。
本稿では、上記の相関関係を学習し、意味的ガイダンスとして活用する新しいマルチ変調ネットワーク(M2N)を提案する。
論文 参考訳(メタデータ) (2021-08-26T13:11:48Z) - Robust Latent Representations via Cross-Modal Translation and Alignment [36.67937514793215]
ほとんどのマルチモーダル機械学習手法では、トレーニングに使用されるすべてのモダリティをテストに利用する必要がある。
この制限に対処するため、トレーニング中のみに複数のモーダルを用いてユニモーダルシステムのテスト性能を向上させることを目的としている。
提案するマルチモーダルトレーニングフレームワークは、クロスモーダル変換と相関に基づく潜在空間アライメントを用いる。
論文 参考訳(メタデータ) (2020-11-03T11:18:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。