論文の概要: Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation
- arxiv url: http://arxiv.org/abs/2608.04902v1
- Date: Wed, 05 Aug 2026 14:28:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.960253
- Title: Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation
- Title(参考訳): 視覚表現の課題:ビデオとオーディオ生成における時間差の爆発的展開
- Authors: Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu,
- Abstract要約: Video-to-audio(V2A)生成は、画像-to-audio生成(I2A)を延長する
本稿では、V2AとI2Aを区別するキー表現として、時間差(TD)を利用するTD-V2Aを紹介する。
提案するフレームワークによるTDを効果的に活用することで、エンドツーエンドのV2A生成品質が大幅に向上することを示す。
- 参考スコア(独自算出の注目度): 53.47090840868696
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video-to-audio (V2A) generation extends image-to-audio generation (I2A) by introducing consecutive frames that provide essential temporal cues for audio synthesis. However, existing conditional diffusion-based V2A methods typically enhance visual conditioning with additional audio-visual supervision, acoustic structure prediction, or reasoning from large multimodal models, requiring extra networks or strong inductive biases. Inspired by recent advances in visual representation learning, we introduce TD-V2A, which leverages temporal differences (TD) as the key representation that distinguishes V2A from I2A, enriching visual conditioning with minimal architectural modification. We first investigate TD at both the frame and feature levels to identify the most effective representation level at which TD complements visual representations. Based on these findings, we develop a hierarchically continual learning strategy and an annealed temporal differences guidance method to progressively learn and exploit TD information during diffusion training and sampling process, respectively. Extensive experiments on benchmark datasets demonstrate that effectively exploiting TD through our proposed framework significantly improves end-to-end V2A generation quality, even outperforming dedicated V2A representations such as contrastive audio-visual pretraining.
- Abstract(参考訳): V2A(Video-to-audio)生成は、音声合成に不可欠な時間的手がかりを提供する連続フレームを導入することにより、画像から音声への生成(I2A)を拡張する。
しかしながら、既存の条件拡散に基づくV2A法は、通常、大きなマルチモーダルモデルからの推論や音響的構造予測を追加して視覚的条件付けを強化し、追加のネットワークや強い帰納バイアスを必要とする。
視覚表現学習の最近の進歩に触発されて、V2AとI2Aを区別するキー表現として時間差(TD)を利用するTD-V2Aを導入する。
まず、フレームレベルと特徴レベルの両方でTDを調査し、TDが視覚的表現を補完する最も効果的な表現レベルを特定する。
これらの知見に基づいて,拡散学習とサンプリングプロセスにおいて,TD情報を段階的に学習し,活用するための階層的連続学習戦略と時間差分誘導手法を開発した。
ベンチマークデータセットの大規模な実験により,提案フレームワークによるTDの有効利用により,V2A生成品質が向上し,コントラッシブ・オーディオ・ビジュアル・プレトレーニングなどの専用V2A表現よりも優れた結果が得られた。
関連論文リスト
- GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining [64.72014392166625]
GMS-CAVPは、マルチスケールビデオ・オーディオアライメントとマルチスケール空間時間拡散に基づく事前学習目的を組み合わせた、新しいフレームワークである。
まず、GMS-CAVPは、様々な粒度にわたる意味的および時間的関係をキャプチャするマルチスケールのコントラスト学習戦略を導入する。
第2に、拡散に基づく生成目的を組み込むことにより、従来のコントラスト学習を超越し、ビデオとオーディオ間のモダリティ変換と合成を可能にする。
論文 参考訳(メタデータ) (2026-01-27T13:43:32Z) - MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings [75.0617088717528]
MoCaは、トレーニング済みのVLMバックボーンを効果的な双方向埋め込みモデルに変換するためのフレームワークである。
MoCaは、MMEBとViDoRe-v2ベンチマークのパフォーマンスを継続的に改善し、新しい最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-06-29T06:41:00Z) - PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling [95.2927277964409]
On-AVEP(On-AVEP: Online Audio-Visual Event Parsing)は、入ってくる映像ストリームを逐次解析することで、音声、視覚、視覚イベントを解析するための新しいパラダイムである。
本稿では,(a)予測的マルチモーダル・フューチャー・モデリングが特徴とする予測的未来・モデリング・フレームワークを提案する。
実験により、PreFMは、パラメータが大幅に少ない大きなマージンで最先端の手法を著しく上回ることが示された。
論文 参考訳(メタデータ) (2025-05-29T06:46:19Z) - Sequential Contrastive Audio-Visual Learning [12.848371604063168]
本稿では,非集約的表現空間に基づく実例を対比した逐次コントラスト型音声視覚学習(SCAV)を提案する。
VGGSoundとMusicのデータセットによる実験は、SCAVの有効性を実証している。
また、SCAVでトレーニングされたモデルが、検索に使用されるメトリックに関して、かなりの柔軟性を示すことを示す。
論文 参考訳(メタデータ) (2024-07-08T09:45:20Z) - Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation [72.90144343056227]
ビデオ理解タスクのためのテキスト・ツー・ビデオ拡散モデル(T2V)から生成した視覚的表現について検討する。
固定されたT2Vモデル上に構築された専用コンポーネントを備えた新しいフレームワーク「VD-IT」を紹介する。
我々のVD-ITは、既存の最先端手法を超越して、非常に競争力のある結果を得る。
論文 参考訳(メタデータ) (2024-03-18T17:59:58Z) - A multimodal dynamical variational autoencoder for audiovisual speech
representation learning [23.748108659645844]
MDVAE (Multimodal and dynamical VAE) は、教師なし音声・視覚的音声表現学習に適用される。
実験には、音声視覚音声の操作、音声視覚の表情の認知、音声視覚の感情認識などが含まれる。
論文 参考訳(メタデータ) (2023-05-05T14:37:26Z) - How to Teach DNNs to Pay Attention to the Visual Modality in Speech
Recognition [10.74796391075403]
本研究では、AV Alignの内部動作を調査し、オーディオ・視覚アライメントパターンを可視化する。
AV Alignは、一般に単調なパターンで、TD-TIMITのフレームレベルで、音声の音響的および視覚的表現を調整することを学習している。
本稿では,視覚的表現から唇関連行動単位を予測する正規化手法を提案する。
論文 参考訳(メタデータ) (2020-04-17T13:59:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。