論文の概要: AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- arxiv url: http://arxiv.org/abs/2606.30811v1
- Date: Mon, 29 Jun 2026 18:35:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.970184
- Title: AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
- Title(参考訳): AVTok:ホロスティックオーディオビデオ生成のための1D統一トークン化
- Authors: Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen,
- Abstract要約: 音声ビデオ生成のための新しい統一トークンである textbfAVTok を提案する。
AVTokは、共有エンコーダデコーダとモーダル固有の学習可能なクエリを備えたデュアルストリームトランスフォーマーベースのアーキテクチャを備えている。
AVTokは、オーディオ・ビデオ再生と、オーディオ・トゥ・ビデオ、ビデオ・トゥ・オーディオ、およびクラス条件のジョイント・オーディオ・ビデオ生成のための下流パイプラインに統合された場合の両方に優れることを示した。
- 参考スコア(独自算出の注目度): 47.70199516002865
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio-video generation has recently gained unprecedented research attention, aiming to synthesize high-quality sounding video content with fine-grained synchronization and semantic alignment between the auditory and visual components. The preceding methods predominantly adopt a dual-branch design with separate tokenization and generation modules per modality, neglecting the representation gap while necessitating intensive computational resources for proper training. Inspired by recent advancements in one-dimensional visual tokenization, we present \textbf{AVTok}, a novel unified tokenizer designated for holistic audio-video generation. AVTok features a dual-stream transformer-based architecture with shared encoder-decoder and modal-specific learnable queries to efficiently and effectively encode an audio-video pair into a compact one-dimensional latent representation with a unified codebook. To cope with the heterogeneous information imbalance that hinders AVTok from exploiting aligned audio-visual information, we devise a hierarchical training strategy to progressively realize reconstruction capabilities for each modality. Extensive experiments demonstrate that AVTok excels both in audio-video reconstruction and when integrated into downstream pipelines for audio-to-video, video-to-audio, and class-conditional joint audio-video generation. AVTok paves the way for the challenge of joint audio-video tokenization and provides a potential direction to build unified large multimodal models for audio-video generation.
- Abstract(参考訳): 近年,高精細な同期と聴覚成分と視覚成分のセマンティックアライメントにより高品質な映像コンテンツを合成することを目的とした,前例のない研究が注目されている。
前述した手法は、異なるトークン化とモダリティごとに生成モジュールを持つデュアルブランチ設計を採用しており、適切なトレーニングのために集中的な計算資源を必要とする一方で、表現ギャップを無視している。
1次元の視覚的トークン化の最近の進歩に触発されて、音声・ビデオ生成のための新しい統一トークンである「textbf{AVTok}」を提示する。
AVTokは、共有エンコーダデコーダとモーダル固有の学習可能なクエリを備えたデュアルストリームトランスフォーマーベースのアーキテクチャを備え、オーディオビデオペアを、統一されたコードブックでコンパクトな1次元ラテント表現に効率的かつ効果的にエンコードする。
AVTokがアライメントされた視覚情報を利用するのを妨げている異種情報不均衡に対処するため、我々は階層的なトレーニング戦略を考案し、各モダリティの再構築能力を段階的に実現した。
大規模な実験により、AVTokはオーディオ・ビデオ再生と、オーディオ・トゥ・ビデオ、ビデオ・トゥ・オーディオ、およびクラス条件のジョイント・オーディオ・ビデオ生成のための下流パイプラインへの統合の両方において優れていることが示された。
AVTokは、ジョイントオーディオビデオトークン化の課題を解決し、オーディオビデオ生成のための大規模なマルチモーダルモデルを構築するための潜在的方向性を提供する。
関連論文リスト
- InstructAV2AV: Instruction-Guided Audio-Video Joint Editing [51.67847766136283]
InstructAV2AVは,インストラクション誘導型オーディオビデオ共同編集のためのエンドツーエンドフレームワークである。
まず、スケーラブルなデータ合成パイプラインを開発し、最初の大規模オーディオビデオ編集データセットであるInsAVEを構築した。
InstructAV2AVは、2つの評価セットで3つの側面にまたがる11のメトリクスで最先端の手法より優れている。
論文 参考訳(メタデータ) (2026-05-18T14:27:05Z) - Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows [75.44753202066171]
ビデオ入力に基づくコーディネートオーディオ生成は、通常、厳格なオーディオ・ビジュアル・アライメント(AV)を必要とする。
マスク付きモデリングトレーニングにより,まずFoleyFlowを用いて非モード型AVエンコーダのアライメントを行う。
トレーニング後、単調データのみを用いて個別に事前訓練されたAVエンコーダは、意味的およびリズム的整合性に整合する。
論文 参考訳(メタデータ) (2026-03-09T09:06:25Z) - LTX-2: Efficient Joint Audio-Visual Foundation Model [3.1804093402153506]
LTX-2は、時間的に同期されたオーディオヴィジュアルコンテンツを生成できるオープンソースモデルである。
より広範な理解のために多言語テキストエンコーダを用いる。
LTX-2は、各シーンのキャラクター、環境、スタイル、感情に従うリッチでコヒーレントなオーディオトラックを生成する。
論文 参考訳(メタデータ) (2026-01-06T18:24:41Z) - Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning [44.518249924335045]
Perception Audiovisual(PE-AV)は、大規模コントラスト学習で訓練された音声およびビデオ理解のためのエンコーダの新たなファミリーである。
PE上に構築されたPE-AVは、オーディオへの表現の拡張にいくつかの重要な貢献を行い、オーディオ・ビデオ、オーディオ・テキスト、ビデオ・テキスト・モダリティ間の共同埋め込みをサポートする。
論文 参考訳(メタデータ) (2025-12-22T18:59:07Z) - AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation [24.799628787198397]
AudioGen-Omniは、入力ビデオとコヒーレントに同期した高忠実度オーディオ、音声、歌を生成する。
ジョイントトレーニングパラダイムは、大規模ビデオテキストオーディオコーパスを統合している。
密度フレームレベルの表現は、AdaLNベースのジョイントアテンション機構を用いて融合する。
推測時間は8秒間1.91秒であり、効率と一般性の両方で大幅に改善されている。
論文 参考訳(メタデータ) (2025-08-01T16:03:57Z) - Seeing and Hearing: Open-domain Visual-Audio Generation with Diffusion
Latent Aligners [69.70590867769408]
ビデオとオーディオのコンテンツ制作は、映画産業とプロのユーザーにとって重要な技術である。
既存の拡散に基づく手法は、ビデオと音声を別々に生成する。
本研究では,このギャップを埋めることを目的として,クロス・ビジュアル・オーディオとジョイント・ヴィジュアル・オーディオ生成のためのフレームワークを慎重に設計した。
論文 参考訳(メタデータ) (2024-02-27T17:57:04Z) - STELLA: Continual Audio-Video Pre-training with Spatio-Temporal Localized Alignment [61.83340833859382]
様々な音声・ビデオの意味を時間とともに継続的に学習することは、音声関連推論タスクに不可欠である。
これは非時間的問題であり、オーディオとビデオのペア間のスパース時間相関と、オーディオとビデオの関係を忘れるマルチモーダル相関オーバーライトという2つの重要な課題を提起する。
本稿では,2つの新しいアイデアを取り入れた連続的なオーディオビデオ事前学習手法を提案する。
論文 参考訳(メタデータ) (2023-10-12T10:50:21Z) - Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model
Adaptation [89.96013329530484]
本研究では,多様な意味クラスから自然音声サンプルによってガイドされる多種多様なリアルなビデオを生成するタスクについて考察する。
既存のテキスト条件付きビデオ生成モデルと事前学習されたオーディオエンコーダモデルを利用する。
提案手法は,音声映像サンプルの有意な意味的多様性を示す3つのデータセットに対して広範に検証する。
論文 参考訳(メタデータ) (2023-09-28T13:26:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。