論文の概要: OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films
- arxiv url: http://arxiv.org/abs/2608.04224v1
- Date: Tue, 04 Aug 2026 21:00:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.641492
- Title: OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films
- Title(参考訳): OmniVR: 劣化した歴史映画を復元するビデオとオーディオのコンディション生成
- Authors: Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha,
- Abstract要約: 歴史的映画は視覚とオーディオの劣化に悩まされている。
オムニVR(OmniVR)は,初の共同音声合成再生モデルである。
- 参考スコア(独自算出の注目度): 77.65090601396003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Historical films suffer from co-occurring visual and audio degradations---blur, noise, flicker, hiss, clipping, and dropout---yet existing methods restore each modality independently, leaving quality gaps and cross-modal inconsistency. We present OmniVR, the first joint audio-video generative restoration model. Built upon a 22B-parameter audio-video generation backbone, OmniVR formulates restoration as conditional generation within a unified multimodal DiT: the low-quality video and audio are encoded as latent conditions, combined with a fixed restoration prompt, and jointly denoised to recover visual structure, temporal motion, and acoustic detail under one coordinated objective. Three key designs enable this adaptation: (1) a joint audio-video degradation pipeline that simulates real old-film characteristics from Internet-collected data; (2) an architecture-preserving text-to-audio-video (T2AV) to audio-video-to-audio-video (AV2AV) transition with prompt annealing that maximally retains the generative prior; and (3) first-frame image-to-video (I2V) anchoring with loss reweighting and waveform supervision for long-video extrapolation and audio fidelity. We also propose OmniVRBench, the first benchmark that evaluates audio-video restoration across visual quality, audio quality, temporal consistency, and audio-visual synchrony on 200 real historical clips. OmniVR surpasses all prior methods on all six visual metrics, achieves the best audio quality, and produces natural colorization---the first method to jointly address all three aspects. Code and weights will be publicly released. Project Page: https://xin1u.github.io/OminiVR_PAGE/
- Abstract(参考訳): 歴史的映画は、ブルー、ノイズ、フリック、ヒス、クリッピング、ドロップアウトといった視覚的・オーディオ的な劣化に悩まされている。
オムニVR(OmniVR)は,初の共同音声合成再生モデルである。
OmniVRは22Bパラメータのオーディオビデオ生成バックボーンをベースとして、統一されたマルチモーダルDiT内の条件生成として復元を定式化し、低品質のビデオとオーディオは、固定された復元プロンプトと組み合わせて遅延条件として符号化され、協調して視覚構造、時間運動、音響ディテールを1つの調整された目的の下で復元する。
3つの重要な設計がこれを実現する:(1)インターネット収集データから実際の古いフィルム特性をシミュレートするジョイントオーディオ・ビデオ分解パイプライン、(2)アーキテクチャ保存されたテキスト・トゥ・オーディオ・ビデオ(T2AV)からオーディオ・ビデオ・トゥ・オーディオ・ビデオ(AV2AV)への移行、(3)損失重み付けを施した第1フレーム画像・ビデオ(I2V)、および長期外挿・オーディオ忠実性の波形監視。
OmniVRBenchは、視覚的品質、オーディオ品質、時間的一貫性、および200の実際の歴史的クリップにおけるオーディオ映像の同期性を評価する最初のベンチマークである。
OmniVRは6つの視覚的指標のすべてに先行する手法を超越し、最高の音質を達成し、自然な色付けを生成する。
コードと重みは公開されます。
Project Page: https://xin1u.github.io/OminiVR_PAGE/
関連論文リスト
- AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation [47.70199516002865]
音声ビデオ生成のための新しい統一トークンである textbfAVTok を提案する。
AVTokは、共有エンコーダデコーダとモーダル固有の学習可能なクエリを備えたデュアルストリームトランスフォーマーベースのアーキテクチャを備えている。
AVTokは、オーディオ・ビデオ再生と、オーディオ・トゥ・ビデオ、ビデオ・トゥ・オーディオ、およびクラス条件のジョイント・オーディオ・ビデオ生成のための下流パイプラインに統合された場合の両方に優れることを示した。
論文 参考訳(メタデータ) (2026-06-29T18:35:17Z) - Diffusion Models for Joint Audio-Video Generation [51.56484100374058]
高品質でペアのオーディオビデオデータセットを2つリリースします。
データセットのスクラッチからMM-拡散アーキテクチャをトレーニングします。
逐次2段階のテキスト・オーディオ・ビデオ生成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-17T03:31:37Z) - MOVA: Towards Scalable and Synchronized Video-Audio Generation [91.56945636522345]
高品質で同期した映像コンテンツを生成できるオープンソースモデルMOVA(MOSS Video and Audio)を紹介する。
モデルウェイトとコードをリリースすることによって、研究を進め、クリエーターの活気あるコミュニティを育むことを目指しています。
論文 参考訳(メタデータ) (2026-02-09T15:31:54Z) - ALIVE: Animate Your World with Lifelike Audio-Video Generation [50.693986608051716]
ALIVEは、Soraスタイルのオーディオビデオ生成とアニメーションに事前訓練されたテキスト・トゥ・ビデオ(T2V)モデルを適用する世代モデルである。
音声-視覚同期と参照アニメーションをサポートするため,共用音声-ビデオブランチによるMMDiTアーキテクチャの強化を行った。
ALIVEは優れたパフォーマンスを示し、一貫してオープンソースモデルを上回り、最先端の商用ソリューションにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-02-09T14:06:03Z) - VABench: A Comprehensive Benchmark for Audio-Video Generation [22.00633729850902]
VABenchは、同期オーディオビデオ生成の機能を評価するために設計されたベンチマークフレームワークである。
タスクタイプは、text-to-audio-video (T2AV)、 Image-to-audio-video (I2AV)、ステレオオーディオビデオ生成の3種類である。
VABenchは、動物、人間の音、音楽、環境音、同期物理音、複雑なシーン、バーチャルワールドの7つの主要なコンテンツカテゴリをカバーしている。
論文 参考訳(メタデータ) (2025-12-10T03:57:29Z) - ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation [55.76423101183408]
ViSAudioは、条件付きフローマッチングとデュアルブランチオーディオ生成アーキテクチャを利用するエンドツーエンドフレームワークである。
空間浸漬による高品質なオーディオを生成し、視点の変化、音源の動き、様々な音響環境に適応する。
論文 参考訳(メタデータ) (2025-12-02T18:56:12Z) - CATR: Combinatorial-Dependence Audio-Queried Transformer for
Audio-Visual Video Segmentation [43.562848631392384]
音声視覚映像のセグメンテーションは、画像フレーム内の音生成対象のピクセルレベルのマップを生成することを目的としている。
本稿では,それぞれの時間的・空間的次元から音声と映像の特徴を結合した非結合型音声・映像依存性を提案する。
論文 参考訳(メタデータ) (2023-09-18T12:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。