論文の概要: VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
- arxiv url: http://arxiv.org/abs/2608.18607v2
- Date: Thu, 20 Aug 2026 15:01:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.564542
- Title: VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
- Title(参考訳): VA-Judger:ジョイントビデオオーディオ生成のための人間の選好フィードバックからのリワードモデリング
- Abstract要約: 共同ビデオオーディオ生成のためのチェーン・オブ・オムニ・リワードモデルであるVA-Judgerを提案する。
VA-Judgerは,ドメイン内評価とドメイン外評価の両方において,ヒトの嗜好を予測する上で,指標ベースラインよりも優れていることを示す。
- 参考スコア(独自算出の注目度): 79.34043102155964
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Using reinforcement learning to post-train joint video-audio generation models requires a reward signal. Existing methods construct this reward by combining metrics for individual quality dimensions, including audio quality, visual fidelity, and synchronization. However, these metrics evaluate perceptual dimensions separately and fail to capture the overall semantic and temporal coherence among the text prompt, video, and audio that shapes human preferences. Optimizing models against these metrics encourages reward hacking, generating video-audio content that achieves high scores on these metrics yet appears incoherent or unfaithful to human viewers. To address this problem, we first construct a large-scale human-preference dataset VAPref-10K for joint video-audio generation, comprising 9K prompts and 10.3K fine-grained paired comparisons from open-source generation models. We also introduce the VA-Judger-Bench benchmark with both in-domain and out-of-domain model comparisons to evaluate whether reward models truly align with human preferences. We further propose VA-Judger, a chain-of-thought omni-reward model for joint video-audio generation. In particular, VA-Judger first learns from pairs with clear quality gaps to establish structured output and coarse preference discrimination, then distills reliable preference explanations for harder near-quality comparisons via rejection sampling verified against human annotations, and finally performs dimension-wise reinforcement learning that decomposes human feedback into individual quality dimensions for denser reward signals than a single binary preference label. Experiments show that VA-Judger outperforms metric baselines in predicting human preferences on both in-domain and out-of-domain evaluations. Using its human-aligned rewards for post-training audio-video generation model also yields significant improvements in generation quality.
- Abstract(参考訳): 強化学習を用いて, 映像・オーディオ生成モデルを構築するには, 報奨信号が必要である。
既存の手法は、オーディオ品質、視覚的忠実度、同期など、個々の品質次元のメトリクスを組み合わせることで、この報酬を構成する。
しかし、これらの指標は知覚次元を別々に評価し、人間の好みを形作るテキストプロンプト、ビデオ、音声の全体的な意味的・時間的コヒーレンスを捉えることができない。
これらのメトリクスに対するモデル最適化は、報酬のハッキングを促進し、これらのメトリクスの高得点を達成するビデオオーディオコンテンツを生成する。
この問題に対処するために,我々はまず,9Kプロンプトと10.3K細粒度ペア比較をオープンソース生成モデルから構成した,ジョイント・ビデオ・オーディオ生成のための大規模人選データセットVAPref-10Kを構築した。
また、VA-Judger-Benchベンチマークをドメイン内モデルとドメイン外モデルの比較で導入し、報酬モデルが人間の嗜好と真に一致するかどうかを評価する。
さらに,共同ビデオオーディオ生成のためのチェーン・オブ・オムニ・リワードモデルであるVA-Judgerを提案する。
特にVA-Judgerは、まず、明確な品質ギャップを持つペアから学習し、構造化された出力を確立し、粗い選好識別を行い、続いて、人間のアノテーションに対して検証された拒絶サンプリングによって、より難しい概好比較のための信頼性の高い選好説明を蒸留し、最後に、人間のフィードバックを1つの二分選好ラベルよりも深い報奨信号のために個々の品質次元に分解する次元的な強化学習を行う。
実験の結果,VA-Judgerは,ドメイン内評価とドメイン外評価の両方において,ヒトの嗜好を予測する上で,メートル法基準よりも優れていた。
トレーニング後のオーディオビデオ生成モデルに対する人力による報酬を利用することで、生成品質も大幅に向上する。
関連論文リスト
- Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation [8.918851532959815]
ビデオ生成はAIによるコンテンツ生成の中心である。
視覚的品質の進歩にもかかわらず、3つの重要な課題が残っている。
まず、報酬信号の信頼性は、人間の嗜好データの品質に制約される。
第2に、標準的なスカラー報酬モデルが、マルチアスペクトの人間の嗜好を単一の値に分解する。
第3に、政策最適化において、広く採用されているKLの発散は、主に局所的な制約を課す。
論文 参考訳(メタデータ) (2026-08-16T07:50:30Z) - Inference-Time Scaling for Joint Audio-Video Generation [38.09471807128537]
ジョイントオーディオビデオ生成モデルは、忠実性を改善するためにかなりのトレーニングリソースを必要とすることが多い。
推論時間スケーリングは、単一のモダリティドメインにおいて、有望なトレーニング不要の代替手段である。
共同音声・ビデオ生成のためのITSの総合的研究について紹介する。
論文 参考訳(メタデータ) (2026-06-02T05:41:41Z) - JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation [112.614973927778]
ジョイントオーディオビデオ生成(JAVG)は、テキスト記述から同期的で意味的に整合した音と視覚を生成する。
本稿では,JAVGの統一モデリングと最適化のためのフレームワークであるJavisDiT++を提案する。
本モデルでは,約100万の公開トレーニングエントリで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-22T12:44:28Z) - High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling [65.02357548201188]
DAVIS(Diffusion-based Audio-VIsual separation framework)を提案する。
本フレームワークは、混合音声入力と関連する視覚情報に基づいて、ノイズ分布から直接、所望の分離音スペクトルを合成することによって機能する。
論文 参考訳(メタデータ) (2025-09-26T08:46:00Z) - Multi-Metric Preference Alignment for Generative Speech Restoration [15.696247605348383]
生成モデルに対するマルチメトリックな選好アライメント戦略を提案する。
3つの異なる生成パラダイムの一貫性と重要なパフォーマンス向上を観察する。
我々のアライメントモデルは強力な'データアノテータ'として機能し、高品質な擬似ラベルを生成する。
論文 参考訳(メタデータ) (2025-08-24T07:05:10Z) - VideoDPO: Omni-Preference Alignment for Video Diffusion Generation [48.36302380755874]
DPO(Direct Preference Optimization)は、言語と画像生成において大幅に改善されている。
本稿では,いくつかの重要な調整を施したビデオDPOパイプラインを提案する。
本実験は視覚的品質とセマンティックアライメントの両面で大幅に改善されたことを示す。
論文 参考訳(メタデータ) (2024-12-18T18:59:49Z) - Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching [51.70360630470263]
Video-to-audio (V2A) は、サイレントビデオからコンテンツマッチング音声を合成することを目的としている。
本稿では,修正フローマッチングに基づくV2AモデルであるFrierenを提案する。
実験により、フリーレンは世代品質と時間的アライメントの両方で最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2024-06-01T06:40:22Z) - MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and
Video Generation [70.74377373885645]
本稿では,視聴体験と視聴体験を同時に実現する,初の共同音声ビデオ生成フレームワークを提案する。
MM拡散(MM-Diffusion)は、設計による共同記述プロセスのための連続的なマルチモーダルなU-Netで構成されている。
実験は、無条件のオーディオビデオ生成とゼロショット条件付タスクにおいて優れた結果を示す。
論文 参考訳(メタデータ) (2022-12-19T14:11:52Z) - Audio-visual speech enhancement with a deep Kalman filter generative
model [0.0]
本稿では,潜伏変数に対するマルコフ連鎖モデルを想定したオーディオビジュアルディープカルマンフィルタ(AV-DKF)生成モデルを提案する。
テスト時に音声信号を推定する効率的な推論手法を開発した。
論文 参考訳(メタデータ) (2022-11-02T09:50:08Z) - Switching Variational Auto-Encoders for Noise-Agnostic Audio-visual
Speech Enhancement [26.596930749375474]
本稿では,異なるVAEアーキテクチャを時間的に切り換えるために,マルコフの依存関係を持つ潜在逐次変数を導入する。
モデルのパラメータを推定し、音声信号を強化するために、対応する変動予測-最大化アルゴリズムを導出する。
論文 参考訳(メタデータ) (2021-02-08T11:45:02Z) - NAViDAd: A No-Reference Audio-Visual Quality Metric Based on a Deep
Autoencoder [0.0]
ディープオートエンコーダ(NAViDAd)に基づく非参照音声品質指標を提案する。
このモデルは、ディープオートエンコーダ層と分類層を含む2層フレームワークによって構成される。
このモデルは、UnB-AVとLiveNetflix-IIデータベースでテストするとうまく動作した。
論文 参考訳(メタデータ) (2020-01-30T15:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。