論文の概要: VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
- arxiv url: http://arxiv.org/abs/2412.14167v1
- Date: Wed, 18 Dec 2024 18:59:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-12-19 16:49:46.422910
- Title: VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
- Title(参考訳): VideoDPO:ビデオ拡散生成のためのOmni-Preferenceアライメント
- Authors: Runtao Liu, Haoyu Wu, Zheng Ziqiang, Chen Wei, Yingqing He, Renjie Pi, Qifeng Chen,
- Abstract要約: DPO(Direct Preference Optimization)は、言語と画像生成において大幅に改善されている。
本稿では,いくつかの重要な調整を施したビデオDPOパイプラインを提案する。
本実験は視覚的品質とセマンティックアライメントの両面で大幅に改善されたことを示す。
- 参考スコア(独自算出の注目度): 48.36302380755874
- License:
- Abstract: Recent progress in generative diffusion models has greatly advanced text-to-video generation. While text-to-video models trained on large-scale, diverse datasets can produce varied outputs, these generations often deviate from user preferences, highlighting the need for preference alignment on pre-trained models. Although Direct Preference Optimization (DPO) has demonstrated significant improvements in language and image generation, we pioneer its adaptation to video diffusion models and propose a VideoDPO pipeline by making several key adjustments. Unlike previous image alignment methods that focus solely on either (i) visual quality or (ii) semantic alignment between text and videos, we comprehensively consider both dimensions and construct a preference score accordingly, which we term the OmniScore. We design a pipeline to automatically collect preference pair data based on the proposed OmniScore and discover that re-weighting these pairs based on the score significantly impacts overall preference alignment. Our experiments demonstrate substantial improvements in both visual quality and semantic alignment, ensuring that no preference aspect is neglected. Code and data will be shared at https://videodpo.github.io/.
- Abstract(参考訳): 生成拡散モデルの最近の進歩は、テキスト・ビデオ生成に大きな進歩をもたらした。
大規模で多様なデータセットに基づいてトレーニングされたテキストからビデオのモデルは、さまざまなアウトプットを生成することができるが、これらの世代は、しばしばユーザの好みから逸脱し、事前訓練されたモデルに対する好みのアライメントの必要性を強調している。
直接選好最適化(DPO)は言語と画像生成の大幅な改善を実証しているが,ビデオ拡散モデルへの適応の先駆けとして,いくつかの重要な調整を施したビデオDPOパイプラインを提案する。
どちらかにのみフォーカスする以前の画像アライメント方法とは違って
i)視覚的品質、または
2)テキストとビデオ間のセマンティックアライメントを包括的に検討し,OmniScoreとよばれる選好スコアを構築した。
提案したOmniScoreに基づいて、選好ペアデータを自動的に収集するパイプラインを設計し、そのスコアに基づいてこれらのペアを再重み付けすることで、全体的な選好アライメントに大きな影響を与えることを発見した。
本実験は,視覚的品質とセマンティックアライメントの両面で大幅に改善され,嗜好的側面が無視されることが保証された。
コードとデータはhttps://videodpo.github.io/.com/で共有される。
関連論文リスト
- Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization [14.50339880957898]
我々は、嗜好データ生成と正規化の訓練技術について、より深く検討することで、嗜好最適化パイプラインの改善を目指している。
選好データ生成のために、ペアワイズ比較信号を用いて完了の選好ランキングを導出する反復的なペアワイズランキング機構を提案する。
正規化のトレーニングでは、LLMが好むサンプルの確率をわずかに減少させると、好みの最適化がよりよく収束する傾向が観察される。
論文 参考訳(メタデータ) (2024-11-07T23:03:11Z) - VPO: Leveraging the Number of Votes in Preference Optimization [5.200545764106177]
本稿では,ユーザの投票データを活用し,多様な主観的嗜好に適合する手法を提案する。
我々は,議論を呼んでいる世代対と明らかな世代対を区別するために,双方の投票数を組み込んだVoteベースのPreference Optimizationフレームワークを開発した。
論文 参考訳(メタデータ) (2024-10-30T10:39:34Z) - Scalable Ranked Preference Optimization for Text-to-Image Generation [76.16285931871948]
DPOトレーニングのための大規模および完全合成データセット収集のためのスケーラブルなアプローチについて検討する。
ペア画像の嗜好は、事前訓練された報酬関数を用いて生成され、アノテーションプロセスに人間を巻き込む必要がなくなる。
ランキングフィードバックを用いてDPOに基づく手法を強化するためにRandonDPOを導入する。
論文 参考訳(メタデータ) (2024-10-23T16:42:56Z) - Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment [57.0121616203175]
本研究では,視覚言語アライメントを改善するための細粒度検証器として,モデル自身のビジュアルエンコーダを利用する新たな自己アライメント手法であるFiSAOを提案する。
ビジョンエンコーダからのトークンレベルのフィードバックを活用することで、FiSAOは視覚言語アライメントを大幅に改善する。
論文 参考訳(メタデータ) (2024-10-18T03:34:32Z) - Margin-aware Preference Optimization for Aligning Diffusion Models without Reference [19.397326645617422]
本稿では、SDXL(Stable Diffusion XL)のような最近のテキスト・画像拡散モデルのアライメントに焦点を当てる。
参照モデルに依存しない拡散モデルのための新しいメモリフレンドリーな選好アライメント手法を提案し,マージン・アウェア・選好最適化(MaPO)を提案する。
MaPOは、好ましくも好ましくない画像集合と好ましくも好まれる集合との近縁マージンを最大化し、同時に一般的なスタイリスティックな特徴と嗜好を学習する。
論文 参考訳(メタデータ) (2024-06-10T16:14:45Z) - Spatio-Temporal Side Tuning Pre-trained Foundation Models for Video-based Pedestrian Attribute Recognition [58.79807861739438]
既存の歩行者認識アルゴリズム(PAR)は主に静的画像に基づいて開発されている。
本稿では,時間的情報を完全に活用できるビデオフレームを用いて,人間の属性を理解することを提案する。
論文 参考訳(メタデータ) (2024-04-27T14:43:32Z) - VideoCon: Robust Video-Language Alignment via Contrast Captions [80.08882631838914]
ビデオ言語アライメントモデルは、ビデオキャプションのセマンティックなコントラスト変化に対して堅牢ではない。
私たちの研究は、エンティティの置換やアクション、イベント順序の反転など、幅広いコントラストのミスアライメントを特定します。
本モデルは,時間的に拡大したビデオ言語タスクにおけるゼロショット性能の新たな状態を設定する。
論文 参考訳(メタデータ) (2023-11-15T19:51:57Z) - HighlightMe: Detecting Highlights from Human-Centric Videos [52.84233165201391]
我々は,人間中心のビデオからハイライト可能な抜粋を検出するために,ドメインとユーザに依存しないアプローチを提案する。
本研究では,時空間グラフ畳み込みを用いたオートエンコーダネットワークを用いて,人間の活動やインタラクションを検出する。
我々は,最先端の手法に比べて,人手によるハイライトのマッチングの平均精度が4~12%向上したことを観察した。
論文 参考訳(メタデータ) (2021-10-05T01:18:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。