Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
Abstractの概要
本論文は、拡散モデルにおける報酬ファインチューニングには尤度ベースの方策勾配機構は不要であり、モデル固有の速度表現で直接定式化可能であると主張している。著者らは、単一のノイズ付加状態に対して報酬重み付け回帰を適用し、参照速度場からのドリフトを抑制する任意のアンカー項を備えた、軌道保存が不要な目的関数である報酬ベース速度マッチング(RVM)を提案する。また、RAMやDiffusionNFTなどの近年の速度ベースの手法が、同一の更新構造の特殊なケースとして表現できることを示している。Text-to-Image、Text-to-Video、Image-to-Videoモデルを用いた実験を通じてRVMを既存手法と比較し、動画生成における動きをはじめとする報酬設計が、速度損失の厳密な数式形態よりも大きな影響を与えることを明らかにしている。
新規性
主な新規性は、方策比率の推定やノイズ除去軌道の保存を不要とし、速度場に直接作用する簡素化された拡散モデル向け報酬ファインチューニングの定式化にある。また、RAMとDiffusionNFTを同一のRVMフレームワークに位置づける統合的視点を提供するとともに、従来の動画報酬が静止した出力を好みがちである課題に対処する動的トラッキング報酬を導入した点にある。
成果
動画タスクにおいて、速度マッチング手法は大幅に少ない計算量で軌道ベースのファインチューニングを一貫して上回り、Wan2.1-T2V-1.3BではRVMが最高水準のVBench Overallスコア(84.13)および動的度(75.00)を達成した。また、SkyReels-I2VではOverallスコアを86.27へと向上させ(FlowGRPOはベースモデルを下回る)、SD3.5-MによるOCR向けText-to-Image検証でも大半の指標で最良またはタイの結果を記録した。Wan2.1の学習コストに関しても、FlowGRPOの1,159 GPU時間やDanceGRPO/TaRoSの6,171 GPU時間に対し、RVMは525 GPU時間と大幅に低減された。
論文の注目点
- RVMは単一のノイズ付加サンプルに対する報酬重み付け速度回帰を用いて拡散モデルをファインチューニングし、尤度比の推定や全軌道の保存を回避する。
- RAMとDiffusionNFTはアンカー付き速度マッチング更新の特殊なケースであることが示され、損失関数の形式の差異よりも報酬やアンカーの設計が重要であることが示唆される。
- 動画生成において提案された動的トラッキング報酬を追加することで動きに関する評価が大幅に改善し、報酬設計が下流タスクの品質における極めて重要な決定要因であることが示された。