論文の概要: Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
- arxiv url: http://arxiv.org/abs/2608.23664v1
- Date: Mon, 24 Aug 2026 17:13:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.47091
- Title: Scaling Reinforcement Learning for Diffusion Models via Velocity Matching
- Title(参考訳): 速度マッチングによる拡散モデルのスケーリング強化学習
- Abstract要約: RewardBenchファインチューニングは、人間の好みやタスク固有の目的に拡散モデルを適用するための重要なツールである。
自己回帰モデルとは異なり、拡散モデルは生成したサンプルの抽出可能な可能性を提供しない。
本稿では,速度場に直接作用する単純なトラジェクトリフリー更新である報酬ベースベロシティマッチング(RVM)を提案する。
- 参考スコア(独自算出の注目度): 66.34541945134916
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reward fine-tuning is becoming an important tool for adapting diffusion models to human preferences and task-specific objectives, but existing methods largely inherit policy-gradient machinery from large language models. Unlike autoregressive models, diffusion models do not provide tractable likelihoods for generated samples. As a result, current approaches either construct trajectory likelihoods from stochastic denoising transitions or approximate endpoint likelihoods with evidence lower bound, introducing additional computation and algorithmic complexity. We demonstrate that this likelihood-based machinery is not necessary for effective diffusion reward fine-tuning. We propose reward-based velocity matching (RVM), a simple trajectory-free update that acts directly on the velocity field. RVM reinforces directions associated with high-reward generations, suppresses those with low reward, and involves an optional anchor term controlling drift from a reference velocity. Notably, it provides a general framework that recovers recent fine-tuning methods, including RAM and DiffusionNFT, as special cases. Across various large-scale diffusion models reward fine-tuning tasks, RVM is competitive with or outperforms trajectory-based policy-gradient methods under substantially reduced training cost. We further find that, once the velocity update is simplified, the particular loss variant matters less than reward and anchor design. For video generation, standard preference rewards can favor visually clean but nearly static outputs; introducing a new dynamic-tracking reward that substantially improve motions while improving overall VBench performance. These results suggest that scalable reward fine-tuning for diffusion models is better posed in the native velocity representation than as likelihood-based policy optimization.
- Abstract(参考訳): リワード微調整は人間の嗜好やタスク固有の目的に拡散モデルを適用するための重要なツールとなっているが、既存の手法は大規模言語モデルから政策段階の機械をほとんど継承している。
自己回帰モデルとは異なり、拡散モデルは生成したサンプルの抽出可能な可能性を提供しない。
結果として、現在のアプローチでは、確率的な分解遷移から軌道的可能性を構築するか、証拠を低い境界で近似的な終点確率を構築するか、さらなる計算とアルゴリズム的な複雑さを導入する。
この可能性に基づく機械は効果的な拡散報酬微調整には必要ないことを実証する。
本稿では,速度場に直接作用する単純なトラジェクトリフリー更新である報酬ベースベロシティマッチング(RVM)を提案する。
RVMは、高逆世代に関連する方向を強化し、報酬の低い方向を抑圧し、基準速度からドリフトを制御するオプションのアンカー項を含む。
特に、RAMやDiffusionNFTなどの最近の微調整メソッドを特別なケースとして回復する一般的なフレームワークを提供する。
様々な大規模拡散モデルが微調整タスクに報いる一方で、RVMは訓練コストを大幅に削減した軌道に基づく政策段階の手法と競合する。
さらに、ベロシティの更新が単純化されると、特定の損失変動は報酬やアンカーの設計よりも重要となる。
ビデオ生成では、標準的な選好報酬は視覚的にクリーンだがほぼ静的な出力が好まれる。
これらの結果は,拡散モデルに対するスケーラブルな報酬微調整が,確率に基づく政策最適化よりもネイティブな速度表現においてより優れていることを示唆している。
関連論文リスト
- Perceptual Flow Matching for Few-Step Generative Modeling [64.26537634881244]
知覚フローマッチング(Perceptual Flow Matching)は、フローマッチングモデルにおいて、数ステップ生成のためのフレームワークである。
PFMは、適切な表現空間で教師される際に、高品質な数ステップジェネレータを生成する。
論文 参考訳(メタデータ) (2026-07-03T17:55:01Z) - TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment [52.570581883709345]
本稿では,報酬を人間レベルの報酬分布マッチングに置き換えるトラジェクティブマッチングポリシバランス最適化(TMPO)を提案する。
TMPOは最先端の手法に対する生成的多様性を9.1%向上させ、下流および効率の指標で競合性能を達成する。
大規模フロープレフィックスのマルチトラックトレーニング時間を短縮するため、TMPOはDynamic Tree Smplingモデルを導入し、動的にスケジュールされたステップでトラジェクトリがdenoisingとブランチを共有する。
論文 参考訳(メタデータ) (2026-05-09T04:41:02Z) - Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers [12.948398661304184]
Diffusion-APOは、ビデオ拡散モデルと人間の意図を一致させる軌跡認識アルゴリズムである。
オンラインランキング、半オンラインアンカー、オフラインリファインメント、蒸留対応ドリフト補正を統合した統一かつモジュール化されたRLHFフレームワークを導入する。
本研究では,Diffusion-APOが視覚的品質と指示の基準線を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-08T09:37:46Z) - Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models [54.597200388738656]
Reward-based fine-tuningは、事前訓練された拡散またはフローベース生成モデルを、より高い逆サンプルに向けて操ることを目的としている。
報酬スコアマッチング (RSM) と呼ばれる共通フレームワークで記述できることが示される。
論文 参考訳(メタデータ) (2026-04-19T12:47:52Z) - Diffusion Reinforcement Learning via Centered Reward Distillation [35.979608265594685]
フォワードプロセス微細チューニング上に構築されたKL正規化報酬モデルから導出した拡散RLフレームワークである textbf Reward Distillation (CRD) を提案する。
信頼性の高いテキスト・画像の微調整を可能にするため,分布のドリフトを明示的に制御する手法を提案する。
textttGenEval と textttOCR rewards によるテキスト・ツー・イメージのポストトレーニング実験では、競合する SOTA の報酬最適化が高速収束と報酬ハッキングの好みの低減をもたらすことが示された。
論文 参考訳(メタデータ) (2026-03-14T21:29:33Z) - FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring [33.809728459395785]
FideDiffは、高忠実度デブロアリング用に設計された新しい単一ステップ拡散モデルである。
我々は、各タイムステップが徐々にぼやけた画像を表す拡散のようなプロセスとして、動きのデブロアリングを再構成する。
一致したぼやけた軌跡でトレーニングデータを再構成することにより、モデルは時間的一貫性を学習し、正確なワンステップのデブロワーを可能にする。
論文 参考訳(メタデータ) (2025-10-02T03:44:45Z) - A-FloPS: Accelerating Diffusion Sampling with Adaptive Flow Path Sampler [21.134678093577193]
A-FloPSは、フローベースの生成モデルのための原則化された、トレーニング不要のフレームワークである。
A-FloPSは, 試料品質と効率の両面において, 最先端のトレーニング不要サンプリング器より一貫して優れていることを示す。
5ドルの関数評価で、A-FloPSはFIDを大幅に低くし、よりシャープでコヒーレントな画像を生成する。
論文 参考訳(メタデータ) (2025-08-22T13:28:16Z) - One-Step Diffusion Model for Image Motion-Deblurring [85.76149042561507]
本稿では,脱臭過程を1段階に短縮する新しいフレームワークである脱臭拡散モデル(OSDD)を提案する。
拡散モデルにおける忠実度損失に対処するために,構造復元を改善する改良された変分オートエンコーダ(eVAE)を導入する。
提案手法は,実測値と非参照値の両方で高い性能を達成する。
論文 参考訳(メタデータ) (2025-03-09T09:39:57Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。