論文の概要: Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
- arxiv url: http://arxiv.org/abs/2607.07693v1
- Date: Wed, 08 Jul 2026 17:49:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.484253
- Title: Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
- Title(参考訳): サンプル高効率拡散RLHFのための選択時間重み付けとアドバンテージベース再生
- Abstract要約: 人間からのフィードバックからの強化学習(RLHF)は、生成モデルと人間の嗜好を整合させる強力なパラダイムとして現れている。
拡散モデルへのRLHFの適用は、既存のアプローチでは、通常、大量の人間または報酬モデルの評価を必要とするため、非常にフィードバックの少ないままである。
本稿では,拡散RLHFのフィードバック効率を大幅に向上する2つの補完戦略を提案する。
- 参考スコア(独自算出の注目度): 47.179011318017835
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Reinforcement learning from human feedback (RLHF) has emerged as a powerful paradigm for aligning generative models with human preferences. However, applying RLHF to diffusion models remains highly feedback inefficient, as existing approaches typically require large amounts of human or reward model evaluations. This limitation reduces the practicality of diffusion RLHF in realworld settings where feedback is the primary bottleneck. In this paper, we propose two complementary strategies that substantially improve the feedback efficiency of diffusion RLHF while preserving generalization to unseen prompts. Our key observation is that reward information in diffusion trajectories is unevenly distributed: not all denoising timesteps or trajectories contribute equally to learning from a reward signal. By emphasizing informative timesteps and trajectories during optimization, we obtain more effective gradient updates. First, we introduce a per-timestep weighting scheme that reweights denoising steps during policy optimization. We theoretically connect this weighting to the optimal convergence properties of proximal policy optimization (PPO) and approximate the resulting weighting trend empirically. Second, we introduce a replay mechanism that prioritizes informative trajectories, enabling the model to reuse past samples instead of repeatedly querying new rewards. Together, these strategies significantly improve the feedback efficiency of diffusion RLHF. Under identical hyperparameter settings, our approach achieves up to a 6$\times$ improvement in sample efficiency compared to widely used diffusion RLHF baselines.
- Abstract(参考訳): 人間からのフィードバックからの強化学習(RLHF)は、生成モデルと人間の嗜好を整合させる強力なパラダイムとして現れている。
しかしながら、RLHFを拡散モデルに適用することは、既存のアプローチでは、通常、大量の人間または報酬モデルの評価を必要とするため、非常にフィードバックの少ないままである。
この制限により、フィードバックが主要なボトルネックとなる現実世界における拡散RLHFの実用性が低下する。
本稿では,拡散RLHFのフィードバック効率を大幅に向上する2つの相補的手法を提案する。
我々のキーとなる観察は、拡散軌道における報酬情報は不均一に分散されていることである。
最適化中の情報的時間ステップと軌道を強調することにより、より効果的な勾配更新が得られる。
まず、政策最適化の段階を重み付けする時間単位重み付け方式を導入する。
理論的には、この重み付けをPPOの最適収束特性に結び付け、結果の重み付け傾向を経験的に近似する。
第2に、情報トラジェクトリを優先するリプレイ機構を導入し、新しい報酬を何度も問い合わせるのではなく、過去のサンプルを再利用できるようにする。
これらの戦略は拡散RLHFのフィードバック効率を大幅に向上させる。
提案手法は, 広範に使用されている拡散RLHFベースラインと比較して, 試料効率を最大6$\times$改善する。
関連論文リスト
- Data-regularized Reinforcement Learning for Diffusion Models at Scale [99.01056178660538]
データ正規化拡散強化学習(Data-regularized Diffusion Reinforcement Learning, DDRL)は, フォワードKLの分散を利用して, 政策を非政治データ分布に固定する新しいフレームワークである。
100万時間以上のGPU実験と1万回の二重盲検評価により、DDRLは、RLで見られる報酬ハックを緩和しながら、報酬を大幅に改善することを示した。
論文 参考訳(メタデータ) (2025-12-03T23:45:07Z) - Fine-Tuning Diffusion-Based Recommender Systems via Reinforcement Learning with Reward Function Optimization [21.769717387197943]
拡散モデルは、ユーザ・イテム相互作用の生成過程をモデル化することによって、最先端のパフォーマンスを提供する。
ReFiTはReinforcement Learning(RL)ベースのFin-Tuningを拡散型レコメンデータシステムに統合する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-10T10:38:16Z) - Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment [54.17386822940477]
PromptLoopはプラグインとプレイの強化学習フレームワークで、遅延フィードバックをステップワイドな即興改善に組み込む。
この設計は、プロンプトベースのアライメントの柔軟性と一般性を維持しながら、拡散RLアプローチと構造的な類似性を実現する。
論文 参考訳(メタデータ) (2025-10-01T02:18:58Z) - Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle [65.14124923451077]
強化学習(Reinforcement Learning, RL)は、マルチモーダル大言語モデル(MLLM)の推論能力を高めるための効果的なポストトレーニングパラダイムとして登場した。
しかしながら、現在のRLパイプラインは、アドバンテージ・コラプシング(Advantage Collapsing)とロールアウト・サイレンシング(Rollout Silencing)という2つの未解決の問題によって、トレーニングの非効率に悩まされることが多い。
軌道サンプリングとバッチ合成を動的に再構成することにより、RLの微調整効率を向上する、シンプルだが原則化されたフレームワークであるShuffle-R1を提案する。
論文 参考訳(メタデータ) (2025-08-07T17:53:47Z) - ARF-RLHF: Adaptive Reward-Following for RLHF through Emotion-Driven Self-Supervision and Trace-Biased Dynamic Optimization [6.472219867780061]
本稿では,自然フィードバックを連続的な嗜好軌道に変換する適応回帰追跡(ARF)を提案する。
ARFはPPOとDPOを一貫して上回り、アライメントを最大7.6%改善する。
その結果,連続報酬モデリングはパーソナライズされ理論的に基礎付けられたRLHFへのスケーラブルな経路を提供することを示した。
論文 参考訳(メタデータ) (2025-07-03T17:59:26Z) - Reward Model Overoptimisation in Iterated RLHF [10.041379049591969]
RLHF(Reinforcement Learning from Human feedback)は、大規模言語モデルと人間の好みを整合させる手法である。
RLHFはしばしば報酬モデルの過度な最適化に悩まされ、モデルが報酬関数に過度に適合する。
反復RLHFにおける過最適化の総合的研究について紹介する。
論文 参考訳(メタデータ) (2025-05-23T17:36:13Z) - VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL [28.95582264086289]
VAlue-based Reinforced Diffusion (VARD) は、中間状態から報酬の期待を予測する値関数を初めて学習する新しい手法である。
提案手法は,バックプロパゲーションによる効果的な,安定したトレーニングを可能にしつつ,事前訓練されたモデルに近づき続ける。
論文 参考訳(メタデータ) (2025-05-21T17:44:37Z) - ROCM: RLHF on consistency models [8.905375742101707]
一貫性モデルにRLHFを適用するための報酬最適化フレームワークを提案する。
正規化戦略として様々な$f$-divergencesを調査し、報酬とモデルの一貫性のバランスを崩す。
論文 参考訳(メタデータ) (2025-03-08T11:19:48Z) - Provably Efficient Online RLHF with One-Pass Reward Modeling [70.82499103200402]
人間のフィードバックからの強化学習は、大規模言語モデルと人間の好みを合わせることに顕著な成功を収めた。
オンラインRLHFは有望な方向性として現れ、反復的なデータ収集と改善を可能にしている。
本稿では,過去のデータを保存する必要をなくし,反復毎に一定時間更新を行うワンパス報酬モデリング手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T02:36:01Z) - Does RLHF Scale? Exploring the Impacts From Data, Model, and Method [83.53178716807776]
本研究では,大規模言語モデルにおける人間のフィードバックからの強化学習のスケーリング特性について検討する。
RLHFフレームワークの主要なコンポーネント、モデルサイズ、データ構成、推論予算、およびそれらのパフォーマンスへの影響を分析します。
論文 参考訳(メタデータ) (2024-12-08T17:19:48Z) - Provable Reward-Agnostic Preference-Based Reinforcement Learning [61.39541986848391]
PbRL(Preference-based Reinforcement Learning)は、RLエージェントが、軌道上のペアワイドな嗜好に基づくフィードバックを用いてタスクを最適化することを学ぶパラダイムである。
本稿では,隠れた報酬関数の正確な学習を可能にする探索軌道を求める理論的報酬非依存PbRLフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T15:00:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。