論文の概要: Latent Reward Registers for Diffusion Preference Alignment
- arxiv url: http://arxiv.org/abs/2608.03929v2
- Date: Wed, 05 Aug 2026 03:09:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.316832
- Title: Latent Reward Registers for Diffusion Preference Alignment
- Title(参考訳): 拡散選好アライメントのための潜在リワードレジスタ
- Authors: Yuanshen Guan, Zipeng Feng, Chengru Song, Zhiwei Xiong, Peiqin Sun,
- Abstract要約: 本稿では,中間雑音の遅延から端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のためには、Reward-Guided Sampling (RGS) はパラメータ更新なしで大小マッチングされた報酬勾配を経由する。
- 参考スコア(独自算出の注目度): 46.49072106092868
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning diffusion models with human preferences usually relies on a sparse terminal reward evaluated on the final generated samples, presenting a severe temporal credit-assignment challenge across the multi-step denoising process. We propose Latent Reward Registers, a mechanism that estimates terminal preference directly from intermediate noisy latents by prepending learnable, position-free register tokens to the input sequence of a frozen Diffusion Transformer (DiT). This independent readout mechanism extracts latent reward evidence without altering the generator's hidden states or velocity field. The resulting dense, differentiable reward signal throughout the full denoising process facilitates two alignment strategies. For training, Reward-Gradient On-Policy Distillation (RG-OPD) distills reward-guided updates along on-policy trajectories, bypassing the computationally expensive rollouts of standard policy gradients. For inference, Reward-Guided Sampling (RGS) steers trajectories via magnitude-matched reward gradients without parameter updates. Empirically, at high noise levels (u = 0.8), the registers reach the highest pairwise accuracy among the evaluated latent reward models. Furthermore, RG-OPD outperforms online reinforcement learning baselines while reducing GPU hours by up to 33x, and RGS establishes a new state-of-the-art among training-free methods, strictly enhancing both alignment and perceptual metrics. Code and weights are available at https://github.com/Guanys-dar/latent-reward-register
- Abstract(参考訳): 人間の嗜好による拡散モデルの調整は、通常、最終生成したサンプルに基づいて評価されたまばらな終末報酬に依存し、多段階の復調過程における深刻な時間的信用割り当ての課題を提示する。
凍結拡散変換器(DiT)の入力シーケンスに、学習可能な、位置のないレジスタトークンを予測することで、中間雑音の潜伏者から直接端末の好みを推定するメカニズムであるLatent Reward Registersを提案する。
この独立した読み出し機構は、発電機の隠された状態や速度場を変えることなく、潜伏した報酬証拠を抽出する。
結果として生じる高密度で微分可能な報酬信号は、完全な復調過程を通して2つのアライメント戦略を促進する。
トレーニングのために、Reward-Gradient On-Policy Distillation (RG-OPD) は、標準的な政策勾配の計算的に高価なロールアウトを回避し、報酬誘導された更新をオンライン軌道に沿って蒸留する。
推論のために、Reward-Guided Sampling (RGS) はパラメータを更新せずに、大まかにマッチした報酬勾配を経由する。
経験的に、高い雑音レベル(u = 0.8)では、レジスタは評価された潜在報酬モデルの中で最高のペアの精度に達する。
さらに、RG-OPDは、最大33倍のGPU時間を削減しながら、オンライン強化学習ベースラインよりも優れており、RGSはトレーニングなしの手法の中で、新たな最先端技術を確立し、アライメントと知覚のメトリクスを厳格に強化している。
コードとウェイトはhttps://github.com/Guanys-dar/latent-reward-registerで入手できる。
関連論文リスト
- SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending [55.764018145256216]
本稿では,補助予測器を介してデノナイジングプロセスを開始する数ステップのパラダイムであるSATB-VRを提案する。
我々は,SATB-VRが,合成,実世界,AIGCベンチマークにおける既存のアプローチに対して良好に動作することを示す。
論文 参考訳(メタデータ) (2026-06-27T01:32:16Z) - RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents [13.362388357375082]
マルチターンツール利用RLは、静的データセットにおける情報的サンプルの迅速な枯渇によってボトルネックとなる。
本稿では, RODS (Reward-driven Online Data Synthesis) を提案する。
論文 参考訳(メタデータ) (2026-06-17T13:13:32Z) - Gradient-Guided Reward Optimization for Inference-time Alignment [22.28081683932275]
グラデーションガイダンスによるデコーディングにおいて、ターゲットとなる最小限の介入を行う軽量な推論時手法を提案する。
実験により、GGROは安全性、有用性、推論ベンチマークを横断する推論時間アライメントを一貫して改善することが示された。
また、コンピュータのオーバーヘッドを最小限に抑えて、高品質なレスポンスと、ハッキングに報いるロバストさのカバレッジも向上する。
論文 参考訳(メタデータ) (2026-06-08T15:33:13Z) - Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models [56.67321805551389]
Reinforcement Learning (RL) は, 拡散・流れマッチングジェネレータにおいて, 迅速なアライメントと知覚品質の向上に有効な方法となっている。
探索行動の制御と力学のデノベーションを行うサンプルは、この方針の一部である。
有効探査と安定性のバランスをとる新しいサンプリング器を提案する。
論文 参考訳(メタデータ) (2026-05-22T11:37:22Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL [16.321536102397733]
ワンステップのテキスト・ツー・イメージ生成により、顕著な効率と品質でリアルタイムな合成が可能になった。
画像空間報酬最適化と拡散雑音空間分布マッチングを組み合わせた1ステップジェネレータの事前強化学習法について検討した。
KL最小化から導かれるデータフリーな軌道レベルのアライメントフレームワークであるDiff-Instruct with Diffused Reward (DIDR)を提案する。
論文 参考訳(メタデータ) (2026-05-18T21:26:33Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents [9.505140329883762]
よりリッチな学習信号を提供するジェネレーティブ・リワード・モデル(GRM)を導入する。
GRMには、特定の行動パターンを奨励または阻止するための基準を示す、人間によって設計されたルーリックが備わっている。
SWEタスク上でRFT(Reinforced Fine-Tuning)に使用する場合,本手法は終端スコアのみのリジェクションサンプリングよりも優れる。
論文 参考訳(メタデータ) (2026-03-13T02:23:49Z) - Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics [49.242224984144904]
本稿では,プロセス報酬勾配誘導ダイナミクスによる生成を支援する新しいフレームワークであるEuphoniumを提案する。
我々の重要な洞察は、プロセス・リワード・モデルの勾配を明示的に組み込んだ理論的に原理化されたアルゴリズムとしてサンプリング・プロセスを定式化することである。
我々は,誘導信号をフローネットワークに内部化する蒸留目標を導出し,報奨モデルへの推論時間依存性を排除した。
論文 参考訳(メタデータ) (2026-02-04T08:59:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。