論文の概要: A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models
- arxiv url: http://arxiv.org/abs/2607.14522v1
- Date: Thu, 16 Jul 2026 03:19:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.970571
- Title: A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models
- Title(参考訳): 微調整離散拡散モデルのための連続時間強化学習フレームワーク
- Abstract要約: 我々は、離散状態空間とおそらく任意の行動空間で連続的に強化学習(RL)を定式化する。
スコアベース離散拡散モデルを微調整するための完全連続時間RLフレームワークを開発した。
- 参考スコア(独自算出の注目度): 9.133661763917374
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We formulate reinforcement learning (RL) in continuous time with discrete state spaces and possibly arbitrary action spaces via a stochastic control approach, where the state dynamics are modeled as a controlled continuous-time Markov chain (CTMC). We consider policy optimization problems and derive the corresponding policy gradient methods, leading to continuous-time variants of proximal policy optimization (PPO) and group relative policy optimization (GRPO). As a primary application, we develop a complete continuous-time RL framework for fine-tuning score-based discrete diffusion models. The proposed framework enables reward-driven optimization without requiring differentiability on the reward signals. In contrast to the existing GRPO-based approaches that only rely on terminal rewards, our formulation allows intermediate reward or advantage signals to be incorporated throughout the denoising trajectory. Importantly, when specialized to masked diffusion models (MDMs), our framework encompasses a rich class of policy parameterizations over the vocabulary simplex with analytically tractable probability ratios, providing a unified perspective on exploration and policy optimization in MDMs. For masked diffusion large language models (dLLMs), we further propose trajectory subsampling techniques to efficiently estimate computationally prohibitive trajectory likelihoods, reducing the computational cost of computing per-position probability ratios. We showcase the effectiveness of our methods on both low-dimensional entropy-regularized optimization problems and RL post-training of dLLMs on mathematical reasoning and coding tasks.
- Abstract(参考訳): 離散状態空間と任意の行動空間との連続時間における強化学習(RL)を確率的制御手法により定式化し、状態ダイナミクスを制御された連続時間マルコフ連鎖(CTMC)としてモデル化する。
政策最適化問題を考察し、対応する政策勾配法を導出し、PPO(近位政策最適化)とGRPO(グループ相対政策最適化)の連続的変動をもたらす。
主な応用として、スコアベース離散拡散モデルを微調整するための完全連続時間RLフレームワークを開発する。
提案フレームワークは報酬信号の微分性を必要とせずに報酬駆動最適化を実現する。
既存のGRPOベースのアプローチが端末報酬のみに依存しているのとは対照的に,私たちの定式化では,デノベーション軌道全体を通して中間報酬や有利信号が組み込まれている。
重要なことは、マスク拡散モデル(MDM)に特化する場合、我々のフレームワークは、解析的に抽出可能な確率比を持つ語彙的単純性上のポリシーパラメーターの豊富なクラスを含み、MDMにおける探索とポリシー最適化の統一的な視点を提供する。
マスク拡散大言語モデル (dLLMs) に対し, トラジェクティブ・サブサンプリング手法を提案する。
本稿では,低次元エントロピー規則化最適化問題と数理推論および符号化タスクにおけるdLLMのRLポストトレーニングにおける提案手法の有効性を示す。
関連論文リスト
- Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching [25.3394501858201]
拡散政策は強化学習(RL)における複雑な行動分布を表す
我々は,近年の最適制御の進歩を活用して,拡散政策を最適化するための高効率アルゴリズムを提案する。
提案手法は, シミュレーション不要な学習を可能にし, 明確な仮説推定の必要性を回避できる随伴マッチングに基づいている。
論文 参考訳(メタデータ) (2026-06-21T18:32:25Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models [71.26391195427878]
拡散大言語モデル(dLLM)は、言語生成の新しいパラダイムを導入する。
本研究は,軌道確率計算のコストを削減し,dLLMのポリシー最適化を改善することを目的とする。
我々は、7B dLLMのdTRPOを命令追従と推論のベンチマークで評価した。
論文 参考訳(メタデータ) (2026-03-19T11:55:52Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Multi-Objective Reward and Preference Optimization: Theory and Algorithms [3.316593788543852]
この論文は、制御、嗜好学習、大規模言語モデルのアライメントを越えて制約付き強化学習(RL)を進める理論的枠組みとアルゴリズムを開発する。
ACPO, e-COP, warmPref-PS, PSPL, MOPOは, 平均コスト, エピソード, 嗜好駆動のパラダイムでRLを推し進める。
集合的に、論文はRLを平均的コスト、エピソード、および嗜好駆動のパラダイムで統一し、理論的な進歩と、安全で整合した意思決定のための実践的なツールを提供する。
論文 参考訳(メタデータ) (2025-12-11T12:51:21Z) - Policy Regularized Distributionally Robust Markov Decision Processes with Linear Function Approximation [10.35045003737115]
分散シフトによる意思決定は、トレーニングとデプロイメント環境が異なる強化学習(RL)における中心的な課題である。
本稿では,モデルのないオンラインポリシー最適化手法DR-RPOを提案する。
DR-RPO は,ロバストな RL における準最適境界とサンプル効率を実現し,値に基づく手法の性能に適合することを示す。
論文 参考訳(メタデータ) (2025-10-16T02:56:58Z) - Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning [77.92320830700797]
強化学習は、大規模言語モデルの推論機能を実現する上で中心的な役割を果たしてきた。
本稿では,ポリシー更新時の曲率情報を追跡し,活用するトラクタブルな計算フレームワークを提案する。
アルゴリズムであるCurvature-Aware Policy Optimization (CAPO)は、不安定な更新に寄与するサンプルを特定し、それらをマスクアウトする。
論文 参考訳(メタデータ) (2025-10-01T12:29:32Z) - Decision Flow Policy Optimization [53.825268058199825]
生成モデルは、複雑なマルチモーダルな動作分布を効果的にモデル化し、連続的な動作空間において優れたロボット制御を実現することができることを示す。
従来の手法は通常、データセットからの状態条件付きアクション分布に適合する振る舞いモデルとして生成モデルを採用する。
マルチモーダルな行動分布モデリングとポリシー最適化を統合した統合フレームワークDecision Flowを提案する。
論文 参考訳(メタデータ) (2025-05-26T03:42:20Z) - Sequential Monte Carlo for Policy Optimization in Continuous POMDPs [10.675160254513615]
連続的な部分観測可能なマルコフ決定プロセスのための新しいポリシー最適化フレームワークを導入する。
本手法は,非マルコフ的ファインマン-カックモデルにおいて,政策学習を確率論的推論とみなす。
提案手法の有効性を,標準連続ポデムPベンチマークで実証する。
論文 参考訳(メタデータ) (2025-05-22T14:45:46Z) - Iterative Amortized Policy Optimization [147.63129234446197]
政策ネットワークは、継続的制御のための深層強化学習(RL)アルゴリズムの中心的な特徴である。
変分推論の観点からは、ポリシーネットワークは、ポリシー分布を直接ではなく、ネットワークパラメータを最適化する、テキスト化最適化の一形態である。
我々は,反復的アモート化ポリシ最適化により,ベンチマーク連続制御タスクの直接アモート化よりも性能が向上することが実証された。
論文 参考訳(メタデータ) (2020-10-20T23:25:42Z) - Formal Controller Synthesis for Continuous-Space MDPs via Model-Free
Reinforcement Learning [1.0928470926399565]
連続空間マルコフ決定プロセス(MDP)のポリシーを合成する新しい強化学習手法を提案する。
この論文の重要な貢献は、有限のMDP上での強化学習に古典的な収束結果を活用することである。
本稿では,学習を高速化するために,新たな報酬形成手法を提案する。
論文 参考訳(メタデータ) (2020-03-02T08:29:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。