論文の概要: Discrete Flow Matching Policy Optimization
- arxiv url: http://arxiv.org/abs/2604.06491v1
- Date: Tue, 07 Apr 2026 21:49:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.256649
- Title: Discrete Flow Matching Policy Optimization
- Title(参考訳): 離散フローマッチングポリシー最適化
- Authors: Maojiang Su, Po-Chung Hsieh, Weimin Wu, Mingcheng Lu, Jiunhau Chen, Jerry Yao-Chieh Hu, Han Liu,
- Abstract要約: 本稿では、Reinforcement Learning(RL)ファインチューニング離散フローマッチング(DFM)モデルの統合フレームワークを提案する。
我々のキーとなる考え方は、DFMサンプリング手順を多段階のマルコフ決定プロセスとして見ることである。
DoMinOは、前回の最高の報酬駆動ベースラインよりも強い予測エンハンサー活性とより優れたシーケンス自然性を達成する。
- 参考スコア(独自算出の注目度): 12.864514553126186
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We introduce Discrete flow Matching policy Optimization (DoMinO), a unified framework for Reinforcement Learning (RL) fine-tuning Discrete Flow Matching (DFM) models under a broad class of policy gradient methods. Our key idea is to view the DFM sampling procedure as a multi-step Markov Decision Process. This perspective provides a simple and transparent reformulation of fine-tuning reward maximization as a robust RL objective. Consequently, it not only preserves the original DFM samplers but also avoids biased auxiliary estimators and likelihood surrogates used by many prior RL fine-tuning methods. To prevent policy collapse, we also introduce new total-variation regularizers to keep the fine-tuned distribution close to the pretrained one. Theoretically, we establish an upper bound on the discretization error of DoMinO and tractable upper bounds for the regularizers. Experimentally, we evaluate DoMinO on regulatory DNA sequence design. DoMinO achieves stronger predicted enhancer activity and better sequence naturalness than the previous best reward-driven baselines. The regularization further improves alignment with the natural sequence distribution while preserving strong functional performance. These results establish DoMinO as an useful framework for controllable discrete sequence generation.
- Abstract(参考訳): 本稿では,RL(Reinforcement Learning)ファインチューニング型離散フローマッチング(DFM)モデルのための統合フレームワークであるDoMinO(Disdisrete Flow Matching Policy Optimization)を紹介する。
我々のキーとなる考え方は、DFMサンプリング手順を多段階のマルコフ決定プロセスとして見ることである。
この観点は、頑健なRL目的としての微調整報酬最大化の単純で透明な再構成を提供する。
その結果、元のDFMサンプリング装置を保存できるだけでなく、多くの従来のRL微調整法で使われている偏りのある補助推定器や可能性のサロゲートを回避できる。
また,政策崩壊を防止するため,事前訓練した分布に近い微調整分布を維持するために,新たな全変量正規化器を導入する。
理論的には、DoMinOの離散化誤差と正則化器のトラクタブルな上界の上限を確立する。
そこで我々は,DNA配列設計におけるDoMinOの評価を行った。
DoMinOは、前回の最高の報酬駆動ベースラインよりも強い予測エンハンサー活性とより優れたシーケンス自然性を達成する。
正規化は、強い機能性能を維持しながら、自然なシーケンス分布との整合性をさらに向上する。
これらの結果は、制御可能な離散シーケンス生成のための有用なフレームワークとしてDoMinOを確立する。
関連論文リスト
- Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Flow Density Control: Generative Optimization Beyond Entropy-Regularized Fine-Tuning [59.11663802446183]
フローおよび拡散生成モデルは、事前情報を保持しながらタスク固有の目的を最適化するために適応することができる。
本研究では,フロー密度制御(FDC)を導入し,複雑な問題をより単純な微調整タスクの特定のシーケンスに還元する。
我々は,近年のミラーフローの理解を活用して,現実的な仮定の下で提案されたスキームの収束保証を導出する。
論文 参考訳(メタデータ) (2025-11-27T17:19:01Z) - Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator [32.05337749590184]
本稿では,非推奨の完了を効果的にサンプリングするための理論的ガイダンスを提供する新しいPOフレームワークを開発する。
次に、サンプリング戦略としてコントラスト分散(CD)を選択し、新しいMC-POアルゴリズムを提案する。
OnMC-POは既存のSOTAベースラインより優れており、OnMC-POはさらなる改善をもたらす。
論文 参考訳(メタデータ) (2025-02-06T23:45:08Z) - Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer [52.09480867526656]
人間の嗜好を学習する際の分布変化と不確実性の一形態として,不一致の原因を同定する。
過度な最適化を緩和するために、まず、逆選択された報酬モデルに最適なポリシーを選択する理論アルゴリズムを提案する。
報奨モデルとそれに対応する最適ポリシーの等価性を用いて、優先最適化損失と教師付き学習損失を組み合わせた単純な目的を特徴とする。
論文 参考訳(メタデータ) (2024-05-26T05:38:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。