論文の概要: $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
- arxiv url: http://arxiv.org/abs/2609.22041v2
- Date: Mon, 21 Sep 2026 18:38:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.863456
- Title: $λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
- Title(参考訳): $λ$-Controlled GRPO: Flow-Matching Ratio Instabilityを予算リソースに変換する
- Abstract要約: Flow-GRPOは、報酬フィードバックから最適化できるポリシーとして、サンプルをデノナイズする。
この環境でのトレーニングは、マルチステップのdenoisingに特有の方法で不安定です。
代わりに、パスの分散と呼ばれる単一のステップ単位の量からそれらが生じることを示す。
これは、修復する症状の集合ではなく、測定と予算化が可能なリソースとして不安定性を再設定する。
- 参考スコア(独自算出の注目度): 2.013955334106378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning is increasingly used to align image generators with reward signals, and Flow-GRPO recently extended this paradigm to flow-matching models by treating the denoising sampler as a stochastic policy that can be optimized from reward feedback. Training in this setting is unstable in a way specific to multi-step denoising: the policy update changes systematically across denoising steps, with importance ratios drifting below one, becoming increasingly dispersed, clipping at different rates, and leaving fewer usable samples late in training. Prior work treats these effects as separate failure modes and addresses each with a hand-tuned stabilizer. We show instead that they arise from a single per-step quantity, which we call path variance. This quantity is determined exactly by the sampler's Gaussian transition kernel and can be estimated cheaply during training. This reframes instability as a resource that can be measured and budgeted rather than a collection of symptoms to repair. Our method, $λ$-Controlled GRPO, calibrates importance-ratio behavior from this predicted law rather than from noisy empirical statistics, and allocates gradient effort across denoising steps according to their predicted cost. The two scales governing the update are fixed by standard policy choices rather than introduced as free tuning parameters. On a text-to-image model under two reward settings, rendering difficult target text scored by optical character recognition and matching human preferences scored by a preference model, $λ$-Controlled GRPO improves both text accuracy and preference reward over the strongest empirical stabilizer. It also keeps late-step path variance within its intended budget, precisely where the baseline systematically overshoots. The result is a Flow-GRPO update calibrated by its own transition law rather than stabilized after instability appears.
- Abstract(参考訳): 画像生成装置を報酬信号と整合させるために強化学習がますます使われており、最近Flow-GRPOは、このパラダイムをフローマッチングモデルに拡張し、報奨フィードバックから最適化できる確率的ポリシーとしてデノナイジングサンプルを扱いました。
この設定でのトレーニングは、マルチステップのDenoisingに特有な方法で不安定である。ポリシー更新は、denoisingステップ間で体系的に変更され、重要度が1以下に漂流し、次第に分散し、異なるレートでクリップされ、トレーニングの後半に使用可能なサンプルが少なくなる。
以前の作業では、これらの効果を個別の障害モードとして扱い、それぞれが手動で調整された安定化器で対処する。
代わりに、パスの分散と呼ばれる単一のステップ単位の量からそれらが生じることを示す。
この量は、サンプルのガウス遷移カーネルによって正確に決定され、トレーニング中に安価に推定できる。
これは、修復する症状の集合ではなく、測定と予算化が可能なリソースとして不安定性を再設定する。
我々の方法である$λ$-Controlled GRPOは、ノイズの多い経験的統計からではなく、この予測された法則から重要度比の挙動を校正し、予測コストに応じて段差の勾配を割り当てる。
アップデートを管理する2つの尺度は、フリーチューニングパラメータとして導入されるのではなく、標準ポリシーの選択によって修正される。
2つの報奨条件下でのテキスト・ツー・イメージ・モデルにおいて、光学的文字認識による難しい目標テキストのレンダリングと、選好モデルによる人間の嗜好の一致により、$λ$-Controlled GRPOは、最も強い経験的安定化器よりもテキスト精度と選好報酬の両方を改善する。
また、意図した予算の中で、ベースラインが体系的にオーバーシュートされるような後期のパスのばらつきも維持します。
その結果、不安定が生じた後に安定化するのではなく、自身の移行法則によって調整されたFlow-GRPOが更新された。
関連論文リスト
- Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models [56.67321805551389]
Reinforcement Learning (RL) は, 拡散・流れマッチングジェネレータにおいて, 迅速なアライメントと知覚品質の向上に有効な方法となっている。
探索行動の制御と力学のデノベーションを行うサンプルは、この方針の一部である。
有効探査と安定性のバランスをとる新しいサンプリング器を提案する。
論文 参考訳(メタデータ) (2026-05-22T11:37:22Z) - ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization [14.900223489465683]
大規模言語モデル(LLM)は、AIフィードバック(RLAIF)から強化学習(Reinforcement Learning)を利用する。
これらのドメインは、細粒度で多層的な報酬を提供するために、しばしばベースオートレーダに依存している。
これは、離散的な報酬を順序付きバイナリインジケータのシーケンスに分解することで、評価ノイズを構造的に分離するフレームワークです。
論文 参考訳(メタデータ) (2026-05-12T19:17:14Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs [19.079556051442168]
強化学習(Reinforcement Learning, RL)は、推論タスクにおける大規模言語モデルの改善に広く用いられている。
しかし、REINFORCE や GRPO のような広く採用されている批判のない政策段階的手法では、高い非同期性によって政策段階的推定器は明らかにノイズを生じさせる。
本稿では,REINFORCE/GRPOスタイルのアルゴリズムの安定化手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T18:40:51Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping [63.33669214116784]
GRPO-Guardは、既存のGRPOフレームワークのシンプルで効果的な拡張である。
PPOクリッピングが有害な更新を適切に制限することを保証するため、バランスとステップ一貫性の重要度を回復する。
重いKL正則化に頼ることなく、暗黙の過最適化を実質的に緩和する。
論文 参考訳(メタデータ) (2025-10-25T14:51:17Z) - SADA: Stability-guided Adaptive Diffusion Acceleration [24.250318487331228]
拡散モデルは生成的タスクにおいて顕著な成功を収めたが、高い計算コストに悩まされている。
既存のトレーニングフリー加速戦略は、ステップごとの計算コストを削減しつつ、サンプリング時間を効果的に削減し、信頼性を低下させる。
本稿では, ODE に基づく生成モデルのサンプリングを高速化する新しいパラダイムとして, 安定誘導型適応拡散加速法 (SADA) を提案する。
論文 参考訳(メタデータ) (2025-07-23T02:15:45Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。