論文の概要: When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy
- arxiv url: http://arxiv.org/abs/2605.12112v1
- Date: Tue, 12 May 2026 13:29:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.882585
- Title: When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy
- Title(参考訳): 政策エントロピー制約が機能しない場合--知覚エントロピーによるフローベースRLHFの多様性の保全
- Authors: Xiaofeng Tan, Jun Liu, Bin-Bin Gao, Yuanting Fan, Xi Jiang, Chengjie Wang, Hongsong Wang, Feng Zheng,
- Abstract要約: RLでは、多様性はしばしばポリシーエントロピーと相関し、エントロピー正則化を動機付けていると仮定される。
政策エントロピーは、知覚の多様性が崩壊しても一定であり続ける。
知覚空間における多様性を捉える知覚エントロピーを導入し,標準エントロピーの特性を維持する。
- 参考スコア(独自算出の注目度): 84.66775319652074
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: RLHF is widely used to align flow-matching text-to-image models with human preferences, but often leads to severe diversity collapse after fine-tuning. In RL, diversity is often assumed to correlate with policy entropy, motivating entropy regularization. However, we show this intuition breaks in flow models: policy entropy remains constant, even while perceptual diversity collapses. We explain this mismatch both theoretically and empirically: the constant entropy arises from the fixed, pre-defined noise schedule, while the diversity collapse is driven by the mode-seeking nature of policy gradients. As a result, policy entropy fails to prevent the model from converging to a narrow high-reward region in the perceptual space. To this end, we introduce perceptual entropy that captures diversity in a perceptual space and maintains the property of standard entropy. Building upon this insight, we propose two entropy-regularized strategies, Perceptual Entropy Constraint and Perceptual Constraints on Generation Space, to preserve perceptual diversity and improve the quality. Experiments across two base models, neural and rule-based rewards, and three perceptual spaces demonstrate consistent gains in the quality-diversity trade-off; PEC achieves the best overall score of 0.734 (vs. baseline's 0.366); a complementary setting of PEC further reaches a diversity average of 0.989 (vs. baseline's 0.047). Our project page (https://xiaofeng-tan.github.io/projects/PEC) is publicly available.
- Abstract(参考訳): RLHFは、フローマッチングテキスト・ツー・イメージモデルと人間の好みを合わせるために広く使用されているが、微調整後、しばしば深刻な多様性の崩壊を引き起こす。
RLでは、多様性はしばしばポリシーエントロピーと相関し、エントロピー正則化を動機付けていると仮定される。
しかし、この直観はフローモデルにおいて破れており、政策エントロピーは、知覚的な多様性が崩壊しても一定である。
一定のエントロピーは、固定された、事前定義された騒音スケジュールから生じるが、多様性の崩壊は、政策勾配のモード探索の性質によって引き起こされる。
結果として、ポリシーエントロピーは、モデルが知覚空間内の狭い高逆領域に収束することを防ぐことができない。
この目的のために、知覚空間における多様性を捉え、標準エントロピーの性質を維持する知覚エントロピーを導入する。
この知見に基づいて、我々は、知覚の多様性を保ち、品質を向上させるために、知覚のエントロピー制約と知覚の制約という2つのエントロピー規則化戦略を提案する。
PECは0.734(v.baseline's 0.366)、PECの相補的な設定は0.989(v. baseline's 0.047)である。
私たちのプロジェクトページ(https://xiaofeng-tan.github.io/projects/PEC)が公開されています。
関連論文リスト
- Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control [77.8471519867791]
実験的に、エントロピー極性はエントロピーの変化を確実に予測することを示した。
本稿では、両極性分岐を保護し、有利な再重み付けによるエントロピー制御を実装するPAPO(Polarity-Aware Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-05-12T08:47:05Z) - Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization [53.75029276020459]
本研究では,エントロピー変化への寄与に応じて,エントロピー増加とエントロピー減少の更新を再スケールする適応的エントロピーフローバランス機構を提案する。
6つの数学的推論ベンチマークの実験は、OPEFOがトレーニングと最終的なパフォーマンスを改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T04:08:17Z) - From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation [53.759125791348396]
Reinforcement Learning (RL) によるChain-of-Thought (CoT) は、テキスト・ツー・イメージ(T2I) の生成を改善する。
本稿では,3つの重要な洞察をもたらすエントロピーに基づく系統的分析について述べる。
本稿では,不確実性により最適化予算を再配置する微調整戦略であるエントロピー誘導グループ相対政策最適化(EG-GRPO)を提案する。
論文 参考訳(メタデータ) (2026-03-12T12:49:26Z) - Mind Your Entropy: From Maximum Entropy to Trajectory Entropy-Constrained RL [56.085103402298905]
本稿では,この2つの課題に対処する軌道エントロピー制約強化学習(TECRL)フレームワークを提案する。
このフレームワーク内では、まず報酬とエントロピーに関連する2つのQ-関数を個別に学習し、温度更新の影響を受けないクリーンで安定した値ターゲットを確保する。
我々は,3つの改良を加えて,最先端の分散型ソフトアクター批判を拡張して,現実的な非政治的アルゴリズムDSAC-Eを開発した。
論文 参考訳(メタデータ) (2025-10-25T09:17:47Z) - Arbitrary Entropy Policy Optimization: Entropy Is Controllable in Reinforcement Fine-tuning [36.00460460149206]
本稿では, エントロピーボーナスをREINFORCEポリシー勾配に置き換えることで, エントロピー崩壊を解消するArbitrary Entropy Policy Optimization (AEPO)を提案する。
AEPOは、ポリシー勾配を正規化として、分布を正規化として、REINFORCEを正規化として統合し、最適化を歪ませることなく正確なエントロピー制御を可能にする。
論文 参考訳(メタデータ) (2025-10-09T12:24:08Z) - The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models [99.98293908799731]
本稿では,LLMによる推論,すなわち政策エントロピーの崩壊において,RLのスケーリングの大きな障害を克服することを目的としている。
実際には、エントロピーHと下流性能Rの間の変換方程式R=-a*eH+bを確立する。
Clip-Cov と KL-Cov という2つの単純かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:38:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。