論文の概要: BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization
- arxiv url: http://arxiv.org/abs/2606.04807v1
- Date: Wed, 03 Jun 2026 12:31:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-04 20:44:18.749343
- Title: BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization
- Title(参考訳): BiasGRPO:グループ相対的政策最適化による高分散リワード景観におけるバイアス緩和の安定化
- Authors: Saket Reddy, Ke Yang, ChengXiang Zhai,
- Abstract要約: 大規模言語モデル(LLM)における社会的バイアスの緩和は、異なるアライメントの課題を示す。
直接選好最適化(DPO)は、オフライントレーニングに固有の探索の欠如によって制限される。
PPO(Proximal Policy Optimization)は、潜在的に信頼性の低い批評家の推定により、トレーニング不安定につながる可能性がある。
- 参考スコア(独自算出の注目度): 23.13988703785064
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mitigating social bias in Large Language Models (LLMs) presents a distinct alignment challenge: unlike verifiable tasks, bias lacks a single ground truth, creating a high-variance, subjective reward landscape. Previous preference-based fine-tuning methods have major trade-offs: Direct Preference Optimization (DPO) is limited by the lack of exploration inherent in offline training, while Proximal Policy Optimization (PPO) can lead to training instability due to potentially unreliable critic estimates. In this paper, we propose BiasGRPO, a framework using Group Relative Policy Optimization (GRPO) to stabilize alignment by normalizing rewards across a group of sampled completions. By substituting the value function with a group-relative baseline, our approach reduces instability while maintaining the exploration benefits of online training. We find that BiasGRPO outperforms DPO and PPO across multiple benchmarks, indicating its effectiveness. To adapt GRPO, we synthetically extend a dataset spanning multiple domains and contexts. We also create and release a custom bias reward model that effectively guides generation while being highly compute-efficient and avoiding knowledge degradation, providing a valuable resource that can be seamlessly integrated into multi-objective RLHF pipelines.
- Abstract(参考訳): 大規模言語モデル(LLM)における社会的バイアスの緩和は、検証可能なタスクとは異なり、バイアスは単一の根拠の真実を欠き、高分散で主観的な報酬の風景を生み出すという、明確なアライメントの課題を示す。
直接選好最適化(DPO)は、オフライントレーニングに固有の探索の欠如によって制限され、一方、PPO(Pximal Policy Optimization)は、潜在的に信頼できない批評家の推定により、トレーニング不安定につながる可能性がある。
本稿では,グループ相対政策最適化(GRPO)を用いたフレームワークであるBiasGRPOを提案する。
グループ相対ベースラインで値関数を置換することにより、オンライントレーニングの探索効果を維持しながら不安定性を低減できる。
BiasGRPO は複数のベンチマークで DPO や PPO よりも優れており,その有効性を示している。
GRPOに適応するために、複数のドメインとコンテキストにまたがるデータセットを合成的に拡張する。
また、計算効率が高く、知識の劣化を回避し、多目的RLHFパイプラインにシームレスに統合可能な貴重なリソースを提供するとともに、生成を効果的に導くカスタムバイアス報酬モデルを作成し、リリースする。
関連論文リスト
- RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning [49.04912820721943]
Group Prioritized Off-Policy Optimization (POPO)は、ロールアウトオーバーヘッドを発生させることなく、効果的なトレーニングバッチを活用するフレームワークである。
POPOは2つの重要なコンポーネントで構成されている。
POPOはRL微細化を著しく加速し、ロールアウトを著しく少なくして強力な推論性能を達成する。
論文 参考訳(メタデータ) (2026-05-31T15:06:38Z) - Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment [51.18269946911088]
RLHF(Reinforcement Learning from Human Feedback)の代替としてDPO(Direct Preference Optimization)が登場している。
このような場合、DPOとRLHFは基本的に異なる目的を最適化する。
本稿では,制約付き制約付きRLHF(Constrained Preference Optimization, CPO)を導入する。
我々の理論的分析は、DPOの保証が保たれ、証明可能なアライメントで単純さを保つソリューションを提供するときに成立する。
論文 参考訳(メタデータ) (2026-05-20T07:26:22Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment [13.085014101959118]
我々は、バッチ統計から有利な推定を分離する新しいアライメントフレームワークであるPersonalized GRPOを紹介する。
我々はP-GRPOを多種多様なタスクで評価し、標準のGRPOよりも高速な収束と高い報酬を達成することを発見した。
論文 参考訳(メタデータ) (2026-02-17T19:00:43Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization [20.66452395111739]
識別性を考慮したグループ相対ポリシー最適化(DaGRPO)を提案する。
DaGRPOは,(1)微粒なスコアリングを利用して,低差別性でサンプルペアを動的にマスキングするシーケンスレベルのグラディエント・リクティフィケーション,(2)高品質なアンカーを導入し,課題に対処するためのトレーニング信号の復元を行うオフ・ポリシー・データ・アジュメンテーションという2つのコアメカニズムを取り入れている。
詳細な分析により、DaGRPOは勾配の爆発を効果的に軽減し、長鎖推論能力の出現を加速することを確認した。
論文 参考訳(メタデータ) (2025-12-06T07:51:36Z) - Entropy Controllable Direct Preference Optimization [3.536605202672355]
提案するDPOは,提案するポリシのエントロピーを制御可能なH-DPOである。
実験の結果,H-DPO は様々なタスクにおいて DPO よりも優れており,数理タスクに対するpass@$k$ 評価において優れた結果が得られた。
論文 参考訳(メタデータ) (2024-11-12T07:09:44Z) - Uncertainty-Penalized Direct Preference Optimization [52.387088396044206]
我々は、優先不確実性ペナル化スキームを導入し、DPOの悲観的な枠組みを開発する。
ペナル化は、不確実なサンプルの損失勾配を減衰させる損失の補正として機能する。
我々は,バニラDPOと比較して全体的な性能が向上し,高い不確実性選択/拒絶反応によるプロンプトの完成度も向上した。
論文 参考訳(メタデータ) (2024-10-26T14:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。