論文の概要: GroupDPO: Memory efficient Group-wise Direct Preference Optimization
- arxiv url: http://arxiv.org/abs/2604.15602v1
- Date: Fri, 17 Apr 2026 00:56:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.68895
- Title: GroupDPO: Memory efficient Group-wise Direct Preference Optimization
- Title(参考訳): GroupDPO: メモリ効率のよいグループワイド直接参照最適化
- Authors: Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon,
- Abstract要約: バックプロパゲーション中にサンプルをデカップリングしながら勾配を保ちながらメモリ効率の高いグループワイズ最適化アルゴリズムを導入する。
オフラインとオンラインのアライメント設定の両方で、複数のレスポンスを活用することでシングルペアトレーニングを継続的に上回ることを示す。
- 参考スコア(独自算出の注目度): 29.469340103121144
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Preference optimization is widely used to align Large Language Models (LLMs) with preference feedback. However, most existing methods train on a single positive-negative pair per prompt, discarding additional supervision available in preference datasets that typically contain multiple candidate responses. Motivated by this limitation, recent work explores group-wise preference optimization, which jointly contrasts multiple responses for the same prompt, but its empirical behavior and scalability remain underexplored due to the memory overhead of group-coupled objectives. In this work, we introduce a memory-efficient group-wise preference optimization algorithm that preserves gradients while decoupling samples during backpropagation, substantially reducing peak memory usage, which enables scalable training with larger group sizes. Across both offline and online alignment settings, we show that leveraging multiple responses consistently outperforms single-pair training. Furthermore, incorporating a negative log-likelihood (NLL) term on positive responses is critical for both performance gains and training stability.
- Abstract(参考訳): 優先度最適化は、Large Language Models (LLM) を好みのフィードバックに合わせるために広く使われている。
しかしながら、既存のほとんどのメソッドは、プロンプト毎に1つの正負のペアでトレーニングし、通常複数の候補応答を含む優先データセットで利用可能な追加の監督を廃止している。
この制限によって動機づけられた最近の研究は、同じプロンプトに対して複数の応答を共同で比較するグループワイドな選好最適化を探求しているが、グループ結合された目的のメモリオーバーヘッドのため、その経験的挙動とスケーラビリティは未解明のままである。
本研究では,バックプロパゲーション中にサンプルをデカップリングしながら勾配を保ち,最大メモリ使用量を大幅に削減し,グループサイズを大きくしたスケーラブルなトレーニングを可能にする,メモリ効率の高いグループ優先最適化アルゴリズムを提案する。
オフラインとオンラインのアライメント設定の両方で、複数のレスポンスを活用することでシングルペアトレーニングを継続的に上回ることを示す。
さらに、負の対数類似項(NLL)を正の応答に組み込むことは、性能向上とトレーニング安定性の両方に不可欠である。
関連論文リスト
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - AMPO: Active Multi-Preference Optimization for Self-play Preference Selection [16.230186347702737]
マルチパラメータ最適化は、有用な応答と望ましくない応答の集合全体を対比することにより、ペアの好みを超えた言語モデルアライメントを強化する。
そこで本稿では,オンライン・プライス・ジェネレーション,マルチ・コントラスト・グループ・コントラスト・ロス,アクティブ・サブセット選択を組み合わせた新しいアプローチである,$textitActive Multi-Preference Optimization$ (AMPO)を提案する。
AMPO は Llama 8B と Mistral Mist 7B を使って $textitAlpacaEval$ で最先端の結果を得る。
論文 参考訳(メタデータ) (2025-02-25T15:29:51Z) - Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment [74.25832963097658]
マルチオブジェクトアライメント(MOA)は、応答を複数の人間の嗜好目標に合わせることを目的としている。
DPOをベースとしたMOAアプローチは、データに広範囲にわたる優先的対立に悩まされている。
論文 参考訳(メタデータ) (2025-02-20T08:27:00Z) - Multi-Preference Optimization: Generalizing DPO via Set-Level Contrasts [17.243429150450886]
応答集合全体の最適化のために,$textbfMulti-Preference Optimization (MPO)を提案する。
MPOは偏差に基づく重み付けを採用しており、平均的な報酬から最も逸脱する外れ値の応答を強調している。
理論的には、MPOはクエリ毎のレスポンス数に対して$mathcalOleft(frac1sqrtnright)$でアライメントバイアスを低減する。
論文 参考訳(メタデータ) (2024-12-05T21:50:22Z) - Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization [75.1240295759264]
本稿では,BMC という名前のペアデータにおけるブリッジ・アンド・モデリングの効果的なフレームワークを提案する。
目的の修正によって、ペアの選好信号の一貫性と情報性が向上する。
DPOだけではこれらの相関をモデル化し、ニュアンス付き変動を捉えるには不十分である。
論文 参考訳(メタデータ) (2024-08-14T11:29:47Z) - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback [103.36048042664768]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムと人間の価値を合わせるための一般的なアプローチである。
本稿では,分散ロバスト最適化(DRO)に基づく適応的優先損失を提案する。
提案手法は多用途であり,様々な選好最適化フレームワークに容易に適用可能である。
論文 参考訳(メタデータ) (2024-06-04T20:33:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。