論文の概要: Groupwise Distortion Guarantees for Preference-Based Alignment
- arxiv url: http://arxiv.org/abs/2610.05450v1
- Date: Sun, 04 Oct 2026 18:45:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:47:20.519492
- Title: Groupwise Distortion Guarantees for Preference-Based Alignment
- Title(参考訳): 選好に基づくアライメントのための集団歪み保証
- Abstract要約: 本稿では,一つのグループ条件のポリシーをユーザ毎の比較から学習する効率的なアルゴリズムを提案する。
類似した好みを持つグループに対するよりシャープな保証は、メンバーが許容可能なお気に入りのレスポンスを共有するときに、その歪みにアプローチする。
- 参考スコア(独自算出の注目度): 7.188275243856368
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Preference-based alignment methods such as reinforcement learning from human feedback (RLHF) and Nash learning from human feedback (NLHF) aggregate pairwise preferences to learn an LLM policy, but a natural goal is maximizing social welfare (average cardinal utility), which comparisons alone need not identify. Gölz, Haghtalab, and Yang (GHY) measure the gap by distortion: the worst-case ratio between the welfare of the best fixed lottery (distribution over responses) and of the learned lottery. They show NLHF is optimal when every user receives the same lottery. Account-based LLMs, however, have information about their users and can serve different lotteries to different people. We give an efficient algorithm, GLHF, that learns a single group-conditioned policy from one comparison per user. Under individual Bradley--Terry comparisons, GLHF asymptotically matches GHY's optimal population distortion bound simultaneously on every group in a prespecified, possibly overlapping collection, with sample complexity growing logarithmically in the number of groups and inversely with the smallest group mass. A sharper guarantee for groups with similar preferences approaches distortion of one when members share a feasible favorite response. In experiments using human coffee ratings and synthetic LLM-generated ratings, GLHF lowers distortion in every evaluated group and substantially reduces worst-group distortion relative to NLHF and other group-agnostic baselines.
- Abstract(参考訳): 人的フィードバックからの強化学習(RLHF)や人的フィードバックからのナッシュ学習(NLHF)といった嗜好に基づくアライメント手法は、LLMポリシーを学ぶためのペアワイズな好みを集約するが、自然なゴールは社会的福祉(平均的基本効力)を最大化することであり、比較だけでは識別する必要がない。
Gölz, Haghtalab, Yang (GHY) は、最良の固定された宝くじの福祉(レスポンスの分配)と学習された宝くじの間の最悪のケース比を歪みによって測定する。
各ユーザが同じ宝くじを受け取ると、NLHFが最適であることを示す。
しかし、アカウントベースのLCMはユーザーに関する情報を持ち、異なる人々に異なる宝くじを提供することができる。
ユーザ毎の比較から単一グループ条件のポリシーを学習する,効率的なアルゴリズムGLHFを提案する。
個々のBradley-Terryの比較において、GLHFはGHYの最適集団歪みを、事前に特定され、おそらく重複するコレクションのすべてのグループに同時に有するものであり、サンプルの複雑さは、グループ数で対数的に増加し、最小のグループ質量と逆数的に増加する。
類似した好みを持つグループに対するよりシャープな保証は、メンバーが許容可能なお気に入りのレスポンスを共有するときに、その歪みにアプローチする。
ヒトコーヒーの格付けと合成LDM生成格付けを用いた実験では、GLHFは評価されたグループごとの歪みを低くし、NLHFや他のグループに依存しないベースラインに対する最悪のグループ歪みを著しく低減する。
関連論文リスト
- Class-Grouped Normalized Momentum and Faster Hyperparameter Exploration to Tackle Class Imbalance in Federated Learning [16.216002257704826]
クラス不均衡は、未表現のクラスが予測性能の低下に苦しむ連邦学習(FL)において重要な課題となる。
本稿では,FLにおけるクライアントサイドであるFedCGNMを提案する。
そこで本研究では,X-armed-bandit(XAB)に基づくアルゴリズムであるFedHOOを導入する。
論文 参考訳(メタデータ) (2026-07-01T21:09:50Z) - Adaptive Sampling for Private Worst-Case Group Optimization [29.021524910413373]
そこで本研究では,ASCと呼ばれるグループ最適化アルゴリズムを提案する。
各グループのサンプリングレートとクリッピング閾値の両方を適応的に制御する。
その結果、全体的な平均精度を犠牲にすることなく、低分散勾配、プライバシー保証の厳格化、最悪のグループ精度が大幅に向上する。
論文 参考訳(メタデータ) (2026-02-11T13:02:45Z) - A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs [2.840505903487544]
本稿では,大規模言語モデル(LLM)を,連合学習環境における多種多様な人間の嗜好と整合させるという課題に対処する。
本研究では,人間の嗜好に異なるアグリゲーション戦略を用いる場合,アライメント品質と公正性のトレードオフを評価する総合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T16:39:32Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - Reward-Augmented Data Enhances Direct Preference Alignment of LLMs [63.32585910975191]
報奨条件付き大言語モデル(LLM)を導入し、データセット内の応答品質のスペクトル全体から学習する。
当社のアプローチは,DPOをかなりのマージンで継続的に向上させることを示す。
本手法は,嗜好データの有用性を最大化するだけでなく,未学習の問題も軽減し,データ拡張を超えてその広範な効果を実証する。
論文 参考訳(メタデータ) (2024-10-10T16:01:51Z) - Group Robust Preference Optimization in Reward-free RLHF [23.622835830345725]
そこで本研究では,大規模言語モデルと各グループの嗜好を密に整合させる新しいグループロバスト選好最適化法を提案する。
これを達成するため、GRPOは異なるグループの重要性を適応的かつ順次重み付けし、累積損失が悪化したグループを優先順位付けする。
我々は,最悪のパフォーマンス群の性能向上,グループ間の損失不均衡の低減,確率精度の向上について検討した。
論文 参考訳(メタデータ) (2024-05-30T17:50:04Z) - On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization [39.29350451006295]
選好マッチング(PM) RLHF はBradley-Terry--Luce/Plackett--Luce モデルの下で、大きな言語モデルと報酬モデルの選好分布を整合させる新しいアプローチである。
我々のアプローチの中心はPM正則化器であり、応答上の LLM のポリシー確率分布の負の対数の形を取る。
実験では、標準的なRLHFと比較して、特定の測定基準によって測定されるように、人間の嗜好に沿った29%から41%の改善が示されている。
論文 参考訳(メタデータ) (2024-05-26T07:00:05Z) - Provable Multi-Party Reinforcement Learning with Diverse Human Feedback [63.830731470186855]
RLHF(Reinforcement Learning with Human feedback)は、モデルと人間の好みを結びつける新しいパラダイムである。
一つの報酬関数を学習しても、複数の個人の好みを捉えバランスが取れないので、従来のRLHFアプローチが失敗する可能性があることを示す。
メタラーニングを取り入れて、複数の嗜好を学習し、異なる社会福祉機能を採用して、複数のパーティにまたがる嗜好を集約する。
論文 参考訳(メタデータ) (2024-03-08T03:05:11Z) - Preference Ranking Optimization for Human Alignment [90.6952059194946]
大規模言語モデル(LLM)は、しばしば誤解を招くコンテンツを含み、それらを人間の価値と整合させる必要性を強調している。
人間のフィードバックからの強化学習(RLHF)が、このアライメントを達成するために採用されている。
我々は、人間のアライメントのための微調整LDMのための効率的なSFTアルゴリズムとして、優先度ランク付け最適化(PRO)を提案する。
論文 参考訳(メタデータ) (2023-06-30T09:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。