論文の概要: Misaligned by Reward: Socially Undesirable Preferences in LLMs
- arxiv url: http://arxiv.org/abs/2605.05003v1
- Date: Wed, 06 May 2026 15:04:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.891536
- Title: Misaligned by Reward: Socially Undesirable Preferences in LLMs
- Title(参考訳): LLMにおける社会的に望ましくない選好
- Abstract要約: 我々は、報酬モデルベンチマークを、バイアス、安全、道徳、倫理的推論という、社会的に連続した4つの領域に拡張する。
報奨モデルが社会的に望ましくない応答を好むか、その選好が系統的に偏りのある分布を生み出すかを検証する。
- 参考スコア(独自算出の注目度): 2.747260140143735
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Reward models are a key component of large language model alignment, serving as proxies for human preferences during training. However, existing evaluations focus primarily on broad instruction-following benchmarks, providing limited insight into whether these models capture socially desirable preferences. As a result, important failures in social alignment can remain hidden. We extend reward-model benchmarking to four socially consequential domains: bias, safety, morality, and ethical reasoning. We introduce a framework that converts social evaluation datasets into pairwise preference data, leveraging gold labels where available and directional bias indicators otherwise. This enables us to test whether reward models prefer socially undesirable responses, and whether their preferences produce systematically biased distributions over selected outputs. Across five publicly available reward models and two instruction-tuned models used as reward proxies, we find substantial variation across domains, with no single model performing best overall. The models fall well short of strong social intelligence: they often prefer socially undesirable options, and their preferences produce systematically biased distributions. Moreover, stronger bias avoidance can reduce sensitivity to context, revealing a key alignment trade-off between avoiding biased outcomes and preserving contextual faithfulness. These findings show that standard reward benchmarks are insufficient for assessing social alignment and highlight the need for evaluations that directly measure the social preferences encoded in reward models.
- Abstract(参考訳): 逆モデル(Reward model)は、大規模な言語モデルのアライメントの重要なコンポーネントであり、トレーニング中の人間の好みのプロキシとして機能する。
しかし、既存の評価は主に幅広い指示追従ベンチマークに焦点を当てており、これらのモデルが社会的に望ましい嗜好を捉えているかどうかについての限られた洞察を与えている。
その結果、社会的アライメントの重要な失敗は隠蔽される可能性がある。
我々は、報酬モデルベンチマークを、バイアス、安全、道徳、倫理的推論という、社会的に連続した4つの領域に拡張する。
我々は、社会的評価データセットをペアワイズ選好データに変換するフレームワークを導入し、利用可能なゴールドラベルと方向性バイアス指標を併用する。
これにより、報酬モデルが社会的に望ましくない応答を好むか、その好みが選択された出力に対して体系的に偏りのある分布を生成するかどうかを検証できる。
5つのパブリックな報酬モデルと2つの命令調整モデルが報酬プロキシとして使用されており、ドメイン間でかなりのばらつきが見られ、全体として最高のモデルが存在しない。
モデルは強力な社会的知性に欠けており、しばしば社会的に望ましくない選択肢を好む。
さらに、強いバイアス回避は、コンテキストに対する感受性を低下させ、バイアス結果の回避とコンテキストの忠実性の維持の間に重要なトレードオフを明らかにする。
これらの結果から,標準的な報酬ベンチマークは社会的アライメントを評価するには不十分であり,報酬モデルに符号化された社会的嗜好を直接測定する評価の必要性を強調した。
関連論文リスト
- To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias [61.40435736418359]
異質なベンチマークを標準化する統一的なフレームワークを導入し、孤立した人口統計評価と強制選択比較設定を対比する。
比較設定は、主に不特定文脈によって引き起こされる潜在識別のアグレッシブな触媒として機能することを示す。
最後に、この比較偏見はモデルサイズと正にスケールする一般化された現象であることを示す。
論文 参考訳(メタデータ) (2026-06-23T13:53:50Z) - SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution [82.31558282651811]
複雑な対人相互作用をナビゲートするソーシャルインテリジェンスは、言語エージェントに根本的な課題を提示する。
既存のアプローチでは、言語モデルを直接使用してエピソードレベルの報酬を分配する。
協調ゲーム理論に基づく新しい原理的枠組みであるSAVOIRを提案する。
論文 参考訳(メタデータ) (2026-04-21T02:08:25Z) - Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization [12.964518425036168]
パーソナライズド・リワードベンチ(Personalized RewardBench)は、パーソナライズされた好みをモデル化するための報酬モデルの能力を厳格に評価する新しいベンチマークである。
選択された応答対と拒否された応答対は、ユーザ固有のルーリックへの厳密な固執(または違反)に基づいて構成し、好みの区別が個人ごとに一意に調整されていることを保証します。
本ベンチマークでは,既存のベースラインと比較して,Best-of-N(BoN)サンプリングとPPO(Porximal Policy Optimization)の両方において,ダウンストリーム性能と有意に高い相関関係を示した。
論文 参考訳(メタデータ) (2026-04-08T17:55:00Z) - Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback [26.682783974167446]
リワードモデリングは、大きな言語モデルと人間の嗜好の整合に不可欠である。
現在のアプローチでは、順序的嗜好データを活用するための基本的な数学的枠組みが欠如している。
本稿では, 離散順序回帰問題として, Likert スケールの選好を用いた報酬モデリングを定式化する理論的な枠組みを提案する。
論文 参考訳(メタデータ) (2026-02-13T05:08:05Z) - From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models [69.4332879415364]
本稿では,ビデオ生成における社会的表現を評価するためのフレームワークであるVideoBiasEvalを紹介する。
VideoBiasEvalでは、アクター属性からセマンティックコンテンツをアンタングルするために、イベントベースのプロンプト戦略を採用している。
我々は、人間の嗜好データセットにおけるバイアス、報酬モデルにおける増幅、アライメント調整されたビデオ拡散モデルによる伝播を結合する最初のエンドツーエンド分析を行う。
論文 参考訳(メタデータ) (2025-10-20T07:37:43Z) - Detecting Prefix Bias in LLM-based Reward Models [4.596249232904721]
選好データセットに基づいて訓練された報酬モデルにおいて,プレフィックスバイアスを検知し,評価するための新しい手法を提案する。
これらの指標を活用して、人種と性別の異なる嗜好モデルにおける大きなバイアスを明らかにします。
本研究は,公正かつ信頼性の高い報酬モデルを開発する上で,バイアス対応データセットの設計と評価を重要視するものである。
論文 参考訳(メタデータ) (2025-05-13T21:50:03Z) - The Root Shapes the Fruit: On the Persistence of Gender-Exclusive Harms in Aligned Language Models [91.86718720024825]
我々はトランスジェンダー、ノンバイナリ、その他のジェンダー・ディバースのアイデンティティを中心とし、アライメント手順が既存のジェンダー・ディバースバイアスとどのように相互作用するかを検討する。
以上の結果から,DPO対応モデルは特に教師付き微調整に敏感であることが示唆された。
DPOとより広範なアライメントプラクティスに合わせたレコメンデーションで締めくくります。
論文 参考訳(メタデータ) (2024-11-06T06:50:50Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - Balancing User Preferences by Social Networks: A Condition-Guided Social Recommendation Model for Mitigating Popularity Bias [64.73474454254105]
ソーシャルレコメンデーションモデルは、ユーザに対してユニークなパーソナライズされたレコメンデーション結果を提供するために、ソーシャルインタラクションをデザインに織り込む。
既存のソーシャルレコメンデーションモデルは、人気バイアスや社会的情報の冗長性の問題に対処できない。
本稿では,モデルの人気バイアスを軽減するための条件付きソーシャルレコメンデーションモデル(CGSoRec)を提案する。
論文 参考訳(メタデータ) (2024-05-27T02:45:01Z) - Fair Multivariate Adaptive Regression Splines for Ensuring Equity and
Transparency [1.124958340749622]
学習過程に公平度を組み込んだMARSに基づく公正度予測モデルを提案する。
MARSは、特徴選択を行い、非線形関係を扱い、解釈可能な決定ルールを生成し、変数の最適分割基準を導出する非パラメトリック回帰モデルである。
実世界のデータにfairMARSモデルを適用し、精度とエクイティの観点からその有効性を実証する。
論文 参考訳(メタデータ) (2024-02-23T19:02:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。