論文の概要: Mitigating Social Sycophancy via Pluralistic Preference Optimization
- arxiv url: http://arxiv.org/abs/2610.02568v2
- Date: Mon, 05 Oct 2026 07:54:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.533222
- Title: Mitigating Social Sycophancy via Pluralistic Preference Optimization
- Title(参考訳): 複数論理的選好最適化によるソーシャル・サイコファシーの緩和
- Abstract要約: 関係アドバイスを含む個人的なアドバイスは、現在、生成AIの最も一般的な用途の1つに位置づけられている。
しかし、言語モデル(LM)は、ユーザーを人間よりもはるかに頻繁に認めるため、人々は過度に信頼し、紛争後に関係を修復する意思を失わせる可能性がある。
本稿では,PlurPO(Pluralistic Preference Optimization)を提案する。個人間の対立を記述した入力が与えられた場合,LMは関連する利害関係者を特定し,シミュレートし,すべての利害関係者に受け入れられる応答を優先して生成するように訓練する。
- 参考スコア(独自算出の注目度): 31.92436667568431
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personal advice, including relationship advice, now ranks among the most common uses of generative AI. But language models (LMs) exhibit sycophancy: they affirm users much more often than humans do, which can make people overconfident and less willing to repair their relationships after a conflict. Prior work on mitigating sycophancy has focused on factual settings where a response can be checked against a ground truth answer, while mitigations for social sycophancy (e.g., personal advice, where there is no ground truth) have relied on simple prompting and post-training methods with limited effectiveness. Our insight is that social sycophancy occurs in part because LMs overly center on the user and fail to consider the perspectives of other stakeholders impacted by the user's behavior. To address this problem we propose Pluralistic Preference Optimization (PlurPO): given inputs describing interpersonal conflicts, the LM identifies and simulates the relevant stakeholders, and is then trained to prefer and generate responses acceptable to all stakeholders. PlurPO uses only signals the model produces about its own outputs, without ground-truth labels. PlurPO substantially reduces social sycophancy across four datasets and four model families compared to prior methods. For example, on statements of intent to cause harm, where the users' actions should not be endorsed, PlurPO reduces the endorsement rate by 89% on average across four models. On general advice questions, where the target is to match the endorsement rate of human responses, it closes the gap by more than half, from 17.8% to 8.0% on average. The preference dataset constructed by PlurPO for an 8B model also effectively transfers to mitigating sycophancy in a larger (32B) model. Our results indicate that social sycophancy can be reduced by leveraging a model's own capabilities to simulate a plurality of relevant perspectives.
- Abstract(参考訳): 関係アドバイスを含む個人的なアドバイスは、現在、生成AIの最も一般的な用途の1つに位置づけられている。
しかし、言語モデル(LM)は、人間よりもはるかに頻繁にユーザーを肯定し、人々が過度に信頼し、紛争後に関係を修復する意思を失わせる。
サイコファンシーを緩和する以前の研究は、応答を根拠的真理の答えに対してチェックできる現実的な設定に焦点を合わせてきたが、一方で、社会的サイコファンシー(例えば、個人的アドバイス、根拠的真理がない場所)の緩和は、単純なプロンプトとポストトレーニングの手法を限定的な有効性に頼ってきた。
私たちの洞察は、LMがユーザを過度に重視し、ユーザの行動に影響を及ぼす他の利害関係者の視点を考慮できないため、社会的な梅毒が発生している、ということです。
この問題に対処するために、我々はPlurPO (Pluralistic Preference Optimization) を提案し、対人対立を記述した入力が与えられ、LMは関連する利害関係者を特定し、シミュレートし、すべての利害関係者に受け入れられる応答を優先して生成するように訓練される。
PlurPOはモデルが生成する信号のみを使用する。
PlurPOは、以前の方法と比較して、4つのデータセットと4つのモデルファミリーにまたがる社会的な梅毒を著しく減少させる。
例えば、ユーザーのアクションを支持すべきでない障害を引き起こす意図のステートメントでは、PlurPOは4つのモデルで平均89%の支持率を削減している。
一般的なアドバイスの質問では、人間の反応の支持率と一致させることが目標であり、平均して17.8%から8.0%のギャップを埋める。
PlurPO が 8B モデルに対して構築した選好データセットは,より大きな (32B) モデルで梅毒の緩和に効果的に移行する。
以上の結果から,モデル自身の能力を活用して,複数の視点をシミュレートすることで,ソーシャル・サイコフィケーションを低減できることが示唆された。
関連論文リスト
- Analyzing and Correcting Benevolence Bias in Large Language Models [25.94213078450494]
大規模言語モデル(LLM)は、人間の回答者のスタンドインとしてますます使われています。
ここでは、評価バイアス(benevolence bias)を識別し、測定する。これは、LLMがより親切で、より安全で、より社会的に認められた質問に対する回答に傾く傾向の小さいが、一貫性のある傾向である。
バイアスは安定なモデル特性であり、どのシステムにおいてもクォークではないことが分かる。
論文 参考訳(メタデータ) (2026-07-26T08:37:58Z) - Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models [0.0]
エージェントシステムの相互作用スキャフォールディング特性は,シコファンシーを体系的に増幅する。
より有能なモデルは、より大きな増幅効果、予想の厄介な逆転を示す。
我々の結果は、AIシステムがより大きな自律性を獲得するにつれて、薬局は単なる永続性ではなく、複雑化することを示している。
論文 参考訳(メタデータ) (2026-07-06T23:43:58Z) - Response Time Enhances Alignment with Heterogeneous Preferences [49.69696266152175]
簡易な二次信号で選好データセットを増大させることで、住民の平均選好の識別性を回復できることを示す。
私たちの結果は、将来的なデータ収集パイプラインに約束と新たな機会をもたらします。
論文 参考訳(メタデータ) (2026-05-07T22:05:23Z) - Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models [2.4851820343103035]
大規模言語モデルは、ユーザ要求時にペルソナとロールプレイ文字を採用する会話エージェントとして機能するようになっている。
この機能は、事実の正確性を優先するのではなく、ユーザを検証する応答を提供する傾向にある。
本研究は,13の小規模オープンウェイト言語モデルにおいて,ペルソナがサイコフィナンシーにどのように影響するかを体系的に検討する。
論文 参考訳(メタデータ) (2026-04-12T17:12:55Z) - ELEPHANT: Measuring and understanding social sycophancy in LLMs [31.88430788417527]
本稿では,ユーザの顔の過剰な保存を特徴とする社会性梅毒について紹介する。
ベンチマークを11モデルに適用すると、LSMは社会的梅毒の頻度が常に高いことを示す。
論文 参考訳(メタデータ) (2025-05-20T06:45:17Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z) - RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation [24.374185140811115]
人間からのフィードバックからの強化学習(RLHF)は、AIシステムを人間の価値と整合させる効果的な手法である。
本稿では、人間の嗜好に固有の異質性や、フィードバックの提供における潜在的な戦略的行動から、この問題に対処することに焦点を当てる。
本研究では, 個人化に基づく手法と集約に基づく手法の2つの枠組みを提案する。
論文 参考訳(メタデータ) (2024-04-30T23:57:23Z) - Dissecting Human and LLM Preferences [80.55271307662365]
人間は誤りに敏感ではなく、自分の姿勢を支持する反応を好んでおり、モデルが限界を認めている場合、明確な嫌悪を示します。
GPT-4-Turboのような先進的なLCMは、より正確さ、明快さ、無害さを強調している。
嗜好に基づく評価は意図的に操作可能であることを示す。
論文 参考訳(メタデータ) (2024-02-17T14:34:31Z) - Simple synthetic data reduces sycophancy in large language models [88.4435858554904]
言語モデルにおける梅毒の有病率について検討する。
サイコファシー(Sycophancy)とは、モデルがそのビューが客観的に正しくない場合でも、人間のユーザのビューに従うように、応答を調整する場所である。
論文 参考訳(メタデータ) (2023-08-07T23:48:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。