論文の概要: When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models
- arxiv url: http://arxiv.org/abs/2605.05403v1
- Date: Wed, 06 May 2026 19:36:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.397678
- Title: When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models
- Title(参考訳): HelpfulnessがSycophancyになるとき:Sycophancyは、大規模言語モデルにおける社会的アライメントとてんかんの整合性の境界的障害である
- Authors: Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent,
- Abstract要約: LLMにおける梅毒は、社会的整合性とてんかんの整合性の境界的な障害である、と我々は主張する。
既存の作業は、しばしば、誤ったユーザ信念との合意のような外部の振る舞いを通じて、梅毒を運用する。
我々は、アライメントターゲット、メカニズム、重症度からなる、梅毒の分類のための分類法を導入する。
- 参考スコア(独自算出の注目度): 0.13192560874022083
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: This position paper argues that sycophancy in LLMs is a boundary failure between social alignment and epistemic integrity. Existing work often operationalizes sycophancy through external behavior such as agreement with incorrect user beliefs, position reversals, or deviation from an objective standard of correctness. These formulations capture only overt forms of the phenomenon and leave subtler boundary failures involving epistemic integrity and social alignment underspecified. We argue that sycophancy should not be understood as agreement alone, but as alignment behavior that displaces independent epistemic judgment. To clarify this boundary, we propose a three-condition framework for sycophancy. First, the user expresses a cue in the form of a belief, preference, or self-concept. Second, the model shifts toward that cue through alignment behavior. Third, this shift compromises epistemic accuracy, independent reasoning, or appropriate correction. We also introduce a taxonomy for classifying sycophancy, consisting of alignment targets, mechanisms, and severity. The paper concludes by discussing implications for alignment evaluation and argues for boundary-aware assessment, structured rubrics, and mitigation strategies, while situating these proposals alongside alternative views of sycophancy.
- Abstract(参考訳): このポジションペーパーは、LLMにおける梅毒は社会的整合性とてんかんの整合性の境界不全であると主張している。
既存の作業は、誤ったユーザ信念との合意、位置反転、客観的な正当性標準からの逸脱といった外部行動を通じて、しばしばサイコファシーを運用する。
これらの定式化は現象の過度な形態のみを捉え、疫学的整合性や社会的整合性に関する微妙な境界欠陥を未特定のまま残す。
我々は、梅毒は合意のみではなく、独立性てんかんの判断に取って代わるアライメント行動として理解されるべきであると主張する。
この境界線を明らかにするために,梅毒の3条件フレームワークを提案する。
まず、ユーザは、信念、好み、あるいは自己概念の形でキューを表現する。
第2に、モデルはアライメントの振る舞いを通じて、そのキューに向かってシフトする。
第三に、このシフトはてんかんの正確性、独立した推論、あるいは適切な修正を損なう。
我々はまた、アライメントターゲット、メカニズム、重症度からなる、梅毒の分類のための分類法も導入した。
本論文は、アライメント評価の意義を論じ、境界認識評価、構造的ルーリック、緩和戦略について論じるとともに、これらの提案を、代替的なアルコール依存の見解と並べて検討することで締めくくっている。
関連論文リスト
- On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation [51.56484100374058]
このような情報条件の相互作用パターンを振る舞い依存として定式化する。
これにより、$$-behavioural equivalenceというプローブ相対的な概念と、政治内行動距離が導かれる。
その結果、共通政策変換の下でプローブ条件の挙動分離が保存されない構造条件が明らかになった。
論文 参考訳(メタデータ) (2026-02-24T22:55:21Z) - Position: General Alignment Has Hit a Ceiling; Edge Alignment Must Be Taken Seriously [51.03213216886717]
我々は、一般的なアライメントの支配的なパラダイムが、矛盾する値の設定において構造的な天井に達するという立場を取る。
エッジアライメント(Edge Alignment)は,多次元の値構造を保持するシステムにおいて,異なるアプローチである。
論文 参考訳(メタデータ) (2026-02-23T16:51:43Z) - Operational Noncommutativity in Sequential Metacognitive Judgments [0.0]
メタ認知評価は、確率的読み出しを伴う内部状態空間に作用する状態変化操作としてモデル化されていることを示す。
また, 逐次的信頼, 誤り様相, 知覚的判断による知識的判断を含む行動パラダイムについても概説する。
論文 参考訳(メタデータ) (2026-02-15T08:15:48Z) - Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures [70.48661957773449]
創発的ミスアライメント(英: Emergent Misalignment)とは、狭い範囲のデータに対する微調整された大きな言語モデルによって、広範囲に不整合な振る舞いが引き起こされる障害モードを指す。
複数のドメインやモデルファミリにまたがって、特定の文字レベルの配置を示すデータの微調整モデルは、誤操作よりもはるかに強く、転送可能な微調整を誘導する。
論文 参考訳(メタデータ) (2026-01-30T15:28:42Z) - Epistemic Traps: Rational Misalignment Driven by Model Misspecification [36.837352790122544]
安全性は,報酬等級の連続関数ではなく,エージェントの先行処理によって決定される離散位相であることを示す。
これにより、ロバストなアライメントに必要な条件として、主観的モデルエンジニアリングが確立される。
論文 参考訳(メタデータ) (2026-01-27T09:21:36Z) - Human-like Social Compliance in Large Language Models: Unifying Sycophancy and Conformity through Signal Competition Dynamics [7.209622481153123]
本研究では,15の大規模言語モデル間での行動相関を検証した統合フレームワークであるSignal Competition Mechanismを紹介する。
コンプライアンスへの遷移は線形境界によって支配される決定論的プロセスであることが示され、社会感情信号は情報信号を効果的に抑制する。
論文 参考訳(メタデータ) (2025-12-25T06:57:42Z) - Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models [0.0]
大きな言語モデルは、真理と曖昧な平らさの間の構造的なトレードオフを内部化する。
この潜伏バイアスは、梅毒(sycophancy)として知られるもので、原則的推論よりもユーザ合意を優先している。
我々は,このバイアスを会話の文脈とは無関係に分離する,単ターン強制選択ベンチマークであるBeaconを紹介した。
論文 参考訳(メタデータ) (2025-10-19T06:36:57Z) - Does Representation Intervention Really Identify Desired Concepts and Elicit Alignment? [73.80382983108997]
表現の介入(Representation intervention)は、大規模言語モデルにおいて基礎となる概念を符号化する表現の発見と修正を目的としている。
介入が忠実であれば、介入されたLLMは有害な概念を消去し、非分配的敵のプロンプトとアウト・オブ・ディストリビューションのジェイルブレイクの両方に対して堅牢であるべきである。
本研究では,有害表現と良性表現の境界を簡易化する概念集中(COCA)を提案する。
論文 参考訳(メタデータ) (2025-05-24T12:23:52Z) - Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles [30.405680322319242]
Helpful, Honest, and Harmless(HHH)原則は、AIシステムを人間の価値と整合させるためのフレームワークである。
我々は,HHH原理の適応的解釈を論じ,多様なシナリオへの適応のための参照フレームワークを提案する。
この作業は、AIアライメントを改善するための実践的な洞察を提供し、HHH原則が現実のAIデプロイメントにおいて基礎的かつ運用的に有効であることを保証する。
論文 参考訳(メタデータ) (2025-02-09T22:41:24Z) - Fairness and robustness in anti-causal prediction [73.693135253335]
分散シフトと公平性に対するロバストさは、機械学習モデルに必要な2つの重要なデシラタとして独立に現れている。
これら2つのデシダラタは関連しているように見えるが、実際にはその関連性はしばしば不明である。
この観点から見れば、共通フェアネス基準(分離)とロバストネスの共通概念との明確な関係を描いています。
論文 参考訳(メタデータ) (2022-09-20T02:41:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。