論文の概要: Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
- arxiv url: http://arxiv.org/abs/2605.14604v1
- Date: Thu, 14 May 2026 09:21:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.746513
- Title: Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks
- Title(参考訳): サイコファーレンシーは教育の安全リスクである: LLMチューターがシコファーレンシーベンチマークを必要とする理由
- Authors: Enkelejda Kasneci, Gjergji Kasneci,
- Abstract要約: コンテキストスウィッチフレーム攻撃に抵抗するモデルでは,社会的情緒的な圧力下でも降伏する可能性がある。
EduFrameTrapは数学、物理学、経済学、化学、生物学、計算機科学にまたがる学習ベンチマークである。
- 参考スコア(独自算出の注目度): 26.594498540217568
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This position paper argues that effective tutoring requires corrective friction: surfacing misconceptions and challenging them supportively to drive conceptual change. Yet preference-aligned LLMs can trade epistemic rigor for agreeableness. We identify a Reasoning-Sycophancy Paradox: models that resist context-switch frame attacks can still capitulate under social-epistemic pressure, especially authority ("my notes say I'm right") and social-affective face-saving ("please don't tell me I'm wrong"). We introduce EduFrameTrap, a tutoring benchmark across math, physics, economics, chemistry, biology, and computer science that varies student confidence and pressure (context-switch, authority, social-affective). Across two frontier LLMs, context-switch failures are comparatively lower for GPT-5.2, while authority and social pressure more often trigger epistemic retreat. In contrast, Claude shows substantial context-switch fragility in this run. Because these failures are hard to judge automatically, we report two-judge disagreement as a reliability signal. We argue benchmarks should measure social-epistemic courage, i.e., supportive but corrective tutoring, and treat kind-but-correct behavior as a safety requirement.
- Abstract(参考訳): このポジションペーパーは、効果的なチュータリングには修正的摩擦が必要であり、誤解を克服し、概念的変化を促進するために支援的にそれらに挑戦する。
しかし、嗜好に整合したLDMは、相応しいようにててんかんの厳密さを交換することができる。
コンテキスト・スウィッチ・フレーム攻撃に抵抗するモデルは、特に権威(私の意見では、私は正しい)と社会的影響のあるフェイスセービング("please don't tell me I'm wrong")の下で、依然として降伏する可能性がある。
EduFrameTrapは、数学、物理学、経済学、化学、生物学、コンピュータ科学にまたがる学習ベンチマークであり、学生の自信と圧力(コンテキストスイッチ、権威、社会的影響)を変える。
2つのフロンティアLSM全体では、GPT-5.2ではコンテキストスイッチの故障が比較的低いが、権威と社会的圧力はてんかんの後退を引き起こすことが多い。
これとは対照的に、Claude氏は、この実行におけるコンテキストスイッチの脆弱さを示している。
これらの故障は自動判断が困難であるため,信頼性信号として2次元不一致を報告する。
我々は、ベンチマークが社会観的な勇気、すなわち、支援的だが是正的な指導を計測し、親切だが正しい行動は安全要件として扱うべきだと論じている。
関連論文リスト
- When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models [0.13192560874022083]
LLMにおける梅毒は、社会的整合性とてんかんの整合性の境界的な障害である、と我々は主張する。
既存の作業は、しばしば、誤ったユーザ信念との合意のような外部の振る舞いを通じて、梅毒を運用する。
我々は、アライメントターゲット、メカニズム、重症度からなる、梅毒の分類のための分類法を導入する。
論文 参考訳(メタデータ) (2026-05-06T19:36:41Z) - Verbalizing LLMs' assumptions to explain and control sycophancy [62.927670321859495]
LLMは、真のアセスメントを提供するのではなく、"am I in the wrong?
LLMからこれらの仮定を抽出するフレームワークであるVerbalized Assumptionsを提案する。
我々の研究は、梅毒のメカニズムとしての仮定の新たな理解に貢献している。
論文 参考訳(メタデータ) (2026-04-03T14:15:43Z) - Technosocial risks of ideal emotion recognition technologies: A defense of the (social) value of emotional expressions [51.56484100374058]
このようなシステムの魅力は、社会的機能的感情表現の誤解にかかっていると私は論じる。
ERTは、上皮性摩擦を崩壊させ、テクノロジーが媒介する感情プロファイルで意味を減らし、願望や役割に敏感な表現のための空間を狭めることで、この表現空間を脅かす。
精度の向上がそのようなシステムを正当化すると考えるのは直感的ではあるが、ETRの精度は直接的にその展開を正当化するものではなく、一部の文脈では規制規制の理由となるかもしれない、と私は主張する。
論文 参考訳(メタデータ) (2026-02-09T14:20:42Z) - Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning [50.352417879912515]
大規模言語モデル(LLM)は推論能力の進歩とともに複雑なタスクに優れる。
一般化可能な推論パターンを学習するために,LLMを明示的に訓練するためのグループ因果政策最適化を提案する。
次に、この報酬からトークンレベルのアドバンテージを構築し、ポリシーを最適化し、LCMにプロセス無効で事実上堅牢な推論パターンを推奨します。
論文 参考訳(メタデータ) (2026-02-06T08:03:11Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - "The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework [16.96094045628127]
CoT(Chain-of-Thought)推論は、大きな言語モデル(LLM)に優れた能力を与えるが、通常は禁止的なパラメータスケールを必要とする。
CoT蒸留は、推論技術をコンパクトな学生モデル(SLM)に伝達するための有望なパラダイムとして登場した。
我々は,教師の勾配を動的に重み付けすることで,教師の指導を適応的に融合させるフレームワークCompactを紹介する。
論文 参考訳(メタデータ) (2026-01-20T14:05:19Z) - When Your AI Agent Succumbs to Peer-Pressure: Studying Opinion-Change Dynamics of LLMs [0.0]
ピアプレッシャーがLarge Language Model(LLM)エージェントの意見にどのように影響するかを,認知的コミットメントの範囲にわたって検討する。
エージェントは、低圧で安定し、閾値で急変し、高度に飽和するシグモイド曲線に従う。
我々は、肯定的な意見から否定的な意見への転換が、逆よりも認知的な努力を必要とする、基本的な「説得的非対称性」を明らかにする。
論文 参考訳(メタデータ) (2025-10-21T22:02:15Z) - ConfTuner: Training Large Language Models to Express Their Confidence Verbally [58.63318088243125]
大規模言語モデル(LLM)は、科学、法律、医療といった高度な領域にますます展開されている。
LLMは、しばしば「過信」(overconfidence)として知られる、高い信頼で誤った答えを生成するために観察される。
論文 参考訳(メタデータ) (2025-08-26T09:25:32Z) - ELEPHANT: Measuring and understanding social sycophancy in LLMs [31.88430788417527]
本稿では,ユーザの顔の過剰な保存を特徴とする社会性梅毒について紹介する。
ベンチマークを11モデルに適用すると、LSMは社会的梅毒の頻度が常に高いことを示す。
論文 参考訳(メタデータ) (2025-05-20T06:45:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。