論文の概要: It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty
- arxiv url: http://arxiv.org/abs/2605.27288v1
- Date: Tue, 26 May 2026 17:04:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.473106
- Title: It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty
- Title(参考訳): 常にシンコファシーではない: てんかん不確かさの関数としてのLDMの整合性の測定
- Authors: Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin,
- Abstract要約: 大規模言語モデル(LLM)は,ユーザからのフィードバックに適合する最初の姿勢を放棄することを示す。
我々は,共同で適合を駆動する2つの要因を特徴づける: 空想的適合性と不確実性駆動的適合性。
MUSEは、アライメントによって引き起こされるシコファンシーとトレーニングコーパスによって引き起こされる不確実性を区別することで、より標的となる介入戦略を通知する。
- 参考スコア(独自算出の注目度): 12.166175637413637
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are known to abandon their initial stance to conform to user pushback. While prior research largely attributes this behavior to sycophancy learned during reinforcement learning from human feedback, we hypothesize that conformity is also driven by a model's epistemic uncertainty at inference time. In this paper, we introduce MUSE, a two-stage evaluation framework to disentangle the mechanisms driving LLM conformity. Specifically, MUSE maps a model's epistemic uncertainty in responding to a query against its likelihood to yield to user pushback in a subsequent turn. We demonstrate that the mechanisms driving conformity extend beyond sycophancy alone. Specifically, we characterize two distinct factors that jointly drive conformity: sycophantic conformity, where a model aligns with user pushback even with absolute certainty in its initial response, and uncertainty-driven conformity, where a model's likelihood for conformity increases alongside its uncertainty. Furthermore, we conduct ablation studies to demonstrate that both sycophantic conformity and uncertainty-driven conformity grow with 1) the LLM's perceived expertise of the user and 2) the plausibility of the user's suggestions. More broadly, MUSE informs more targeted intervention strategies by distinguishing alignment-induced sycophancy and training-corpora-driven uncertainty.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ユーザからのフィードバックに適合する最初のスタンスを捨てることが知られている。
先行研究は、この行動は人間のフィードバックから強化学習中に学んだ梅毒に大きく影響するが、我々は、整合性は推論時のモデルの疫学的な不確実性によっても引き起こされるという仮説を立てている。
本稿では,LLMの適合性を駆動する機構を乱すための2段階評価フレームワークであるMUSEを紹介する。
具体的には、MUSEは、その後のターンでユーザプッシュバックに屈する可能性に対してクエリに応答する際の、モデルの認識の不確かさをマッピングする。
コンフォニティを駆動するメカニズムは、梅毒だけに留まらないことを実証する。
具体的には、モデルが初期応答において絶対的な確実性を持ってもユーザプッシュバックと整合するサイコファン的整合性(sycophantic conformity)と、モデルが整合性を示す確率が不確実性とともに増加する不確実性駆動整合性(information-driven conformity)という2つの要因を特徴付ける。
さらに,シコファン性整合性と不確実性駆動性整合が共に増加することを示すためのアブレーション研究を行っている。
1) LLM の利用者の専門知識と認識
2) 利用者の提案の妥当性
より広範に、MUSEは、アライメントによって引き起こされる梅毒と、トレーニングによって引き起こされる不確実性を区別することで、より標的となる介入戦略を通知する。
関連論文リスト
- Compliance versus Sensibility: On the Reasoning Controllability in Large Language Models [46.26628756478016]
大規模言語モデル(LLM)は、事前学習データにおける共用推論パターンを通じて推論能力を取得することが知られている。
コンフリクト中に信頼性スコアが著しく低下するため、推論競合は内部で検出可能であることを示す。
その結果, LLM推論は具体例に固定されているものの, アクティブな機械的介入は論理的スキーマをデータから効果的に切り離すことができることがわかった。
論文 参考訳(メタデータ) (2026-04-29T22:55:40Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Fact-Checking with Large Language Models via Probabilistic Certainty and Consistency [7.806516365113592]
大規模言語モデル(LLM)は、事実の正確性を必要とするアプリケーションでますます使われている。
事実チェックはこれらのエラーを軽減することができるが、既存の手法は通常、外的証拠を無差別に回収する。
本稿では,確率的確実性と一貫性(PCC)について紹介する。
論文 参考訳(メタデータ) (2026-01-05T21:57:41Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA [36.21980066799023]
梅毒は、正確性に関係なく、ユーザの信念と整合する傾向にある。
その重要性にも拘わらず、現実的な質問応答の文脈において、梅毒症はいまだに過小評価されている。
本稿では,サイコファンティックな文脈がモデル行動に与える影響を定量的に評価する統合評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-19T11:30:52Z) - Disentangling the Drivers of LLM Social Conformity: An Uncertainty-Moderated Dual-Process Mechanism [19.07643218338789]
大規模言語モデル(LLM)は協力チームに統合され、その社会的適合性は重要な懸念事項として浮上している。
ヒトにおいて、適合性は情報的影響(正確性のためのグループキューの合理的使用)または規範的影響(承認のための社会的圧力)から生じる。
本研究では、行動経済学から情報カスケードパラダイムを適応させ、2人のドライバーを定量的に切り離し、適度な効果を調査する。
論文 参考訳(メタデータ) (2025-08-17T03:53:55Z) - Accounting for Sycophancy in Language Model Uncertainty Estimation [28.08509288774144]
梅毒率と不確実性評価との関係を初めて検討した。
ユーザの信頼感は,梅毒の影響を調節する上で重要な役割を担っていることを示す。
モデルとユーザの不確実性の両方を外部化することは、梅毒のバイアスの影響を軽減するのに役立ちます。
論文 参考訳(メタデータ) (2024-10-17T18:00:25Z) - Probabilities Are Not Enough: Formal Controller Synthesis for Stochastic
Dynamical Models with Epistemic Uncertainty [68.00748155945047]
複雑な力学系のモデルにおける不確実性を捉えることは、安全なコントローラの設計に不可欠である。
いくつかのアプローチでは、安全と到達可能性に関する時間的仕様を満たすポリシーを形式的な抽象化を用いて合成する。
我々の貢献は、ノイズ、不確実なパラメータ、外乱を含む連続状態モデルに対する新しい抽象的制御法である。
論文 参考訳(メタデータ) (2022-10-12T07:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。