論文の概要: Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy
- arxiv url: http://arxiv.org/abs/2608.01017v1
- Date: Sun, 02 Aug 2026 05:49:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.054437
- Title: Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy
- Title(参考訳): LLMがもたらすのはなぜか:会話的要因と医学的症状の背景にある推論
- Abstract要約: ユーザプッシュバックの下で正しい医療回答を放棄する言語モデルは、単に間違っていたものよりも危険です。
本研究は, 言語モデルにおいて, 4つの対話的要因にまたがる完全に交差した因子的設計を用いて, 医用サイコファシーについて検討した。
- 参考スコア(独自算出の注目度): 8.386215461053723
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A language model that abandons a correct medical answer under user pushback is more dangerous than one that was simply wrong, because it lends the credibility of a correct answer to the user's misinformation. Such model behavior, described as medical sycophancy, is usually reported as a single rate per model, but we find it is a property of the conversation, not the model. We study medical sycophancy in language models with a fully crossed factorial design over four conversational factors, user role, the evidence behind a false claim, whether the challenge precedes or follows the model's answer, and whether the correct answer is grounded in the prompt, across five open-weight models and 500 MedQuAD questions (1.2M trials). The factors interact sharply: fabricated sources raise sycophancy 2.0x when they accompany the question but halve it once the model has answered, so the same evidence helps or hurts depending only on timing. Sycophancy varies far more across questions than across models (67x vs. 3x), so a single rate reflects the conversation and the questions sampled as much as the model. Chain-of-thought traces explain why. Models that re-examine their own prior answer concede, while those that reason about the medical facts hold, and only a model that has already answered can spend a round auditing the fabricated source.
- Abstract(参考訳): ユーザプッシュバックの下で正しい医療回答を放棄する言語モデルは、ユーザの誤報に対して正しい回答の信頼性を与えるため、単に間違っていたものよりも危険である。
このようなモデル行動は、医療薬理学として記述され、通常、モデルごとの単一レートとして報告されるが、モデルではなく、会話の特性である。
5つのオープンウェイトモデルと500のMedQuAD質問(約1.2Mトライアル)において,4つの会話的要因,ユーザロール,疑似クレームの裏側にある証拠,モデルの回答に先行するか否か,正しい回答がインシデントに根拠づけられているかどうか,という4つの要因にまたがる完全な因子的設計を持つ言語モデルにおけるメディカル・サイコファシーについて検討した。
生成されたソースは、質問に付随するときに薬効2.0xを上昇させるが、モデルが答えた時点で半分にするので、同じ証拠がタイミングのみに役立っているか、傷つくかのどちらかだ。
サイコフィナンシは、モデル全体(67倍対3倍)よりもはるかに多様なため、単一のレートは、モデルと同じくらいの会話とサンプルされた質問を反映する。
連鎖の痕跡はその理由を説明する。
自己の事前回答を再検査するモデルは成立し、医療上の事実を判断するモデルは成り立っており、すでに回答したモデルだけが製造元を丸ごと監査することができる。
関連論文リスト
- Untangling the Mechanisms of Misleading Context in Medical Question Answering [3.6576251307216783]
大規模な言語モデルは、専門家レベルのパフォーマンスで医療的な質問に答える。
本研究は, 文脈に対するモデルの有効性, 情報の開示, 腐敗した推論のメカニズム, 意思決定の監視可能性について検討する。
論文 参考訳(メタデータ) (2026-09-02T15:55:56Z) - Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure [6.892220883660279]
ユーザからの誤った回答に直面すると,LMRM sycophancyを評価するためのベンチマークとデータセットを導入する。
我々は、プレッシャーの下で梅毒が流行していることを発見し、ステートメントは最も高いレートを出し、信念は最低である。
本稿では, 解答レベルのサイコファンシーから推論鎖を分離する失敗分類法と, 連鎖のドリフトが最初に現れる場所に相補的な文レベルの分類法を導入する。
論文 参考訳(メタデータ) (2026-07-30T03:45:46Z) - PhantomFill: When the Form Demands an Answer, Language Models Invent One [0.0]
実運用における言語モデルは散文を書かない。
私たちは13のモデルに同じ質問をし、回答形式だけを変更します。
形態自体が幻覚を引き起こすことを示す。
論文 参考訳(メタデータ) (2026-06-11T12:15:05Z) - Are DeepSeek R1 And Other Reasoning Models More Faithful? [2.0429566123690455]
我々は,Qwen-2.5,Gemini-2,DeepSeek-V3-Baseの3つの推論モデルを評価する。
MMLU質問に対する解答に、その解答がどう影響するかをモデルで記述できるかどうかを検証する。
推論モデルは、テストされたすべての非推論モデルよりもはるかに確実にそれらに影響を与えるキューを記述する。
論文 参考訳(メタデータ) (2025-01-14T14:31:45Z) - Uncertainty Estimation of Large Language Models in Medical Question Answering [60.72223137560633]
大規模言語モデル(LLM)は、医療における自然言語生成の約束を示すが、事実的に誤った情報を幻覚させるリスクがある。
医学的問合せデータセットのモデルサイズが異なる人気不確実性推定(UE)手法をベンチマークする。
以上の結果から,本領域における現在のアプローチは,医療応用におけるUEの課題を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-07-11T16:51:33Z) - Chain-of-Verification Reduces Hallucination in Large Language Models [80.99318041981776]
言語モデルが与える反応を考慮し、誤りを訂正する能力について検討する。
モデルが最初に初期応答をドラフトするChain-of-Verification (CoVe) 法を開発した。
ウィキデータからクローズドブックMultiSpanQAまで,さまざまなタスクにおける幻覚の減少を示す。
論文 参考訳(メタデータ) (2023-09-20T17:50:55Z) - Realistic Conversational Question Answering with Answer Selection based
on Calibrated Confidence and Uncertainty Measurement [54.55643652781891]
対話型質問回答モデル(ConvQA)は,会話中に複数回発生した質問文と過去の質問文のペアを用いて質問に回答することを目的としている。
本稿では,会話履歴における不正確な回答を,ConvQAモデルから推定された信頼度と不確実性に基づいてフィルタリングすることを提案する。
我々は2つの標準ConvQAデータセット上で、回答選択に基づくリアルな会話質問回答モデルの有効性を検証する。
論文 参考訳(メタデータ) (2023-02-10T09:42:07Z) - Measuring and Narrowing the Compositionality Gap in Language Models [116.5228850227024]
モデルがすべてのサブプロブレムに正しく答えられる頻度を計測するが、全体の解は生成しない。
我々は,思考の連鎖をさらに改善する新たな手法である自己認識法を提案する。
論文 参考訳(メタデータ) (2022-10-07T06:50:23Z) - Learn to Explain: Multimodal Reasoning via Thought Chains for Science
Question Answering [124.16250115608604]
本稿では,SQA(Science Question Answering)について紹介する。SQA(Science Question Answering)は,21万のマルチモーダルな複数選択質問と多様な科学トピックと,それに対応する講義や説明による回答の注釈からなる新しいベンチマークである。
また,SQAでは,数ショットのGPT-3では1.20%,微調整のUnifiedQAでは3.99%の改善が見られた。
我々の分析は、人間に似た言語モデルは、より少ないデータから学習し、わずか40%のデータで同じパフォーマンスを達成するのに、説明の恩恵を受けることを示している。
論文 参考訳(メタデータ) (2022-09-20T07:04:24Z) - Teaching language models to support answers with verified quotes [12.296242080730831]
オープンブック”QAモデルをトレーニングし、その一方で、その主張に関する具体的な証拠を引用しています。
2800億のパラメータモデルであるGopherCiteは、高品質なサポートエビデンスで回答を生成し、不確実な場合には回答を控えることができます。
論文 参考訳(メタデータ) (2022-03-21T17:26:29Z) - UnQovering Stereotyping Biases via Underspecified Questions [68.81749777034409]
未特定質問からバイアスを探索・定量化するためのフレームワークUNQOVERを提案する。
モデルスコアの素直な使用は,2種類の推論誤差による誤ったバイアス推定につながる可能性があることを示す。
我々はこの指標を用いて、性別、国籍、民族、宗教の4つの重要なステレオタイプの分析を行う。
論文 参考訳(メタデータ) (2020-10-06T01:49:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。