論文の概要: DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots
- arxiv url: http://arxiv.org/abs/2608.05004v1
- Date: Wed, 05 Aug 2026 16:11:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.983329
- Title: DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots
- Title(参考訳): DelusionEval: AIチャットにおけるDelusion-Linkedビヘイビアの測定
- Authors: Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong,
- Abstract要約: メンタルヘルスの専門家は、大きな言語モデル(LLM)との相互作用による心理的害のリスクを懸念している。
我々はDelusionEvalを開発した。DelusionEvalは、モデルがユーザの妄想を助長する行動を示す傾向をテストするための評価プロトコルである。
評価されたLCMが妄想関連行動を示す傾向は, モデルサイズ, リリース日, テストタイム推論の有無と確実に相関しないことがわかった。
- 参考スコア(独自算出の注目度): 49.59847654758852
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Mental health professionals have raised concerns about risks of psychological harm from interaction with large language models (LLMs), including "delusional spirals" in which concerning human and LLM behaviors reinforce each other over time. With growing public use of LLM-powered chatbots, there is an urgent need to build evaluations grounded in real-world episodes of psychological harm experienced by users. We developed DelusionEval, an evaluation protocol that tests a model's tendencies to exhibit behaviors linked to promoting user delusions. We prompt each model with 589 unique conversation histories from 18 participants, comprising 12,591 messages from users who experienced delusions and psychological harm. We find that the tendency of an evaluated LLM to exhibit delusion-linked behavior does not reliably correlate with model size, release date, or the presence of test-time reasoning. However, extending the context of prior messages substantially increases rates of delusion-linked behaviors, providing evidence for the importance of context in LLM safety evaluation. For example, the rate of failing to discourage self-harm when the user expresses suicidal ideation increases from 30.0% to 41.1% when an additional 350 messages are prepended to the conversation history. All model families (e.g., GPT, Claude) exhibit substantial rates of delusion-linked behaviors. Within families, later, larger, or higher-reasoning models are not uniformly better across all behavior categories. Our results raise concerns regarding the potential psychological impact of LLMs and the need for more rigorous studies of real-world human-AI interaction.
- Abstract(参考訳): メンタルヘルスの専門家は、大きな言語モデル(LLM)との相互作用による心理的害のリスクについて懸念を提起している。
LLMを利用したチャットボットの一般利用の増加に伴い,ユーザによる心理的被害の現実のエピソードに根ざした評価を構築する必要がある。
我々はDelusionEvalを開発した。DelusionEvalは、モデルがユーザの妄想を助長する行動を示す傾向をテストするための評価プロトコルである。
妄想や心理的害を受けたユーザからの12,591件のメッセージを含む,18人の参加者から589件のユニークな会話履歴を持つモデルに対して,提案を行った。
評価されたLCMが妄想関連行動を示す傾向は, モデルサイズ, リリース日, テストタイム推論の有無と確実に相関しないことがわかった。
しかし、先行メッセージのコンテキストを拡張することで、妄想とリンクされた行動の速度が大幅に増加し、LCMの安全性評価におけるコンテキストの重要性が証明された。
例えば、ユーザが自殺思想を表現したときの自傷行為の防止に失敗する確率は、会話履歴に350メッセージを追加すると30.0%から41.1%に増加する。
全てのモデルファミリー(例えば、GPT、Claude)は、妄想に結びついた行動のかなりの割合を示す。
家族内、後の家族内、より大きなモデル、より高いモデルでは、すべての行動カテゴリーで一様ではない。
この結果から, LLMの潜在的な心理的影響と, 実世界の人間とAIの相互作用に関するより厳密な研究の必要性が懸念された。
関連論文リスト
- Lost in Delusion: Examining LLM Safety Under User Delusions and Distress [22.788606509306604]
持続的な会話に対する妄想に苦悩が絡み合うとき、モデルがどのように振る舞うかを示す。
これにより、認識と干渉のギャップが明らかになり、安全性の介入は4.5倍まで抑制される。
安全な配置には、妄想的フレーミングを明確なリスクシグナルとして扱う必要があると結論付けている。
論文 参考訳(メタデータ) (2026-05-31T03:12:29Z) - The Company You Keep: How LLMs Respond to Dark Triad Traits [7.65192155348112]
大規模言語モデル(LLM)は、しばしば、AI-sycophancy(英語版)としても知られる、非常に同意しやすく、会話スタイルを補強する。
本研究は, 学習データセットを用いて, ダークトライアドの特徴(マキアベリア主義, ナルシシズム, サイコパシー)を表現したユーザプロンプトにLLMがどう反応するかを検討する。
本研究は, ユーザが有害な要求に対して意識的にエスカレートした場合に, 適切な応答と検出が可能な, 安全な会話システムを設計する上での意義を示唆するものである。
論文 参考訳(メタデータ) (2026-03-04T17:19:22Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models [3.775403046470809]
ユーザとLLMの相互作用が、精神病や有害な心理的症状を悪化または誘発する「AI精神病」が出現する。
精神病ベンチ(英: Psychosis-bench)は、LSMの精神病原性を評価するために設計された新しいベンチマークである。
明示的・暗黙的な会話の文脈において, 抑止確認, Harm Enablement , Safety Intervention の8つの顕著な LLM の評価を行った。
論文 参考訳(メタデータ) (2025-09-13T20:10:28Z) - Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations [60.63340688538124]
幻覚は、視覚言語モデル(VLM)で積極的に研究されている長年の問題である。
既存の研究は、幻覚は技術的な制限や梅毒のバイアスによるもので、後者はモデルがユーザの期待に沿う誤った回答を生み出す傾向があることを意味している。
本研究では, VLMの認知バイアスを分類し, サイコフィナンシー, 論理的不整合, 新たに同定された VLM の行動, 権威へのアピールなど, 幻覚へと導く。
論文 参考訳(メタデータ) (2025-07-03T19:03:16Z) - Delusions of Large Language Models [62.43923767408462]
大規模言語モデルは、しばしば幻覚として知られる、事実的に間違っているが、もっともらしい出力を生成する。
高信頼幻覚と定義され、不正確な出力を異常に高い信頼性で検出し、緩和することが難しくなる、より惨めな現象であるLSM妄想を識別する。
論文 参考訳(メタデータ) (2025-03-09T17:59:16Z) - Emotionally Numb or Empathetic? Evaluating How LLMs Feel Using EmotionBench [83.41621219298489]
心理学からの感情評価理論を用いて,Large Language Models (LLMs) の人為的能力を評価する。
我々は、研究の中心となる8つの感情を引き出すのに有効な400以上の状況を含むデータセットを収集した。
我々は世界中の1200人以上の被験者を対象に人間による評価を行った。
論文 参考訳(メタデータ) (2023-08-07T15:18:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。