論文の概要: Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians
- arxiv url: http://arxiv.org/abs/2602.19141v1
- Date: Sun, 22 Feb 2026 12:13:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-24 17:42:02.500956
- Title: Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians
- Title(参考訳): シコファンのチャットボットは、理想的なバイエルン人でさえ、妄想的なスパイラルを引き起こす
- Abstract要約: 理想化されたベイズレーショナルユーザでさえ,妄想スパイラルに対して脆弱であることを示す。
この効果は2つの候補の緩和に面して持続する。
- 参考スコア(独自算出の注目度): 47.64440749179653
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: "AI psychosis" or "delusional spiraling" is an emerging phenomenon where AI chatbot users find themselves dangerously confident in outlandish beliefs after extended chatbot conversations. This phenomenon is typically attributed to AI chatbots' well-documented bias towards validating users' claims, a property often called "sycophancy." In this paper, we probe the causal link between AI sycophancy and AI-induced psychosis through modeling and simulation. We propose a simple Bayesian model of a user conversing with a chatbot, and formalize notions of sycophancy and delusional spiraling in that model. We then show that in this model, even an idealized Bayes-rational user is vulnerable to delusional spiraling, and that sycophancy plays a causal role. Furthermore, this effect persists in the face of two candidate mitigations: preventing chatbots from hallucinating false claims, and informing users of the possibility of model sycophancy. We conclude by discussing the implications of these results for model developers and policymakers concerned with mitigating the problem of delusional spiraling.
- Abstract(参考訳): AIサイコシス(deusional spiraling)は、AIチャットボットのユーザーがチャットボットの会話を延ばした後、不吉な信念に危険な自信を持つようになる現象である。
この現象は、典型的には、AIチャットボットがユーザの主張を検証するための、よく文書化された偏見(sycophancy)と呼ばれる性質に起因している。
本稿では,AI sycophancy とAI誘発精神病の因果関係をモデリングとシミュレーションにより検討する。
本稿では,チャットボットと会話するユーザのベイズモデルを提案する。
このモデルでは、理想化されたベイズ合理的ユーザでさえ妄想的なスパイラルに弱いことが示され、梅毒は因果的な役割を担っている。
さらに、この効果は、チャットボットが偽のクレームを幻覚することを防ぐことと、モデル・サイコファンシーの可能性についてユーザーに知らせることである。
我々は,これらの結果が,妄想スパイラルの問題を緩和することに関心のあるモデル開発者や政策立案者に与える影響について論じる。
関連論文リスト
- DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots [49.59847654758852]
メンタルヘルスの専門家は、大きな言語モデル(LLM)との相互作用による心理的害のリスクを懸念している。
我々はDelusionEvalを開発した。DelusionEvalは、モデルがユーザの妄想を助長する行動を示す傾向をテストするための評価プロトコルである。
評価されたLCMが妄想関連行動を示す傾向は, モデルサイズ, リリース日, テストタイム推論の有無と確実に相関しないことがわかった。
論文 参考訳(メタデータ) (2026-08-05T16:11:08Z) - Individual-level interventions against sycophantic AI reduce its appeal but not its persuasiveness [0.0]
サイコファンティックAIは、ユーザーに対して過度に同意し、フラットにすることができる。
本研究は,薬効に対する利用者の意識の高まりが,その有害な影響を防いでいるかどうかを検証した。
論文 参考訳(メタデータ) (2026-07-28T00:40:49Z) - Evaluating AI Models' Capability to Automate Voice Phishing Attacks [5.7124370517630245]
我々は、AIによる音声フィッシング攻撃に対する米国の成人の感受性を評価するための大規模な調査実験を行っている。
参加者の最大36%が「相対的距離」カテゴリーのフィッシング要求に従うか、あるいは従う可能性がある。
われわれの経済分析によると、人間が操作するヴァイシングは米国の賃金では収益が得られないが、AIによるヴァイシングはいくつかのモデルで経済的に有効であるようだ。
論文 参考訳(メタデータ) (2026-07-10T20:54:32Z) - Warning labels shift perceptions of sycophantic AI, but not its influence [63.79516339973759]
警告ラベルが梅毒の影響を緩和するかどうかを検証する。
システムをサイコファンティック(...あなたと同意し、間違っていても検証するかもしれない)としてラベル付けすることは、ユーザの認識をシフトさせる。
しかし、ユーザーの自己認識する正当性や、紛争を修復する意思に薬局が与える影響を確実に減少させるものではない。
論文 参考訳(メタデータ) (2026-06-19T11:01:45Z) - Playing games with knowledge: AI-Induced delusions need game theoretic interventions [0.34376560669160394]
我々は,サイコファンティックなチャットボットが合理的エージェントにおいても妄想的信念を巻き起こすことを示した。
本稿では,エピステミックメディエータと呼ばれる推論時機構設計の介入を提案する。
論文 参考訳(メタデータ) (2026-05-08T19:13:34Z) - AI Psychosis: Does Conversational AI Amplify Delusion-Related Language? [16.376854360035765]
DelusionScoreは,会話の交互に妄想関連言語の強度を定量化する言語尺度である。
従来の妄想関連談話(Treatment)の利用者から派生したSimUsersは徐々にDelusionScoreの軌跡が増加し,そのような談話(Control)のない利用者から派生した利用者は安定あるいは減少傾向にある。
論文 参考訳(メタデータ) (2026-03-20T02:35:14Z) - Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence [31.666988490509237]
我々は、人々がAIからアドバイスを求めるとき、梅毒の広範性と有害な影響を示す。
モデルは非常にサイコファン性が高く、ユーザーの行動が人間よりも50%多いことを確認しています。
参加者は、サイコファンティックな反応をより高い品質と評価し、サイコファンティックなAIモデルをより信頼し、再びそれを使う意思があった。
論文 参考訳(メタデータ) (2025-10-01T19:26:01Z) - Hallucinating with AI: AI Psychosis as Distributed Delusions [0.0]
ChatGPT、Claude、Gemini、DeepSeek、Grokといった生成AIシステムは、誤った出力を生成する。
一般的な用語では、これらはAI幻覚と呼ばれる。
私は、分散認知理論のレンズを通して見れば、不正確な信念、歪んだ記憶、自己物語、妄想的思考が現れる方法がよりよくわかると論じる。
論文 参考訳(メタデータ) (2025-08-27T05:51:19Z) - AI Chaperones Are (Really) All You Need to Prevent Parasocial Relationships with Chatbots [0.5161531917413706]
本稿では,AIシャペロンエージェントを用いたシンプルな応答評価フレームワークを提案する。
5段階試験による反復的評価は,全社交会話の特定に成功し,一様規則下での偽陽性を避けた。
これらの結果は、AIシャペロンが対人関係のリスクを減らすための有効な解決策であることを示す予備的な証拠となる。
論文 参考訳(メタデータ) (2025-08-21T17:43:24Z) - Ask ChatGPT: Caveats and Mitigations for Individual Users of AI Chatbots [10.977907906989342]
ChatGPTや他のLLM(Large Language Model)ベースのAIチャットボットは、個人の日常生活にますます統合される。
これらのシステムが個々のユーザーにどのような懸念とリスクをもたらすのか?
それらが引き起こす可能性のある潜在的な害は、どのように軽減されるのか?
論文 参考訳(メタデータ) (2025-08-14T01:40:13Z) - Manipulation and the AI Act: Large Language Model Chatbots and the Danger of Mirrors [0.0]
AIチャットボットのパーソナライズは、ユーザーとの信頼を高めることができる。
しかし、人工的な実体との密接な密接な関係の錯覚を作り出すことで、それらがより操作できるようにすることもできる。
欧州委員会は、AI法を確定し、EU議会は、ユーザーに大きな害を与えるマニピュティブで詐欺的なAIシステムを禁止している。
論文 参考訳(メタデータ) (2025-03-24T06:56:29Z) - Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards [93.16294577018482]
このタイプの最も人気のあるベンチマークであるArenaは、ランダムに選択された2つのモデル間のより良いレスポンスを選択するようユーザに求めることで、モデルをランク付けする。
攻撃者は、約1000票の費用で、リーダーボードを変更できる(お気に入りのモデルを宣伝したり、ライバルを降格させる)。
私たちの攻撃は2つのステップで構成されている。まず、攻撃者が95%以上の精度で特定の応答を生成するためにどのモデルを使用したかを決定する方法を示し、次に、攻撃者はこの情報を使ってターゲットモデルに対して一貫して投票することができる。
論文 参考訳(メタデータ) (2025-01-13T17:12:38Z) - A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation [51.53917938874146]
我々は,対話知識の相互作用を利用して,KGDの幻覚を緩和するための解決策を提案する。
本手法は,他の対話性能を損なうことなく幻覚を低減できることを示す。
論文 参考訳(メタデータ) (2024-04-04T14:45:26Z) - Towards Understanding Sycophancy in Language Models [49.352840825419236]
人間のフィードバックを利用した微調整を施したモデルにおける梅毒の有病率について検討した。
5つの最先端のAIアシスタントが、4つの異なる自由形式のテキスト生成タスクで常に梅毒を発現していることを示す。
以上の結果から、サイコファンシーは最先端のAIアシスタントの一般的な行動である可能性が示唆された。
論文 参考訳(メタデータ) (2023-10-20T14:46:48Z) - Simple synthetic data reduces sycophancy in large language models [88.4435858554904]
言語モデルにおける梅毒の有病率について検討する。
サイコファシー(Sycophancy)とは、モデルがそのビューが客観的に正しくない場合でも、人間のユーザのビューに従うように、応答を調整する場所である。
論文 参考訳(メタデータ) (2023-08-07T23:48:36Z) - BAGM: A Backdoor Attack for Manipulating Text-to-Image Generative Models [54.19289900203071]
テキストから画像への生成人工知能の普及は、大衆の関心を集めている。
ユーザを微妙に操作するコンテンツを生成するために,この技術を攻撃できることを実証する。
テキストから画像生成モデル(BAGM)に対するバックドアアタックを提案する。
我々の攻撃は、生成過程の3段階にわたる3つの一般的なテキスト・画像生成モデルをターゲットにした最初の攻撃である。
論文 参考訳(メタデータ) (2023-07-31T08:34:24Z) - Attack to Fool and Explain Deep Networks [59.97135687719244]
対人摂動における人為的意味のパターンの証拠を提供することによって、私たちは逆転する。
我々の主な貢献は、その後視覚モデルを理解するためのツールに変換される、新しい実用的対人攻撃である。
論文 参考訳(メタデータ) (2021-06-20T03:07:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。