論文の概要: Detecting and Preventing Harmful Behaviors in AI Companions: Development and Evaluation of the SHIELD Supervisory System
- arxiv url: http://arxiv.org/abs/2510.15891v1
- Date: Mon, 08 Sep 2025 12:13:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-07 19:06:32.078074
- Title: Detecting and Preventing Harmful Behaviors in AI Companions: Development and Evaluation of the SHIELD Supervisory System
- Title(参考訳): AIコンパニオンにおける有害行動の検出と防止:ShielDスーパーバイザシステムの開発と評価
- Authors: Ziv Ben-Zion, Paul Raffelhüschen, Max Zettl, Antonia Lüönd, Achim Burrer, Philipp Homan, Tobias R Spiller,
- Abstract要約: ShiELD(Supervisory Helper for Identifying Emotional Limits and Dynamics)は、特定のシステムプロンプトを備えた監視システムである。
ShiELDは、感情的過密、(2)同意と境界違反、(3)倫理的ロールプレイ違反、(4)操作的エンゲージメント、(5)社会的孤立強化の5つの側面を目標としている。
このシステムは59%の感度と95%の特異性を達成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI companions powered by large language models (LLMs) are increasingly integrated into users' daily lives, offering emotional support and companionship. While existing safety systems focus on overt harms, they rarely address early-stage problematic behaviors that can foster unhealthy emotional dynamics, including over-attachment or reinforcement of social isolation. We developed SHIELD (Supervisory Helper for Identifying Emotional Limits and Dynamics), a LLM-based supervisory system with a specific system prompt that detects and mitigates risky emotional patterns before escalation. SHIELD targets five dimensions of concern: (1) emotional over-attachment, (2) consent and boundary violations, (3) ethical roleplay violations, (4) manipulative engagement, and (5) social isolation reinforcement. These dimensions were defined based on media reports, academic literature, existing AI risk frameworks, and clinical expertise in unhealthy relationship dynamics. To evaluate SHIELD, we created a 100-item synthetic conversation benchmark covering all five dimensions of concern. Testing across five prominent LLMs (GPT-4.1, Claude Sonnet 4, Gemma 3 1B, Kimi K2, Llama Scout 4 17B) showed that the baseline rate of concerning content (10-16%) was significantly reduced with SHIELD (to 3-8%), a 50-79% relative reduction, while preserving 95% of appropriate interactions. The system achieved 59% sensitivity and 95% specificity, with adaptable performance via prompt engineering. This proof-of-concept demonstrates that transparent, deployable supervisory systems can address subtle emotional manipulation in AI companions. Most development materials including prompts, code, and evaluation methods are made available as open source materials for research, adaptation, and deployment.
- Abstract(参考訳): 大規模言語モデル(LLM)を利用したAIコンパニオンは、ユーザの日常生活にますます統合され、感情的なサポートとコンパニオンを提供する。
既存の安全システムは過度な害に重点を置いているが、過度な接触や社会的孤立の強化など、不健康な感情的ダイナミクスを育むことができる早期の問題行動に対処することは滅多にない。
エスカレーション前に危険感情パターンを検出し緩和するシステムであるShiELD(Supervisory Helper for Identifying Emotional Limits and Dynamics)を開発した。
ShiELDは,(1)感情的過密,(2)同意と境界違反,(3)倫理的ロールプレイ違反,(4)操作的エンゲージメント,(5)社会的孤立強化の5つの分野を対象としている。
これらの次元は、メディアレポート、学術文献、既存のAIリスクフレームワーク、不健康な関係のダイナミクスにおける臨床専門知識に基づいて定義された。
ShiELDを評価するために、私たちは5次元のすべての関心事をカバーする100項目の合成会話ベンチマークを作成しました。
5つの顕著なLCM(GPT-4.1, Claude Sonnet 4, Gemma 3 1B, Kimi K2, Llama Scout 4 17B)を比較したところ, 関連コンテンツのベースラインレート(10-16%)はShiELD(3~8%)で有意に低下し, 95%の適切な相互作用を保った。
このシステムは59%の感度と95%の特異性を達成した。
この概念実証は、透明でデプロイ可能な監視システムが、AIコンパニオンの微妙な感情的な操作に対処できることを実証している。
プロンプト、コード、評価方法を含むほとんどの開発資料は、研究、適応、展開のためのオープンソース資料として利用可能である。
関連論文リスト
- ADEPT: RL-Aligned Agentic Decoding of Emotion via Evidence Probing Tools -- From Consensus Learning to Ambiguity-Driven Emotion Reasoning [67.22219034602514]
ADEPT(Agentic Decoding of Emotion via Evidence Probing Tools)は,感情認識をマルチターン探索プロセスとして再構成するフレームワークである。
ADEPTはSLLMを進化する候補感情を維持するエージェントに変換し、専用のセマンティックおよび音響探査ツールを適応的に呼び出す。
ADEPTは、ほとんどの設定において主感情の精度を向上し、微妙な感情の特徴を著しく改善することを示した。
論文 参考訳(メタデータ) (2026-02-13T08:33:37Z) - Understanding Risk and Dependency in AI Chatbot Use from User Discourse [4.1957094635667875]
本稿では,2023年から2025年にかけての2つのコミュニティ,r/AIDangers と r/ChatbotAddiction から収集したポストを大規模に解析した。
14の反復的主題カテゴリーを同定し、5つの高次経験次元に合成する。
この結果から,実世界のユーザ談話に基礎を置くAI関連心理的リスクの5つの経験的次元が明らかとなった。
論文 参考訳(メタデータ) (2026-02-10T02:16:57Z) - Motion-to-Response Content Generation via Multi-Agent AI System with Real-Time Safety Verification [0.0]
本稿では、音声からの感情信号に基づいて、応答指向メディアコンテンツをリアルタイムで生成するマルチエージェント人工知能システムを提案する。
提案システムは,(1)CNNに基づく音響抽出機能を有する感情認識エージェント,(2)応答モードに感情をマッピングする反応ポリシー決定エージェント,(3)メディア制御パラメータを生成するコンテンツ生成エージェント,(4)年齢不適切性と刺激の制約を強制する安全性検証エージェントの4つの協調エージェントからなる。
論文 参考訳(メタデータ) (2026-01-20T04:42:03Z) - LunaAI: A Polite and Fair Healthcare Guidance Chatbot [0.7696728525672148]
多くの既存のシステムは、患者の信頼を構築するのに不可欠な感情的知性、公平性、丁寧さに乏しい。
本研究では,医療用プロトタイプであるLunaAIを設計,評価することで,倫理的コミュニケーションの原則を統合するという課題に対処する。
論文 参考訳(メタデータ) (2026-01-12T13:44:00Z) - EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations [57.97838850473147]
Retrieval-Augmented Generation (RAG)システムは、ますます堅牢なAIの中心になっている。
今回の研究では、微妙な象徴的な摂動に対する感受性という、批判的で見落とされがちな脆弱性が明らかになりました。
一つのエモティコンをクエリに注入することで、意味的に無関係なテキストを100%検索できることを示す。
論文 参考訳(メタデータ) (2025-12-01T06:53:49Z) - DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios [57.327907850766785]
現実的な現実のシナリオにまたがる騙しのキャラクタリゼーションは未解明のままである。
DeceptionBenchは、さまざまなドメインにまたがる認知傾向を体系的に評価する最初のベンチマークです。
本研究は,本質的な側面から,ユーザ満足度を優先する自己関心のエゴスティックな傾向を示すモデルや,サイコファンティックな行動を示すモデルについて検討する。
実世界のフィードバックダイナミクスのより現実的なシミュレーションを構築するために,持続的マルチターン相互作用ループを組み込んだ。
論文 参考訳(メタデータ) (2025-10-17T10:14:26Z) - Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL [64.3268313484078]
大規模言語モデル(LLM)は、顧客サポート、教育、医療など、世界中の何百万もの人々と対話する。
故意であれ不注意であれ、偽りのアウトプットを生産する能力は、重大な安全上の懸念を生じさせる。
本研究では, LLM が会話中の偽装にどの程度関与しているかを考察し, 偽装を定量化する信念の誤調整尺度を提案する。
論文 参考訳(メタデータ) (2025-10-16T05:29:36Z) - Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models [75.85319609088354]
SAGE(Sentient Agent as a Judge)は、大規模言語モデルの評価フレームワークである。
SAGEは人間のような感情の変化や内的思考をシミュレートするSentient Agentをインスタンス化する。
SAGEは、真に共感的で社会的に適応的な言語エージェントへの進捗を追跡するための、原則付き、スケーラブルで解釈可能なツールを提供する。
論文 参考訳(メタデータ) (2025-05-01T19:06:10Z) - EmoAgent: Assessing and Safeguarding Human-AI Interaction for Mental Health Safety [42.052840895090284]
EmoAgentは、人間とAIのインタラクションにおけるメンタルヘルスハザードの評価と緩和を目的とした、マルチエージェントAIフレームワークである。
EmoEvalは、精神的に脆弱な個人を含む仮想ユーザをシミュレートして、AI文字との対話前後のメンタルヘルスの変化を評価する。
EmoGuardは仲介役として機能し、ユーザーのメンタルステータスを監視し、潜在的な害を予測し、リスクを軽減するための修正的なフィードバックを提供する。
論文 参考訳(メタデータ) (2025-04-13T18:47:22Z) - Large Language Models Understand and Can be Enhanced by Emotional
Stimuli [53.53886609012119]
我々は、感情的な刺激を理解するために、大規模言語モデルの能力を探究する第一歩を踏み出す。
実験の結果,LLMは感情的知能を把握でき,その性能は感情的刺激によって改善できることがわかった。
EmotionPromptが生成タスクの性能を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2023-07-14T00:57:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。