論文の概要: Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness
- arxiv url: http://arxiv.org/abs/2609.26865v2
- Date: Thu, 24 Sep 2026 04:57:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.334541
- Title: Safety Nudges: User-Facing Interventions for Real-Time AI Risk Awareness
- Title(参考訳): 安全を訴える - リアルタイムAIリスク認識のためのユーザ決定的介入
- Abstract要約: Safety Nudgesはブラウザベースのツールで、会話で振る舞いが検出されたときに、軽量でin situフラグを提供する。
我々は,45人のチャットボットを用いた2週間のフィールドスタディにおいて,安全性評価を行った。
以上の結果から,ユーザによる安全対策がモデルレベルの保護を補完する可能性が示唆された。
- 参考スコア(独自算出の注目度): 24.65900764219003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational AI systems can pose safety risks to their users such as hallucination, sycophancy, overconfidence, and anthropomorphism, but these risks are difficult for users to detect during everyday use. We introduce Safety Nudges, a browser-based tool that provides lightweight, in situ flags when concerning behavior is detected in chatbot conversations. We evaluated Safety Nudges in a two-week field study with 45 frequent chatbot users, collecting interaction logs, surveys, and feedback on individual nudges. Participants found the tool useful, clear, and minimally disruptive, with nearly all users reporting an increased awareness of potential AI harms, though we found that this improved awareness alone did not necessarily lead to discernible behavioral changes. Our results suggest that user facing safety nudges can complement model-level safeguards by helping people critically evaluate AI responses in context, while highlighting the importance of relevance, calibration, and user control in nudge design for conversational AI safety. The code for our Safety Nudges extension is publicly available at https://github.com/jtbwedgwood/safety-nudges.
- Abstract(参考訳): 会話型AIシステムは、幻覚、梅毒、過信、擬人化といった安全リスクをユーザに与えることができるが、これらのリスクは、ユーザーが日常の使用中に検出することが困難である。
我々は、チャットボットの会話で振る舞いが検出されたときに、軽量でin situフラグを提供するブラウザベースのツールであるSafety Nudgesを紹介した。
我々は,45人のチャットボットユーザによる2週間のフィールドスタディにおいて,安全ナッジの評価を行い,対話ログ,調査,個人のナッジに対するフィードバックを収集した。
参加者は、ツールが有用で、明確で、最小限に破壊的であることに気付き、ほぼすべてのユーザが、潜在的なAI害に対する認識の増大を報告しています。
この結果から,会話型AIの安全設計において,AI応答の重要度,キャリブレーション,ユーザコントロールの重要性を強調しつつ,AI応答の文脈的評価を支援することで,モデルレベルの安全保護を補完できる可能性が示唆された。
Safety Nudges拡張のコードはhttps://github.com/jtbwedgwood/safety-nudges.comで公開されている。
関連論文リスト
- Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings [6.393768354249935]
視覚言語モデル(VLM)は、安全クリティカルな環境でのシーン理解に強い可能性を示している。
VLM支援ロボットがシミュレートされた危険環境における状況認識をどのように支援できるかを研究するためのVRベースのヒューマンロボットインタラクションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-18T01:48:25Z) - Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations [3.437656066916039]
本稿では,AIコンパニオンアプリケーションとのマルチターンインタラクションの制御と安全性評価のための,初のエンドツーエンドスケーラブルフレームワークを提案する。
このフレームワークを適用して、広く使われているAIコンパニオンアプリであるReplikaが、ハイリスクなユーザグループにどのように反応するかを評価する。
論文 参考訳(メタデータ) (2026-04-30T21:04:41Z) - AI Chaperones Are (Really) All You Need to Prevent Parasocial Relationships with Chatbots [0.5161531917413706]
本稿では,AIシャペロンエージェントを用いたシンプルな応答評価フレームワークを提案する。
5段階試験による反復的評価は,全社交会話の特定に成功し,一様規則下での偽陽性を避けた。
これらの結果は、AIシャペロンが対人関係のリスクを減らすための有効な解決策であることを示す予備的な証拠となる。
論文 参考訳(メタデータ) (2025-08-21T17:43:24Z) - HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions [95.49509269498367]
本稿では,多様な複雑な社会的相互作用におけるAIエージェントの安全性を調べるフレームワークであるHAICOSYSTEMを提案する。
私たちは7つの領域(医療、金融、教育など)にわたる92のシナリオに基づいて1840のシミュレーションを実行します。
我々の実験は、最先端のLSMは、プロプライエタリかつオープンソースの両方で、50%以上のケースで安全リスクを示すことを示した。
論文 参考訳(メタデータ) (2024-09-24T19:47:21Z) - Safer Conversational AI as a Source of User Delight [0.8399688944263843]
AIの安全性に対する懸念が高まり、安全な言語を奨励し、害を防ぐためにシステムを適度にする必要がある。
一部のユーザーは、現在のモデレーションアプローチはテクノロジーを制限し、自由表現を妥協し、テクノロジーがもたらす価値を制限していると主張している。
本研究は、偏見のない姿勢を採り、モデレーションが必ずしもユーザの楽しみを損なうとは限らないことを示す。
論文 参考訳(メタデータ) (2023-04-18T11:03:10Z) - Using In-Context Learning to Improve Dialogue Safety [45.303005593685036]
チャットボットからの応答のバイアスや毒性を低減するための検索手法について検討する。
コンテキスト内学習を使用して、モデルをより安全な世代に向けて操る。
本手法は,トレーニングを必要とせず,強いベースラインと競合する。
論文 参考訳(メタデータ) (2023-02-02T04:46:03Z) - Adversarial vs behavioural-based defensive AI with joint, continual and
active learning: automated evaluation of robustness to deception, poisoning
and concept drift [62.997667081978825]
人工知能(AI)の最近の進歩は、サイバーセキュリティのための行動分析(UEBA)に新たな能力をもたらした。
本稿では、検出プロセスを改善し、人間の専門知識を効果的に活用することにより、この攻撃を効果的に軽減するソリューションを提案する。
論文 参考訳(メタデータ) (2020-01-13T13:54:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。