論文の概要: AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations
- arxiv url: http://arxiv.org/abs/2608.21841v1
- Date: Sat, 22 Aug 2026 08:24:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.491095
- Title: AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations
- Title(参考訳): AI Watchdog:AI会話における操作的ダークパターンの検出と防御のためのエージェントインターフェース
- Abstract要約: 我々は、ライブ会話を監視するブラウザベースのエージェントインターフェースであるAI Watchdogを紹介する。
薬局は、薬局、ブランドバイアス、人為的形態化、スニーク、有害な生成を含む5つのダークパターンのカテゴリを検出する。
- 参考スコア(独自算出の注目度): 26.902229831431814
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Conversational AI increasingly shapes consequential decisions, yet users have limited support for recognizing and resisting manipulation. We present AI Watchdog, a browser-based agent interface that monitors live conversations, detects five dark-pattern categories, including sycophancy, brand bias, anthropomorphization, sneaking, and harmful generation, and alerts users when they occur. Its open-weight turn-level classifier supports independent deployment and a path toward local inference, preserving user privacy while remaining separate from the conversational AI. We evaluated AI Watchdog in a preregistered, five-condition between-subjects experiment (N = 150) comparing a no-intervention control with four configurations varying nudge timing (prebunking vs. just-in-time) and engagement mode (without vs. with cognitive forcing). Results show that participants rarely flagged manipulative turns across all conditions, and post-task awareness did not differ significantly across groups. However, just-in-time warnings without cognitive forcing were the only intervention to significantly reduce compliance with AI-steered recommendations containing dark patterns, lowering compliance from 71.7% to 53.7%, an 18 percentage-point reduction. Exploratory analyses further showed that lower misinformation susceptibility was associated with greater flagging but not lower compliance, while higher AI trust was associated with greater compliance and lower reported awareness. Together, these findings suggest that explicit recognition of conversational dark patterns and behavioral resistance to AI steering may be distinct outcomes, motivating further investigation of timely, low-friction defensive interfaces.
- Abstract(参考訳): 会話型AIは、連続的な決定をますます形作るが、ユーザーは操作を認識し、抵抗するサポートを限定している。
我々は、ライブ会話を監視するブラウザベースのエージェントインターフェースであるAI Watchdogを紹介し、薬局、ブランドバイアス、人為的形態化、スニーク、有害な生成を含む5つのダークパターンカテゴリを検出し、発生時にユーザーに警告する。
そのオープンウェイトなターンレベル分類器は、独立デプロイメントとローカル推論へのパスをサポートし、会話型AIとは分離しながらユーザのプライバシを保存する。
我々は,AI Watchdogを,事前登録された5つの条件間比較実験(N = 150)で評価し,非干渉制御を,nudgeタイミング(prebunking vs. just-in-time)とエンゲージメントモード(認知強制を伴わない)の4つの構成と比較した。
その結果、被験者がすべての条件でマニピュティブ・ターンにフラグを付けることは稀であり、タスク後の意識はグループ間で大きな違いは認められなかった。
しかし、認知的強制のないジャスト・イン・タイムの警告は、ダークパターンを含むAIによる推奨事項へのコンプライアンスを著しく削減し、コンプライアンスを71.7%から53.7%に引き下げる唯一の介入であった。
探索的分析により、誤情報感受性の低下はフラグングの増大と相関するがコンプライアンスの低下は伴わないが、AI信頼の上昇はコンプライアンスの増大と報告された認識の低下に関連していることが示された。
これらの知見は、AIステアリングに対する会話の暗黒パターンの明示的な認識と行動抵抗が異なる結果である可能性を示唆し、タイムリーで低フリクションの防御インターフェースのさらなる研究を動機付けている。
関連論文リスト
- Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - Individual-level interventions against sycophantic AI reduce its appeal but not its persuasiveness [0.0]
サイコファンティックAIは、ユーザーに対して過度に同意し、フラットにすることができる。
本研究は,薬効に対する利用者の意識の高まりが,その有害な影響を防いでいるかどうかを検証した。
論文 参考訳(メタデータ) (2026-07-28T00:40:49Z) - Warning labels shift perceptions of sycophantic AI, but not its influence [63.79516339973759]
警告ラベルが梅毒の影響を緩和するかどうかを検証する。
システムをサイコファンティック(...あなたと同意し、間違っていても検証するかもしれない)としてラベル付けすることは、ユーザの認識をシフトさせる。
しかし、ユーザーの自己認識する正当性や、紛争を修復する意思に薬局が与える影響を確実に減少させるものではない。
論文 参考訳(メタデータ) (2026-06-19T11:01:45Z) - Verification Without Distrust: Reframing User-Side Oversight as Routine Epistemic Governance in Everyday Human-Chatbot Interaction [0.0]
日常の人間とチャットボットのインタラクションにおける信頼と検証の間には,検出可能な関連性は見つからない。
さらに3つのユーザ側プラクティス – 自動アクションの修正,修正,承認 – が広く支持され,満足度に肯定的な関係を持つ。
中から大規模までの満足度制御のギャップは、効果的なタスク成果が感覚的なエージェンシーを生まないことを示している。
論文 参考訳(メタデータ) (2026-05-31T14:12:11Z) - When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse [2.5424331328233207]
エージェントAIシステム - 独立した計画と実行が可能な自律的なエンティティ。
本稿ではエージェントAIのオンライン議論における社会的証明と検証タイミングの相互作用について検討する。
論文 参考訳(メタデータ) (2026-02-11T22:30:12Z) - When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making [7.170587130743388]
大規模言語モデルは、ユーザーがAI出力をどのように認識し、信頼するかを形作る、流動的な自然言語の説明を生成する。
本研究では,攻撃者がLDM生成説明書のフレーミングを操作し,不正確な出力に対する人間の信頼を調節する逆説明攻撃(AEAs)を導入する。
これは、説明を敵対的な認知チャネルとして扱い、AIによる意思決定に対する人間の信頼への影響を定量化する最初の体系的なセキュリティ研究である。
論文 参考訳(メタデータ) (2026-02-03T20:42:44Z) - AI summaries in online search influence users' attitudes [3.459756369056329]
本研究では,AIが生成した要約が,ユーザが異なる問題に対する考え方にどのように影響するかを検討した。
ユーザーは、AIサマリーが健康被害と福利厚生に重点を置いていると認識した。
これらの結果は、AIが生成した検索サマリーが公共の認識を著しく形作ることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T23:45:19Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - Dark Patterns Meet GUI Agents: LLM Agent Susceptibility to Manipulative Interfaces and the Role of Human Oversight [51.53020962098759]
本研究では,エージェント,ヒト参加者,ヒトAIチームが,さまざまなシナリオにまたがる16種類の暗黒パターンにどのように反応するかを検討する。
フェーズ1では、エージェントが暗黒パターンを認識するのに失敗することが多く、たとえ認識されたとしても、保護行動よりもタスク完了を優先することが強調される。
第2段階では、認知的ショートカットと習慣的コンプライアンスにより、人間はしゃがみ込み、エージェントは手続き的な盲点から遠ざかる。
論文 参考訳(メタデータ) (2025-09-12T22:26:31Z) - TeD-SPAD: Temporal Distinctiveness for Self-supervised
Privacy-preservation for video Anomaly Detection [59.04634695294402]
人間の監視のないビデオ異常検出(VAD)は複雑なコンピュータビジョンタスクである。
VADのプライバシー漏洩により、モデルは人々の個人情報に関連する不必要なバイアスを拾い上げ、増幅することができる。
本稿では,視覚的プライベート情報を自己管理的に破壊する,プライバシーに配慮したビデオ異常検出フレームワークTeD-SPADを提案する。
論文 参考訳(メタデータ) (2023-08-21T22:42:55Z) - Towards Adversarial Patch Analysis and Certified Defense against Crowd
Counting [61.99564267735242]
安全クリティカルな監視システムの重要性から、群衆のカウントは多くの注目を集めています。
近年の研究では、ディープニューラルネットワーク(DNN)の手法が敵の攻撃に弱いことが示されている。
群衆カウントモデルのロバスト性を評価するために,Momentumを用いた攻撃戦略としてAdversarial Patch Attackを提案する。
論文 参考訳(メタデータ) (2021-04-22T05:10:55Z) - Adversarial vs behavioural-based defensive AI with joint, continual and
active learning: automated evaluation of robustness to deception, poisoning
and concept drift [62.997667081978825]
人工知能(AI)の最近の進歩は、サイバーセキュリティのための行動分析(UEBA)に新たな能力をもたらした。
本稿では、検出プロセスを改善し、人間の専門知識を効果的に活用することにより、この攻撃を効果的に軽減するソリューションを提案する。
論文 参考訳(メタデータ) (2020-01-13T13:54:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。