論文の概要: AI Persuasion as a Threat to Human Control
- arxiv url: http://arxiv.org/abs/2609.14796v2
- Date: Wed, 16 Sep 2026 05:47:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.403165
- Title: AI Persuasion as a Threat to Human Control
- Title(参考訳): ヒューマンコントロールの脅威としてのAI説得
- Abstract要約: 私たちは、AI自体の開発、封じ込め、監視、ガバナンスを損なう決定に向けて、重要な設定でAIがどのように人間を説得するかを分析します。
このフレームワークを使って5つの具体的なシナリオを開発し、関連するリスクを評価するための青写真を提供する。
われわれの希望は、この論文がAIによる説得のリスクを強調し、将来の研究への道筋を提供することだ。
- 参考スコア(独自算出の注目度): 3.7466967375076003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The threat that AI persuasion poses to human control has been acknowledged in the literature, but not yet systematically studied. Now that persuasion attacks are no longer theoretical - with Anthropic's Claude Mythos 5 recently making headlines for trying to convince people involved in an open-source project to merge malicious code during an evaluation - there is a pressing need to deeply analyze this threat. We undertake that effort here. In particular, we analyze how AI could persuade humans in key settings (e.g. safety-relevant R&D within frontier labs) toward decisions that compromise the development, containment, oversight, and governance of AI itself. In doing so, we elucidate a framework for characterizing this threat, develop five concrete scenarios using this framework, and provide a blueprint for assessing the associated risks. Using this blueprint, we conduct an initial risk estimation survey with select researchers and find that their opinions on which scenarios are riskiest are highly mixed. Their disagreements stem from differing opinions about the effectiveness of AI persuasion in different contexts, and point to the need for follow-up risk elicitation studies and persuasion evaluations, which we outline. Our hope is that this paper highlights the risks from AI persuasion undermining control, and provides a path forward for future research.
- Abstract(参考訳): AIによる説得が人間のコントロールに影響を及ぼすという脅威は文献で認識されているが、体系的にはまだ研究されていない。
Anthropic の Claude Mythos 5 氏は先日,オープンソースプロジェクトに関わる人々が評価中に悪意のあるコードをマージするように説得する上で,この脅威を深く分析する必要性を見出しにしている。
私たちはこの努力をここで行います。
特に、AIが人間を重要な設定(例えば、フロンティア研究所の安全関連研究開発)で説得し、AI自体の開発、封じ込め、監視、ガバナンスを侵害する決定を下す方法について分析する。
そこで我々は、この脅威を特徴づける枠組みを解明し、この枠組みを用いて5つの具体的なシナリオを開発し、関連するリスクを評価するための青写真を提供する。
この青写真を用いて、我々は一部の研究者と最初のリスク推定調査を行い、どのシナリオが最もリスクが高いかという意見が混ざり合っていることを発見した。
彼らの意見の相違は、異なる文脈におけるAIの説得の有効性についての意見の相違に起因し、我々が概説するリスク評価のフォローアップの必要性を指摘する。
われわれの希望は、この論文がAIによる説得のリスクを強調し、将来の研究への道筋を提供することだ。
関連論文リスト
- Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5 [61.787178868669265]
この技術レポートは、サイバー犯罪、説得と操作、戦略上の詐欺、制御されていないAIR&D、自己複製の5つの重要な側面について、更新されきめ細かな評価を提示する。
この作業は、現在のAIフロンティアのリスクに対する理解を反映し、これらの課題を軽減するための集団行動を促します。
論文 参考訳(メタデータ) (2026-02-16T04:30:06Z) - Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework [0.0]
人間はしばしばサイバーセキュリティシステムにおいて最も弱いリンクである。
ミスアライメントのAIシステムは、従業員を操作することによって人間の監視を損なう可能性がある。
これらのリスクを評価し緩和するための体系的な枠組みは存在しない。
本稿では,AIの安全性管理に操作リスクを統合するための,最初の体系的方法論を提供する。
論文 参考訳(メタデータ) (2025-07-17T07:45:53Z) - Persuasion and Safety in the Era of Generative AI [0.0]
EU AI法(EU AI Act)は、情報的意思決定を弱めるためにマニピュティブまたは偽装技術を使用するAIシステムを禁止している。
私の論文は、この領域における実証研究の欠如に対処し、説得的手法の分類学を開発しました。
説得型AIのリスクを軽減するためのリソースを提供し、生成型AIの時代における倫理的説得に関する議論を促進する。
論文 参考訳(メタデータ) (2025-05-18T06:04:46Z) - Must Read: A Systematic Survey of Computational Persuasion [60.83151988635103]
AI駆動の説得は、有益なアプリケーションに活用することができるが、操作と非倫理的な影響を通じて脅威を引き起こす。
本調査では,AIによる説得の安全性,公平性,有効性を高めるための今後の研究方針について概説する。
論文 参考訳(メタデータ) (2025-05-12T17:26:31Z) - Fully Autonomous AI Agents Should Not be Developed [50.61667544399082]
本稿では,完全自律型AIエージェントを開発すべきではないと主張している。
この立場を支持するために、我々は、従来の科学文献と現在の製品マーケティングから、異なるAIエージェントレベルを規定するために構築する。
分析の結果,システムの自律性によって人へのリスクが増大することが明らかとなった。
論文 参考訳(メタデータ) (2025-02-04T19:00:06Z) - Particip-AI: A Democratic Surveying Framework for Anticipating Future AI Use Cases, Harms and Benefits [54.648819983899614]
汎用AIは、一般大衆がAIを使用してそのパワーを利用するための障壁を下げたようだ。
本稿では,AI利用事例とその影響を推測し,評価するためのフレームワークであるPartICIP-AIを紹介する。
論文 参考訳(メタデータ) (2024-03-21T19:12:37Z) - Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy [65.77763092833348]
この視点は、AI科学者の脆弱性を調べ、その誤用に関連する潜在的なリスクに光を当てる。
我々は、ユーザ意図、特定の科学的領域、およびそれらが外部環境に与える影響を考慮に入れている。
本稿では,人間規制,エージェントアライメント,環境フィードバックの理解を含む三段階的枠組みを提案する。
論文 参考訳(メタデータ) (2024-02-06T18:54:07Z) - Control Risk for Potential Misuse of Artificial Intelligence in Science [85.91232985405554]
我々は、科学におけるAI誤用の危険性の認識を高めることを目的としている。
化学科学における誤用の実例を取り上げる。
我々は、科学におけるAIモデルの誤用リスクを制御するSciGuardというシステムを提案する。
論文 参考訳(メタデータ) (2023-12-11T18:50:57Z) - AI Risk Skepticism, A Comprehensive Survey [1.370633147306388]
この研究は、このトピックに関する異なる視点を考慮に入れ、科学で現れた他の形態の懐疑論と類似している。
我々は、AIの危険性に関する様々な懐疑論を、関係する誤った思考の種類によって分類する。
論文 参考訳(メタデータ) (2023-02-16T16:32:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。