論文の概要: The Ethics of Autonomous AI Agents for Offensive Security
- arxiv url: http://arxiv.org/abs/2607.20255v1
- Date: Wed, 22 Jul 2026 15:13:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.128344
- Title: The Ethics of Autonomous AI Agents for Offensive Security
- Title(参考訳): 攻撃的セキュリティのための自律型AIエージェントの倫理
- Abstract要約: LLM駆動の自律エージェントは、攻撃的なセキュリティを再構築しています。
従来の浸透試験ツールとは異なり、エージェントセキュリティツールは3つの独立した次元にまたがる決定性を示す。
我々の研究は、攻撃的なセキュリティのために自律的なAIエージェントを採用する際に、ユーザー、ツールメーカー、サードパーティの間で道徳的帰属がいかに拡散するかを分析します。
- 参考スコア(独自算出の注目度): 1.1677624591989955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-driven autonomous agents are reshaping offensive security. Unlike traditional penetration-testing tooling -- deterministic, narrowly scoped, and operated by trained practitioners -- agentic security tools exhibit \textit{indeterminacy} along three independent dimensions. First, their actions are drawn from a non-deterministic policy whose outputs resist both ex-ante and ex-post explanation, frustrating incident attribution and pre-deployment safety review. Second, their impact is open-ended due to the non-deterministic actions, agency of utilized models, and opaque LLM supply-chains. Third, their user population is indeterminate in both size and required skill: the operating skill floor for using or developing offensive capabilities has dropped sharply. These three properties are linked thematically, but are not derivable from one another. Combined with the structural cost asymmetry between offense and defense, they enable the industrialization of offensive capability. The net short-term effect favors attackers, even if the same technology may, in the long run, democratize access to defensive practice. Existing dual-use cybersecurity and AI-ethics frameworks were not designed for this combination. Our work analyzes how moral attribution becomes diffuse between users, tool-makers, and third parties when employing autonomous AI agents for offensive security. We also examine the stakeholder impact of this technology and provide stratified recommendations.
- Abstract(参考訳): LLM駆動の自律エージェントは、攻撃的なセキュリティを再構築しています。
従来の浸透テストツール(決定論的、狭く、訓練された実践者が運用する)とは異なり、エージェントセキュリティツールは、3つの独立した次元に沿って‘textit{indeterminacy’を示す。
第一に、これらの行動は、アウトプットが前任者および前任者説明の両方に抵抗する非決定主義政策、インシデント帰属へのフラストレーション、および事前デプロイの安全性レビューから引き出される。
第二に、その影響は非決定論的行動、活用されたモデルのエージェンシー、不透明なLCMサプライチェーンによるものである。
第3に、ユーザ人口はサイズとスキルの両面で不定であり、攻撃能力の使用や開発のための運用スキルフロアは急激に低下している。
これら3つの性質は数学的に結びついているが、互いに導出することはできない。
攻撃性と防御の間の構造的コスト非対称性と組み合わせることで、攻撃能力の工業化を可能にする。
短期的効果は、たとえ同じ技術が長期的には防衛活動へのアクセスを民主化するとしても、攻撃者に有利である。
既存のデュアルユースサイバーセキュリティとAI倫理フレームワークは、この組み合わせのために設計されていない。
我々の研究は、攻撃的なセキュリティのために自律的なAIエージェントを採用する際に、ユーザー、ツールメーカー、サードパーティの間で道徳的帰属がいかに拡散するかを分析します。
また、この技術のステークホルダーへの影響を調べ、階層化されたレコメンデーションを提供する。
関連論文リスト
- Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - What Does It Mean to Break a Distillation Defense? [33.607700445538136]
ブラックボックスのLSMは蒸留攻撃に弱いので、攻撃者がモデルに問い合わせて、その出力で生徒を訓練する。
本稿では,クエリ予算,データ予算,インターフェースプロファイルという,攻撃者の3つの側面を記述した脅威モデルフレームワークを提案する。
蒸留防衛の今後の取り組みは、それらの周辺に構築されたガバナンスや政策の枠組みとともに、明示的に特定し、ストレステストのアタッカーの能力をテストすべきである、と我々は主張する。
論文 参考訳(メタデータ) (2026-06-23T18:13:02Z) - Beyond Runtime Enforcement: Shield Synthesis as Defensibility Analysis for Adversarial Networks [0.0]
シールド強化学習は典型的には、時間論理仕様をエージェントの動作を制限するオートマトンにコンパイルする実行時安全メカニズムとして提示される。
ネットワーク防御のための制約付き2人プレイヤ安全ゲームを通じてこれをインスタンス化する。
我々は、アトラクタ構造からトポロジレベルのメトリクスを導き、シールド制約された対向多エージェント強化学習から収束後の振る舞いと組み合わせる。
論文 参考訳(メタデータ) (2026-06-11T17:35:40Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents [64.80318459073526]
敵のコンテンツは、同一のエージェントによって提供される相互作用にまたがって持続できることを示し、そのような脅威を検知し緩和することを困難にしている。
具体的には、敵対的コンテンツはエージェント状態に留まり、相互作用をまたいだ休眠状態に留まり、その後、良心的なユーザクエリによって活性化される。
我々は、このタイプの安全脅威をスリーパー攻撃として形式化し、評価するために、現実世界の有害な結果6つ、攻撃戦略3つ、エージェント状態の目標3つをカバーする1,896件のベンチマークを構築した。
論文 参考訳(メタデータ) (2026-05-27T09:25:37Z) - CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution [49.689452243966315]
ツールコール機能を備えたAIエージェントは、IPI(Indirect Prompt Injection)攻撃の影響を受けやすい。
本稿では,選択防衛フレームワークCausalArmorを提案する。
AgentDojoとDoomArenaの実験は、CausalArmorが攻撃的な防御のセキュリティと一致することを示した。
論文 参考訳(メタデータ) (2026-02-08T11:34:08Z) - Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective [31.55000083809067]
私たちは、ゲーム理論による抑止がAIを積極的に監視し、リスクを認識し、操作に対して回復力を与える方法を示します。
本稿では,(1)データ/フィードバック中毒に対するトレーニング時間監査,(2)制約されたレビュアーリソースによる事前デプロイ評価,(3)敵環境における堅牢なマルチモデル展開について報告する。
論文 参考訳(メタデータ) (2026-02-06T23:20:26Z) - To Defend Against Cyber Attacks, We Must Teach AI Agents to Hack [14.333336222782856]
AIエージェントは、数千のターゲットにわたる脆弱性発見とエクスプロイトを自動化する。
現在の開発者は、データフィルタリング、安全アライメント、出力ガードレールによる誤用を防止することに重点を置いている。
AIエージェントによるサイバー攻撃は避けられないものであり、防御戦略の根本的な変更が必要であると我々は主張する。
論文 参考訳(メタデータ) (2026-02-01T12:37:55Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Enhancing Trust in Autonomous Agents: An Architecture for Accountability and Explainability through Blockchain and Large Language Models [0.3495246564946556]
この研究は、ROSベースの移動ロボットに実装された説明可能性と説明可能性のアーキテクチャを示す。
提案されたソリューションは2つの主要コンポーネントで構成されている。まず、説明責任を提供するブラックボックスのような要素で、ブロックチェーン技術によって達成されるアンチタンパ特性を特徴とする。
第二に、前述のブラックボックスに含まれるデータに対して、Large Language Models(LLM)の機能を利用することで、自然言語の説明を生成するコンポーネントである。
論文 参考訳(メタデータ) (2024-03-14T16:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。