論文の概要: Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation
- arxiv url: http://arxiv.org/abs/2607.14006v1
- Date: Wed, 15 Jul 2026 16:36:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.833626
- Title: Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation
- Title(参考訳): AI対応システムの浸透試験再考:資源妥協から行動目的違反へ
- Abstract要約: 侵入テストは伝統的に、敵がセキュリティ関連の妥協を達成するために、ソフトウェア、インフラストラクチャ、設定、運用制御の弱点を悪用できるかどうかを評価する。
本稿では,AI対応システムの浸透試験を客観的行動評価として再検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Penetration testing traditionally evaluates whether adversaries can exploit weaknesses in software, infrastructure, configurations, or operational controls to achieve security-relevant compromise. This paradigm remains necessary for AI-enabled systems, but it is no longer sufficient. In such systems, adversaries may influence prompts, retrieved content, sensor inputs, training data, memory, tools, or human-AI interaction loops to alter system behavior without directly compromising the underlying infrastructure. This paper reframes penetration testing for AI-enabled systems as objective-driven behavioral evaluation. We define an AI-enabled system as one in which learned models materially influence behavior affecting operational outcomes, and we define AI-enabled penetration as the feasible induction of AI-governed behavior that violates one or more operational objectives under an explicit threat model. This definition preserves conventional penetration testing while extending it to adversarial pathways such as prompt injection, indirect prompt injection, data poisoning, sensor manipulation, retrieval poisoning, tool misuse, and agentic misalignment. We further propose a testing workflow that identifies operational objectives, maps AI-governed behavior, analyzes adversarial influence surfaces, defines behavioral failure criteria, executes scenario-based tests, and reports evidence linking adversarial action to objective violation. A running example involving an AI-enabled security operations center assistant illustrates how penetration may occur through behavioral influence rather than infrastructure compromise. Together, the definitions, workflow, and example provide a technical framework for evaluating adversarial success in deployed AI-enabled systems.
- Abstract(参考訳): 侵入テストは伝統的に、敵がセキュリティ関連の妥協を達成するために、ソフトウェア、インフラストラクチャ、設定、運用制御の弱点を悪用できるかどうかを評価する。
このパラダイムは、AI対応システムには依然として必要だが、もはや不十分である。
このようなシステムでは、相手はプロンプト、検索されたコンテンツ、センサー入力、トレーニングデータ、メモリ、ツール、あるいは人間とAIの相互作用ループに影響を与え、基盤となるインフラを直接的に妥協することなくシステム動作を変化させることができる。
本稿では,AI対応システムの浸透試験を客観的行動評価として再検討する。
我々は、AI対応システムを、学習モデルが運用結果に影響を与える行動に実質的に影響を与えるシステムとして定義し、AI対応の侵入を、明示的な脅威モデルの下で1つ以上の運用目標に違反するAI対応行動の実現可能性として定義する。
この定義は、従来の浸透試験を維持しながら、即発注射、間接注射、データ中毒、センサー操作、検索中毒、ツール誤用、エージェント誤調整などの敵経路に拡張する。
さらに、運用目的を特定し、AIが支配する振る舞いをマップし、敵の影響面を分析し、行動障害基準を定義し、シナリオベースのテストを実行し、敵行為を客観的違反にリンクする証拠を報告するテストワークフローを提案する。
AI対応のセキュリティオペレーションセンターアシスタントを含む実行中の例は、インフラストラクチャの妥協よりも行動の影響による侵入の発生を例示している。
定義、ワークフロー、例と共に、デプロイされたAI対応システムにおける敵対的成功を評価するための技術的なフレームワークを提供する。
関連論文リスト
- A Diagnostic Framework for AI Agent Behavior [2.7491881437593553]
このパースペクティブは、AIエージェントの振る舞い:レイヤ属性の診断フレームワークを提案する。
このフレームワークは、3つの結果を明確にしている: 代理妥当性はモデル-タスク層の関係であり、人間-AIの分岐は診断の証拠を提供し、ガバナンスは介入の前にソースの帰属を必要とする。
論文 参考訳(メタデータ) (2026-07-19T09:14:27Z) - Defeat Devices in AI Systems [8.970269049715933]
2015年のフォルクスワーゲン排出ガス事件(Volkswagen emissions case)で広く注目を集めた。
本稿では,3つの軸に沿って文書化された事例(オリジン,トリガー,スワップ機構)を整理し,法医学的検出プロトコルとしてTrigger-Axis-Aware Differential Probing (TADP)を提案する。
我々は、自然に出現する倒産デバイスを、AIの安全実践が体系的に監視し、テストすべき有害な現象の1つとして特徴づける。
論文 参考訳(メタデータ) (2026-06-27T11:12:17Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents [90.05202259420138]
意図しないコンピュータ利用エージェントは、良質な入力コンテキストの下でも期待された結果から逸脱することができる。
意図しないCUA行動に対する最初の概念的および方法論的枠組みを紹介する。
本稿では,CUA実行フィードバックを用いた命令を反復的に摂動するエージェントフレームワークであるAutoElicitを提案する。
論文 参考訳(メタデータ) (2026-02-09T03:20:11Z) - AI Deception: Risks, Dynamics, and Controls [153.71048309527225]
このプロジェクトは、AI偽装分野の包括的で最新の概要を提供する。
我々は、動物の偽装の研究からシグナル伝達理論に基づく、AI偽装の正式な定義を同定する。
我々は,AI偽装研究の展望を,偽装発生と偽装処理の2つの主要な構成要素からなる偽装サイクルとして整理する。
論文 参考訳(メタデータ) (2025-11-27T16:56:04Z) - MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm [0.5495755145898128]
現在のAIシステムは、監査証跡、証明追跡、EU AI Actのような新たな規則で要求される説明可能性に欠ける不透明なデータ構造で運用されている。
動作は一時的なタスクではなく、永続的で検証可能なデータアーティファクトによって駆動される、アーティファクト中心のAIエージェントパラダイムを提案する。
プロダクション対応実装では、超高速ストリーミング(2,720.7MB/s)、最適化されたビデオ処理(1,342MB/s)、エンタープライズレベルのセキュリティが示されている。
論文 参考訳(メタデータ) (2025-11-19T04:10:32Z) - ANNIE: Be Careful of Your Robots [48.89876809734855]
エンボディドAIシステムに対する敵の安全攻撃に関する最初の体系的研究について述べる。
すべての安全カテゴリーで攻撃の成功率は50%を超えている。
結果は、実証済みのAIシステムにおいて、これまで未調査だったが、非常に連続的な攻撃面を露呈する。
論文 参考訳(メタデータ) (2025-09-03T15:00:28Z) - CANTXSec: A Deterministic Intrusion Detection and Prevention System for CAN Bus Monitoring ECU Activations [53.036288487863786]
物理ECUアクティベーションに基づく最初の決定論的侵入検知・防止システムであるCANTXSecを提案する。
CANバスの古典的な攻撃を検知・防止し、文献では調査されていない高度な攻撃を検知する。
物理テストベッド上での解法の有効性を実証し,攻撃の両クラスにおいて100%検出精度を達成し,100%のFIAを防止した。
論文 参考訳(メタデータ) (2025-05-14T13:37:07Z) - Detecting Malicious AI Agents Through Simulated Interactions [0.0]
本研究では、悪意あるAIアシスタントの操作特性と、人間のようなシミュレーションユーザーと対話する際に、その動作が検出できるかどうかを調査する。
我々は,AIアシスタントとユーザ間のインタラクションを,複雑さと利害関係の異なる8つの意思決定シナリオでシミュレートする。
悪意のあるAIアシスタントは、シミュレーションされたユーザの脆弱性と感情的なトリガーを利用する、ドメイン固有のペルソナ対応の操作戦略を採用している。
論文 参考訳(メタデータ) (2025-03-31T12:22:24Z) - Adversarial vs behavioural-based defensive AI with joint, continual and
active learning: automated evaluation of robustness to deception, poisoning
and concept drift [62.997667081978825]
人工知能(AI)の最近の進歩は、サイバーセキュリティのための行動分析(UEBA)に新たな能力をもたらした。
本稿では、検出プロセスを改善し、人間の専門知識を効果的に活用することにより、この攻撃を効果的に軽減するソリューションを提案する。
論文 参考訳(メタデータ) (2020-01-13T13:54:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。