論文の概要: Adversarial Prompting Framework for AI Safety Assessment
- arxiv url: http://arxiv.org/abs/2607.13453v1
- Date: Wed, 15 Jul 2026 05:26:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.659368
- Title: Adversarial Prompting Framework for AI Safety Assessment
- Title(参考訳): AI安全性評価のための逆プロンプトフレームワーク
- Authors: Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee,
- Abstract要約: 本稿では,AIの安全性を総合的に評価するためのAPF(Adversarial Prompting Framework)の実装について述べる。
このフレームワークは、構造化された敵プロンプトの生成を通じて、AIモデルのレジリエンスを体系的に評価する。
結果は、異なる攻撃ベクトルにわたるモデル脆弱性の顕著なばらつきを示している。
- 参考スコア(独自算出の注目度): 0.7619404259039283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Artificial Intelligence (AI), especially Generative AI (GenAI), adoption has increased in industries significantly in recent years. However, the use of these models may also expose systems to new forms of cyberattacks by different malicious actors -- adversarial prompt attack (APA) being one of the most prominent examples of such threats. This paper presents the implementation of an Adversarial Prompting Framework (APF) for a comprehensive assessment of AI safety. The framework systematically evaluates the resilience of the AI model through the generation of structured adversarial prompts at multiple sophistication levels, from direct harmful requests to advanced encoding-based attacks. Our implementation demonstrates the practical application of this methodology in enterprise environments, providing automated testing capabilities with quantitative security assessment metrics. The results indicate significant variations in the model vulnerabilities across different attack vectors, with encoded prompts presenting the highest success rates in bypassing safety mechanisms.
- Abstract(参考訳): 人工知能(AI)、特にジェネレーティブAI(GenAI)は、近年、産業において急速に普及している。
しかし、これらのモデルを使用することで、異なる悪意のあるアクターによる新たなサイバー攻撃のシステムを公開する可能性がある。
本稿では,AIの安全性を総合的に評価するためのAPF(Adversarial Prompting Framework)の実装について述べる。
このフレームワークは、直接有害な要求から高度なエンコーディングベースの攻撃に至るまで、構造化された敵プロンプトを複数の高度なレベルで生成することで、AIモデルのレジリエンスを体系的に評価する。
本実装では,この方法論を企業環境に適用し,定量的セキュリティ評価指標を用いた自動テスト機能を提供する。
その結果、異なる攻撃ベクトル間でモデル脆弱性の顕著なばらつきが示され、エンコードされたプロンプトは安全性メカニズムをバイパスする上で最高の成功率を示す。
関連論文リスト
- RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems [4.789897887600273]
グラフ表現駆動型動的リピート手法であるRIFT-Benchを紹介する。
RIFT-Benchは、システム構造を抽出するDiscoveryと、適応的な敵攻撃を展開するScanningの2つの自動化フェーズで動作する。
多様な実装にまたがる45のエージェントシステムを対象とした評価パイプラインの有効性を示す。
論文 参考訳(メタデータ) (2026-06-22T20:46:56Z) - STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment [0.0]
我々は,高レベルリスク標準(NIST AI RMF)と技術的脆弱性のギャップを埋めるフレームワークであるtextitSTRIDE-AIを提案する。
このフレームワークは6フェーズのアセスメントライフサイクルを定義し、AIシステムのための古典的STRIDEの脅威モデリング適応を導入し、目的とするWebツールを通じて運用する。
論文 参考訳(メタデータ) (2026-05-16T21:27:23Z) - Toward Risk Thresholds for AI-Enabled Cyber Threats: Enhancing Decision-Making Under Uncertainty with Bayesian Networks [0.3151064009829256]
我々は、AIサイバーリスク閾値の開発と評価のための構造化アプローチを提案する。
まず、既存の業界におけるサイバーしきい値を分析し、共通しきい値要素を同定する。
第2に,AI可能なサイバーリスクをモデル化するためのツールとしてベイズネットワークを提案する。
論文 参考訳(メタデータ) (2026-01-23T23:23:12Z) - Analyzing Code Injection Attacks on LLM-based Multi-Agent Systems in Software Development [11.76638109321532]
本稿では,ソフトウェア工学プロセスの実装フェーズのためのマルチエージェントシステムのアーキテクチャを提案する。
このようなシステムは、非常に正確にコードを生成することができるが、コードインジェクションを含む攻撃に弱いことを実証する。
論文 参考訳(メタデータ) (2025-12-26T01:08:43Z) - Toward Quantitative Modeling of Cybersecurity Risks Due to AI Misuse [50.87630846876635]
我々は9つの詳細なサイバーリスクモデルを開発する。
各モデルはMITRE ATT&CKフレームワークを使用して攻撃をステップに分解する。
個々の見積もりはモンテカルロシミュレーションによって集約される。
論文 参考訳(メタデータ) (2025-12-09T17:54:17Z) - A Systematic Survey of Model Extraction Attacks and Defenses: State-of-the-Art and Perspectives [65.3369988566853]
近年の研究では、敵が対象モデルの機能を複製できることが示されている。
モデル抽出攻撃は知的財産権、プライバシー、システムのセキュリティに脅威をもたらす。
本稿では,攻撃機構,防衛手法,計算環境に応じてMEAを分類する新しい分類法を提案する。
論文 参考訳(メタデータ) (2025-08-20T19:49:59Z) - Offensive Security for AI Systems: Concepts, Practices, and Applications [0.0]
従来の防御策は、AI駆動技術に直面するユニークで進化する脅威に対して、しばしば不足する。
本稿では、AIライフサイクル全体を通して脆弱性を明らかにするために、積極的な脅威シミュレーションと敵対的なテストを強調する。
論文 参考訳(メタデータ) (2025-05-09T18:58:56Z) - Position: Mind the Gap-the Growing Disconnect Between Established Vulnerability Disclosure and AI Security [56.219994752894294]
我々は、AIセキュリティレポートに既存のプロセスを適用することは、AIシステムの特徴的な特徴に対する根本的な欠点のために失敗する運命にあると主張している。
これらの欠点に対処する私たちの提案に基づき、AIセキュリティレポートへのアプローチと、新たなAIパラダイムであるAIエージェントが、AIセキュリティインシデント報告の進展をさらに強化する方法について論じる。
論文 参考訳(メタデータ) (2024-12-19T13:50:26Z) - EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents [53.717918131568936]
EAI(Embodied AI)は、高度なAIモデルを現実世界のインタラクションのための物理的なエンティティに統合する。
高レベルのタスク計画のためのEAIエージェントの"脳"としてのファンデーションモデルは、有望な結果を示している。
しかし、これらのエージェントの物理的環境への展開は、重大な安全性上の課題を呈している。
本研究では,EAIシナリオにおける身体的リスクの自動評価のための新しいフレームワークEARBenchを紹介する。
論文 参考訳(メタデータ) (2024-08-08T13:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。