論文の概要: ASPIRE: Agentic Safety & Prompt Injection Red-teaming Engine
- arxiv url: http://arxiv.org/abs/2610.08951v1
- Date: Tue, 06 Oct 2026 18:18:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.536833
- Title: ASPIRE: Agentic Safety & Prompt Injection Red-teaming Engine
- Title(参考訳): ASPIRE: エージェントセーフティ&プロンプトインジェクション・レッドチームエンジン
- Abstract要約: LLMエージェントは信頼できないコンテンツを検索し、ツールを通して行動し、間接的なインジェクションリスクを発生させる。
我々は,オープンな行動レベルの脆弱性発見のためのエージェントセーフティ&プロンプトインジェクション・レッドチームエンジンであるASPIREを紹介する。
- 参考スコア(独自算出の注目度): 51.17686708121503
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents retrieve untrusted content and act through tools, creating indirect prompt-injection risks that can cause unauthorized actions or persistent state changes. Existing automated red-teaming largely optimizes payloads for pre-specified scenarios, leaving latent vulnerabilities across the agent's behavior space unexplored. We present ASPIRE, an Agentic Safety & Prompt Injection Red-teaming Engine for open-ended, behavior-level vulnerability discovery. ASPIRE maintains an evolving Agent Security Behavior Graph and uses complementary Explore and Exploit experts to discover, verify, and generalize consequence-centric tests. Trajectory evidence updates the graph and diagnoses partial or failed attempts, while cross-run memory transfers useful red-team strategies. Experiments on various benchmarks show that ASPIRE substantially expands coverage across consequences, injection methods, environments, and behavior paths while maintaining strong attack success.
- Abstract(参考訳): LLMエージェントは信頼できないコンテンツを検索し、ツールを通じて行動し、間接的なプロンプト・インジェクションのリスクを発生させ、不正なアクションや永続的な状態変化を引き起こす。
既存の自動赤チーム処理は、事前に特定されたシナリオのペイロードを最適化し、エージェントの行動空間に潜伏する脆弱性を未調査のまま残している。
我々は,オープンな行動レベルの脆弱性発見のためのエージェントセーフティ&プロンプトインジェクション・レッドチームエンジンであるASPIREを紹介する。
ASPIREは進化するAgens Security Behavior Graphを維持し、補完的なExploreとExploreのエキスパートを使って結果中心のテストを発見し、検証し、一般化する。
Trajectoryのエビデンスによってグラフが更新され、部分的あるいは失敗した試行が診断される。
様々なベンチマーク実験により、ASPIREは強力な攻撃成功を維持しながら、結果、注入方法、環境、行動経路の範囲を大幅に拡大することが示された。
関連論文リスト
- Breadcrumbing Search Agents [118.20284823674382]
LLMベースの検索エージェントは情報検索タスクに広く利用されているが、外部ツールへの依存度は重大なセキュリティリスクをもたらす。
検索およびページ観察を行うチャネルは脆弱なセキュリティ境界であることを示す。
制約付きツール仲介脅威モデルの下では、クエリ毎に1つのコントロールされた結果のみを追加することで、攻撃の成功を大幅に増加させることができる。
論文 参考訳(メタデータ) (2026-08-05T07:57:27Z) - Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming [8.592488240217625]
本研究では, 1 つのエージェント研究環境を用いて, 生産用 LLM エージェントの自動リピートについて検討した。
脆弱性仮説を提案し、ファルシファイアを構築し、有効な攻撃をインスタンス化し、サンドボックス化されたハーネスで実行し、検証された結果をVulnerability Concept Graph(VCG)にプロモートする。
直接および間接的な攻撃をカバーする3つのシナリオに関するClude CodeとCodexの裏側で、発見された概念は、モデルとエージェント間で再利用可能な脆弱性コアを明らかにしている。
論文 参考訳(メタデータ) (2026-07-13T15:31:04Z) - Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming [10.806133492616432]
既存のレッドチームのアプローチは、主に固定されたアタックテンプレートや最終アタック結果に依存している。
我々は,脆弱性の発見に実行トラジェクトリを使用するトラジェクトリ誘導型レッドチームフレームワークであるTrajRedを提案する。
また、Red Teaming中に発見されたハイリスクなトラジェクトリを使用して、進行中のトラジェクトリを監視し、介入するランタイム層であるTrajGuardも開発しています。
論文 参考訳(メタデータ) (2026-06-23T15:14:30Z) - PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections [51.8246149916068]
大きな言語モデル(LLM)は、外部のツールや環境と相互作用するエージェントシステムへと急速に進化しています。
LLMエージェントのプロアクティブな脆弱性暴露のための自動エージェント監査フレームワークPI-Hunterを提案する。
論文 参考訳(メタデータ) (2026-06-10T22:57:02Z) - DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents [121.77550256034]
DecodingTrust-Agent Platform (DTap)は、AIエージェントのためのコントロール可能でインタラクティブなレッドチームプラットフォームである。
DTap-Redは、多様なインジェクションベクターを探索し、効果的な攻撃戦略を自律的に発見する、最初の自律的赤チームエージェントである。
DTapを通じて、さまざまなバックボーンモデル上に構築された一般的なAIエージェントの大規模評価を行う。
論文 参考訳(メタデータ) (2026-05-06T11:59:48Z) - SkillJect: Automating Stealthy Skill-Based Prompt Injection for Coding Agents with Trace-Driven Closed-Loop Refinement [120.52289344734415]
エージェントスキルに適したステルスプロンプトインジェクションのための自動フレームワークを提案する。
フレームワークは、明示的なステルス制約の下でインジェクションスキルを合成するアタックエージェント、インジェクションされたスキルを使用してタスクを実行するコードエージェント、アクショントレースをログする評価エージェントの3つのエージェントでクローズドループを形成する。
本手法は,現実的な環境下で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2026-02-15T16:09:48Z) - Cuckoo Attack: Stealthy and Persistent Attacks Against AI-IDE [64.47951172662745]
Cuckoo Attackは、悪意のあるペイロードを構成ファイルに埋め込むことで、ステルス性と永続的なコマンド実行を実現する新しい攻撃である。
攻撃パラダイムを初期感染と持続性という2つの段階に分類する。
当社は、ベンダーが製品のセキュリティを評価するために、実行可能な7つのチェックポイントを提供しています。
論文 参考訳(メタデータ) (2025-09-19T04:10:52Z) - IPIGuard: A Novel Tool Dependency Graph-Based Defense Against Indirect Prompt Injection in LLM Agents [33.775221377823925]
大規模言語モデル(LLM)エージェントは現実世界のアプリケーションに広くデプロイされており、複雑なタスクのために外部データを検索し操作するためのツールを活用している。
信頼できないデータソースと対話する場合、ツールレスポンスには、エージェントの動作に秘密裏に影響を与え、悪意のある結果をもたらすインジェクションが含まれている可能性がある。
我々はIPIGuardと呼ばれる新しい防御タスク実行パラダイムを提案し、ソースにおける悪意あるツール呼び出しを防止する。
論文 参考訳(メタデータ) (2025-08-21T07:08:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。