論文の概要: $S^3$: Improving Agent Safety through Multi-Stage Defense
- arxiv url: http://arxiv.org/abs/2608.02683v1
- Date: Mon, 03 Aug 2026 02:06:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.886455
- Title: $S^3$: Improving Agent Safety through Multi-Stage Defense
- Title(参考訳): S^3$:マルチステージ防御によるエージェント安全性の向上
- Abstract要約: 大規模言語モデル(LLM)エージェントは、複雑なタスクを達成するために、メモリ、計画、ツール実行といったステージを持つ多段階のエージェントに依存している。
既存の安全手法は、独立したステージのみを保護し、統合が困難であり、ワークフロー全体を通して包括的な保護を持たないエージェントを残している。
不均一な安全設計を明示的なステージ意味を持つ再利用可能な構成可能なコンポーネントとして表現する統合抽象化であるStage-Specific Safety Skillsを紹介する。
我々は、エージェントワークフロー全体を通してリスク検出と緩和のために、ガードエージェントがステージ固有の安全スキルを編成する多段階防衛フレームワークであるS3$を提案する。
- 参考スコア(独自算出の注目度): 6.9152314145765
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) agents rely on multi-stage agentic workflows, with stages such as memory, planning, and tool execution, to accomplish complex tasks. However, risks may emerge at different stages, propagate across steps, and become difficult to detect and mitigate. Existing safety methods protect only isolated stages and are difficult to integrate, leaving agents without comprehensive protection throughout the workflow. To address these limitations, we introduce Stage-Specific Safety Skills, a unified abstraction that represents heterogeneous safety designs as reusable and composable components with explicit stage semantics. We further develop an automated transformation pipeline that converts existing safety designs into reusable safety skills and establish a community-driven safety skill library. Building on this abstraction, we propose $S^3$, a multi-stage defense framework in which a guard agent orchestrates stage-specific safety skills for risk detection and mitigation throughout the agentic workflow. We also construct the Multi-Stage Risk Benchmark (MSRB) to evaluate representative risks across workflow stages. Experimental results show that $S^3$ consistently outperforms representative state-of-the-art baselines in both safety effectiveness and utility preservation. These results demonstrate the potential of stage-specific safety skills as a scalable and composable foundation for building resilient and trustworthy agent systems.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、複雑なタスクを達成するために、メモリ、計画、ツール実行といったステージを持つ多段階のエージェントワークフローに依存している。
しかし、リスクは異なる段階で発生し、ステップを越えて伝播し、検出と緩和が困難になる可能性がある。
既存の安全手法は、独立したステージのみを保護し、統合が困難であり、ワークフロー全体を通して包括的な保護を持たないエージェントを残している。
これらの制約に対処するために、我々は、異種安全設計を明示的なステージ意味を持つ再利用可能な構成可能なコンポーネントとして表現した統一的な抽象化であるStage-Specific Safety Skillsを紹介した。
さらに,既存の安全設計を再利用可能な安全スキルに変換する自動変換パイプラインを開発し,コミュニティ主導の安全スキルライブラリを構築した。
この抽象化に基づいて、ガードエージェントがエージェントワークフロー全体のリスク検出と緩和のためにステージ固有の安全スキルを編成する多段階防衛フレームワークであるS^3$を提案する。
また,多段階リスクベンチマーク(Multi-Stage Risk Benchmark,MSRB)を構築し,ワークフローステージ全体にわたる代表的なリスクを評価する。
実験結果から,S^3$は安全性と実用性の両方において,最先端のベースラインを一貫して上回ることがわかった。
これらの結果は,信頼性・信頼性の高いエージェントシステムを構築するための,スケーラブルで構成可能な基盤として,ステージ固有の安全スキルの可能性を示している。
関連論文リスト
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification [32.337075755765056]
Veraは、非決定論的エージェントのためのソフトウェアエンジニアリングテストの原則をインスタンス化するエンドツーエンドの自動安全テストフレームワークである。
124のリスクカテゴリにまたがる1600の実行可能な安全ケースで構成されたVeraをリリースします。
これらの結果から,高度に進化するエージェントシステムの厳密かつ保守可能な安全性評価には,モジュール型で実行可能なテストインフラストラクチャが不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-07-02T07:08:26Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment [64.36422334429228]
大規模言語モデル(LLM)は、現実の環境で運用されるエージェントとして、ますます多くデプロイされている。
既存のエージェントの安全性評価は、特定のエージェント設定に合わせて、リスク指向のタスクに依存する。
本稿では,現実の展開に根ざした組織的エージェント安全評価を実現するフレームワークであるR Risky-Benchを提案する。
論文 参考訳(メタデータ) (2026-02-03T04:44:11Z) - BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments [22.32760987248309]
本研究では,機能的環境における位置エージェントの行動安全リスクを明らかにするベンチマークであるBeSafe-Bench(BSB)を提案する。
BSBは、Web、Mobile、Embodied VLM、Embodied VLAの4つの代表的なドメインをカバーしている。
機能的環境を用いて、安全クリティカルリスクの9つのカテゴリでタスクを増強し、多様な指導空間を構築する。
論文 参考訳(メタデータ) (2026-01-30T03:41:57Z) - SafePro: Evaluating the Safety of Professional-Level AI Agents [29.90240552544994]
大規模言語モデルに基づくエージェントは、単純な会話アシスタントから、複雑な専門レベルのタスクを実行することができる自律システムへと急速に進化している。
既存の安全性評価は、主に単純で日常的な支援作業に重点を置いており、複雑な意思決定プロセスのキャプチャーに失敗し、プロフェッショナルな設定で不正に整合した行動の潜在的な影響がある。
プロの活動を行うAIエージェントの安全性アライメントを評価するために設計されたベンチマークであるSafeProを紹介する。
論文 参考訳(メタデータ) (2026-01-10T19:53:09Z) - How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity [55.441602598245744]
LLM駆動エージェントの現在の安全性評価は、主に原子害に焦点を当てており、悪意のある意図が複雑なタスクで隠されたり希釈されたりする高度な脅威に対処できなかった。
このギャップを,意図隠蔽とタスク複雑性の圧力下でのエージェントの安全性の脆さを二次元的に解析することで解決する。
目的が明確になるにつれて、安全アライメントは急激かつ予測的に低下し、「複雑パラドックス」が出現する。
論文 参考訳(メタデータ) (2025-11-11T17:27:27Z) - SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents [7.975014390527644]
大規模言語モデル(LLM)を利用したエージェントは、高度な計画能力を継承するが、物理世界との直接的な相互作用は安全上の脆弱性を露呈する。
SafeMindBenchは、4つのタスクカテゴリ(Instr-Risk、Env-Risk、Order-Fix、Req-Align)にまたがる5,558のサンプルを備えたマルチモーダルベンチマークである。
SafeMindAgentはモジュール型Planner-Executorアーキテクチャで、3つのケースドセーフモジュールを統合し、安全性制約を推論プロセスに組み込む。
論文 参考訳(メタデータ) (2025-09-30T07:24:04Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - Towards provable probabilistic safety for scalable embodied AI systems [79.31011047593492]
エンボディードAIシステムは、様々なアプリケーションでますます普及している。
複雑な運用環境での安全性確保は依然として大きな課題である。
このパースペクティブは、安全で大規模に実施されたAIシステムを安全クリティカルなアプリケーションに採用するための道筋を提供する。
論文 参考訳(メタデータ) (2025-06-05T15:46:25Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。