論文の概要: AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents
- arxiv url: http://arxiv.org/abs/2607.27294v1
- Date: Wed, 29 Jul 2026 15:55:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.286297
- Title: AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents
- Title(参考訳): AgentS4D: LLMベースのワークスペースエージェントの実行ライフサイクルにおける実行時リスクのベンチマーク
- Authors: Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan,
- Abstract要約: 大規模言語モデル(LLM)ベースのワークスペースエージェントは、異種リソースをまたいだステートフルなマルチステップを実行する。
最近のベンチマークでは、先進的な安全テストと軌道認識検証が実施されている。
我々は、ライフサイクル全体のランタイム安全性評価のためのサンドボックスベンチマークであるAgentS4Dを紹介する。
- 参考スコア(独自算出の注目度): 10.99961131065026
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM)-based workspace agents execute stateful, multi-step workflows across heterogeneous resources, external tools, and persistent state. Their safety must therefore be assessed from actions, side effects, and state changes throughout execution. Although recent benchmarks have advanced executable safety testing and trajectory-aware verification, they rarely provide a unified account of where risks enter, how they elicit unsafe behavior, which harms they target, and where supporting evidence appears during execution. We introduce AgentS4D, a sandboxed benchmark for lifecycle-wide runtime safety evaluation. Its four-dimensional runtime-safety framework uses six risk-entry sources, six induction strategies, and nine target harms to guide case construction, while seven lifecycle checkpoints organize post-run evidence. AgentS4D contains 328 risk-injected cases. We evaluate all 20 combinations of four harnesses (Hermes, OpenClaw, Claude Code, and Codex) and five LLM backends (GPT-5.5, Gemini 3.1 Pro, DeepSeek-V4-Pro, MiniMax-M3, and Qwen3.7-Plus) on these cases, yielding 6,560 runs. Overall, 4,461 runs (68.0%) trigger prespecified unsafe signals. Across the 20 configurations, the observed safety of an agent system varies with both its harness-LLM pairing and how risk is introduced. Agent systems exhibit markedly different safety behavior when the same induction strategy reaches them through different risk carriers. They also respond differently to the same target harm when it is realized through different carriers and strategies. Moreover, 4,344 runs (66.22% overall) are unsafe yet complete. Thus, task completion cannot establish runtime safety, and testing only one form of a risk can conceal important weaknesses. Evaluations should examine complete agent configurations across diverse risk conditions and retain evidence throughout execution.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのワークスペースエージェントは、異種リソース、外部ツール、永続的ステートにまたがるステートフルでマルチステップのワークフローを実行する。
そのため、それらの安全性は実行中、アクション、副作用、状態の変化から評価されなければならない。
最近のベンチマークでは、先進的な安全テストと軌跡認識検証が実施されているが、リスクがどこに入れば良いのか、どのように安全でない振る舞いを誘発するか、ターゲットに害を与え、実行中に証拠が現れるのかを統一的に説明することは滅多にない。
我々は、ライフサイクル全体のランタイム安全性評価のためのサンドボックスベンチマークであるAgentS4Dを紹介する。
4次元のランタイムセーフティフレームワークでは、6つのリスクエントリーソース、6つのインジェクション戦略、9つのターゲット障害を使用してケース構築をガイドし、7つのライフサイクルチェックポイントが実行後のエビデンスを組織している。
AgentS4Dには328のリスク注入ケースが含まれている。
これら4つのハーネス(Hermes、OpenClaw、Claude Code、Codex)と5つのLLMバックエンド(GPT-5.5、Gemini 3.1 Pro、DeepSeek-V4-Pro、MiniMax-M3、Qwen3.7-Plus)の組み合わせをそれぞれ20の組み合わせで評価し、6,560ランを出力した。
全体では4,461回(68.0%)の無安全信号がトリガーされる。
エージェントシステムの安全性は、ハーネスとLLMのペアリングとリスクの導入によって異なる。
エージェントシステムは、同じ誘導戦略が異なるリスクキャリアを通してそれらに到達すると、非常に異なる安全行動を示す。
また、異なるキャリアや戦略を通じて実現された場合、同じ標的の害に対して異なる反応をする。
さらに4,344ラン(全体の66.22%)は安全ではない。
したがって、タスク補完は実行時の安全性を確立することができず、リスクの1つの形態だけをテストすることで重要な弱点を隠蔽することができる。
評価は、さまざまなリスク条件にまたがる完全なエージェント構成を調べ、実行を通じて証拠を保持するべきである。
関連論文リスト
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification [32.337075755765056]
Veraは、非決定論的エージェントのためのソフトウェアエンジニアリングテストの原則をインスタンス化するエンドツーエンドの自動安全テストフレームワークである。
124のリスクカテゴリにまたがる1600の実行可能な安全ケースで構成されたVeraをリリースします。
これらの結果から,高度に進化するエージェントシステムの厳密かつ保守可能な安全性評価には,モジュール型で実行可能なテストインフラストラクチャが不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-07-02T07:08:26Z) - VESTA: A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents [7.980753712857791]
大規模言語モデル(LLM)のための完全に自動化されたシナリオ生成と安全性評価フレームワークであるVESTAを紹介する。
VESTAは、現実世界のタスク実行における抽象的かつ多様な安全性リスクを1,072の計測可能な評価シナリオに即時化する。
その結果、現在のエージェントはタスク実行中に重大な行動安全リスクに直面しており、平均的なASRは47.1%、いくつかのモデルは70%を超えている。
論文 参考訳(メタデータ) (2026-06-07T09:23:38Z) - SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment [19.947119280467934]
セーフハーネス(Safeharness)は、4つの防衛レイヤがエージェントライフサイクルに直接織られるセキュリティアーキテクチャである。
ベンチマークデータセットの安全性を、多様なハーネス構成で評価する。
論文 参考訳(メタデータ) (2026-04-15T08:59:00Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents [7.975014390527644]
大規模言語モデル(LLM)を利用したエージェントは、高度な計画能力を継承するが、物理世界との直接的な相互作用は安全上の脆弱性を露呈する。
SafeMindBenchは、4つのタスクカテゴリ(Instr-Risk、Env-Risk、Order-Fix、Req-Align)にまたがる5,558のサンプルを備えたマルチモーダルベンチマークである。
SafeMindAgentはモジュール型Planner-Executorアーキテクチャで、3つのケースドセーフモジュールを統合し、安全性制約を推論プロセスに組み込む。
論文 参考訳(メタデータ) (2025-09-30T07:24:04Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。