論文の概要: EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents
- arxiv url: http://arxiv.org/abs/2610.03153v1
- Date: Fri, 02 Oct 2026 11:22:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.348772
- Title: EvoRiskBench: An Evolving Benchmark for Runtime Security Risks in Workspace Agents
- Title(参考訳): EvoRiskBench:ワークスペースエージェントのランタイムセキュリティリスクのベンチマーク
- Abstract要約: EvoRiskBenchはEP-Path-EFフレームワークを中心に編成された、進化中のベンチマークである。
最初のリスクエントリポイントと,エージェントを介するリスクパスを通じて,ワンホップの技術的効果を関連付ける。
3つのモデルにまたがる9つのモデルハーネス構成を評価した。
- 参考スコア(独自算出の注目度): 14.26092486614381
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Workspace agents combine large language models with execution harnesses to perform stateful, multi-step tasks that access or modify external resources. Existing benchmarks leave gaps in executable coverage of their runtime security risks, while evolving model capabilities, harnesses, tools, and threats motivate benchmark evolution. We introduce EvoRiskBench, an evolving benchmark organized around the EP-Path-EF framework, which links an initial risk entry point to a one-hop technical effect through an agent-mediated risk path. The framework defines nine entry-point categories and five effect categories; a 20-participant study supports their interpretability and classification consistency on representative cases. Guided by this framework, an automated end-to-end workflow constructs and executes risk cases in isolated environments and independently verifies outcomes using runtime traces and environment states. The benchmark provides a reproducible dataset of 450 adversarial tasks across six scenarios. We evaluate nine model-harness configurations spanning three models (GPT-5.6 Sol, DeepSeek-V4-Pro-0813, and Claude Opus 5) and three harnesses (Claude Code, Codex, and OpenClaw). Our results reveal substantial vulnerabilities across systems. The most vulnerable configuration, Codex with DeepSeek-V4-Pro-0813, reaches a 68.44% attack success rate (ASR), indicating that configuration of workspace agent is insufficient to ensure secure autonomous execution. ASR varies more across models than harnesses, and harness differences depend on the model. The benchmark cases and evaluation platform will be released after completion of artifact safety and reproducibility checks.
- Abstract(参考訳): ワークスペースエージェントは、大きな言語モデルと実行ハーネスを組み合わせて、外部リソースへのアクセスや変更を行うステートフルなマルチステップタスクを実行する。
既存のベンチマークは、ランタイムセキュリティリスクの実行可能なカバレッジにギャップを残している一方で、モデル機能、ハーネス、ツール、脅威がベンチマークの進化を動機付けている。
EvoRiskBenchは、EP-Path-EFフレームワークを中心に組織された進化的ベンチマークであり、エージェントを介するリスクパスを通じて、最初のリスクエントリポイントとワンホップの技術的効果をリンクする。
このフレームワークは、9つのエントリポイントカテゴリと5つのエフェクトカテゴリを定義している。
このフレームワークによってガイドされ、自動化されたエンドツーエンドワークフローは、独立した環境でリスクケースを構築し、実行時トレースと環境状態を使用して独立して結果を検証する。
このベンチマークは、6つのシナリオにわたる450の逆タスクの再現可能なデータセットを提供する。
9つのモデルハーネス構成(GPT-5.6 Sol, DeepSeek-V4-Pro-0813, Claude Opus 5)と3つのハーネス(Claude Code, Codex, OpenClaw)を評価した。
私たちの結果は、システム間で重大な脆弱性を明らかにします。
最も脆弱な構成であるCodex with DeepSeek-V4-Pro-0813は68.44%の攻撃成功率(ASR)に達し、ワークスペースエージェントの設定が安全な自律実行を保証するには不十分であることを示している。
ASRはハーネスよりもモデルによって異なるが、ハーネスの違いはモデルによって異なる。
アーティファクトの安全性と再現性チェックが完了した後、ベンチマークケースと評価プラットフォームがリリースされる。
関連論文リスト
- HazardAuditor: From Executable Threats to Safer Computer-Use Agents [50.06351661912873]
既存のガードモデルは静的なプロンプトと応答をターゲットとしている。
既存の安全プラットフォームは、正規化された監督ではなく、ガードモデルで学ぶ必要がある評価判断を生成する。
両ギャップを埋める実行基盤フレームワークであるHazardAuditorを紹介します。
論文 参考訳(メタデータ) (2026-09-14T07:09:33Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety [45.163264704448125]
エージェントの安全性を6つの運用フェーズにまとめるライフサイクル指向ベンチマークを提案する。
実用性, 攻撃成功率, 永続性, 検出性を用いて各軌道の評価を行った。
明示的なリスク認識は、90%以上の実行中のリスクを検出する構成であるため、安全行動に確実に結びつくものではないことが分かっています。
論文 参考訳(メタデータ) (2026-08-18T10:03:58Z) - AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents [10.99961131065026]
大規模言語モデル(LLM)ベースのワークスペースエージェントは、異種リソースをまたいだステートフルなマルチステップを実行する。
最近のベンチマークでは、先進的な安全テストと軌道認識検証が実施されている。
我々は、ライフサイクル全体のランタイム安全性評価のためのサンドボックスベンチマークであるAgentS4Dを紹介する。
論文 参考訳(メタデータ) (2026-07-29T15:55:45Z) - Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety [2.661610409070365]
ツール使用のAIモデルがインクリメンタルアタックの影響を受けやすいかどうかを評価するベンチマークであるBoiling the Frogを紹介した。
シナリオは3段階の運用リスク分類によって編成される。
9モデルパネル全体では、総攻撃成功率(ASR)は44.4%である。
論文 参考訳(メタデータ) (2026-05-21T15:50:18Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。