論文の概要: Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- arxiv url: http://arxiv.org/abs/2607.01793v2
- Date: Sat, 04 Jul 2026 02:16:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 17:33:48.920901
- Title: Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Title(参考訳): 大規模LLMエージェントの安全性試験:リスク発見からエビデンスを中心とした検証まで
- Authors: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng,
- Abstract要約: Veraは、非決定論的エージェントのためのソフトウェアエンジニアリングテストの原則をインスタンス化するエンドツーエンドの自動安全テストフレームワークである。
124のリスクカテゴリにまたがる1600の実行可能な安全ケースで構成されたVeraをリリースします。
これらの結果から,高度に進化するエージェントシステムの厳密かつ保守可能な安全性評価には,モジュール型で実行可能なテストインフラストラクチャが不可欠であることが示唆された。
- 参考スコア(独自算出の注目度): 32.337075755765056
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.
- Abstract(参考訳): LLMエージェントは、外部ツールを通じて自律的なアクションをますます実行し、複雑で進化する安全リスクをもたらす。
しかし、既存の安全試験は専門家が設計した安全違反を標的としており、対応する結果はハードコードされたルールによって評価され、エージェントが進化するにつれて拡張するのにコストがかかる。
この目的のために私たちは,3段階の自己強化パイプラインを通じて,非決定的エージェントのためのソフトウェアエンジニアリングテストの原則をインスタンス化する,エンドツーエンドの自動安全テストフレームワークであるVeraを紹介します。
第一に、文献による調査は、安全リスク、攻撃方法、およびツール実行環境の分類学に出現するリスクを継続的に発見し、構造する。
第2に、分類学の次元にまたがる組合せ的構成は、具体的な安全目標、プログラム的に構築された初期状態、および観測可能なアーティファクトに根ざした決定論的検証述語を指定して、実行可能な安全事例を生成する。
第三に、アダプティブ実行は、制御エージェントがランタイム観測に基づいてマルチターンインタラクションを操り、エビデンスグラウンド検証は、モデル自己報告よりも環境状態とツールコールエビデンスから結果を判断する。
我々は,4つのプロダクションエージェントフレームワーク(OpenClaw, Hermes, Codex, Claude Code)上でVeraを評価し,平均攻撃成功率が93.9\%に達するという重大な安全性上の弱点を明らかにした。
これらの結果から,大規模に進化するエージェントシステムの厳密かつ保守可能な安全性評価には,モジュール型で実行可能なテストインフラストラクチャが不可欠であることが示唆された。
コードはhttps://github.com/Yunhao-Feng/Vera.comで公開されている。
関連論文リスト
- AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents [87.26967184869198]
SeClawは、仕様駆動のセキュリティタスク合成と、自律エージェントの実行ベースのセキュリティ評価を組み合わせたフレームワークである。
ベンチマークは、リソース、ユーザタスク、環境、本質的なエージェントの振る舞いから生じるリスクをカバーしている。
論文 参考訳(メタデータ) (2026-06-01T14:23:42Z) - SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces [28.615215165815297]
SkillSafetyBenchは、スキルを介する安全性障害を評価するためのベンチマークである。
ローカライズされた非ユーザアタックは、常に安全でない振る舞いを誘導できることを示す。
その結果, エージェントの安全性は, モデルレベルのアライメントだけでなく, エージェントがいかにスキルを解釈するかにも依存していることがわかった。
論文 参考訳(メタデータ) (2026-05-12T12:03:54Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - SafeEvalAgent: Toward Agentic and Self-Evolving Safety Evaluation of LLMs [37.82193156438782]
本稿では, エージェント安全評価の新しいパラダイムとして, 継続的かつ自己進化的なプロセスとしてのリフレーミング評価を提案する。
本稿では、構造化されていないポリシー文書を自律的に取り込み、包括的な安全ベンチマークを生成し、永続的に進化させる、新しいマルチエージェントフレームワークSafeEvalAgentを提案する。
本実験はSafeEvalAgentの有効性を実証し,評価が強まるにつれてモデルの安全性が一貫した低下を示す。
論文 参考訳(メタデータ) (2025-09-30T11:20:41Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。