論文の概要: GuardianAgentBench: Where Agents Fail and How to Guard Them
- arxiv url: http://arxiv.org/abs/2607.20982v1
- Date: Thu, 23 Jul 2026 07:05:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.304799
- Title: GuardianAgentBench: Where Agents Fail and How to Guard Them
- Title(参考訳): GuardianAgentBench: エージェントの失敗と保護方法
- Abstract要約: GuardianAgentBenchは、プロダクション対応の3つのフレームワークで評価された6つのドメインにわたる580のシナリオのベンチマークである。
最強の構成でさえ、全体的な精度は74.8%に過ぎず、2つの異なる障害体制を明らかにしている。
我々のガードレールの実装は、全てのモデルにおけるシステムプロンプトベースの防御を一貫して上回り、19.9%の障害をわずか0.5%の偽陽性率で回復させる。
- 参考スコア(独自算出の注目度): 1.5223648595073074
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language model agents increasingly operate autonomously with access to tools and external environments, ensuring their safe and reliable behavior becomes critical. We present GuardianAgentBench (GABench), a benchmark of 580 scenarios across six domains evaluated on three production-ready frameworks: LangChain, LlamaIndex, and Vectara. The benchmark incorporates rigorous multi-stage validation and five adversarial attack modes. Experiments with six state-of-the-art models reveal that even the strongest configuration achieves only 74.8% overall accuracy and expose two distinct failure regimes: stronger models under-call required tools, while weaker models mis-select and over-call tools. Performance degrades monotonically with both tool-set size and sequential turn depth, with long-horizon planning proving the steeper bottleneck. Our guardrail implementation consistently outperforms system-prompt-based defenses across all models, recovering 19.9% of failures at a false positive rate of just 0.5%. These results demonstrate that execution-time structural intervention improves safety without disrupting correct agent behavior.
- Abstract(参考訳): 大きな言語モデルエージェントがツールや外部環境にアクセスして自律的に運用するようになると、安全で信頼性の高い行動が重要になる。
GuardianAgentBench(GABench)は、LangChain、LlamaIndex、Vectaraの3つのプロダクション対応フレームワークで評価された6つのドメインにわたる580のシナリオのベンチマークである。
このベンチマークには厳格な多段階検証と5つの敵攻撃モードが組み込まれている。
6つの最先端モデルによる実験では、最強構成でさえ全体の74.8%の精度しか達成せず、2つの異なる障害体制が露呈している。
パフォーマンスはツールセットのサイズとシーケンシャルなターン深さの両方で単調に低下する。
我々のガードレールの実装は、全てのモデルにおけるシステムプロンプトベースの防御を一貫して上回り、19.9%の障害をわずか0.5%の偽陽性率で回復させる。
これらの結果は, 適切なエージェント動作を阻害することなく, 実行時構造介入により安全性が向上することを示した。
関連論文リスト
- FailBench: How Reliable are VLMs at Judging Robot Task Success? [0.0]
FailBenchは、14の公開ソースにわたる2,197回の操作を含むロボット故障検出のベンチマークである。
FailBenchでは、75%の障害が自然に発生し、6つの実世界のソースが非障害検出データセットから発生している。
論文 参考訳(メタデータ) (2026-09-03T09:58:55Z) - How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making [0.0]
大規模言語モデル(LLM)エージェントのプロダクションデプロイメントは、ベンチマーク成功率が着実に上昇しても、長期間のマルチステップでは信頼性が低いままである。
この効果を直接測定し, 分解剤の形状を特徴付けるとともに, その原因を解明する。
エージェントのオーケストレーションと信頼性を大規模に管理するチームにとって、これらの結果は地平線を考慮した評価と信頼性の予算化を主張する。
論文 参考訳(メタデータ) (2026-08-31T19:11:47Z) - Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing [8.293465530619246]
本稿では,2段階の非結合評価フレームワークを提案する。
我々は、マルチエージェント、モノリシック、グラフ駆動アーキテクチャをカバーする、オープンソースの5つの浸透試験エージェントを実証的に評価する。
論文 参考訳(メタデータ) (2026-06-24T02:51:58Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning [1.8047694351309207]
我々は、安全に配慮したオペレーターの信頼された特権にツールレスの敵が"タグを付ける"脅威モデルを定式化し、会話だけで禁止されたツールの使用を誘導する。
創発的攻撃ベクトルを自律的に発見する強化学習フレームワークであるSlingshotを紹介する。
我々の研究は、タッグ・アロング・アタックを第一級で検証可能な脅威モデルとして確立し、環境相互作用のみを通じて、既製のオープンウェイトモデルから効果的なエージェント・アタックが引き出されることを示す。
論文 参考訳(メタデータ) (2026-02-02T17:56:55Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。