論文の概要: Autonomous Intelligent Agents for Natural-Language-Driven Web Execution with Integrated Security Assurance
- arxiv url: http://arxiv.org/abs/2605.15281v1
- Date: Thu, 14 May 2026 18:00:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 17:44:16.266906
- Title: Autonomous Intelligent Agents for Natural-Language-Driven Web Execution with Integrated Security Assurance
- Title(参考訳): 統合型セキュリティ保証を用いた自然言語駆動型Web実行のための自律的インテリジェントエージェント
- Authors: Vinil Pasupuleti, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi,
- Abstract要約: 本稿では、ナビゲーション信頼性、コンテキスト対応セレクタ生成、ポストジェネレーションバリデーション、スマートウェイトインジェクション、障害学習に対処するAI駆動の自律テストフレームワークを提案する。
4つのプロダクションアプリケーションと176のシナリオで評価されたこのフレームワークは、スクリプト生成の成功を55%から93%に改善し、ナビゲーション障害を8倍削減し、タイミング関連の競合条件の80%を排除し、手動のSeleniumオーサリングと比較してテスト生成時間を75%短縮する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern web test suites rot. A UI refactor breaks locators, a timing change causes race conditions, and within weeks developers abandon the suite entirely. This paper presents an AI-driven autonomous testing framework that addresses these failure modes through five integrated strategies - navigation reliability, context-aware selector generation, post-generation validation, smart wait injection, and failure learning - implemented over a containerised worker architecture that decouples orchestration from long-running browser execution. Evaluated across four production applications and 176 scenarios, the framework improves script generation success from 55% to 93%, achieves an 8x reduction in navigation failures, eliminates 80% of timing-related race conditions, and reduces test creation time by 75% compared to manual Selenium authoring. The framework extends naturally to security validation: testers describe attack scenarios in plain English - "try accessing another user's invoice" - which the agent converts to OWASP Top 10-aligned browser probes, detecting 85% of authentication bypass vulnerabilities and 95% of input validation flaws with false positive rates below 12%. Natural-language-driven security testing of this kind represents, to our knowledge, a novel contribution to the field.
- Abstract(参考訳): 現代のWebテストスイートは腐っている。
UIリファクタリングがロケータを壊し、タイミング変更が競合状態を引き起こし、数週間以内に開発者はスイートを完全に放棄する。
本稿では、ナビゲーション信頼性、コンテキスト対応セレクタ生成、ポストジェネレーションバリデーション、スマートウェイトインジェクション、障害学習という5つの統合戦略を通じて、これらの障害モードに対処するAI駆動の自律テストフレームワークを提案する。
4つのプロダクションアプリケーションと176のシナリオで評価されたこのフレームワークは、スクリプト生成の成功を55%から93%に改善し、ナビゲーション障害の8倍の削減を実現し、タイミング関連の競合条件の80%を排除し、手動のSeleniumオーサリングと比較してテスト生成時間を75%削減する。
エージェントがOWASPトップ10のブラウザプローブに変換し、認証バイパス脆弱性の85%、入力バリデーション欠陥の95%を12%以下の偽陽性率で検出する。
この種の自然言語駆動型セキュリティテストは、私たちの知る限り、この分野に新しい貢献をしてくれる。
関連論文リスト
- Practical Limits of Autonomous Test Repair: A Multi-Agent Case Study with LLM-Driven Discovery and Self-Correction [0.0]
本稿では,実運用型エンタープライズUIテストプロトタイプの匿名実行データを用いて,マルチエージェント自律テストシステムの産業ケーススタディを提案する。
システムは、人間指向のテストからハイオートノミー機能発見とテスト実行へと進化する。
我々の研究結果によると、制限のない自律は不安定でしばしば誤解を招く結果をもたらすが、制約された自律はそのようなシステムを運用上実行可能なものにする。
論文 参考訳(メタデータ) (2026-05-02T14:39:55Z) - WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing [57.7131457251794]
エンドツーエンドの自動Webテストを評価するベンチマークであるWebTestBenchを紹介します。
テストプロセスを2つのカスケードサブタスク、チェックリストの生成と欠陥検出に分解し、WebTesterを提案する。
以上の結果から,現在のコンピュータ利用エージェント能力と産業レベルの展開要求との間に大きなギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-03-26T09:27:29Z) - SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments [1.6149725696651924]
SpecOpsはGUIベースのAIエージェントを現実の環境で評価するために設計された、新しい完全に自動化されたテストフレームワークである。
エンドツーエンドのタスクコヒーレンス、堅牢なエラー処理、さまざまなエージェントプラットフォームへの適応性など、重要な課題に対処する。
F1スコア0.89の現実世界のエージェントの164の真のバグを識別する。
論文 参考訳(メタデータ) (2026-03-10T22:56:03Z) - AWE: Adaptive Agents for Dynamic Web Penetration Testing [0.0]
AWEは、自動Web侵入テストのためのメモリ拡張マルチエージェントフレームワークである。
軽量なLLMオーケストレーション層に、構造化された脆弱性固有の分析パイプラインを組み込む。
AWEはインジェクションクラスの脆弱性を大幅に向上させる。
論文 参考訳(メタデータ) (2026-03-01T07:32:42Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Building Browser Agents: Architecture, Security, and Practical Solutions [0.0]
本稿では,実運用ブラウザエージェントの構築と運用から得られた知見について述べる。
モデル能力はエージェントのパフォーマンスを制限しない。
現実世界のインシデントに対するセキュリティ分析は、インジェクションの迅速な攻撃によって、汎用的な自律運転が基本的に安全でないことを明らかにしている。
論文 参考訳(メタデータ) (2025-11-22T12:18:35Z) - MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models [10.977990951788422]
我々は、HTML/DOMを読み、Seleniumを出力することで、LLMが再利用可能なブラウザ自動プログラム(マクロ)を自然言語で合成できるかどうかを評価するコードファーストベンチマークであるMacroBenchを紹介した。
MacroBenchは、681のタスクをカバーする7つのセルフホストサイトを、インタラクションの複雑さとターゲティングの難しさでインスタンス化する。
GPT-4o-mini (96.8%), GPT-4o (95.3%), Gemini (89.0%), DeepSeek (83.4%)
論文 参考訳(メタデータ) (2025-10-05T21:15:11Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety [58.201189860217724]
OpenAgentSafetyは,8つの危機リスクカテゴリにまたがるエージェントの動作を評価する包括的なフレームワークである。
従来の作業とは異なり、我々のフレームワークは、Webブラウザ、コード実行環境、ファイルシステム、bashシェル、メッセージングプラットフォームなど、実際のツールと対話するエージェントを評価します。
ルールベースの分析とLSM-as-judgeアセスメントを組み合わせることで、過度な行動と微妙な不安全行動の両方を検出する。
論文 参考訳(メタデータ) (2025-07-08T16:18:54Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。