論文の概要: DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing
- arxiv url: http://arxiv.org/abs/2607.28750v2
- Date: Wed, 05 Aug 2026 17:13:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:42.955258
- Title: DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing
- Title(参考訳): DragonCrawl: スケーラブルなモバイルエンドツーエンドテストのための生成、インテントベースのフレームワーク
- Authors: Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano,
- Abstract要約: DragonCrawlは、継続的回帰テストのためのAI駆動のモバイルテストシステムである。
コードの変更毎に特定のユーザフローを検証し、重要な機能を壊すコミットをブロックする。
iOSで91.6%、Androidで92.2%、CI/CDパイプラインで継続的に実行される1013の自動化テストで91.6%のパスレートを達成した。
- 参考スコア(独自算出の注目度): 3.0812793454543375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As mobile applications grow in complexity, traditional End-to-End (E2E) testing frameworks struggle with UI volatility, maintenance overhead, and cross-platform scalability. This paper presents DragonCrawl, an AI-driven mobile testing system for continuous regression testing that has evolved from embedding-based similarity matching to generative intent-based reasoning using large language models. Unlike prior LLM-based testing research focused on exploratory testing and crash detection, DragonCrawl validates specific user flows on every code change, blocking commits that break critical functionality. By leveraging GPT-4o's multimodal capabilities, DragonCrawl achieves 91.6% pass rate on iOS and 92.2% on Android across 1,013 automated tests running continuously in CI/CD pipelines. The system reduces test onboarding time from 96-120 hours to under 4 hours and has saved an estimated 27 developer years in test maintenance effort. We present the architectural evolution from V1 (semantic embedding matching) to V2 (generative intent-based reasoning), discuss implementation challenges including token explosion and memory constraints, and report operational experience from production deployment. The integration of multimodal vision for end-state detection and tool calling for backend state transitions enables comprehensive regression testing that bridges UI interactions with system state. Our results demonstrate that AI-driven testing can maintain stability while eliminating the brittleness of traditional automated tests, enabling continuous quality assurance at scale.
- Abstract(参考訳): モバイルアプリケーションが複雑化するにつれて、従来のエンドツーエンド(E2E)テストフレームワークはUIのボラティリティ、メンテナンスのオーバーヘッド、クロスプラットフォームのスケーラビリティに悩まされる。
本稿では,AIによる連続回帰テスト用モバイルテストシステムであるDragonCrawlについて述べる。
探索的テストとクラッシュ検出に焦点を当てた以前のLLMベースのテスト研究とは異なり、DragonCrawlは、コード変更毎に特定のユーザフローを検証することで、重要な機能を破壊するコミットをブロックする。
GPT-4oのマルチモーダル機能を活用することで、DragonCrawlはiOSで91.6%、Androidで92.2%のパスレートを達成した。
このシステムは、テスト実行時間を96~120時間から4時間未満に短縮し、テストメンテナンスに要する27年を節約した。
本稿では,V1(セマンティック埋め込みマッチング)からV2(生成意図に基づく推論)へのアーキテクチャの進化,トークンの爆発やメモリの制約といった実装上の課題について議論し,本運用環境からの運用経験を報告する。
バックエンド状態遷移のためのエンドツーエンド検出とツール呼び出しのためのマルチモーダルビジョンの統合により、システム状態とのUIインタラクションをブリッジする包括的な回帰テストが可能になる。
我々の結果は、AI駆動テストが従来の自動テストの脆さを排除し、安定性を維持し、大規模な品質保証を可能にすることを実証している。
関連論文リスト
- PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - Context-Aware Generative AI for Automated Telecom Test Script Generation [0.0024792470319550896]
既存のソリューションは、システムのスナップショットに対して静的テストスイートを生成する。
コード、構成、トポロジ、キーパフォーマンスインジケータ(KPI)が進化するにつれて、これらのテストはすぐに時代遅れになるか、ライブシステムと不一致になる。
本稿では,自動テレコムテストスクリプト生成のためのコンテキスト認識型生成AIフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-19T06:44:31Z) - Practical Limits of Autonomous Test Repair: A Multi-Agent Case Study with LLM-Driven Discovery and Self-Correction [0.0]
本稿では,実運用型エンタープライズUIテストプロトタイプの匿名実行データを用いて,マルチエージェント自律テストシステムの産業ケーススタディを提案する。
システムは、人間指向のテストからハイオートノミー機能発見とテスト実行へと進化する。
我々の研究結果によると、制限のない自律は不安定でしばしば誤解を招く結果をもたらすが、制約された自律はそのようなシステムを運用上実行可能なものにする。
論文 参考訳(メタデータ) (2026-05-02T14:39:55Z) - WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing [57.7131457251794]
エンドツーエンドの自動Webテストを評価するベンチマークであるWebTestBenchを紹介します。
テストプロセスを2つのカスケードサブタスク、チェックリストの生成と欠陥検出に分解し、WebTesterを提案する。
以上の結果から,現在のコンピュータ利用エージェント能力と産業レベルの展開要求との間に大きなギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-03-26T09:27:29Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Scaling Mobile Chaos Testing with AI-Driven Test Execution [2.7786234871633995]
大規模分散システムのモバイルアプリケーションは、バックエンドのサービス障害の影響を受けやすい。
従来のカオスエンジニアリングアプローチでは,フローやロケーション,障害シナリオの爆発によるモバイルテストのスケールアップは不可能だ。
LLMベースのモバイルテストプラットフォームであるDragonCrawlとサービスレベルの障害注入システムであるuHavocを統合した,自動モバイルカオステストシステムを提案する。
論文 参考訳(メタデータ) (2026-02-05T22:01:50Z) - ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks [37.79008306764891]
実世界のタスクは複雑で、複数の有効なソリューションが可能である。
オフラインベンチマークは、1つの事前定義された"ゴールドパス"のみを検証することができる
オンライン動的テストは、実際のデバイスの複雑さと非再現性によって制約される。
本稿では,新しいグラフ構造化ベンチマークフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-16T12:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。