論文の概要: WebUIProof: Benchmarking WebUI Code Generators with UI-Agent Execution Harness
- arxiv url: http://arxiv.org/abs/2610.02617v1
- Date: Fri, 02 Oct 2026 00:17:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.134716
- Title: WebUIProof: Benchmarking WebUI Code Generators with UI-Agent Execution Harness
- Title(参考訳): WebUIProof: UI-Agent Execution HarnessによるWebUIコードジェネレータのベンチマーク
- Abstract要約: 我々は、WebUI生成のための構造化仕様と高密度で実行可能なインタラクションテストを提供する、実行指向のベンチマークであるWebUIProofを紹介します。
WebUIProofには、ヘッドレスブラウザで実行可能なインタラクションテストを実行するUIエージェントハーネスが含まれている。
我々は,8つの商用LCMを評価し,ページのレンダリングに成功しても,インタラクションベースの要求に対して頻繁な障害を観測する。
- 参考スコア(独自算出の注目度): 36.90262479036216
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating WebUI code generation at scale is difficult: outputs may compile and look plausible yet fail under user interaction, and prior benchmarks largely rely on free-form prompts with static checks (build success, screenshots) that miss functional correctness. We introduce WebUIProof, an execution-oriented benchmark that provides structured specifications and dense, executable interaction tests for WebUI generation across two task families: general WebUIs (e.g., dashboards, game, interactive tools) and 3D interactive simulation (e.g., particle/galaxy systems, physics dynamics). WebUIProof includes a UI-agent harness that runs executable interaction tests in a headless browser using an iterative plan--act--observe loop: it locates DOM elements, performs actions, observes resulting UI/DOM changes, and checks the specified assertions. We evaluate across eight commercial LLMs and observe frequent failures on interaction-based requirements even when pages render successfully, especially on 3D simulation interfaces. Finally, we show the UI-agent harness can provide outcome-level training signals. Training compact models (e.g., Qwen2.5 14B and MIMO 7B) with RL rewards derived from executable interaction tests improves functional completion while reducing build failures.
- Abstract(参考訳): アウトプットはコンパイル可能で、ユーザインタラクション下では失敗する可能性があるし、以前のベンチマークは、機能的正確性を欠く静的チェック(ビルド成功、スクリーンショット)によるフリーフォームプロンプトに大きく依存している。
一般的なWebUI(ダッシュボード、ゲーム、インタラクティブツール)と3Dインタラクティブシミュレーション(例えば、粒子/銀河系、物理力学)である。
WebUIProofには、繰り返しプラン-act-observeループを使用してヘッドレスブラウザで実行可能なインタラクションテストを実行するUIエージェントハーネスが含まれている。
我々は8つの商用LCMを評価し,特に3次元シミュレーションインタフェースにおいてページのレンダリングに成功しても,インタラクションベースの要求に対して頻繁な障害を観測した。
最後に、UIエージェントハーネスが結果レベルのトレーニング信号を提供できることを示す。
例えば、Qwen2.5 14B、MIMO 7Bといったコンパクトモデルと、実行可能な相互作用テストから得られるRL報酬のトレーニングは、ビルド失敗を低減しながら機能補完を改善する。
関連論文リスト
- RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents [53.51359930826217]
真のデジタルワークには、端から端まで積み重ねるのではなく、両方をインターリーブする必要があります。
インターフェースを探索し、ソフトウェアを実装し、それらのアーティファクトを実行し、視覚的に検証するタイミングを自律的に決定するハイブリッドCUAについて研究する。
レクリエーションを中心に構築された5プラットフォームフレームワークであるRecreationWorldを紹介します。
論文 参考訳(メタデータ) (2026-09-18T17:00:56Z) - UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation [35.72992007209751]
インタラクション推論をターゲットとする最初のベンチマーク、スクリーンショットのみからアプリケーションの振る舞いを復元する機能を紹介します。
UI2Appは、実行可能なマルチルートWebアプリケーションのための45のステートコヒーレントスクリーンショットセットにグループ化された327のスクリーンショットで構成されている。
実行可能性、ナビゲーション到達性、視覚的忠実性、相互作用推論の4つの次元に沿って、各アーティファクトを評価するエンドツーエンドパイプラインを設計する。
論文 参考訳(メタデータ) (2026-07-07T14:08:55Z) - WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing [57.7131457251794]
エンドツーエンドの自動Webテストを評価するベンチマークであるWebTestBenchを紹介します。
テストプロセスを2つのカスケードサブタスク、チェックリストの生成と欠陥検出に分解し、WebTesterを提案する。
以上の結果から,現在のコンピュータ利用エージェント能力と産業レベルの展開要求との間に大きなギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-03-26T09:27:29Z) - WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation [30.193562985137813]
インタラクティブなUI-to-Code生成とバリデーションのための最初のエージェントフレームワークであるWebVIAを提案する。
フレームワークには,1)マルチステートUIスクリーンショットをキャプチャする探索エージェント,2)実行可能なインタラクティブコードを生成するUI2Codeモデル,3)対話性を検証する検証モジュールの3つのコンポーネントが含まれている。
論文 参考訳(メタデータ) (2025-11-09T06:58:52Z) - Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs [0.5965410190046627]
本稿では,Webアプリケーションの2つの重要な側面であるサイトナビゲーションとフォームフィリングのためのテストケース自動生成システムを提案する。
サイトナビゲーションでは、画面遷移グラフとLCMを使用してナビゲーションフローをモデル化し、テストシナリオを生成する。
フォームフィリングにはステートグラフを使用して条件付きフォームを処理し、Seleniumスクリプト生成を自動化する。
論文 参考訳(メタデータ) (2025-06-03T07:08:21Z) - UI-TARS: Pioneering Automated GUI Interaction with Native Agents [58.18100825673032]
本稿では,GUIエージェントのネイティブモデルであるUI-TARSを紹介する。
OSWorldベンチマークでは、UI-TARSはスコアが24.6、50ステップが22.7、15ステップが22.7でクロード(それぞれ22.0と14.9)を上回っている。
論文 参考訳(メタデータ) (2025-01-21T17:48:10Z) - Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping [57.024913536420264]
MLLM(Multimodal Large Language Models)は、設計からコードへのタスクにおいて顕著な性能を示す。
本稿では,インタラクティブなWebページを生成する上で,MLLMを初めて体系的に研究する。
論文 参考訳(メタデータ) (2024-11-05T17:40:03Z) - AUITestAgent: Automatic Requirements Oriented GUI Function Testing [12.83932274541321]
本稿では,モバイルアプリ用の初の自動自然言語駆動GUIテストツールであるAUITestAgentを紹介する。
GUIインタラクションと機能検証の全プロセスを完全に自動化することができる。
カスタマイズされたベンチマークの実験では、AUITestAgentが生成されたGUIインタラクションの品質で既存のツールより優れていることが示されている。
論文 参考訳(メタデータ) (2024-07-12T06:14:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。