論文の概要: WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
- arxiv url: http://arxiv.org/abs/2608.06474v1
- Date: Thu, 06 Aug 2026 18:06:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.259018
- Title: WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
- Title(参考訳): WebGrader: 自己進化型プログラムグレーダによるWeb開発のためのLLMのトレーニング
- Authors: Boshui Chen, Huiping Liu, Shaolei Zhang,
- Abstract要約: 本稿では,WebGraderを提案する。WebGraderは,各Webサイトからの対話フローを自律的に導出する,自己進化型プログラムグレーダである。
WebGraderは、生成されたプロジェクトをライブブラウザで実現し、ソースコードとライブDOMに対してターゲットアクションを接地し、ビジュアル、DOM、レスポンス、永続状態のエビデンスを収集します。
WebGen-Benchでは、WebGraderは8Bポリシーを52.01%の機能的な成功率にトレーニングし、マッチした外見+スクリプトの報酬を7.88ポイント上回り、o4-miniとDeepSeek-v4-flashを上回っている。
- 参考スコア(独自算出の注目度): 23.87868496043721
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models increasingly generate complete websites from natural-language descriptions, and reinforcement learning has become a central approach to closing their remaining functional gap. This training regime is bottlenecked by reward design. Hand-authored browser scripts are executable yet costly to write for open-ended requirements, while VLM and GUI-agent graders scale but may issue verdicts before observing the decisive state. We propose WebGrader, a self-evolving programmatic grader that autonomously derives the required interaction flows from each website request, represents each flow as an executable Flow Contract, and uses its execution outcome as an RL reward. WebGrader materializes the generated project in a live browser, grounds target actions against the source code and live DOM, and collects visual, DOM, response, and persistent-state evidence along the same browser trajectory. A residual-driven offline loop then discovers reusable verifier skills, screens them on disjoint validation pages, and freezes the promoted skill graph before policy training. By separating test planning, action grounding, evidence collection, and semantic judgment, WebGrader issues a Pass verdict only after observing the requested transition. On WebGen-Bench, WebGrader trains an 8B policy to a 52.01% functional success rate, outperforming a matched appearance-plus-script reward by 7.88 points and surpassing o4-mini and DeepSeek-v4-flash. On WG-core-250, the policy reaches a Full Score of 44.953 and surpasses Qwen3-Coder-480B.
- Abstract(参考訳): 大規模言語モデルは、自然言語の記述から完全なWebサイトを生成する傾向にあり、強化学習は、残りの機能的ギャップを埋めるための中心的なアプローチとなっている。
このトレーニング体制は報酬設計によってボトルネックになっている。
手書きのブラウザスクリプトは、オープンな要件のために書けるが、VLMとGUIエージェントグレーダーはスケールするが、決定的な状態を見る前に検証を発行する。
本稿では,WebGraderを提案する。WebGraderは,各Webサイト要求から要求される対話フローを自律的に導出し,各フローを実行可能なフローコントラクトとして表現し,その実行結果をRL報酬として利用する,自己進化型プログラムグレーダである。
WebGraderは、生成されたプロジェクトをライブブラウザで実現し、ソースコードとライブDOMに対してターゲットアクションを接地し、同じブラウザの軌道に沿ってビジュアル、DOM、レスポンス、永続的なエビデンスを収集します。
残余駆動のオフラインループは再利用可能なバリデーションスキルを発見し、不随意のバリデーションページでスクリーニングし、ポリシートレーニングの前にプロモートされたスキルグラフを凍結する。
テスト計画、アクショングラウンディング、エビデンスコレクション、セマンティックな判断を分離することで、WebGraderは要求された遷移を観察した後のみパスの判定を発行する。
WebGen-Benchでは、WebGraderは8Bポリシーを52.01%の機能的な成功率にトレーニングし、マッチした外見+スクリプトの報酬を7.88ポイント上回り、o4-miniとDeepSeek-v4-flashを上回っている。
WG-core-250では44.953のフルスコアに達し、Qwen3-Coder-480Bを上回っている。
関連論文リスト
- GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - MolmoWeb: Open Visual Web Agent and Open Data for the Open Web [60.29597961827816]
MolmoWebMixはブラウザのタスクとWeb-GUIの知覚データを組み合わせたものだ。
MolmoWeb-8Bは、完全にオープンなマルチモーダルWebエージェントのファミリーである。
我々は、Webエージェントのオープンな研究を可能にするため、モデルチェックポイント、トレーニングデータ、コード、統一された評価ハーネスをリリースする。
論文 参考訳(メタデータ) (2026-04-09T17:54:02Z) - Steward: Natural Language Web Automation [19.301371856154965]
大規模言語モデル(LLM)は、AIアシスタントの基盤として機能する優れた能力を示している。
我々は、低コストでスケーラブルでエンドツーエンドなWebインタラクション自動化ソリューションとして機能するように設計された、新しいLLMベースのWeb自動化ツールであるStewardを紹介します。
本稿では,状態表現,アクションシーケンス選択,システム応答性,タスク完了の検出,キャッシュ実装など,さまざまな設計と実装の課題について論じる。
論文 参考訳(メタデータ) (2024-09-23T18:06:32Z) - A Real-World WebAgent with Planning, Long Context Understanding, and
Program Synthesis [69.15016747150868]
本稿では,WebAgentについて紹介する。WebAgentは自己経験から学習し,実際のWebサイト上でタスクを完了させるエージェントである。
WebAgentは、指示を標準のサブ命令に分解し、長いHTMLドキュメントをタスク関連スニペットに要約し、ウェブサイトで作用する計画である。
我々は、我々のモジュラーレシピが実際のWebサイトの成功を50%以上改善し、HTML-T5が様々なHTML理解タスクを解決する最良のモデルであることを実証的に実証した。
論文 参考訳(メタデータ) (2023-07-24T14:56:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。