論文の概要: MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation
- arxiv url: http://arxiv.org/abs/2607.10079v1
- Date: Sat, 11 Jul 2026 02:08:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.288865
- Title: MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation
- Title(参考訳): MAG:マルチモーダルアクションとガイド生成のためのWebエージェントベンチマークとハーネス
- Abstract要約: MAGは、タスク実行を統一し、単一のマルチモーダルアクションとガイドタスクに書き込みをガイドする最初のベンチマークである。
我々は、この複合作業のための完全なハーネスを構築し、LLMアシストと人間による検証、トレーニング、ライブ環境の評価、詳細な分析を報告した。
最強のモデルでさえタスクの40%以下を完了し、将来の研究に十分な余地を残している。
- 参考スコア(独自算出の注目度): 11.543353599329675
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digital Adoption Platforms (DAPs) are embedded overlays widely used on web systems to guide users through operations inside a page, helping them get started with unfamiliar interfaces quickly. Completing a real task, however, rarely means clicking a few buttons on a single page: it takes a sequence of actions that unfolds across changing page states. Prior studies have also treated automated web agent actions and guide text generation as two separate problems, and most of them feed models textual page representations such as the DOM or accessibility trees rather than the rendered screens that humans actually operate on. In this work we introduce MAG, the first benchmark that unifies task execution and guide writing into a single Multimodal Action and Guide task, with two grounding schemes over screenshots: Set-of-Mark element selection and raw pixel coordinates. We further build a complete harness for this compound task, covering annotation with LLM assistance and human verification, training, evaluation in live environments, and joint metrics for actions and guides. With this harness we evaluate frontier API models and open multimodal models, and report detailed analyses. Finally, we design a GRPO training method augmented with expert trajectories, which nearly doubles the success rate of a supervised 9B agent (from 6.9% to 13.2%) and improves guide quality at the same time. Even the strongest model completes fewer than 40% of the tasks, leaving ample room for future research.
- Abstract(参考訳): Digital Adoption Platforms (DAP) は、Webシステムで広く使われている組み込みオーバーレイで、ページ内の操作を通じてユーザを誘導し、不慣れなインターフェースを素早く始めるのに役立つ。
しかし、実際のタスクを補完することは、単一のページでボタンを数回クリックすることを意味することは滅多にない。
以前の研究では、自動Webエージェントアクションとガイドテキスト生成を2つの別の問題として扱い、その多くは、人間が実際に操作するレンダリング画面ではなく、DOMやアクセシビリティツリーのようなテキストページ表現のモデルを提供する。
本研究では,タスク実行とガイド記述をひとつのマルチモーダルアクションとガイドタスクに統合する最初のベンチマークであるMAGを紹介した。
我々はさらに、この複合作業のための完全なハーネスを構築し、LCMアシストと人間の検証、トレーニング、ライブ環境の評価、アクションとガイドのジョイントメトリクスを含むアノテーションを網羅する。
このハーネスを用いて、フロンティアAPIモデルとオープンマルチモーダルモデルを評価し、詳細な分析を報告する。
最後に,教師付き9Bエージェント(6.9%から13.2%)の成功率をほぼ2倍にし,ガイド品質を同時に向上するGRPOトレーニング手法を設計する。
最強のモデルでさえタスクの40%以下を完了し、将来の研究に十分な余地を残している。
関連論文リスト
- Beyond Domains: Reusing Web Skills via Transferable Interaction Patterns [68.0603867264595]
SkillMigratorは再利用可能なWebスキルを学習し、特定の要素参照ではなくレイアウト構造にマッチしてサイト間でそれらを転送する。
WebArenaとMind2Webの両方において、成功軌道上の平均LCM-アクション数を、一致した成功速度で8-10%削減する。
論文 参考訳(メタデータ) (2026-06-16T08:04:35Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials [53.376263056033046]
既存のアプローチは高価な人間のアノテーションに依存しており、大規模には持続不可能である。
本稿では,Webエージェントトラジェクトリを生成するスケーラブルなデータ合成パイプラインであるAgentTrekを提案する。
完全に自動化されたアプローチは、データ収集コストを大幅に削減し、人間のアノテータを使わずに、高品質な軌道を0.55ドルに抑えることができます。
論文 参考訳(メタデータ) (2024-12-12T18:59:27Z) - AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents [52.13695464678006]
本研究は, 観察空間と行動空間を簡略化することで, LLMベースのWebエージェントを強化する。
AgentOccam は以前の最先端および同時処理を 9.8 (+29.4%) と 5.9 (+15.8%) で上回っている。
論文 参考訳(メタデータ) (2024-10-17T17:50:38Z) - AppAgent v2: Advanced Agent for Flexible Mobile Interactions [57.98933460388985]
本研究は,モバイル機器向けの新しいLLMベースのマルチモーダルエージェントフレームワークを提案する。
我々のエージェントは、様々なアプリケーションにまたがる適応性を高めるフレキシブルなアクション空間を構築する。
本研究は,実世界のシナリオにおいて,フレームワークの優れた性能を実証し,その有効性を確認した。
論文 参考訳(メタデータ) (2024-08-05T06:31:39Z) - MMInA: Benchmarking Multihop Multimodal Internet Agents [36.173995299002]
本稿では,マルチホップとマルチモーダルのベンチマークであるMMInAについて述べる。
私たちのデータには、ショッピングや旅行など、さまざまな分野をカバーする1050の人書きタスクが含まれています。
マルチホップタスクの完了におけるエージェントの進捗を評価するための新しいプロトコルを提案する。
論文 参考訳(メタデータ) (2024-04-15T17:59:50Z) - Do BERTs Learn to Use Browser User Interface? Exploring Multi-Step Tasks
with Unified Vision-and-Language BERTs [33.30962388481026]
我々は,Webページで実装されたグラフィカルユーザインタフェースを複数のステップで操作することで,モデルがタスクを実行するフレームワークを開発する。
BERT拡張をこれらのタスクページと共同でトレーニングし、以下の結果を得た。
以上の結果から, BERTをGUIによるマルチステップタスクに微調整できること, 一般化性の向上の余地があることが示唆された。
論文 参考訳(メタデータ) (2022-03-15T12:32:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。