論文の概要: CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
- arxiv url: http://arxiv.org/abs/2608.08392v1
- Date: Sun, 09 Aug 2026 01:08:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.80051
- Title: CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception
- Title(参考訳): CAP:複雑なアクションと知覚を備えたクロスサイトブラウザエージェント評価のためのスケーラブルなベンチマーク
- Abstract要約: 大規模な言語モデルは、ブラウザを介してWebと対話する自律的なエージェントとして、ますます多くデプロイされている。
我々は、クロスサイト、ヒューマンライクなWebタスク上でブラウザエージェントを評価するためのスケーラブルなベンチマークであるCAPを紹介した。
108の現実世界のWebサイトと24のドメインに420のタスクを構築し、注意深く品質管理します。
- 参考スコア(独自算出の注目度): 22.620664364045286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly deployed as autonomous agents that interact with the web through browsers. While recent progress has been driven by benchmarks that evaluate end-to-end task success, these evaluations largely overlook two fundamental sources of difficulty in real web browsing: complex actions over rich user interfaces and visual perception of dynamically rendered content, especially in workflows that span multiple websites. We introduce CAP, a scalable benchmark for evaluating browser agents on cross-site, human-like web tasks that require non-trivial UI interactions and visual understanding. Specifically, we adopt a decomposition-and-recomposition pipeline that first abstracts each website into a structured site card capturing user-facing functions, complex execution operations, and perceptual requirements, and then recomposes these components into realistic cross-site workflows. Each task is therefore grounded in multiple specific operations on each website, enabling fine-grained diagnosis. Built on this framework, we construct 420 tasks across 108 real-world websites and 24 domains under careful quality control. Experiments on state-of-the-art browser agents using our verifiable agent-as-a-judge evaluation framework show low success rates and reveal that perception-heavy interactions remain a major bottleneck, exposing substantial gaps between current agents and real-world web browsing demands.
- Abstract(参考訳): 大規模な言語モデルは、ブラウザを介してWebと対話する自律的なエージェントとして、ますます多くデプロイされている。
最近の進歩は、エンドツーエンドのタスク成功を評価するベンチマークによって推進されているが、これらの評価は、実際のWebブラウジングにおける難しさの2つの基本的な源である、リッチなユーザインタフェースに対する複雑なアクションと、動的にレンダリングされたコンテンツの視覚的認識、特に複数のWebサイトをまたがるワークフローを見落としている。
CAPは、非自明なUIインタラクションと視覚的理解を必要とするクロスサイト、ヒューマンライクなWebタスク上で、ブラウザエージェントを評価するためのスケーラブルなベンチマークである。
具体的には、まず各Webサイトを、ユーザ対応機能、複雑な実行操作、知覚的要求をキャプチャする構造化サイトカードに抽象化し、これらのコンポーネントを現実的なクロスサイトワークフローに再構成する分解分解分解パイプラインを採用する。
そのため、各タスクは、各Webサイト上の複数の特定の操作に基礎を置いており、きめ細かい診断を可能にしている。
このフレームワーク上に構築され、108の現実世界のWebサイトと24のドメインにわたる420のタスクを、注意深く品質管理の下で構築します。
検証可能なエージェント・アズ・ア・ジャッジ評価フレームワークを用いた最先端ブラウザエージェントの実験では、成功率が低く、認識と重大な相互作用が依然として大きなボトルネックであり、現在のエージェントと現実世界のWebブラウジングの要求との間にかなりのギャップがあることが判明した。
関連論文リスト
- WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation [26.889929086766003]
Webエージェントは、タスクの自動実行の能力をますます示しています。
既存のベンチマークでは、スケールが不十分で、ドメインの多様性が制限されている。
800のWebサイトと1,550のタスクを含む大規模なベンチマークであるWebRetrieverを紹介します。
論文 参考訳(メタデータ) (2026-07-07T10:27:31Z) - Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments [67.2234316079859]
GauntletBenchは、挑戦的なシナリオでエージェントの一般化を評価するためのWebベースのベンチマークである。
調査されていない5つのプロフェッショナルアプリケーションにわたる3つの機能(時間的知覚、グラフィカルな理解、そして3D推論)に焦点を当てている。
実験結果から,フロンティアエージェントシステムは人間レベルの性能を達成するには程遠いことが判明した。
論文 参考訳(メタデータ) (2026-06-12T12:32:24Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - WebSP-Eval: Evaluating Web Agents on Website Security and Privacy Tasks [10.738768990548428]
WebSP-EvalはWebエージェントのパフォーマンスをWebサイトのセキュリティとプライバシのタスクで測定するための評価フレームワークである。
WebSP-Evalは、1)28のWebサイトにわたる200のタスクインスタンスからなる手作業によるタスクデータセット、2)カスタムのGoogle Chromeエクステンションを使用して実行中のアカウントと初期状態管理をサポートする堅牢なエージェントシステム、3)自動評価器で構成される。
我々は、最先端のマルチモーダル言語モデルを用いて8つのWebエージェントのインスタンス化を評価し、Webサイト、タスクカテゴリ、UI要素間できめ細かい分析を行う。
論文 参考訳(メタデータ) (2026-04-07T18:43:21Z) - Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification [27.677130026020006]
Vision2Webは、静的UIからコード生成からフルスタック開発まで、ビジュアルWebサイト開発のための階層的なベンチマークである。
ベンチマークには16のカテゴリで合計193のタスクが含まれており、918のプロトタイプイメージと1,255のテストケースが含まれている。
我々は、異なるコーディングエージェントフレームワークでインスタンス化された複数のビジュアル言語モデルを評価し、すべてのタスクレベルでの大幅なパフォーマンスギャップを明らかにした。
論文 参考訳(メタデータ) (2026-03-27T17:50:45Z) - Nested Browser-Use Learning for Agentic Information Seeking [60.775556172513014]
情報検索(IS)エージェントは広範囲にわたる検索タスクで高いパフォーマンスを達成しているが、ツールの使用はAPIレベルのスニペット検索やURLベースのページフェッチに限られている。
我々はNested Browser-Use Learning (NestBrowse)を提案する。NestBrowseは、ネストされた構造を通してページ探索からインタラクション制御を分離する最小かつ完全なブラウザアクションフレームワークである。
論文 参考訳(メタデータ) (2025-12-29T17:59:14Z) - BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks [51.803138848305814]
我々はBrowserArenaを紹介した。BrowserArenaは、ユーザから送信されたタスクを収集するオープンソースのエージェント評価プラットフォームである。
Captcha解決、ポップアップバナー削除、URLへのダイレクトナビゲーションの3つの一貫した障害モードを特定します。
本研究は,Webエージェントの多様性と脆性の両方を明らかにする。
論文 参考訳(メタデータ) (2025-10-02T15:22:21Z) - IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video? [56.33950760097989]
IWR-Benchは、ビデオからインタラクティブなWebページ再構築におけるLVLM(Large Vision-Language Models)の機能を評価するための新しいベンチマークである。
IWR-Benchは100の現実世界のウェブサイトから1,001のアクションで1,3の精巧にキュレートされたタスクで構成されている。
このベンチマークは、ビデオとアセットからインタラクションロジックを推論する包括的なマルチモーダル推論と、このロジックを関数コードに変換するための高度なコード生成という、2つの基本的な課題に関するモデルを評価する。
論文 参考訳(メタデータ) (2025-09-29T12:38:06Z) - REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites [9.58858258192147]
実世界のWebサイトの決定論的シミュレーションにおけるマルチターンエージェント評価のためのベンチマークおよびフレームワークであるREALを紹介する。
また、日々の複雑なユーザインタラクションを反映した112の実践的なタスクからなるベンチマークもリリースしています。
我々のフレームワークは、新しいタスクの容易な統合、再現可能な評価、スケーラブルな後学習データ生成をサポートします。
論文 参考訳(メタデータ) (2025-04-15T18:22:55Z) - The BrowserGym Ecosystem for Web Agent Research [151.90034093362343]
BrowserGymエコシステムは、Webエージェントの効率的な評価とベンチマークの必要性の高まりに対処する。
本稿では,Webエージェント研究のためのBrowserGymベースの拡張エコシステムを提案する。
大規模なマルチベンチマークWebエージェント実験を初めて実施し、6つのWebエージェントベンチマークで6つの最先端LCMの性能を比較した。
論文 参考訳(メタデータ) (2024-12-06T23:43:59Z) - From Context to Action: Analysis of the Impact of State Representation and Context on the Generalization of Multi-Turn Web Navigation Agents [7.41862656697588]
本研究の目的は,Webナビゲーションエージェントの機能に不可欠な様々なコンテキスト要素を解析することである。
インタラクション履歴とWebページ表現の影響に焦点を当てる。
当社の作業は、アウト・オブ・ディストリビューションシナリオにおけるエージェントパフォーマンスの向上を強調しています。
論文 参考訳(メタデータ) (2024-10-31T01:51:41Z) - VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks [93.85005277463802]
VisualWebArenaは、マルチモーダルWebエージェントのパフォーマンスを現実的なタスクで評価するために設計されたベンチマークである。
このベンチマークを実行するには、イメージテキスト入力を正確に処理し、自然言語命令を解釈し、ユーザが定義した目的を達成するためにウェブサイト上でアクションを実行する必要がある。
論文 参考訳(メタデータ) (2024-01-24T18:35:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。