論文の概要: WebFovea: When the Model Is Right but the Click Is Wrong -- Reliable Round Trips for Vision-Based Web Agents on Live Websites
- arxiv url: http://arxiv.org/abs/2610.03036v1
- Date: Fri, 02 Oct 2026 09:18:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.298016
- Title: WebFovea: When the Model Is Right but the Click Is Wrong -- Reliable Round Trips for Vision-Based Web Agents on Live Websites
- Title(参考訳): WebFovea: モデルが正しいとき、クリックは間違っている -- 視覚ベースのWebエージェントをライブWebサイトで信頼性の高いラウンドトリップ
- Abstract要約: We present WebFovea, a vision-based web agent that placed 2nd in the WebRetriever Challenge 2026 with final score of 57.0 of 100。
この課題は、WebRetrieverベンチマークのProtocol IIIでエージェントをエンドツーエンドに評価する。
- 参考スコア(独自算出の注目度): 0.5076419064097734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present WebFovea, a vision-based web agent that placed 2nd in the WebRetriever Challenge 2026 with a final score of 57.0 out of 100. The challenge evaluates agents end to end on Protocol III of the WebRetriever benchmark (arXiv:2607.06118): starting from an entry URL on a live website, the agent must operate the site's own interface and return a verifiable answer. A capable multimodal large language model (LLM) is necessary for this, but not sufficient. The model's decisions reach the browser through the harness, the code between the model and the page. At every step, four things must go right: the model's reply must be parsed into the intended action, the action must take effect on the page, the result must be reported back accurately, and the model must be shown the information it needs. On real websites, many of the failures we observed occurred at one of these four stages rather than in the model's reasoning. A coordinate-space mismatch placed every click at 3/4 of its intended coordinates; actions on native dropdowns, inside iframes, and in text boxes failed silently; and self-generated chat-template tokens contaminated 4.9% of task episodes. WebFovea hardens each stage and surrounds the loop with guardrails that keep the agent within the rules and its budget. The four-stage view does not depend on the model, although some individual fixes do. Because we used the same model in all four submissions, the rise of our official hidden-set score from 31.0 to 57.0 reflects changes to the harness, up to run-to-run variance on live sites. We describe the design, the evidence for each component (including negative results), a failure analysis, the limitations, and a roadmap that includes routing different steps to different models.
- Abstract(参考訳): We present WebFovea, a vision-based web agent that placed 2nd in the WebRetriever Challenge 2026 with final score of 57.0 of 100。
この課題は、WebRetrieverベンチマークのProtocol III(arXiv:2607.06118): ライブWebサイトのエントリURLから始まるエージェントは、サイト自身のインターフェースを操作し、検証可能な回答を返す必要がある。
有能な多モーダル大言語モデル(LLM)が必要であるが、十分ではない。
モデルの決定は、ハーネス、モデルとページの間のコードを通じてブラウザに届く。
モデルの応答は意図したアクションに解析されなければならず、アクションはページ上で有効でなければならず、結果は正確に報告され、モデルは必要な情報を表示する必要がある。
実際のWebサイトでは、モデルの推論よりも、これらの4つのステージのうちの1つで、私たちが観察した失敗の多くが発生しました。
座標空間のミスマッチは、すべてのクリックを意図した座標の3/4に配置し、ネイティブドロップダウン、iframe内部、テキストボックス内のアクションは静かに失敗し、セルフ生成のチャットテンプレートトークンはタスクエピソードの4.9%を汚染した。
WebFoveaは各ステージを硬化させ、エージェントをルールとその予算内に保持するガードレールでループを囲む。
4段階のビューはモデルに依存しません。
同じモデルを4つの投稿すべてで使用したため、公式な隠れセットスコアが31.0から57.0に上昇したことは、ライブサイトにおける実行と実行のばらつきに対するハーネスの変化を反映しています。
設計、各コンポーネントのエビデンス(負の結果を含む)、障害分析、制限、さまざまなステップを異なるモデルにルーティングするロードマップについて説明する。
関連論文リスト
- Discriminative World Models for Web Agents [52.31107486410659]
最近のWebエージェントは、テストタイムアクションの選択に世界モデルを使用し、候補アクションをサンプリングし、結果のWeb状態を予測し、ランキングモデルまたはプロセスリワードモデル(PRM)でランキングする。
予測状態マッチング(英: predict-state matching)は、予測された表現が真の結果状態と、代替行動によって到達した状態とを区別しなければならない訓練目的である。
提案手法は,WebPRMBench上でのPRMスタイルのアクションランキングを改善する。
論文 参考訳(メタデータ) (2026-09-02T17:59:40Z) - WebWorld: The Browser as a World Model for Self-Improving Web Code [34.5278922037561]
WebWorldは、VLMがこのブラウザ・アズ・ワールド・モデルと自律的に対話することを可能にする。
WebWorld-27BはRaw-27BをHTMLBench-400で5.3ポイント、MiniAppBench-Valで14.9ポイント改善した。
論文 参考訳(メタデータ) (2026-08-31T10:00:12Z) - BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes [54.96895469970198]
BrowserForgeは、オープンなWeb上で多くのブラウザサンドボックスを並行して駆動することで、大規模なWebインタラクションデータを生成する。
BrowserForgeには3つのコンポーネントがある: オープンなWebソーシングステージ。
ルール+モデルクリーニングパイプラインは、失敗した実行を除去し、生き残った推論を単一の統合されたチェーン・オブ・シンクスタイルに書き換える。
論文 参考訳(メタデータ) (2026-08-25T17:35:42Z) - WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader [23.87868496043721]
本稿では,WebGraderを提案する。WebGraderは,各Webサイトからの対話フローを自律的に導出する,自己進化型プログラムグレーダである。
WebGraderは、生成されたプロジェクトをライブブラウザで実現し、ソースコードとライブDOMに対してターゲットアクションを接地し、ビジュアル、DOM、レスポンス、永続状態のエビデンスを収集します。
WebGen-Benchでは、WebGraderは8Bポリシーを52.01%の機能的な成功率にトレーニングし、マッチした外見+スクリプトの報酬を7.88ポイント上回り、o4-miniとDeepSeek-v4-flashを上回っている。
論文 参考訳(メタデータ) (2026-08-06T18:06:12Z) - What-If World: A Causal Benchmark for General World Models in Embodied Scenarios [23.527918480081013]
ビデオ生成モデルは、運転やロボット操作といったタスクのための世界シミュレータとして、ますます使われている。
これらの設定で重要なのは、単一のビデオが正しく見えるかどうかではなく、入力が変わったときにモデルの出力が変わるかどうかです。
我々は、同じシーンを1つの物理的詳細で記述した2つのプロンプトをモデルに与え、この2つのビデオが物理の予測方法が異なるかどうかを確認することによって、これを検証した。
論文 参考訳(メタデータ) (2026-05-26T19:02:26Z) - WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation [56.5415838759151]
WBenchはインタラクティブな世界モデルを評価するための総合的なベンチマークである。
ビデオの品質、セッティングアテンジェンス、インタラクションアテンデンス、一貫性、物理コンプライアンスをカバーしている。
289件のテストケースと1,058件のインタラクション・ターンが含まれており、多様なシーン、スタイル、主題、一対三の視点をカバーしている。
論文 参考訳(メタデータ) (2026-05-25T14:01:31Z) - MolmoWeb: Open Visual Web Agent and Open Data for the Open Web [60.29597961827816]
MolmoWebMixはブラウザのタスクとWeb-GUIの知覚データを組み合わせたものだ。
MolmoWeb-8Bは、完全にオープンなマルチモーダルWebエージェントのファミリーである。
我々は、Webエージェントのオープンな研究を可能にするため、モデルチェックポイント、トレーニングデータ、コード、統一された評価ハーネスをリリースする。
論文 参考訳(メタデータ) (2026-04-09T17:54:02Z) - WebLINX: Real-World Website Navigation with Multi-Turn Dialogue [23.71601972991744]
WEBLINXは,対話型Webナビゲーションの2300人の専門家による実演における100Kインタラクションのベンチマークである。
私たちのベンチマークでは、150以上の現実世界のWebサイト上の幅広いパターンをカバーし、さまざまなシナリオにおけるエージェントのトレーニングと評価に使用しています。
選択した要素とスクリーンショットとアクション履歴を使用して、Webをナビゲートする際の人間の振る舞いを再現するさまざまなモデルを評価します。
論文 参考訳(メタデータ) (2024-02-08T18:58:02Z) - Multimodal Web Navigation with Instruction-Finetuned Foundation Models [99.14209521903854]
視覚言語基礎モデルを用いたWebエージェントのためのデータ駆動オフライントレーニングについて検討する。
本稿では,WebページのスクリーンショットとHTMLページの両方を観察する命令追従型マルチモーダルエージェントWebGUMを提案する。
このレシピは,マルチモーダル認識,HTML理解,マルチステップ推論といったエージェントの能力を向上させることを実証的に実証する。
論文 参考訳(メタデータ) (2023-05-19T17:44:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。