論文の概要: Mango: Multi-Agent Web Navigation via Global-View Optimization
- arxiv url: http://arxiv.org/abs/2604.18779v1
- Date: Mon, 20 Apr 2026 19:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-22 22:41:49.454724
- Title: Mango: Multi-Agent Web Navigation via Global-View Optimization
- Title(参考訳): Mango: グローバルビュー最適化によるマルチエージェントWebナビゲーション
- Authors: Weixi Tong, Yifeng Di, Tianyi Zhang,
- Abstract要約: 既存のWebエージェントは通常、ルートURLからの探索を開始するが、これは深い階層構造を持つ複雑なウェブサイトでは非効率である。
ウェブサイト構造を利用して最適な出発点を動的に決定するマルチエージェントWebナビゲーション手法であるMangoを提案する。
- 参考スコア(独自算出の注目度): 6.132360707355468
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing web agents typically initiate exploration from the root URL, which is inefficient for complex websites with deep hierarchical structures. Without a global view of the website's structure, agents frequently fall into navigation traps, explore irrelevant branches, or fail to reach target information within a limited budget. We propose Mango, a multi-agent web navigation method that leverages the website structure to dynamically determine optimal starting points. We formulate URL selection as a multi-armed bandit problem and employ Thompson Sampling to adaptively allocate the navigation budget across candidate URLs. Furthermore, we introduce an episodic memory component to store navigation history, enabling the agent to learn from previous attempts. Experiments on WebVoyager demonstrate that Mango achieves a success rate of 63.6% when using GPT-5-mini, outperforming the best baseline by 7.3%. Furthermore, on WebWalkerQA, Mango attains a 52.5% success rate, surpassing the best baseline by 26.8%. We also demonstrate the generalizability of Mango using both open-source and closed-source models as backbones. Our data and code are open-source and available at https://github.com/VichyTong/Mango.
- Abstract(参考訳): 既存のWebエージェントは通常、ルートURLからの探索を開始するが、これは深い階層構造を持つ複雑なウェブサイトでは非効率である。
ウェブサイトの構造のグローバルな見方がなければ、エージェントはしばしばナビゲーショントラップに陥り、無関係な枝を探索したり、限られた予算内でターゲット情報に到達できなかったりする。
ウェブサイト構造を利用して最適な出発点を動的に決定するマルチエージェントWebナビゲーション手法であるMangoを提案する。
マルチアームの帯域幅問題としてURL選択を定式化し、トンプソンサンプリングを用いて、候補URL間でナビゲーション予算を適応的に割り当てる。
さらに、ナビゲーション履歴を保存するためのエピソードメモリコンポーネントを導入し、エージェントが以前の試みから学習できるようにする。
WebVoyagerの実験では、GPT-5-miniを使用する場合、Mangoは63.6%の成功率に達し、最高のベースラインを7.3%上回った。
さらに、WebWalkerQAでは、Mangoが52.5%の成功率を獲得し、ベースラインが26.8%を超えた。
また,オープンソースモデルとクローズドソースモデルの両方をバックボーンとして,Mangoの一般化可能性を示す。
私たちのデータとコードはオープンソースで、https://github.com/VichyTong/Mango.comで公開しています。
関連論文リスト
- MolmoWeb: Open Visual Web Agent and Open Data for the Open Web [60.29597961827816]
MolmoWebMixはブラウザのタスクとWeb-GUIの知覚データを組み合わせたものだ。
MolmoWeb-8Bは、完全にオープンなマルチモーダルWebエージェントのファミリーである。
我々は、Webエージェントのオープンな研究を可能にするため、モデルチェックポイント、トレーニングデータ、コード、統一された評価ハーネスをリリースする。
論文 参考訳(メタデータ) (2026-04-09T17:54:02Z) - ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation [53.95797153529148]
身体的エージェントは、主に部分的な自我中心の観測に依存するため、効率的なナビゲーションに苦しむことが多い。
本稿では,マルチモーダル大規模言語モデル(MLLM)と決定論的プランナを結合することにより,この理由に基づくパラダイムを運用する,人間にインスパイアされたフレームワークであるReasonNaviを紹介する。
論文 参考訳(メタデータ) (2026-01-26T19:09:20Z) - BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks [51.803138848305814]
我々はBrowserArenaを紹介した。BrowserArenaは、ユーザから送信されたタスクを収集するオープンソースのエージェント評価プラットフォームである。
Captcha解決、ポップアップバナー削除、URLへのダイレクトナビゲーションの3つの一貫した障害モードを特定します。
本研究は,Webエージェントの多様性と脆性の両方を明らかにする。
論文 参考訳(メタデータ) (2025-10-02T15:22:21Z) - Go-Browse: Training Web Agents with Structured Exploration [49.19468732253614]
本稿では,多彩で現実的なWebエージェントデータを大規模に収集する手法であるGo-Browseを提案する。
Go-Browseはグラフ検索としてデータ収集をフレーミングすることで効率的な探索を実現する。
提案手法をWebArenaベンチマーク上でインスタンス化し,100URLにわたる10Kのタスク解決トラジェクトリと40Kのインタラクションステップのデータセットを収集する。
論文 参考訳(メタデータ) (2025-06-04T03:27:56Z) - WebLists: Extracting Structured Information From Complex Interactive Websites Using Executable LLM Agents [1.6673034682613495]
我々は、一般的な4つのビジネスおよびエンタープライズユースケースにわたる200のデータ抽出タスクのベンチマークであるWebListsを紹介します。
検索能力を有するLLMとSOTA Webエージェントの両方が、それぞれ3%と31%のリコールで、これらのタスクに苦労していることを示す。
提案するBardeenAgentは,Webエージェントが実行をリピータブルなプログラムに変換し,類似した構造を持つページ間で大規模に再生することを可能にする新しいフレームワークである。
WebListsベンチマークでは、BardeenAgentが総リコール総数の66%を達成し、SOTA Webエージェントのパフォーマンスを倍増し、出力行あたりのコストを3倍に削減した。
論文 参考訳(メタデータ) (2025-04-17T06:16:40Z) - Multimodal Web Navigation with Instruction-Finetuned Foundation Models [99.14209521903854]
視覚言語基礎モデルを用いたWebエージェントのためのデータ駆動オフライントレーニングについて検討する。
本稿では,WebページのスクリーンショットとHTMLページの両方を観察する命令追従型マルチモーダルエージェントWebGUMを提案する。
このレシピは,マルチモーダル認識,HTML理解,マルチステップ推論といったエージェントの能力を向上させることを実証的に実証する。
論文 参考訳(メタデータ) (2023-05-19T17:44:34Z) - Learning to Navigate Wikipedia by Taking Random Walks [40.26808946240421]
ランダムにサンプリングされた軌道の行動的クローニングは、効果的なリンク選択ポリシーを学ぶのに十分であることを示す。
我々は,3800万のノードと387万のエッジを持つウィキペディアのグラフバージョンに対するアプローチを実証する。
次に、結果の埋め込みとポリシーを下流の事実検証と質問応答タスクに使用します。
論文 参考訳(メタデータ) (2022-10-31T22:40:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。