論文の概要: MELLON - Multimodal Enhanced LLM for Online Navigation
- arxiv url: http://arxiv.org/abs/2608.09121v1
- Date: Mon, 10 Aug 2026 04:56:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.085551
- Title: MELLON - Multimodal Enhanced LLM for Online Navigation
- Title(参考訳): MELLON - オンラインナビゲーションのためのマルチモーダル拡張LDM
- Authors: Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu,
- Abstract要約: ウェブナビゲーションの現在のベースラインは、マルチモーダル入力が与えられた場合、非モーダルまたは強い推論能力の欠如である。
本稿では,MELLON(Multimodal Enhanced LLM for Online Navigation),VQAgent,Multimodal Rankerの3つの革新的な拡張を提案する。
MELLONはタスク完了の精度が大幅に向上し、訓練期間がたった1回で9.26%向上した。
- 参考スコア(独自算出の注目度): 3.6302496232346235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Web navigation agents are capable of addressing various types of tasks on different websites. Current baselines on web navigation are either unimodal or lack strong reasoning abilities given multimodal inputs. Focusing on the WebShop benchmark, a real-world website simulation, we explore the alignment of text and images, as well as multimodal reasoning and planning abilities, to enhance the performance of web navigation agents. We propose three innovative multimodal enhancements: Multimodal Enhanced LLM for Online Navigation (MELLON), VQAgent, and Multimodal Ranker. MELLON demonstrates a significant improvement in task completion accuracy, with a 9.26% increase after just one epoch of training. Our findings suggest the necessity of further exploration into multimodal approaches, with a focus on more extensive training and alignment strategies to enhance the effectiveness of web navigation agents.
- Abstract(参考訳): Webナビゲーションエージェントは、異なるウェブサイト上の様々な種類のタスクに対処することができる。
ウェブナビゲーションの現在のベースラインは、マルチモーダル入力が与えられた場合、非モーダルまたは強い推論能力の欠如である。
実世界のWebサイトシミュレーションであるWebShopベンチマークに着目し,Webナビゲーションエージェントの性能向上を目的として,テキストと画像のアライメント,マルチモーダル推論と計画能力について検討する。
我々は,MELLON(Multimodal Enhanced LLM for Online Navigation),VQAgent,Multimodal Rankerの3つの革新的なマルチモーダル拡張を提案する。
MELLONはタスク完了の精度が大幅に向上し、訓練期間がたった1回で9.26%向上した。
本研究は、Webナビゲーションエージェントの有効性を高めるための、より広範なトレーニングとアライメント戦略に焦点を当てたマルチモーダルアプローチのさらなる探索の必要性を示唆するものである。
関連論文リスト
- Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents [16.161877699225986]
我々は,これまでで最大かつ最も多様な軌跡レベルのデータセットを合成するスケーラブルなレシピを開発した。
このデータセットには、49KのユニークなURL、720Kのスクリーンショット、3300万のWeb要素を含む、94K以上の成功したマルチモーダルWebトラジェクトリが含まれている。
我々は、Mind2Web-Live、Multimodal-Mind2Web、MiniWob++のようなオフラインおよびオンライン両方のWebエージェントベンチマークで強力なパフォーマンスを示します。
論文 参考訳(メタデータ) (2025-02-17T02:13:48Z) - OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization [66.22117723598872]
マルチモーダルWebエージェントの開発を容易にするために設計されたオープンソースフレームワークを紹介する。
まず、基本モデルを模倣学習で訓練し、基礎能力を得る。
次に、エージェントにオープンウェブを探索させ、その軌道に関するフィードバックを収集する。
論文 参考訳(メタデータ) (2024-10-25T15:01:27Z) - On the Multi-turn Instruction Following for Conversational Web Agents [83.51251174629084]
本稿では,ユーザと環境の両方で複数回にまたがる高度なインタラクションを必要とする,対話型Webナビゲーションの新たなタスクを紹介する。
本稿では,メモリ利用と自己回帰技術を用いた自己反射型メモリ拡張計画(Self-MAP)を提案する。
論文 参考訳(メタデータ) (2024-02-23T02:18:12Z) - Mastering Robot Manipulation with Multimodal Prompts through Pretraining and Multi-task Fine-tuning [49.92517970237088]
我々はマルチモーダルなプロンプトを理解するためにロボットを訓練する問題に取り組む。
このようなタスクは、視覚と言語信号の相互接続と相補性を理解するロボットの能力にとって大きな課題となる。
マルチモーダルプロンプトを用いてロボット操作を行うためのポリシーを学習する効果的なフレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-14T22:24:58Z) - Multimodal Web Navigation with Instruction-Finetuned Foundation Models [99.14209521903854]
視覚言語基礎モデルを用いたWebエージェントのためのデータ駆動オフライントレーニングについて検討する。
本稿では,WebページのスクリーンショットとHTMLページの両方を観察する命令追従型マルチモーダルエージェントWebGUMを提案する。
このレシピは,マルチモーダル認識,HTML理解,マルチステップ推論といったエージェントの能力を向上させることを実証的に実証する。
論文 参考訳(メタデータ) (2023-05-19T17:44:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。