論文の概要: GuideWeb: A Benchmark for Automatic In-App Guide Generation on Real-World Web UIs
- arxiv url: http://arxiv.org/abs/2602.01917v1
- Date: Mon, 02 Feb 2026 10:21:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-03 19:28:34.073744
- Title: GuideWeb: A Benchmark for Automatic In-App Guide Generation on Real-World Web UIs
- Title(参考訳): GuideWeb: 現実世界のWeb UI上でのアプリケーション内ガイドの自動生成のためのベンチマーク
- Abstract要約: textbfGuideWebは、現実世界のWeb UI上でアプリケーション内ガイドの自動生成のための新しいベンチマークである。
GuideWebは、Webページに接地されたtextbfguideターゲット要素を選択し、ユーザ意図に沿った簡潔なガイドテキストを生成することによって、ページレベルのガイダンスを生成するタスクとして、そのタスクを定式化する。
提案した textbfGuideWeb Agent は誘導対象要素予測における textbf30.79% の精度を実現し,意図生成のための textbf44.94 のBLEUスコアと textbf21.34 を得る。
- 参考スコア(独自算出の注目度): 8.649229353305506
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Digital Adoption Platform (DAP) provide web-based overlays that deliver operation guidance and contextual hints to help users navigate complex websites. Although modern DAP tools enable non-experts to author such guidance, maintaining these guides remains labor-intensive because website layouts and functionalities evolve continuously, which requires repeated manual updates and re-annotation. In this work, we introduce \textbf{GuideWeb}, a new benchmark for automatic in-app guide generation on real-world web UIs. GuideWeb formulates the task as producing page-level guidance by selecting \textbf{guide target elements} grounded in the webpage and generating concise guide text aligned with user intent. We also propose a comprehensive evaluation suite that jointly measures the accuracy of guide target element selection and the quality of generated intents and guide texts. Experiments show that our proposed \textbf{GuideWeb Agent} achieves \textbf{30.79\%} accuracy in guide target element prediction, while obtaining BLEU scores of \textbf{44.94} for intent generation and \textbf{21.34} for guide-text generation. Existing baselines perform substantially worse, which highlights that automatic guide generation remains challenging and that further advances are necessary before such systems can be reliably deployed in real-world settings.
- Abstract(参考訳): Digital Adoption Platform (DAP)は、複雑なWebサイトをナビゲートするための操作ガイダンスとコンテキストヒントを提供するWebベースのオーバーレイを提供する。
現代のDAPツールは、非専門家がそのようなガイダンスを作成できるが、ウェブサイトのレイアウトと機能は継続的に進化し、繰り返し手動の更新と再注釈を必要とするため、これらのガイドの維持は労働集約的である。
そこで本研究では,実際のWeb UI上でのアプリケーション内ガイドの自動生成のためのベンチマークである,‘textbf{GuideWeb}’を紹介する。
GuideWebは、Webページにある‘textbf{guide target element’を選択し、ユーザの意図に沿った簡潔なガイドテキストを生成することによって、ページレベルのガイダンスを生成するようにタスクを定式化します。
また、ガイド対象要素選択の精度と、生成された意図やガイドテキストの品質を共同で測定する総合評価スイートを提案する。
実験により,本提案手法はガイド対象要素の予測において,意図生成のためのtextbf{44.94} とガイドテキスト生成のための \textbf{21.34} のBLEUスコアを取得するとともに,目標要素の予測における \textbf{30.79\%} の精度を達成することが示された。
既存のベースラインは著しく悪化しており、これは自動ガイド生成が困難なままであり、そのようなシステムが現実の環境で確実にデプロイされる前にさらなる進歩が必要であることを強調している。
関連論文リスト
- LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages [29.651352891869582]
ランディングページは目標指向のWebインターフェースであり、ターゲット固有の価値提案を伝達する必要があります。
そこで,本研究では,新たなターゲットに対して実行可能ページを作成しなければならない目標誘導型ランディングページ生成について検討する。
実際のランディングページをセクションシーケンス、レイアウトパターン、トーン記述子、視覚強調表示、CTA構造に抽象化する参照型データセットであるLandingBenchを紹介した。
本研究では、ターゲットをプロファイリングし、参照誘導ワイヤフレームを構築し、批判誘導研磨によりページを洗練する3相エージェントフレームワークであるLandingAgentを提案する。
論文 参考訳(メタデータ) (2026-08-28T04:15:38Z) - MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation [11.543353599329675]
MAGは、タスク実行を統一し、単一のマルチモーダルアクションとガイドタスクに書き込みをガイドする最初のベンチマークである。
我々は、この複合作業のための完全なハーネスを構築し、LLMアシストと人間による検証、トレーニング、ライブ環境の評価、詳細な分析を報告した。
最強のモデルでさえタスクの40%以下を完了し、将来の研究に十分な余地を残している。
論文 参考訳(メタデータ) (2026-07-11T02:08:46Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - No More Manual Guides: Automatic and Scalable Generation of High-Quality Excel Tutorials [63.10037761131196]
既存のチュートリアルは、専門家が手作業で作成し、ソフトウェアリリース毎に頻繁な更新が必要で、相当なコストがかかる。
自然言語タスク記述から直接Excelチュートリアルを自動生成する最初のフレームワークを提案する。
我々のフレームワークは、最先端のベースラインよりもタスク実行の成功率を8.5%向上させる。
論文 参考訳(メタデータ) (2025-09-26T03:21:39Z) - RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users [8.044364097415007]
RealWebAssistは、Webとの長い水平相互作用を含む現実的なシナリオにおいて、シーケンシャルなインストラクションフォローを評価するために設計された新しいベンチマークである。
各ユーザはWebベースのアシスタントに、複数のWebサイト上で一連のタスクを実行するように指示する。
成功したエージェントは、それぞれの命令の背後にある真の意図を推論し、ユーザの精神状態を追跡し、ユーザ固有のルーチンを理解し、意図したタスクを正しいGUI要素に基づいて実行しなければなりません。
論文 参考訳(メタデータ) (2025-04-14T17:36:46Z) - AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials [53.376263056033046]
既存のアプローチは高価な人間のアノテーションに依存しており、大規模には持続不可能である。
本稿では,Webエージェントトラジェクトリを生成するスケーラブルなデータ合成パイプラインであるAgentTrekを提案する。
完全に自動化されたアプローチは、データ収集コストを大幅に削減し、人間のアノテータを使わずに、高品質な軌道を0.55ドルに抑えることができます。
論文 参考訳(メタデータ) (2024-12-12T18:59:27Z) - Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents [68.22496852535937]
本稿では,事前訓練された大規模言語モデル(LLM)を,直接微調整なしで対象ドメインのエージェントとして適用する手法であるAuto-Intentを紹介する。
提案手法はまず,対象領域の実証から意図を教師なしで発見する。
我々は、エージェントの過去の観察と行動から次の意図を予測するために、意図予測器を訓練する。
論文 参考訳(メタデータ) (2024-10-29T21:37:04Z) - Can we only use guideline instead of shot in prompt? [36.578562560365384]
ショットメソッドは、与えられた例のステップを模倣することによって、モデルに質問に答えるように暗黙的にインスピレーションを与える。
ガイドライン法は、簡潔で簡潔なタスク固有の知識を含むガイドラインに従って、モデルに推論を指示する。
本稿では,フィードバック,ガイドライン,ツリーゲザエージェントからなるデータセットから,タスク固有のガイドラインを自動的に学習するFGTフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-03T08:14:55Z) - AutoGuide: Automated Generation and Selection of Context-Aware Guidelines for Large Language Model Agents [74.17623527375241]
オフライン体験からコンテキスト認識ガイドラインを自動的に生成する,AutoGuideという新しいフレームワークを導入する。
その結果,本ガイドラインはエージェントの現在の意思決定プロセスに関連性のある知識の提供を促進する。
評価の結果, AutoGuide は複雑なベンチマーク領域において, 競争ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2024-03-13T22:06:03Z) - Instruct-SCTG: Guiding Sequential Controlled Text Generation through
Instructions [42.67608830386934]
Instruct-SCTGは、命令調整言語モデルを利用して構造的に一貫性のあるテキストを生成するシーケンシャルフレームワークである。
本フレームワークは,自然言語命令を用いて,所望の人体構造に整合して記事を生成する。
論文 参考訳(メタデータ) (2023-12-19T16:20:49Z) - Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following [59.997857926808116]
画像にテキストのデコードとして意味パネルを導入する。
パネルは、入力テキストから解析された視覚概念をアレンジすることで得られる。
我々は,実用的なシステムを開発し,連続生成とチャットベースの編集の可能性を示す。
論文 参考訳(メタデータ) (2023-11-28T17:57:44Z) - Instruct and Extract: Instruction Tuning for On-Demand Information
Extraction [86.29491354355356]
On-Demand Information extractは、現実世界のユーザのパーソナライズされた要求を満たすことを目的としている。
InstructIEというベンチマークを、自動生成したトレーニングデータと、人手による注釈付きテストセットの両方を含む形で提示する。
InstructIE 上に構築した On-Demand Information Extractor, ODIE をさらに発展させる。
論文 参考訳(メタデータ) (2023-10-24T17:54:25Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - The Klarna Product Page Dataset: Web Element Nomination with Graph
Neural Networks and Large Language Models [51.39011092347136]
私たちはKlarna Product Pageデータセットを紹介します。これは、豊かさと多様性で既存のデータセットを超えるWebページの集合です。
我々は、Web要素指名タスクにおいて、GNN(Graph Neural Networks)の範囲を実証的にベンチマークする。
第2に、各ページから少数の関連要素を識別する訓練改善手順を導入する。
第3に,推薦精度をさらに高める新たなトレーニング手法であるChallenge Nomination Training procedureを導入する。
論文 参考訳(メタデータ) (2021-11-03T12:13:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。