論文の概要: Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- arxiv url: http://arxiv.org/abs/2606.27330v1
- Date: Thu, 25 Jun 2026 17:44:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.38333
- Title: Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- Title(参考訳): GUIエージェントの自律的体験探索とタスクプランニングのための隠れた体験利用
- Authors: Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao,
- Abstract要約: 小さなオープンソースMLLMは、弱い計画と限られたクロスウェブサイトの一般化に悩まされている。
本研究では,環境を自律的に探索して経験を発見するPEEU手法を提案する。
実世界のベンチマーク実験はPEEUの優れた性能を示し、より大きなQwen2.5-VL-32Bモデルを上回った。
- 参考スコア(独自算出の注目度): 39.028462985881305
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal web agents can assist humans in operating repetitive GUI tasks, where effective task planning is essential for decomposing complex tasks into executable actions. While small open source MLLMs are cost efficient and privacy preserving compared with commercial large models, they suffer from weak planning and limited cross website generalization. To address these limitations, we introduce the planning experience exploration and utilization (PEEU) method, which autonomously explores environments to discover experiences and utilizes hindsight experience to synthesize strictly aligned, high level training data. To quantitatively analyze the generalization behaviors driving this performance, we propose the task decomposition hierarchical analysis framework (TDHAF) to systematically study compositional generalization across three task granularities: low, middle and high levels. Our analysis reveals that mastering low level atomic skills does not guarantee high level planning competence, while high level task training yields stronger OOD generalization. Experiments on real world benchmarks demonstrate PEEU's superior effectiveness: our 7B model achieves 30.6% accuracy, outperforming the much larger Qwen2.5-VL-32B model. These demonstrate constructing hindsight high level tasks and leveraging experiences is crucial for OOD planning abilities of small MLLMs.
- Abstract(参考訳): 複雑なタスクを実行可能なアクションに分解するためには、効果的なタスク計画が不可欠である。
小さなオープンソースMLLMは、商用の大規模モデルと比べてコスト効率が良く、プライバシを保っているが、弱い計画と限られたクロスサイト一般化に悩まされている。
これらの制約に対処するため、我々は、環境を自律的に探索して経験を発見する計画経験探索・利用(PEEU)手法を導入し、密に整合した高レベルのトレーニングデータを後見経験を用いて合成する。
この性能を駆動する一般化挙動を定量的に解析するために,低,中,高の3つのタスク粒度にまたがる構成一般化を体系的に研究するタスク分解階層解析フレームワーク(TDHAF)を提案する。
分析の結果,低レベルのアトミックスキルを習得しても高レベルの計画能力は保証されず,高レベルのタスクトレーニングはより強力なOOD一般化をもたらすことがわかった。
我々の7Bモデルは30.6%の精度でQwen2.5-VL-32Bモデルよりも優れています。
これらのことは、小規模MLLMのOOD計画能力に欠かせないハイレベルタスクの構築と経験の活用を実証するものである。
関連論文リスト
- How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective [18.773467537970753]
VLM駆動型エンボディエージェントのベンチマークであるNativeEmbodiedを提案する。
多様なシミュレートされたシーンに基づいて構築されたNativeEmbodiedには、全体的なパフォーマンスを評価するための複雑なシナリオにおける3つの代表的なハイレベルタスクが含まれている。
より詳細な分析を行うため、4種類の低レベルタスクを構築し、それぞれが基本的な具体的スキルをターゲットにしている。
論文 参考訳(メタデータ) (2026-02-24T08:42:41Z) - Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation [57.12284831164602]
モバイルエージェントは膨大な可能性を示しているが、現在のSoTA(State-of-the-art)エージェントは、現実世界、長期的、クロスアプリケーションタスクに不適切な成功率を示す。
本稿では,新しい階層型マルチエージェントフレームワークであるMobile-Agent-RAGを提案する。
論文 参考訳(メタデータ) (2025-11-15T15:22:42Z) - Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning [15.393743659727926]
大規模言語モデル(LLM)は、知識獲得、推論、ツール使用において顕著な能力を示した。
本稿では,マルチターンタスク計画を単一ターンタスク推論問題に変換する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-09-24T23:47:36Z) - Anticipate & Act : Integrating LLMs and Classical Planning for Efficient Task Execution in Household Environments [16.482992646001996]
我々は,これらの課題を共同で達成する行動列を計算し,家庭内課題を予測するための枠組みを開発する。
今後の課題を考慮しないシステムと比較して,実行時間の31%削減を実証する。
論文 参考訳(メタデータ) (2025-02-04T07:31:55Z) - Spatial Reasoning and Planning for Deep Embodied Agents [2.7195102129095003]
この論文は空間的推論と計画タスクのためのデータ駆動手法の開発を探求する。
学習効率、解釈可能性、新しいシナリオ間の伝達可能性の向上に重点を置いている。
論文 参考訳(メタデータ) (2024-09-28T23:05:56Z) - Agent Planning with World Knowledge Model [88.4897773735576]
エージェント計画を容易にするためにパラメトリック世界知識モデル(WKM)を導入する。
我々はWKMを開発し,グローバルプランニングと動的状態知識を指導し,地域プランニングを支援する。
本手法は, 各種の強靭なベースラインと比較して, 優れた性能が得られる。
論文 参考訳(メタデータ) (2024-05-23T06:03:19Z) - Efficient Learning of High Level Plans from Play [57.29562823883257]
本稿では,移動計画と深いRLを橋渡しするロボット学習のフレームワークであるELF-Pについて紹介する。
ELF-Pは、複数の現実的な操作タスクよりも、関連するベースラインよりもはるかに優れたサンプル効率を有することを示す。
論文 参考訳(メタデータ) (2023-03-16T20:09:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。