論文の概要: A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
- arxiv url: http://arxiv.org/abs/2603.19685v1
- Date: Fri, 20 Mar 2026 06:32:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.030006
- Title: A Subgoal-driven Framework for Improving Long-Horizon LLM Agents
- Title(参考訳): 長期LDMエージェント改善のためのサブゴール駆動型フレームワーク
- Authors: Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette,
- Abstract要約: 大規模言語モデル(LLM)ベースのエージェントは、デジタル環境のための強力な自律型コントローラとして登場した。
我々は、密度の高いマイルストーンベースの報酬信号を使用するRLトレーニングフレームワークであるMiRAを紹介する。
以上の結果から,明示的な推論時間計画とマイルストーンに基づく報酬を組み合わせることで,エージェントの長期的機能を大幅に向上することが示唆された。
- 参考スコア(独自算出の注目度): 12.411629679174183
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM)-based agents have emerged as powerful autonomous controllers for digital environments, including mobile interfaces, operating systems, and web browsers. Web navigation, for example, requires handling dynamic content and long sequences of actions, making it particularly challenging. Existing LLM-based agents struggle with long-horizon planning in two main ways. During online execution, they often lose track as new information arrives, lacking a clear and adaptive path toward the final goal. This issue is further exacerbated during reinforcement learning (RL) fine-tuning, where sparse and delayed rewards make it difficult for agents to identify which actions lead to success, preventing them from maintaining coherent reasoning over extended tasks. To address these challenges, we propose two contributions. First, we introduce an agent framework that leverages proprietary models for online planning through subgoal decomposition. Second, we present MiRA (Milestoning your Reinforcement Learning Enhanced Agent), an RL training framework that uses dense, milestone-based reward signals. The real-time planning mechanism improves proprietary models such as Gemini by approximately a 10% absolute increase in success rate (SR) on the WebArena-Lite benchmark. Meanwhile, applying MiRA to the open Gemma3-12B model increases its success rate from 6.4% to 43.0%. This performance surpasses proprietary systems such as GPT-4-Turbo (17.6%) and GPT-4o (13.9%), as well as the previous open-model state of the art, WebRL (38.4%). Overall, our findings demonstrate that combining explicit inference-time planning with milestone-based rewards significantly improves an agent's long-horizon capabilities, paving the way for more robust and general-purpose autonomous systems.
- Abstract(参考訳): 大規模言語モデル(LLM)ベースのエージェントは,モバイルインターフェースやオペレーティングシステム,Webブラウザなど,デジタル環境用の強力な自律型コントローラとして登場した。
例えば、Webナビゲーションは動的なコンテンツと長いアクションシーケンスを扱う必要があり、特に難しい。
既存のLLMベースのエージェントは、2つの主要な方法で長期計画に苦労する。
オンライン実行中は、新しい情報が到着するにつれてトラックを失うことが多く、最終目標に向かって明確で適応的なパスが欠如している。
この問題は、強化学習(RL)の微調整においてさらに悪化しており、スパースと遅延報酬により、エージェントがどのアクションが成功するかを特定するのが難しくなり、拡張タスクよりも一貫性のある推論を維持するのを妨げている。
これらの課題に対処するため、我々は2つのコントリビューションを提案する。
まず、サブゴール分解によるオンライン計画のためのプロプライエタリモデルを活用するエージェントフレームワークを提案する。
次に、密度の高いマイルストーンベースの報酬信号を使用するRLトレーニングフレームワークであるMiRA(Milestoning your Reinforcement Learning Enhanced Agent)を紹介する。
リアルタイムプランニングメカニズムは、WebArena-Liteベンチマークにおいて、約10%の絶対的な成功率(SR)の増加によって、Geminiのようなプロプライエタリなモデルを改善する。
一方、オープンなGemma3-12BモデルにMiRAを適用すると、成功率は6.4%から43.0%に向上する。
この性能は GPT-4-Turbo (17.6%) や GPT-4o (13.9%) といったプロプライエタリなシステムを超えており、また以前のオープンモデルである WebRL (38.4%) も上回っている。
全体として、明示的な推論時間計画とマイルストーンに基づく報酬を組み合わせることで、エージェントの長期的な能力が大幅に向上し、より堅牢で汎用的な自律システムへの道が開けることを示した。
関連論文リスト
- M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval [64.06936170117943]
M$2$は、文脈効率と意思決定を最適化するために設計されたトレーニング不要のメモリ拡張フレームワークである。
本手法では,対話履歴を簡潔な状態更新に圧縮する動的トラジェクトリ要約(Internal Memory)と,オフラインのインサイトバンクから取得した実行可能なガイドラインでエージェントを誘導するInsight Retrieval Augmentation(External Memory)を併用する。
論文 参考訳(メタデータ) (2026-02-28T06:59:51Z) - OpAgent: Operator Agent for Web Navigation [23.928869500029432]
我々は、オンラインインタラクション環境を開発し、特殊なRLパイプラインを用いてビジョン・ランゲージ・モデル(VLM)を微調整する。
本稿では,総合的な結果評価のためのWebJudgeと,進捗報酬のためのルールベース決定木(RDT)を組み合わせたハイブリッド・リワード機構を提案する。
特に、我々のRL強化モデルは、WebArena上で38.1%の成功率(pass@5)を達成し、既存のモノリシックなベースラインを上回ります。
論文 参考訳(メタデータ) (2026-02-14T02:33:55Z) - WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning [82.12501258760814]
大規模言語モデル(LLM)ベースのエージェントは、Web情報検索において強力な能力を示している。
Plan anchorは、長期にわたるWeb推論タスクにおいて、最初の推論ステップが下流の動作に不均等に影響を与えている場所です。
計画と実行を分離する2段階のRLフレームワークであるAnchor-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-06T16:36:40Z) - Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents [44.34340798542]
大きな言語モデル(LLM)は、複雑な推論を必要とする自然言語タスクにおいて顕著な能力を示している。
静的データセットに対する従来の教師付き事前トレーニングは、自律的なエージェント機能を実現するには不十分である。
本稿では,モンテカルロ木探索(MCTS)を自己批判機構と組み合わせ,エージェント間相互作用を反復的に微調整するフレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-13T20:52:13Z) - DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning [56.887047551101574]
大規模言語モデル(LLM)エージェントとケースベース推論(CBR)を利用した新しいフレームワークであるDS-Agentを提案する。
開発段階では、DS-AgentはCBRフレームワークに従い、自動イテレーションパイプラインを構築する。
デプロイメントの段階では、DS-Agentは、シンプルなCBRパラダイムで低リソースのデプロイメントステージを実装し、LCMの基本能力に対する需要を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-27T12:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。