論文の概要: AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management
- arxiv url: http://arxiv.org/abs/2512.10371v1
- Date: Thu, 11 Dec 2025 07:37:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-12 16:15:42.250147
- Title: AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management
- Title(参考訳): AgentProg: プログラム型コンテキスト管理による長距離GUIエージェントの活用
- Abstract要約: AgentProgはエージェントコンテキスト管理のためのプログラム誘導型アプローチである。
インタラクション履歴を変数と制御フローを備えたプログラムとして再構成する。
AndroidWorldと拡張ロングホライゾンタスクスイートの実験では、AgentProgが最先端の成功率を達成したことが示されています。
- 参考スコア(独自算出の注目度): 24.465443389008055
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid development of mobile GUI agents has stimulated growing research interest in long-horizon task automation. However, building agents for these tasks faces a critical bottleneck: the reliance on ever-expanding interaction history incurs substantial context overhead. Existing context management and compression techniques often fail to preserve vital semantic information, leading to degraded task performance. We propose AgentProg, a program-guided approach for agent context management that reframes the interaction history as a program with variables and control flow. By organizing information according to the structure of program, this structure provides a principled mechanism to determine which information should be retained and which can be discarded. We further integrate a global belief state mechanism inspired by Belief MDP framework to handle partial observability and adapt to unexpected environmental changes. Experiments on AndroidWorld and our extended long-horizon task suite demonstrate that AgentProg has achieved the state-of-the-art success rates on these benchmarks. More importantly, it maintains robust performance on long-horizon tasks while baseline methods experience catastrophic degradation. Our system is open-sourced at https://github.com/MobileLLM/AgentProg.
- Abstract(参考訳): モバイルGUIエージェントの急速な開発は、長期タスク自動化に対する研究の関心の高まりを刺激している。
しかし、これらのタスクのためのエージェントの構築は重大なボトルネックに直面している。
既存のコンテキスト管理と圧縮技術は、しばしば重要な意味情報の保存に失敗し、タスクのパフォーマンスが低下する。
本稿では,エージェントコンテキスト管理のためのプログラム誘導型アプローチであるAgentProgを提案する。
プログラムの構造に従って情報を整理することにより、この構造は、どの情報を保持すべきか、どの情報を破棄すべきかを決定するための原則化されたメカニズムを提供する。
我々はさらに、Belief MDPフレームワークにインスパイアされた世界的信念状態機構を統合し、部分観測可能性の扱いと予期せぬ環境変化への対応を行う。
AndroidWorldと拡張された長期タスクスイートの実験では、AgentProgがこれらのベンチマークで最先端の成功率を達成したことが示されています。
さらに重要なことは、ベースラインの手法が破滅的な劣化を経験している間に、長い水平タスクで堅牢なパフォーマンスを維持することである。
当社のシステムはhttps://github.com/MobileLLM/AgentProg.comで公開されている。
関連論文リスト
- Agents in the Large: Perception-Centered Architecture for Persistent Agents [66.30987129595137]
永続エージェント(Pera)のための知覚中心型アーキテクチャを提案する。
Pera氏は、サービス関連信号を継続的に知覚する知覚と制御コンポーネントを中心に組織された永続的なエージェントについて説明する。
私たちはPeraを使って、最近の作業を振り返りに整理し、詳細なケーススタディを調べ、より有能な永続的なエージェントを構築するための前向きな洞察を提供します。
論文 参考訳(メタデータ) (2026-08-31T09:04:52Z) - ACM: Agentic Context Management for Long Horizon Tasks [27.337726990282928]
Agentic Context Management (ACM) は、エージェントに汎用的なコンテキスト編集ツールを提供するフレームワークである。
短期記憶と長期記憶の相互作用にインスパイアされたエージェントは、いつそのコンテキストを圧縮するかを自律的に決定する。
論文 参考訳(メタデータ) (2026-07-26T19:19:24Z) - StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure [29.25570731801935]
StructAgentは、コンパクトで検証可能なタスク進捗を維持するための状態中心のフレームワークである。
明確な進捗チェックポイント、エビデンス駆動のタスク補完、ターゲットとする障害回復、ツールサポートされた実行を可能にします。
デスクトップ環境を超えてMinecraftに一般化し、私たちのデザインの汎用性を実証します。
論文 参考訳(メタデータ) (2026-07-13T10:48:25Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents [115.18197165538943]
大規模言語モデル(LLM)は、長距離情報探索のための自律エージェントへと進化する。
既存のコンテキスト管理手法は通常、軌道全体を通して単一の固定戦略にコミットする。
本稿では,探索効率と終端精度の2つの相補的な次元を通じて,長期的成功を特徴付ける確率的枠組みを提案する。
論文 参考訳(メタデータ) (2026-03-29T02:59:27Z) - Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development [42.371764229953165]
エージェントによる決定が時間やツールコール,アーキテクチャ境界を越えてどのように展開されるかを明らかにする,プロセス指向の説明可能性フレームワークを提案する。
私たちのアプローチは、既存のレビュープラクティスを置き換えるのではなく、補完するインテントレベルのテレメトリを提供します。
認知的ドリフトをコード品質と並んで第一級の関心事として扱うことで、エージェントの監視に必要な人間の理解の最小レベルを安定的に維持する。
論文 参考訳(メタデータ) (2026-03-03T12:55:28Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z) - The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution [63.61358761489141]
LLM(Large Language Model)ベースのエージェントは、カスタマーサービス、Webナビゲーション、ソフトウェアエンジニアリングといった現実世界のアプリケーションで広く使われている。
本稿では,タスク結果に関係なく,エージェントの動作を駆動する内部要因を識別する,テキスト汎用エージェント属性のための新しいフレームワークを提案する。
標準ツールの使用やメモリ誘起バイアスのような微妙な信頼性リスクなど、さまざまなエージェントシナリオでフレームワークを検証する。
論文 参考訳(メタデータ) (2026-01-21T15:22:21Z) - InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents [36.740230738304525]
InfiAgentは、タスクの持続時間に関係なく、エージェントの推論コンテキストを厳密に拘束する。
20Bのオープンソースモデルを持つInfiAgentは、より大きなプロプライエタリなシステムと競合する。
論文 参考訳(メタデータ) (2026-01-06T17:35:57Z) - SCOPE: Prompt Evolution for Enhancing Agent Effectiveness [53.75986399936395]
大規模言語モデル(LLM)エージェントは、大規模で動的なコンテキストを生成する環境にますますデプロイされている。
エージェントはこのコンテキストにアクセスできますが、静的なプロンプトには効果的に管理するメカニズムがありません。
textbfSCOPE (Self-evolving Context Optimization via Prompt Evolution) を導入する。
本稿では,戦術的特異性(即時誤りの解消)と戦略的汎用性(長期原則の進化)のバランスをとるデュアルストリーム機構を提案する。
論文 参考訳(メタデータ) (2025-12-17T12:25:05Z) - Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation [25.0921056409982]
シングルエージェントGUIエージェントは、ハイレベルな機能と低レベルな実行能力のバランスをとるのに苦労する。
統一されたポリシーモデルのトレーニングとは異なり、私たちはハイレベルなスケジューリングモデルのトレーニングに重点を置いています。
低レベルのExecutorモデルと統合可能なCoordinator-Executor-State Trackerフレームワークを構築します。
論文 参考訳(メタデータ) (2025-11-27T09:01:38Z) - Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation [57.12284831164602]
モバイルエージェントは膨大な可能性を示しているが、現在のSoTA(State-of-the-art)エージェントは、現実世界、長期的、クロスアプリケーションタスクに不適切な成功率を示す。
本稿では,新しい階層型マルチエージェントフレームワークであるMobile-Agent-RAGを提案する。
論文 参考訳(メタデータ) (2025-11-15T15:22:42Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - UltraHorizon: Benchmarking Agent Capabilities in Ultra Long-Horizon Scenarios [63.67884284105684]
textbfUltraHorizonは、複雑な現実世界の課題に不可欠な基礎的能力を測定する新しいベンチマークである。
エージェントは、隠されたルールを反復的に発見しなければならない、長期にわたる発見タスクで設計されている。
実験の結果, LLM-agents はこれらの設定において常に不利な成績を示し, ヒトは高いスコアを得ることができた。
論文 参考訳(メタデータ) (2025-09-26T02:04:00Z) - PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC [98.82146219495792]
本稿では,PC-Agentという階層型エージェントフレームワークを提案する。
認識の観点からは,現在のMLLMのスクリーンショットコンテンツに対する認識能力の不十分さを克服するために,アクティブ知覚モジュール(APM)を考案する。
意思決定の観点から、複雑なユーザ命令や相互依存サブタスクをより効果的に扱うために、階層的なマルチエージェント協調アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-02-20T05:41:55Z) - Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks [85.48034185086169]
Mobile-Agent-Eは、過去の経験を通じて自己進化できる階層的なマルチエージェントフレームワークである。
Mobile-Agent-Eは従来の最先端アプローチよりも22%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2025-01-20T20:35:46Z) - Agent S: An Open Agentic Framework that Uses Computers Like a Human [31.16046798529319]
我々は、GUI(Graphical User Interface)を通じてコンピュータとの自律的なインタラクションを可能にするオープンエージェントフレームワークであるAgent Sを提案する。
Agent Sは、ドメイン固有の知識の取得、長いタスクの水平線の計画、動的で一様でないインターフェイスの処理という、コンピュータタスクの自動化における3つの重要な課題に対処することを目指している。
論文 参考訳(メタデータ) (2024-10-10T17:43:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。