論文の概要: AgentGUI: An Interface for Observing and Steering Long-Running AI Agents
- arxiv url: http://arxiv.org/abs/2607.26300v2
- Date: Tue, 04 Aug 2026 13:59:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.390665
- Title: AgentGUI: An Interface for Observing and Steering Long-Running AI Agents
- Title(参考訳): AgentGUI:長期的なAIエージェントの監視とステアリングのためのインターフェース
- Abstract要約: AgentGUIはユーザーフレンドリーで、ローカルにホストされた、AIエージェントをシームレスに観察し、操るGUIである。
制御されたユーザスタディは、エージェントトレースからキー要素を特定するのに要する時間の統計的に顕著な減少を示す。
予備的な実験では、AgentGUIの自動ドリフト防止機能は、0.8B--9Bモデルラグを越えて34ppの小さなローカルエージェントのタスク完了率を高める。
- 参考スコア(独自算出の注目度): 3.2387066735835273
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents are increasingly adept at tackling complex, long-running tasks. With the rapid surge of autonomous capabilities, human oversight is systematically lagging behind due to limited human-centered interfacing. Aiming to address this, we introduce AgentGUI, a user-friendly, locally hosted GUI for seamlessly observing and steering AI agents amid multiple concurrent, long-running sessions. AgentGUI features 1) rich agent trajectory visualizations, 2) effective manual and automated steering, and 3) integration with and coordination between open-source and frontier agent frameworks. A controlled user study demonstrates statistically significant reduction in the time it takes to identify key elements from agent traces (38% faster, p = 0.023). In a preliminary experiment, AgentGUI's automated drift prevention feature raises the task completion rate of small local agents by as high as 34pp across a 0.8B--9B model ladder (N=50 runs per model). AgentGUI is publicly available through its project website (https://agent-gui-project.github.io) and open-source repository (https://github.com/eth-medical-ai-lab/agent-gui), along with a demo video (https://youtube.com/watch?v=GSDyxN1gTF0).
- Abstract(参考訳): AIエージェントは、複雑で長期にわたるタスクに取り組むことにますます長けている。
自律能力の急激な急上昇により、人間中心の対面が制限されているため、人間の監視は体系的に遅れている。
この問題を解決するために、AgentGUIを紹介します。AgentGUIはユーザーフレンドリで、ローカルにホストされたGUIで、複数の同時実行セッションの中でAIエージェントをシームレスに観察し、ステアリングします。
AgentGUI機能
1)リッチエージェントの軌跡可視化
2 効果的なマニュアル及び自動操縦
3) オープンソースとフロンティアエージェントフレームワークの統合と調整。
制御されたユーザスタディは、エージェントトレース(38%高速、p = 0.023)からキー要素を特定するのに要する時間の統計的に顕著な減少を示す。
予備実験では、AgentGUIの自動ドリフト防止機能は、0.8B--9Bモデルラダー(N=50ラン)で34ppの小さなローカルエージェントのタスク完了率を高める。
AgentGUIはプロジェクトのWebサイト(https://agent-gui-project.github.io)とオープンソースリポジトリ(https://github.com/eth-medical-ai-lab/agent-gui)から公開されており、デモビデオ(https://youtube.com/watch?v=GSDyxN1gTF0)も公開されている。
関連論文リスト
- Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players [87.87842088508553]
対話型シミュレーションのための生成的マルチエージェント世界モデルを提案する。
本モデルでは,映像の忠実度,アクション制御性,およびスロットベースおよび高密度アテンションベースライン上でのエージェント間整合性を改善する。
論文 参考訳(メタデータ) (2026-05-27T17:59:31Z) - Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling [64.40340291543971]
我々は,小さなエッジスケールモデルとのリアルタイムインタラクションを実現するための投機的インタラクションエージェントを提案する。
また、ストリーミング入力と非同期応答を処理するためにモデルを適応させるクロックベースのトレーニング手法を提案する。
このアプローチは、Qwen2.5-3B-InstructとLlama-3.2-3B-Instructモデルを複数のツール呼び出しベンチマークで1.6-2.2$times$ Speedupを提供する。
論文 参考訳(メタデータ) (2026-05-13T11:20:52Z) - UIPro: Unleashing Superior Interaction Capability For GUI Agents [33.77980648230746]
人間のようなグラフィカルユーザインタフェース(GUI)を知覚し、操作する自律エージェントの構築は、人工知能の分野における長年のビジョンである。
視覚言語モデル(VLM)のマルチモーダル理解能力に基づくGUIエージェントの開発が試みられている。
本稿では,多プラットフォーム・マルチタスクGUIインタラクションデータを用いた新しい汎用GUIエージェントであるtextUIProを提案する。
論文 参考訳(メタデータ) (2025-09-22T03:04:53Z) - AppAgent-Pro: A Proactive GUI Agent System for Multidomain Information Integration and User Assistance [64.78994124332989]
AppAgent-Proは、ユーザ命令に基づいて複数のドメイン情報を積極的に統合するプロアクティブGUIエージェントシステムである。
AppAgent-Proは、日常生活における情報取得を根本的に再定義する可能性を秘めている。
論文 参考訳(メタデータ) (2025-08-26T05:23:24Z) - AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning [82.42421823672954]
AgentCPM-GUIは、堅牢で効率的なオンデバイスGUIインタラクションのために構築されている。
私たちのトレーニングパイプラインには、知覚を高めるためのグラウンドアウェア事前トレーニングが含まれています。
AgentCPM-GUIは5つの公開ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-06-02T07:30:29Z) - Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents [30.253353551910404]
コンピュータ利用エージェントは、コンピュータやモバイルデバイスのグラフィカルユーザインタフェース(GUI)と直接対話することで、デジタルタスクを自動化する。
本稿では,様々なジェネラリストおよびスペシャリストモデルにまたがって認知的責任を委譲する新しい構成フレームワークであるAgens S2を紹介する。
Agent S2は、3つの著名なコンピュータ使用ベンチマーク上でのSOTA(State-of-the-art)のパフォーマンスを確立する。
論文 参考訳(メタデータ) (2025-04-01T15:40:27Z) - InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection [38.833925781308665]
MLLMベースのGUIエージェントである textitInfiGUIAgent を2段階の教師付き微調整パイプラインでトレーニングした。
ステージ1はGUIの理解や接地といった基本的なスキルを強化し、ステージ2は階層的推論と予測反射推論のスキルを統合する。
textitInfiGUIAgentは、いくつかのGUIベンチマークで競合するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-01-08T15:45:21Z) - Agent S: An Open Agentic Framework that Uses Computers Like a Human [31.16046798529319]
我々は、GUI(Graphical User Interface)を通じてコンピュータとの自律的なインタラクションを可能にするオープンエージェントフレームワークであるAgent Sを提案する。
Agent Sは、ドメイン固有の知識の取得、長いタスクの水平線の計画、動的で一様でないインターフェイスの処理という、コンピュータタスクの自動化における3つの重要な課題に対処することを目指している。
論文 参考訳(メタデータ) (2024-10-10T17:43:51Z) - ClickAgent: Enhancing UI Location Capabilities of Autonomous Agents [0.0]
ClickAgentは、自律エージェントを構築するための新しいフレームワークである。
ClickAgentでは、MLLMが推論とアクションプランニングを処理し、別のUIロケーションモデルが画面上の関連するUI要素を識別する。
本評価は,Androidスマートフォンエミュレータと実際のAndroidスマートフォンの両方で実施し,タスク成功率をエージェント性能測定の指標として用いた。
論文 参考訳(メタデータ) (2024-10-09T14:49:02Z) - CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation [61.68049335444254]
MLLM(Multimodal large language model)は、人間のような自律型言語エージェントが現実世界の環境と相互作用する可能性を示している。
包括的環境認識(CEP)と条件付き行動予測(CAP)の2つの新しいアプローチを備えた包括的認知型LLMエージェントCoCo-Agentを提案する。
AITW と META-GUI ベンチマークにおいて,我々のエージェントは実シナリオで有望な性能を示す新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2024-02-19T08:29:03Z) - Agents: An Open-source Framework for Autonomous Language Agents [98.91085725608917]
我々は、言語エージェントを人工知能への有望な方向と見なしている。
Agentsはオープンソースライブラリで、これらの進歩を広く非専門的な聴衆に開放することを目的としています。
論文 参考訳(メタデータ) (2023-09-14T17:18:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。