論文の概要: OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations
- arxiv url: http://arxiv.org/abs/2609.02149v3
- Date: Thu, 10 Sep 2026 15:52:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 19:20:15.668564
- Title: OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations
- Title(参考訳): OmegaUse-SOP:人間によるコンピュータ活用のためのSOPエンジニアリング
- Authors: Yixiong Xiao, Lang An, Hucheng Yang, Pinxue Ma, Yongquan Chen, Jingjia Cao, Yusai Zhao, Ting Wang, Ting Liu, Siqi Bao, Jingbo Zhou, Hua Wu,
- Abstract要約: OmegaUse-SOP(オメガユーゼ-SOP)は、プロのコンピュータ使用による人間のデモをGUIエージェントの再利用SOPスキルに変換するためのシステムである。
PVsyst 7.2における太陽光発電シミュレーションにおいて,パワーセクタクライアントと協調してOmegaUse-SOPを検証した。
- 参考スコア(独自算出の注目度): 28.32813445785844
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly evolving from conversational assistants into agents capable of operating external digital environments. Graphical user interface (GUI) agents play an important role in this transition, as many real-world workflows remain accessible only through user-facing software interfaces. However, despite recent progress on general computer-use benchmarks, domain-specific professional standard operating procedures (SOPs) remain challenging for GUI agents because they often involve implicit domain knowledge, software-specific conventions, and task-level verification requirements. We introduce OmegaUse-SOP, a human-in-the-loop SOP Engineering system for transforming human demonstrations of professional computer use into reusable SOP skills for GUI agents. Analogous to prompt engineering, SOP Engineering iteratively refines demonstrations, execution rules, and domain knowledge to convert professional SOPs into reusable GUI-agent skills. OmegaUse-SOP consists of four modules: Observe, Reason, Configure, and Execute. Together, these modules record expert operations as multimodal GUI traces, abstract low-level events into semantic step-level instructions, incorporate domain rules and task-specific parameters, and execute the resulting skills in live GUI environments through step-wise grounding, action generation, and verification. To demonstrate its effectiveness, we collaborate with a power-sector client and test OmegaUse-SOP on photovoltaic simulation workflows in PVsyst 7.2. The results suggest that OmegaUse-SOP can improve GUI-agent reliability on professional SOP tasks, highlighting a practical path toward deploying GUI agents in domain-specific professional software environments.
- Abstract(参考訳): 大規模言語モデル(LLM)は、会話アシスタントから外部デジタル環境を操作できるエージェントへと進化しつつある。
グラフィカルユーザインタフェース(GUI)エージェントはこの移行において重要な役割を果たす。
しかし、最近の一般的なコンピュータ利用ベンチマークの進歩にもかかわらず、暗黙のドメイン知識、ソフトウェア固有の規約、タスクレベルの検証要件をしばしば含んでいるため、GUIエージェントにとってドメイン固有の専門的標準動作手順(SOP)は依然として困難である。
OmegaUse-SOPは,プロのコンピュータ使用による人間の実演をGUIエージェントに再利用可能なSOPスキルに変換する,ループ型SOPエンジニアリングシステムである。
エンジニアリングを促進するために、SOPエンジニアリングは、プロのSOPを再利用可能なGUIエージェントスキルに変換するために、デモ、実行ルール、ドメイン知識を反復的に洗練します。
OmegaUse-SOPはObserve、Reason、Configure、Executeの4つのモジュールで構成されている。
これらのモジュールは、専門家の操作をマルチモーダルGUIトレースとして記録し、低レベルのイベントをセマンティックステップレベルの命令に抽象化し、ドメインルールとタスク固有のパラメータを組み込んで、ステップワイズグラウンド、アクション生成、検証を通じて実際のGUI環境でのスキルを実行する。
PVsyst 7.2の太陽光発電シミュレーションワークフローにおいて,パワーセクタクライアントと協調してOmegaUse-SOPをテストする。
その結果、OmegaUse-SOPはプロのSOPタスクにおけるGUIエージェントの信頼性を向上し、ドメイン固有のプロのソフトウェア環境にGUIエージェントをデプロイする実践的な道のりを強調している。
関連論文リスト
- Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields [91.11458140756208]
本稿では,専門分野と専門ソフトウェア環境を中心とした長期GUIタスクのベンチマークを紹介する。
最強のモデルでさえ、30%以上の成功率しか達成していません。
本研究は,現在のエージェントシステムの限界について重要な知見を提供し,次世代のGUIエージェント研究の鍵となる方向性を示唆するものである。
論文 参考訳(メタデータ) (2026-06-09T16:10:16Z) - SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows? [29.5539656241093]
Computer-Using Agents (CUA)は、より複雑な環境でのアクション実行に対するテキストベースの推論を超えて、大規模言語モデル(LLM)を急速に拡張している。
既存のベンチマークは、しばしば単純化された設定、孤立したタスク、短期水平相互作用に依存している。
6つのプロフェッショナルドメインにわたる23のデプロイ可能なシステム上に構築されたベンチマークには、現実的な作業シナリオに基づく106のタスクが含まれています。
実験の結果、LLMベースのエージェントがベンチで苦労していることが示され、最強のモデルでさえ、エンドツーエンドのタスクの4%未満を完了している。
論文 参考訳(メタデータ) (2026-05-15T09:35:15Z) - GUISpector: An MLLM Agent Framework for Automated Verification of Natural Language Requirements in GUI Prototypes [58.197090145723735]
本稿では,GUIプロトタイプにおけるNL要求の自動検証にマルチモーダル(M)LLMエージェントを利用する新しいフレームワークを提案する。
GuiSpectorはエージェントの検証プロセスから詳細なNLフィードバックを抽出し、開発者に実行可能な洞察を提供する。
本稿では,これらの機能を統合化し,検証実行の監視,エージェントの合理性検査,エンドツーエンドの要件検証プロセスの管理を行うインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-06T13:15:24Z) - SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering [79.07755560048388]
SWEエージェント(SWE-agent)は、LMエージェントが自律的にコンピュータを使用してソフトウェア工学のタスクを解決するシステムである。
SWEエージェントのカスタムエージェントコンピュータインタフェース(ACI)は、エージェントがコードファイルを作成し編集し、リポジトリ全体をナビゲートし、テストやその他のプログラムを実行する能力を著しく向上させる。
我々はSWE-benchとHumanEvalFixのSWE-agentを評価し、それぞれ12.5%と87.7%のパス@1レートで最先端の性能を実現した。
論文 参考訳(メタデータ) (2024-05-06T17:41:33Z) - ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation [30.693616802332745]
本稿では,ユーザが要求するタスクに応じて,Windowsプラットフォーム上でマウスとキーボードを操作することができるかどうかを評価するための新しいベンチマーク,AssistGUIを提案する。
本稿では,AIエージェントによって駆動される高度なGUIを組み込んだ高度なアクタ・クリティカル・フレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-20T15:28:38Z) - Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction [28.53259866617677]
Android モバイル環境で GUI ベンチマークを作成するための総合ツールキットである Mobile-Env を紹介した。
我々は、さまざまな現実世界のアプリにまたがるオープンワールドのタスクと、固定されたワールドセットWikiHowを収集し、大量の動的オンラインコンテンツをキャプチャする。
我々の研究結果によると、高度なモデルでさえ、人間にとって比較的簡単なタスクに苦しむことがわかった。
論文 参考訳(メタデータ) (2023-05-14T12:31:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。