論文の概要: Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
- arxiv url: http://arxiv.org/abs/2604.05477v1
- Date: Tue, 07 Apr 2026 06:16:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.656301
- Title: Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction
- Title(参考訳): 素直に行動しない:アクションエフェクト検証と自己補正によるロバストGUI自動化
- Authors: Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu, Xinran He, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang,
- Abstract要約: ノイズの多い環境下での動作結果と回復を明示的にモデル化するVeriGUIを提案する。
ロバストSFTと合成故障軌道とGRPOを非対称な検証報酬と組み合わせた2段階の訓練パイプラインを開発した。
実験の結果、VeriGUIは障害ループを大幅に削減し、標準的なタスク性能を維持しながらリカバリ成功を改善することがわかった。
- 参考スコア(独自算出の注目度): 4.081183001322422
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous GUI agents based on vision-language models (VLMs) often assume deterministic environment responses, generating actions without verifying whether previous operations succeeded. In real-world settings with network latency, rendering delays, and system interruptions, this assumption leads to undetected action failures, repetitive ineffective behaviors, and catastrophic error accumulation. Moreover, learning robust recovery strategies is challenging due to the high cost of online interaction and the lack of real-time feedback in offline datasets.We propose VeriGUI (Verification-driven GUI Agent), which explicitly models action outcomes and recovery under noisy environments. VeriGUI introduces a Thinking--Verification--Action--Expectation (TVAE) framework to detect failures and guide corrective reasoning, and a two-stage training pipeline that combines Robust SFT with synthetic failure trajectories and GRPO with asymmetric verification rewards. We further construct a Robustness Benchmark based on AndroidControl to evaluate failure recognition and correction. Experiments show that VeriGUI significantly reduces failure loops and improves recovery success while maintaining competitive standard task performance.
- Abstract(参考訳): 視覚言語モデル(VLM)に基づく自律GUIエージェントは、しばしば決定論的環境応答を仮定し、以前の操作が成功したかどうかを検証せずにアクションを生成する。
ネットワーク遅延、レンダリング遅延、システムの中断といった現実的な設定では、この仮定は未検出の動作障害、繰り返しの非効率な動作、破滅的なエラーの蓄積につながる。
さらに,オンラインインタラクションの高コスト化とオフラインデータセットにおけるリアルタイムフィードバックの欠如により,堅牢なリカバリ戦略の学習は困難であり,ノイズ環境下でのアクション結果とリカバリを明示的にモデル化するVeriGUI(Verification-driven GUI Agent)を提案する。
VeriGUIは、障害を検出し、修正推論を導くためのThinking--Verification--Action-Expectation (TVAE)フレームワークと、Robust SFTと合成障害軌跡とGRPOと非対称な検証報酬を組み合わせた2段階のトレーニングパイプラインを導入している。
さらに,AndroidControlに基づくロバストネスベンチマークを構築し,故障認識と修正を評価する。
実験によると、VeriGUIは、競合する標準タスク性能を維持しながら、障害ループを著しく削減し、リカバリ成功を改善する。
関連論文リスト
- GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL [64.8155693023222]
オープンソースのネイティブGUIエージェントは、長い水平ナビゲーションタスクのクローズドソースシステムに遅れを取っている。
このギャップは、高品質でアクション整合性のある推論データが不足していることに起因している。
GUI-Libraは、これらの課題に対処する調整されたトレーニングレシピです。
論文 参考訳(メタデータ) (2026-02-25T18:34:57Z) - Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction [7.731207237810125]
VAGENは、対話ツールを備えた検証エージェントを使用して、自律的に検証戦略を計画するフレームワークである。
VAGEN は LLM-as-a-Judge ベースラインと比較して評価精度が有意に向上することを示す。
論文 参考訳(メタデータ) (2026-01-31T07:36:54Z) - CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding [60.06899554269808]
サイクロンVLA(CycleVLA)は、VLA(Vision-Language-Action Model)を積極的に自己補正するシステムである。
CycleVLAは、重要なサブタスク遷移ポイントにフラグを付けるプログレス対応のVLAを統合することで、これを実現する。
大規模な実験により、CycleVLAは、よく訓練されたVLAと訓練されていないVLAの両方のパフォーマンスを改善することが示された。
論文 参考訳(メタデータ) (2026-01-05T17:31:01Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent [12.334063115362758]
Orcust は Principle-Constrained Reward Modeling と Online VM-Grounded Trajectory Construction を統合したフレームワークである。
OVTCは機器化された仮想マシンをスピンアップして、構造化GUIインタラクション軌跡を自律的に収集する。
論文 参考訳(メタデータ) (2025-09-22T15:40:31Z) - Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation [83.92224427735859]
実際の実行に先立って効果的なフィードバックを提供する事前の批判機構を導入する。
そこで我々は,GUI-Critic-TrainとGUI-Critic-Testを作成するために,推論ブートストラップに基づくデータ収集パイプラインを開発した。
我々のモデルは、現在のMLLMと比較して、批評家の精度に大きな利点をもたらす。
論文 参考訳(メタデータ) (2025-06-05T04:12:36Z) - A Unified Framework for Real-Time Failure Handling in Robotics Using Vision-Language Models, Reactive Planner and Behavior Trees [1.3481665321936716]
本稿では,リアクティブプランナであるVLM(Vision-Language Models)とBT(Behavior Trees)を組み合わせて,リアルタイムの障害処理を実現する,統合された障害復旧フレームワークを提案する。
当社のアプローチには、実行前の潜在的な障害をチェックする事前実行検証と、実行中の障害を検出し修正するリアクティブ障害処理が含まれている。
我々は、ペグ挿入、オブジェクトソート、引き手の配置といったタスクにおいて、ABB YuMiロボットを用いた実世界の実験を通して、我々のフレームワークを評価する。
論文 参考訳(メタデータ) (2025-03-19T13:40:56Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。