論文の概要: Reflection with Action-Induced Visual Differences for Desktop GUI Agents
- arxiv url: http://arxiv.org/abs/2608.24015v1
- Date: Tue, 25 Aug 2026 03:10:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.769697
- Title: Reflection with Action-Induced Visual Differences for Desktop GUI Agents
- Title(参考訳): デスクトップGUIエージェントにおける行動誘発視覚差による反射
- Authors: Yijie Ma, Chaoyue Niu, Fan Wu, Guihai Chen,
- Abstract要約: Planner-Operator-Reflector (POR)フレームワークは複雑なタスクにおける客観的アライメントを維持するためにGUIエージェントで広く使われている。
既存のリフレクタは、変化の検出と結果の検証を1ステップに分解し、証拠を暗黙的に残し、根拠の弱い決定を下す。
Evidence-First Reflection (EFR) は、2段階の反射鏡であり、行動誘発視覚差を結果検証から抽出する。
- 参考スコア(独自算出の注目度): 29.424541963900598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The Planner-Operator-Reflector (POR) framework is widely used in GUI agents to maintain objective alignment in complex tasks through modular collaboration. However, desktop GUIs introduce a key challenge: large, dense interfaces often exhibit subtle or scattered state changes, placing most of the burden on the reflector, which must compare pre- and post-action screens, while the planner and operator reason over a single state. Existing reflectors collapse change detection and outcome verification into one step, leaving evidence implicit and yielding weakly grounded decisions. To address this limitation, we propose Evidence-First Reflection (EFR), a two-stage reflector that explicitly decouples action-induced visual differences extraction from outcome verification. EFR identifies the action location and candidate changed regions with Set-of-Marks annotations, describes and filters action-relevant changes, and makes the final judgment from the cleaned evidence. This evidence-reasoning decoupled design makes reflection better grounded in screen transitions, while reducing both visual search complexity and reasoning burden. Experiments on OSWorld-Verified and WindowsAgentArena demonstrate that EFR improves reflector accuracy by 7.11%, yielding average end-to-end task success gains of 5.94% and 4.95% on the two benchmarks, respectively.
- Abstract(参考訳): Planner-Operator-Reflector (POR) フレームワークはGUIエージェントでモジュール的な協調を通じて複雑なタスクの客観的アライメントを維持するために広く使われている。
しかし、デスクトップGUIは重要な課題をもたらす: 大きくて密度の高いインターフェースは、しばしば微妙に、あるいは散らばった状態の変化を示し、リフレクタに負担の大部分を課し、プレアクション画面とポストアクション画面を比較しなければならない。
既存のリフレクタは、変化の検出と結果の検証を1ステップに分解し、証拠を暗黙的に残し、根拠の弱い決定を下す。
この制限に対処するために、動作誘発視覚差を結果検証から明示的に分離する2段階反射器であるエビデンス・ファースト・リフレクション(EFR)を提案する。
EFRは、Set-of-Marksアノテーションを使用してアクション位置と候補変更領域を特定し、アクション関連変更を記述およびフィルタリングし、クリーン化されたエビデンスから最終的な判断を行う。
このエビデンスと分離されたデザインは、視覚的な検索の複雑さと推論の負担を軽減しつつ、リフレクションをよりスクリーン遷移の基盤にします。
OSWorld-VerifiedとWindowsAgentArenaの実験では、ERFはリフレクタの精度を7.11%改善し、それぞれのベンチマークで平均5.94%と4.95%のタスク成功率を得た。
関連論文リスト
- StepReflect: Structured UI Transition Reflection for Mobile GUI Agents [22.922734013100825]
ステップ毎のGUI反射を明示的な遷移仕様とペアの視覚的エビデンスに基づく教師付き構造化予測として定式化するStepReflectを提案する。
オフラインでは、結果の8Bモデルは、AndroidWorldで82.16%のトランジションレベルの精度を達成し、ゼロショットのGPT-5.2を11.83ポイント上回る。
オンライン上では、M3A、Agent-SAMA、MAI-UI-8B、Seed-2.0-Proの3つのエージェント構成のうち、StepReflectはより高いタスク成功を実現している。
論文 参考訳(メタデータ) (2026-08-06T04:17:27Z) - MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG [50.46218163777298]
知識に基づくビジュアル質問回答 (KB-VQA) では、大規模百科事典の知識ベースからクエリ画像と一致する視覚エンティティを検索し、関連する質問に答える必要がある。
MMAgent-R$2$は、視覚的リランク化と能動的拒絶を内部検証機構として統合したエージェントmRAGフレームワークである。
論文 参考訳(メタデータ) (2026-07-08T13:15:39Z) - A Task-State Representation for Long-Horizon Mobile GUI Agents [53.359524744953575]
Task-State Representation (TSR)は、感覚入力からタスク状態を明示的に分離する、トレーニング不要のフレームワークである。
4つのモバイルGUIベンチマークによる実験では、TSRの有効性が検証され、成功率が12ポイントまで向上した。
論文 参考訳(メタデータ) (2026-07-01T06:37:21Z) - Contrastive Reflection for Iterative Prompt Optimization [0.6533652962118279]
エージェントIRの反復的プロンプト最適化フレームワークであるContrastive Reflectionを提案する。
フレームワークをツリーベースのスライスセレクタでインスタンス化するが、コントリビューションはツリー自体よりもコントラストループである。
論文 参考訳(メタデータ) (2026-06-29T19:16:07Z) - AgentV-RL: Scaling Reward Modeling with Agentic Verifier [63.55502685076245]
試験時間スケーリング(TTS)によるLCM推論を強化する検証器が実証されている。
本稿では,報酬モデリングを多ターンツール拡張型検討プロセスに変換するフレームワークであるエージェント検証を提案する。
Agentic Verifier は並列およびシーケンシャルTS の両方で一貫した性能向上が得られることを示す。
論文 参考訳(メタデータ) (2026-04-17T12:27:36Z) - MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions [42.03378622674476]
視覚領域の反射によるマルチモーダル反復推論のためのMIRRORフレームワークを提案する。
ビジュアルリフレクションをコアメカニズムとして埋め込むことで、MIRRORはドラフト、批評、地域ベースの検証、リビジョンを含むクローズドループプロセスとして定式化される。
一般的な視覚言語ベンチマークと代表的な視覚言語推論ベンチマークの両方の実験は、MIRRORが正確性を改善し、視覚幻覚を減らすことを示している。
論文 参考訳(メタデータ) (2026-02-21T07:56:59Z) - Agentic Reward Modeling: Verifying GUI Agent via Online Proactive Interaction [7.731207237810125]
VAGENは、対話ツールを備えた検証エージェントを使用して、自律的に検証戦略を計画するフレームワークである。
VAGEN は LLM-as-a-Judge ベースラインと比較して評価精度が有意に向上することを示す。
論文 参考訳(メタデータ) (2026-01-31T07:36:54Z) - VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation [64.82775032985485]
視覚検索強化世代(VRAG)は視覚言語モデル(VLM)を外的視覚知識で拡張し、基礎推論を行い幻覚を減らす。
しかし、現在のVRAGシステムは、複数の画像に対して確実な認識と証拠の統合に失敗し、根拠の弱さと誤った結論に繋がることが多い。
EVisRAGは,エビデンス誘導型マルチイメージで推論を学習し,この問題に対処するエンド・ツー・エンドのフレームワークである。
論文 参考訳(メタデータ) (2025-10-10T13:34:23Z) - From Objects to Events: Unlocking Complex Visual Understanding in Object Detectors via LLM-guided Symbolic Reasoning [71.41062111470414]
現在のオブジェクト検出器は、エンティティのローカライゼーションと分類において優れているが、イベント認識機能には固有の制限がある。
本稿では,単なるオブジェクト認識以上の標準オブジェクト検出能力を,複雑なイベント理解に拡張する新しいフレームワークを提案する。
私たちの重要なイノベーションは、高価なタスク固有のトレーニングを必要とせずに、オブジェクト検出とイベント理解のセマンティックなギャップを埋めることです。
論文 参考訳(メタデータ) (2025-02-09T10:30:54Z) - Two-Stage Single Image Reflection Removal with Reflection-Aware Guidance [78.34235841168031]
シングルイメージリフレクション除去(SIRR)のためのリフレクション・アウェア・ガイダンス(RAGNet)を用いた新しい2段階ネットワークを提案する。
RAGは、(i)観測からの反射の効果を緩和するために、(ii)線形結合仮説から逸脱する効果を緩和するための部分畳み込みにおいてマスクを生成するために用いられる。
5つの一般的なデータセットの実験は、最先端のSIRR法と比較して、RAGNetの量的および質的な優位性を実証している。
論文 参考訳(メタデータ) (2020-12-02T03:14:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。