論文の概要: CUADebug: Diagnosing and Repairing Computer-Use Agent Failures
- arxiv url: http://arxiv.org/abs/2608.02643v1
- Date: Fri, 31 Jul 2026 13:59:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.873389
- Title: CUADebug: Diagnosing and Repairing Computer-Use Agent Failures
- Title(参考訳): CUADebug: コンピュータ使用エージェント障害の診断と修復
- Abstract要約: コンピュータ利用エージェント(CUA)は、スクリーンショット、マウスとキーボードのアクション、ステートフルなUIフィードバックを通じて、実際のデスクトップとWebインターフェースを操作する。
テキストのみのエージェントとは異なり、CUAの失敗は、視覚知覚、接地、低レベル相互作用、タスク推論、環境ダイナミクスの複合から生じる。
CUA障害の診断と修復のためのフレームワークであるCUA Debugを紹介する。
- 参考スコア(独自算出の注目度): 65.56066380320107
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents (CUAs) operate real desktop and web interfaces through screenshots, mouse and keyboard actions, and stateful UI feedback, yet their failures remain difficult to diagnose and repair. Unlike text-only agents, CUA failures arise from coupled visual perception, spatial grounding, low-level interaction, task reasoning, and environment dynamics, making debugging a distinctive multimodal causal localization problem. We introduce CUADebug, a framework for diagnosing and repairing CUA failures. CUADebug includes a CUA-specific error taxonomy, CUAErrorBench, a human-annotated OSWorld failure benchmark, and CUADebugger, a tool-augmented debugger. Instead of prompting over the full trajectory once, CUADebugger actively inspects suspicious steps with paired before/after screenshots and action traces, then submits a structured diagnosis containing the root-cause step, error type, grounded evidence, and corrective strategy for re-execution. Human annotations over 204 failed trajectories show that task reasoning and control is the largest failure family (110/204), followed by perception (36), grounding/interaction (25), external/system (13), and an others category of 20 OSWorld infeasible-task cases. On the main Claude-agent split, CUADebugger improves joint subtype-and-step diagnosis from 11.2% to 19.6% with Gemini 2.5 Pro and improves consistently across debugger backbones. In single re-execution package evaluation, RCA-based conditions achieve higher task completion than history-only continuation (28.47% with machine RCA and 29.90% with our method, versus 13.89%); in continual re-execution, our method improves success from 12.2% to 25.86%, while human-oracle guidance reaches 29.21%. These results show that CUA root-cause diagnosis can provide actionable repair signals rather than merely post-hoc explanations.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)は、スクリーンショット、マウスとキーボードのアクション、ステートフルなUIフィードバックを通じて、実際のデスクトップとWebインターフェースを操作するが、診断と修復は困難である。
テキストのみのエージェントとは異なり、CUAの失敗は、視覚知覚、空間的接地、低レベル相互作用、タスク推論、環境ダイナミクスの複合から発生し、デバッグが独特なマルチモーダル因果ローカライゼーション問題となる。
CUA障害の診断と修復のためのフレームワークであるCUADebugを紹介する。
CUADebugにはCUA固有のエラー分類、人間による注釈付きOSWorld障害ベンチマークCUAErrorBench、ツール拡張デバッガCUADebuggerが含まれている。
CUADebuggerは1回に1回、完全なトラジェクトリを発行する代わりに、スクリーンショットとアクショントレースをペアにした不審なステップを積極的に検査し、ルート原因のステップ、エラータイプ、根拠付きエビデンス、再実行のための修正戦略を含む構造化された診断を提出する。
204以上のヒューマンアノテーションは、タスクの推論と制御が最大の障害ファミリ(110/204)であり、続いて知覚(36)、接地/相互作用(25)、外部/システム(13)、その他20のOSWorld非実用タスクケースのカテゴリが続くことを示している。
メインのクロードエージェントスプリットでは、CUADebuggerは、Gemini 2.5 Proで11.2%から19.6%のジョイントサブタイプとステップの診断を改善し、デバッガバックボーン間で一貫して改善している。
単一再実行パッケージ評価において、RCAベースの条件は、履歴のみの継続よりもタスク完了率が高く(28.47%、機械RCAでは29.90%、我々の手法では13.89%)、連続的な再実行では12.2%から25.86%に改善し、人間軌道誘導は29.21%に達した。
以上の結果から,CUAの根本診断は,単にポストホックな説明ではなく,実用的な修復信号を提供する可能性が示唆された。
関連論文リスト
- SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction [13.719725391379276]
脆弱性発見は、大規模言語モデル(LLM)エージェントの重要な機能である。
我々は、その測定を、クローズドな決定論的基底真理を持つ入力予測タスクとして再放送する。
これにより、発見は15ドメインにまたがる22の現実世界のC/C++プログラムで3つのタスクモードに分解される。
論文 参考訳(メタデータ) (2026-09-05T19:04:41Z) - D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory [10.177699115336425]
D$2$ACCIプロトコルは、ペア化されたエビデンス、保護されたスライス監視、トレースレベルのローカライズ可能性に基づいて、メモリ介入を促進、機能フラグ、拒否する。
我々はMemStackでプロトコルをインスタンス化し、3つの公開ベンチマークで評価し、LoCoMoで93.59%、LongMemEvalで90.93%、PersonaMem-V2で57.20%を達成した。
論文 参考訳(メタデータ) (2026-08-18T13:18:38Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation [0.0]
本稿では,プランナー指向実行,特殊なツール使用,テレメトリ駆動評価を中心に構築されたツール拡張型自律推論フレームワークを提案する。
クリーンな評価制約の下でGAIA 2023 Level-1バリデーションタスクのクロマフローを解析する。
論文 参考訳(メタデータ) (2026-05-13T20:40:37Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration [71.18377595277018]
大きな言語モデル(LLM)は、診断が難しい複雑なロジックエラーを伴うバグの多いコードを生成することが多い。
対話型デバッガ制御による動的解析を LLM に委ねる初のエージェントプログラム修復システムである InspectCoder を提案する。
論文 参考訳(メタデータ) (2025-10-21T06:26:29Z) - Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction [58.51530390018909]
大規模言語モデルに基づくマルチエージェントシステムは、協調的な問題解決において優れているが、エラーのカスケードには脆弱である。
我々は,MASにリアルタイム,教師なし,ステップレベルの誤り検出と自己補正を付与するメタ認知フレームワークMASCを提案する。
論文 参考訳(メタデータ) (2025-10-16T05:35:37Z) - Where LLM Agents Fail and How They can Learn From Failures [62.196870049524364]
大規模言語モデル(LLM)エージェントは、複雑なマルチステップタスクの解決において有望であることを示す。
単一ルート原因エラーがその後の決定を通じて伝播する、障害のカスケードに対する脆弱性を増幅する。
現在のシステムは、モジュール的で体系的な方法でエージェントエラーを包括的に理解できるフレームワークを欠いている。
AgentErrorTaxonomyは、メモリ、リフレクション、計画、アクション、システムレベルの操作にまたがる障害モードのモジュール分類である。
論文 参考訳(メタデータ) (2025-09-29T18:20:27Z) - Agent KB: Leveraging Cross-Domain Experience for Agentic Problem Solving [62.71545696485824]
我々は,異種エージェントフレームワーク間のシームレスな体験共有を可能にするユニバーサルメモリ基盤であるAgent KBを紹介した。
Agent KBはトラジェクトリを構造化知識ベースに集約し、軽量APIを提供する。
我々は,GAIA,Humanity's Last Exam,GPQA,SWE-benchなどの主要フレームワークにまたがるエージェントを検証した。
論文 参考訳(メタデータ) (2025-07-08T17:59:22Z) - SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests [17.90798133817018]
本研究は, 事故報告から得られたスタックトレースを, スペクトルベース断層定位における故障トリガー試験のプロキシとして用いる可能性について検討した。
本稿では,スタックトレース情報とテストカバレッジデータを統合する新たな手法であるSBESTを提案する。
論文 参考訳(メタデータ) (2024-05-01T15:15:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。