論文の概要: How Benchmarks Mis-Score Computer-Use Agents
- arxiv url: http://arxiv.org/abs/2607.28367v1
- Date: Thu, 30 Jul 2026 15:29:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.624708
- Title: How Benchmarks Mis-Score Computer-Use Agents
- Title(参考訳): ベンチマークのミススコアコンピュータ利用エージェント
- Abstract要約: タスク構築、軌道観測、スコアリング、レポートにまたがる信頼性フレームワークに問題を整理する。
我々は,5つのWeb,エンタープライズワークフロー,デスクトップ制御ベンチマークから,150のパブリックな障害対応トラジェクトリを監査する。
真の失敗については、3階層の診断分類では、検証/フィードバックと計画失敗が実行/グラウンドエラーを支配していることを示している。
- 参考スコア(独自算出の注目度): 12.455546989850227
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents (CUA) are being deployed to browse the web and operate desktop software, yet their benchmark scores are still commonly produced by brittle scripted oracles. A score is the output of a pipeline in which tasks can be stale, trajectories can omit decisive visual evidence, evaluators can reject valid alternatives, and aggregate reports can hide the cause of failure. We organize these problems into a reliability framework spanning task construction, trajectory observation, scoring, and reporting. We then audit 150 public failure-scored trajectories from five web, enterprise-workflow, and desktop-control benchmarks, find that 15.3\% of FAIL verdicts are wrong: 10.7\% are evaluator false negatives and 4.7\% are broken tasks. For genuine failures, a three-tier diagnostic taxonomy shows that verification/feedback and planning failures dominate execution/grounding errors, while a single scalar success rate can not explain. We connect these findings to newer long-horizon CUA benchmarks and derive stage-specific design rules for CUA evaluation.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)はウェブを閲覧してデスクトップソフトウェアを操作するためにデプロイされているが、ベンチマークスコアはいまだに不安定なスクリプトによるオラクルによって作成されている。
スコア(英: score)とは、タスクが不安定になりうるパイプラインの出力であり、トラジェクトリは決定的な視覚的証拠を省略でき、評価者は有効な代替案を拒否でき、集計レポートは失敗の原因を隠すことができる。
これらの問題をタスク構築、軌道観測、スコアリング、レポートにまたがる信頼性フレームワークに整理する。
次に、5つのWeb、エンタープライズワークフロー、デスクトップ制御ベンチマークから150のパブリックな障害対応軌跡を監査し、FAILの判定の15.3\%が間違っていることを発見した。
真の失敗については、検証/フィードバックと計画失敗が実行/グラウンドエラーを支配しているのに対して、単一のスカラー成功率では説明できない、という3段階の診断分類が示される。
これらの結果は、より長期にわたるCUAベンチマークと結びつけ、CUA評価のためのステージ固有の設計規則を導出する。
関連論文リスト
- Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems [0.519554837386174]
構造化データタスクでは、不正なトレースによってベンチマーク正解が生成される。
本稿では,回答の裏側で記録された計算が明確かどうかを評価するためのデプロイメント信頼性基準であるTrace Integrityを紹介する。
また,CAIT (Correct Answer / Invalid Trace) レートを導入し,回答のみの評価が計算支援出力をどれだけ成功させるかを測定する。
論文 参考訳(メタデータ) (2026-08-26T17:15:24Z) - ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts [0.0]
エージェントベンチマークは、エージェントがステートフルランタイム上で実行されている場合でも、最終回答のみを評価することが多い。
OpenClaw上でインスタンス化されたランタイムネイティブエージェント評価のためのトレース対応ベンチマークであるClawProBenchを提案する。
論文 参考訳(メタデータ) (2026-08-23T17:09:02Z) - Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? [3.9561795512466413]
現在のベンチマークは、主にエンドタスクの成功または単一フレームグラウンドを測定する。
推論、リモート入力、アプリのレンダリング、スクリーンショットキャプチャが非同期であるため、これは難しい。
オフラインのステップレベルベンチマークであるDesktop-Delta Bench (DDB)を紹介した。
論文 参考訳(メタデータ) (2026-07-28T17:49:51Z) - Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories [51.22051230894794]
最終回答に基づく評価は、エージェントが成功するかどうかを示すが、どの部分の軌道が答えを信頼できないかを示すものではない。
2つのエージェントフレームワーク、3つのバックボーンモデル、3つのベンチマークから2,790の実際のトラジェクトリを収集し、生ログをセマンティックスパンに変換し、エキスパートレビューを通じて有害なエラースパンを注釈付けします。
我々は,エージェントの主張を追跡するクレーム中心の監査フレームワークであるDRIFTを提案する。
論文 参考訳(メタデータ) (2026-06-01T10:50:26Z) - ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents [4.908588441456849]
ProcCtrlBenchは、LLM符号化エージェントの実行プロセス評価のベンチマークである。
4つのカテゴリで11の障害タイプをカバーする再利用可能なオントロジーに、繰り返し実行される障害を整理する。
最終結果のみではなく、標準化されたプロセスエビデンスを通じてエージェントの軌跡を評価する。
論文 参考訳(メタデータ) (2026-05-18T08:34:48Z) - Can Agent Benchmarks Support Their Scores? Evidence-Supported Bounds for Interactive-Agent Evaluation [8.049844623361725]
インタラクティブエージェントベンチマークは、結果チェックを通じてエージェントの実行をバイナリ結果にマッピングする。
これらのチェックは、表面レベル信号に依存するか、エージェントの実際のアクションパスをキャプチャできない。
既存のベンチマークに対して、結果エビデンスレポート層を導入します。
論文 参考訳(メタデータ) (2026-05-11T12:20:15Z) - Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework [0.0]
生産エージェントシステムに特有の7つの障害モードの分類法を提案する。
標準メトリクスは、7つの障害モードのうち4つを完全に検出することができない。
オープンソースの参照実装を備えた5次元評価フレームワークPAEFを提案する。
論文 参考訳(メタデータ) (2026-05-02T21:02:08Z) - When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents [50.5814495434565]
この研究は、コンピュータ利用エージェント(CUA)における不整合検出を定義し、研究する最初の試みである。
実世界のCUAデプロイメントにおける3つの一般的なカテゴリを特定し、人間の注釈付きアクションレベルのアライメントラベルを用いたリアルな軌跡のベンチマークであるMisActBenchを構築した。
本稿では,実行前に不整合を検知し,構造化されたフィードバックによって繰り返し修正する,実用的で普遍的なガードレールであるDeActionを提案する。
論文 参考訳(メタデータ) (2026-02-09T18:41:15Z) - Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents [71.85020581835042]
大規模言語モデルベースのエージェントは、ソフトウェアエンジニアリングの約束を示すが、環境構成はボトルネックのままである。
既存のベンチマークでは、エンドツーエンドのビルド/テストの成功のみを評価し、エージェントが成功または失敗する場所と理由を見極めている。
本研究では,環境設定計画中の細粒度エージェントのプロセスレベルの軌道評価を行うEnconda-benchを紹介する。
論文 参考訳(メタデータ) (2025-10-29T16:59:07Z) - AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories [61.38499597241457]
我々は,LLM審査員によるWebエージェント評価の有効性を評価する最初のベンチマークであるAgentRewardBenchを提案する。
ベンチマークを用いて,12名のLLM審査員を評価し,全てのベンチマークでLLMが排他的でないことを発見した。
また、一般的なベンチマークで使用されるルールベースの評価は、Webエージェントの成功率を過小評価する傾向にあることも見出した。
論文 参考訳(メタデータ) (2025-04-11T19:49:22Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z) - PULL: Reactive Log Anomaly Detection Based On Iterative PU Learning [58.85063149619348]
本稿では,推定故障時間ウィンドウに基づくリアクティブ異常検出のための反復ログ解析手法PULLを提案する。
我々の評価では、PULLは3つの異なるデータセットで10のベンチマークベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2023-01-25T16:34:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。