論文の概要: Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories
- arxiv url: http://arxiv.org/abs/2610.01491v1
- Date: Thu, 01 Oct 2026 11:31:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.080642
- Title: Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories
- Title(参考訳): WebArena-LiteによるWebエージェントの評価 - アウトカムとトラジェクトリの人間レビュー
- Abstract要約: GPT 5.5とトレーニングされていないQwen3.5 9Bモデルから構築した6つの評価条件下で165個のWebArenaタスクをすべて監査する。
人間のレビューは5.45から8.49パーセントの成功率で回復する。
102のGPT 5.5軌道のレビューでは、頻繁なスクロールループ、未完成の探索、未完成の回答、無効なアクション、不完全なフォームが明らかになった。
- 参考スコア(独自算出の注目度): 3.9862738498550403
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Web agents are an important application of large language models, yet their evaluation often depends on rule based or language model evaluators that inspect only the final outcome. Human verification of task completion and detailed analysis of failed trajectories remain limited. We audit all 165 WebArena Lite tasks under six evaluation conditions built from GPT 5.5 and an untrained Qwen3.5 9B model. The audit retains the original score, corrects false negatives from the automatic evaluator, identifies the first consequential error, and examines progress across the trajectory. We also study a Memory and Analysis Support Mechanism (MASM), which maintains explicit execution state, and Guide Text, which provides task relevant procedural guidance. Across four GPT 5.5 settings, human review recovers 5.45 to 8.49 percentage points of success missed by the evaluator. With a 25 step budget, Guide Text raises corrected success with MASM from 34.55% to 38.18%. On the untrained Qwen3.5 9B model, MASM raises the evaluator score from 13.90% to 18.80%. Review of 102 failed GPT 5.5 trajectories reveals frequent scrolling loops, unfinished exploration, premature answers, invalid actions, and incomplete form workflows. Step level evidence further shows that substantial early progress can coexist with a final failure. These results show why final scores alone provide an incomplete account of web agent behavior and motivate human grounded, trajectory aware verification.
- Abstract(参考訳): Webエージェントは、大規模な言語モデルの重要な応用であるが、その評価は、最終結果のみを検査するルールベースまたは言語モデル評価者に依存することが多い。
タスク完了の人間による検証と失敗した軌道の詳細な分析は依然として限られている。
GPT 5.5とトレーニングされていないQwen3.5 9Bモデルから構築した6つの評価条件下で165個のWebArena Liteタスクをすべて監査する。
監査は、元のスコアを保持し、自動評価器からの偽陰性を補正し、最初の逐次誤差を特定し、軌道を横断する進捗を検査する。
また、明示的な実行状態を維持するメモリ・アンド・アナリティクス・サポート・メカニズム(MASM)と、関連する手続き的ガイダンスを提供するガイドテキストについても検討する。
4つのGPT 5.5設定で、人間によるレビューは5.45から8.49パーセントの成功率で回復する。
25ステップの予算で、ガイドテキストはMASMを34.55%から38.18%に改善した。
トレーニングされていないQwen3.5 9Bモデルでは、MASMは評価器のスコアを13.90%から18.80%に引き上げている。
GPT 5.5トラジェクトリ102のレビューでは、頻繁なスクロールループ、未完成の探索、未完成の回答、未完成のアクション、不完全なフォームワークフローが明らかになった。
ステップレベルのエビデンスはさらに、実質的な初期段階が最終的な失敗と共存可能であることを示しています。
これらの結果は,最終スコアだけでウェブエージェントの動作を不完全に説明し,人為的な軌道認識による検証を動機づけていることを示す。
関連論文リスト
- Shockingly Simple Self-retrospection Improves Agentic Models Without RL [56.88703385147974]
本研究は,説明のみの訓練がその後の行動に与える影響を分離するために,レトロスペクティブ・オンリー・ファインチューニングについて検討する。
Qwen3.5-4B を用いたソフトウェア工学実験では、ROFT は成功と失敗の混合したベースモデルの試行に関する問題で訓練されている。
また、64のサンプルベースモデル試みが失敗する個々のタスクの解決も学べる。
論文 参考訳(メタデータ) (2026-09-28T17:54:24Z) - FRAMES: Failure Recovery And Monitoring of Embodied Skills for Humanoid Loco-Manipulation [13.728630492769378]
我々は、Unitree G1ヒューマノイドの障害対応監視フレームワークであるFRAMESを提案する。
プランナーエージェントはパラメータ化中級スキルを介してサブタスクを選択し、ビジョン言語モデルに基づくモニターエージェントは各スキルを評価する。
我々は、50の失敗と50の成功した実行を含む100のトライアルを用いて、MuJoCoにおけるフレームワークの監視モジュールを評価した。
論文 参考訳(メタデータ) (2026-09-18T19:53:21Z) - VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control [57.5995346750474]
VA-Benchを導入し、完全なオブザーバ・レアソン・アクト・リビジョンループを評価する。
汎用MLLMは、RGBのみのデモンストレーションから手続き的コンテキストを学習する。
モデルには特権オブジェクトのポーズ、オラクルの軌跡、学習されたアクションヘッドは含まれない。
論文 参考訳(メタデータ) (2026-09-17T01:24:51Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds [43.5891705224868]
自己進化型スキルシステムは、基礎となるモデルを変更することなく、実行フィードバックを永続的なスキル更新に変換することでエージェントを改善することを約束する。
5つのベンチマークと3つのモデルで制御された評価フレームワークを提案する。
全体として、永続的なスキルの自己進化は、モデル依存リターンとベンチマーク依存リターンを備えたスパース、バリデーションフィルタリング検索として理解されている。
論文 参考訳(メタデータ) (2026-07-31T04:02:51Z) - ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents [23.840537431318296]
エージェントが何を達成し、どのように達成するかを同時に測定するデュアルアセスメントベンチマークであるClawTrackを提示する。
ClawTrackは8つのドメインにわたる320のタスクと25以上の決定論的モックサービスで構成されている。
プロセスグレーダは、12,541のタスク固有の項目で固定された4次元(ゴールアライメント、効率性、情報利用、結果検証)に沿って各推論ターンをスコアする。
論文 参考訳(メタデータ) (2026-07-30T11:18:47Z) - Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation [3.079997053226693]
本報告では,4つの主要なツールコール・ベンチマーク・ファミリーの体系的妥当性と評価について述べる。
496人の専門家がレビューしたベンチマークタスクのうち、92人の評価者と人間の意見の不一致が18.5%のミスアライメントレートに対応している。
ツールコール評価失敗、トレースレベルの監査成果物、修正された評価項目の統一分類を導入し、ツールの実行、タスク完了、結果検証を別々に計測する指標について議論する。
論文 参考訳(メタデータ) (2026-06-30T21:10:42Z) - Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development [6.072381417546439]
既存のベンチマークは、スクラッチから動くアプリケーションを構築するための完全な"ゼロ・ツー・ワン"プロセスではなく、独立したタスクを計測します。
Vibe Code Benchは、ブラウザベースのサブステップが964である100のWebアプリケーション仕様のベンチマークである。
提案するコントリビューションには,(1)エンドツーエンドWebアプリケーション開発のための新しいベンチマークデータセットとブラウザベースの評価パイプライン,(2)コスト,レイテンシ,エラー解析を備えた16のフロンティアモデルの包括的評価,(3)クロスモデルとヒューマンアノテーションの両方による評価器アライメントプロトコルなどが含まれている。
論文 参考訳(メタデータ) (2026-03-04T21:00:33Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning [63.77667876176978]
大規模言語モデルでは、最終回答を正当化するためにステップバイステップの推論を生成するように促された場合、ダウンストリームタスクの解釈可能性が改善されている。
これらの推論ステップは、モデルの解釈可能性と検証を大幅に改善するが、客観的にそれらの正確性を研究することは困難である。
本稿では、従来のテキスト生成評価指標を改善し拡張する、解釈可能な教師なし自動スコアのスイートであるROSを提案する。
論文 参考訳(メタデータ) (2022-12-15T15:52:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。