論文の概要: The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge
- arxiv url: http://arxiv.org/abs/2609.30604v1
- Date: Thu, 24 Sep 2026 22:36:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.152826
- Title: The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge
- Title(参考訳): 検索後にハードパートがやってくる: 知識の合成、整理、表示に関するWebエージェントのベンチマーク
- Abstract要約: KNOWSは、これらの機能を共同で評価する、オープンで複雑なブラウザベースのタスクのベンチマークである。
タスクを書くためには,タスクが要求を満たすことを保証するためのタスク設計とプロトコルを開発する。
我々は、フロンティアコンピュータ利用エージェントとブラウザベースのハーネスを評価し、分析する。
- 参考スコア(独自算出の注目度): 37.21080040024616
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing computer-use agent benchmarks do not fully evaluate agents acting as assistants. A useful assistant retrieves information across complex, multi-step workflows, synthesizes it into artifacts (documents, presentations, spreadsheets), and navigates program interfaces to produce a coherent final product. Such workflows demand reasoning and synthesis, decomposition of complex tasks, as well as visual and spatial understanding. To study agents on workflows like these, we introduce KNOWS, a benchmark of open-ended, complex, browser-based tasks that jointly evaluate these capabilities, with each task culminating in a produced artifact. To write tasks, we develop a task design rubric and a protocol for ensuring that tasks meet the requirements. Each task is paired with an evaluator, a program that combines deterministic checks with LLM judgments to balance the richness, reliability, and automation tradeoff inherent to agent evaluation. We evaluate and analyze frontier computer-use agents and browser-based harnesses. They achieve moderate scores on partial-success metrics, but the best performer fully succeeds in fewer than 3% of our complex, long-horizon tasks. Failures on visual steps render the resulting artifacts unusable, even when agents complete more than 50% of other evaluation steps. Our results expose limitations of current agents acting as end-to-end assistants, and call for progress on tool use, visual understanding, and long-horizon reasoning.
- Abstract(参考訳): 既存のコンピュータ利用エージェントベンチマークでは、アシスタントとして働くエージェントを十分に評価していない。
有用なアシスタントは、複雑な多段階のワークフローにまたがる情報を検索し、それをアーティファクト(ドキュメント、プレゼンテーション、スプレッドシート)に合成し、プログラムインターフェースをナビゲートし、一貫性のある最終製品を生成する。
このようなワークフローは、推論と合成、複雑なタスクの分解、および視覚的および空間的理解を必要とする。
このようなワークフローでエージェントを研究するために、我々はKNOWSを紹介した。KNOWSは、オープンエンドで複雑なブラウザベースのタスクのベンチマークで、これらの機能を共同で評価し、各タスクが生成されたアーティファクトに終止符を打つ。
タスクを書くために,タスク設計のルーブリックと,タスクが要求を満たすことを保証するプロトコルを開発する。
各タスクは、エージェント評価に固有のリッチ性、信頼性、自動化トレードオフのバランスをとるために、決定論的チェックとLCM判断を組み合わせるプログラムである評価器と組み合わせられる。
我々は、フロンティアコンピュータ利用エージェントとブラウザベースのハーネスを評価し、分析する。
しかし、最も優れたパフォーマーは、我々の複雑で長期にわたるタスクの3%以下で完全に成功します。
視覚的なステップの失敗は、エージェントが他の評価ステップの50%以上を完了しても、結果のアーティファクトを使用不能にする。
本研究は, エンドツーエンドアシスタントとして機能するエージェントの限界を明らかにするとともに, ツール利用, 視覚的理解, 長期的推論の進歩を求めるものである。
関連論文リスト
- StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows [63.57092302641323]
textbfStartupBenchは、市場価値の高いAIスタートアップ製品に根ざしたE2Eエージェントベンチマークである。
我々は、AIが現実的な需要を確立した現実的なタスクを特定するために、製品やユーザとともに、AI製品の採用を実証して研究する。
以上の結果から,現在の汎用エージェントの信頼性を超越した,市場価値の高いエージェントが多数存在することが明らかとなった。
論文 参考訳(メタデータ) (2026-08-18T14:01:32Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - Same Outcomes, Different Journeys: A Trace-Level Framework for Comparing Human and GUI-Agent Behavior in Production Search Systems [7.382907970058899]
本研究では, (i) タスクの成果と努力, (ii) クエリの定式化, (iii) インターフェース状態間のナビゲーションを比較したトレースレベルの評価フレームワークを提案する。
39人の参加者と最先端のGUIエージェントが10種類のマルチホップ検索タスクを行う実運用オーディオストリーミング検索アプリケーションにおいて、このフレームワークを制御された研究でインスタンス化する。
論文 参考訳(メタデータ) (2026-04-09T07:49:02Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - Cross-Task Experiential Learning on LLM-based Multi-Agent Collaboration [63.90193684394165]
マルチエージェント・クロスタスク体験学習(MAEL)は,LSM駆動型エージェントに明示的なクロスタスク学習と経験蓄積を付与する新しいフレームワークである。
経験的学習フェーズでは、タスク解決ワークフローの各ステップの品質を定量化し、その結果の報酬を記憶する。
推論中、エージェントは、各推論ステップの有効性を高めるために、いくつかの例として、高頻度のタスク関連体験を検索する。
論文 参考訳(メタデータ) (2025-05-29T07:24:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。