論文の概要: Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
- arxiv url: http://arxiv.org/abs/2605.03596v4
- Date: Thu, 14 May 2026 13:14:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 18:18:46.722066
- Title: Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
- Title(参考訳): Workspace-Bench 1.0: 大規模ファイル依存のワークスペースタスクにAIエージェントをベンチマークする
- Abstract要約: 大規模なファイル依存を伴うワークスペース学習におけるAIエージェントの評価のためのベンチマークであるWorkspace-Benchを紹介する。
5つのワーカープロファイル、74のファイルタイプ、20,476のファイル(最大20GB)を持つ現実的なワークスペースを構築し、それぞれが7,399の合計ルーリックに対して評価された独自のファイル依存グラフを持つ388のタスクをキュレートする。
- 参考スコア(独自算出の注目度): 29.138677906501865
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Workspace learning requires AI agents to identify, reason over, exploit, and update explicit and implicit dependencies among heterogeneous files in a worker's workspace, enabling them to complete both routine and advanced tasks effectively. Despite its importance, existing relevant benchmarks largely evaluate agents on pre-specified or synthesized files with limited real-world dependencies, leaving workspace-level evaluation underexplored. To this end, we introduce Workspace-Bench, a benchmark for evaluating AI agents on Workspace Learning involving Large-Scale File Dependencies. We construct realistic workspaces with 5 worker profiles, 74 file types, 20,476 files (up to 20GB) and curate 388 tasks, each with its own file dependency graph, evaluated across 7,399 total rubrics that require cross-file retrieval, contextual reasoning, and adaptive decision-making. We further provide Workspace-Bench-Lite, a 100-task subset that preserves the benchmark distribution while reducing evaluation costs by about 70%. We evaluate 4 popular agent harnesses and 7 foundation models. Experimental results show that current agents remain far from reliable workspace learning, where the best reaches only about 60%, substantially below the human result of 80.7%, and the average performance across agents is only 43.3%.
- Abstract(参考訳): ワークスペース学習では、労働者のワークスペース内の異種ファイル間の明示的で暗黙的な依存関係を識別、推論、エクスプロイト、更新するためにAIエージェントが必要である。
その重要性にも拘わらず、既存の関連するベンチマークでは、実世界の依存関係が限られている事前に特定または合成されたファイルのエージェントを評価しており、ワークスペースレベルの評価は過小評価されている。
この目的のために,大規模なファイル依存を伴うワークスペース学習におけるAIエージェントの評価ベンチマークであるWorkspace-Benchを紹介した。
5つの作業者プロファイル、74のファイルタイプ、20,476のファイル(最大20GB)を持つ現実的なワークスペースを構築し、388のタスクをそれぞれ独自のファイル依存グラフでキュレートする。
さらに、ベンチマーク分布を保存し、評価コストを約70%削減する100タスクサブセットであるWorkspace-Bench-Liteを提供する。
4つのエージェントハーネスと7つの基盤モデルを評価した。
実験の結果、現在のエージェントは信頼性の高いワークスペースの学習には程遠いままであり、最も優れたエージェントは60%程度しか届かず、その結果は80.7%以下であり、エージェントの平均的なパフォーマンスは43.3%に過ぎなかった。
関連論文リスト
- Efficient Test-Time Adaptation through Human-AI Interaction [112.5131603022122]
我々は,ヒト-エージェント間相互作用(TAHI)によるテスト時間適応を提案する。
エージェントを2つの高ユーティリティドメイン(書き込みと視覚的創造)の30人に適応させ、合計600のタスクをこなします。
エージェントは10タスク以内の単独作業の成功率を4.5-20.9%向上させる。
論文 参考訳(メタデータ) (2026-09-03T17:33:18Z) - Reliable LLM-Generated Programs for High-Energy Physics Experiments through Graph-Grounded Software Knowledge [18.431539281285225]
汎用大規模言語モデル (LLM) はしばしばそのようなタスクに対する信頼性の低いプログラムを生成する。
我々は、これらのソフトウェア関係を生成前に整理し、推論時にタスク関連知識を取得する。
ヘテロジニアスなソフトウェア知識グラフ上でのハイブリッド検索を組み合わせた完全基底システムの評価を行う。
論文 参考訳(メタデータ) (2026-09-01T11:35:02Z) - PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems [53.65117408512214]
我々は,現実的なマルチターンユーザ-エージェントインタラクションを合成するユーザシミュレーションフレームワークであるtextbfPersonaForgeを紹介した。
PersonaForgeを使って、6.3Kレコードのトレーニングデータセットと、手動で注釈付き138タスクベンチマークである textbfPersonaForge-Benchを構築します。
実験の結果、PersonaForgeのトレーニングでは、合成スコアが+4.1%向上し、4次元すべてで利得が得られた。
論文 参考訳(メタデータ) (2026-08-28T14:33:19Z) - ContextWeave: A Real-World Workflow Benchmark [44.23367918659128]
ContextWeaveは、現実的なオフィスワークストリームにおいて、リコールされたエクスペリエンスがダウンストリームエージェントのパフォーマンスを改善するかどうかを評価する、時系列ベンチマークである。
関連性、連続性、可溶性、不適切なリコールに対する堅牢性の診断によって補完される、参加者固有の嗜好と品質と整合性を測定する。
分析の結果,実行可能で体験に富んだメモリはワークフロー継続をサポートし,コンパクトなサマリーよりも冗長な探索を効果的に行うことができることがわかった。
論文 参考訳(メタデータ) (2026-08-05T13:31:18Z) - DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces [25.28248447900504]
データエージェントは、組織ワークスペース上の自然言語分析を可能にする。
既存のベンチマークは、構造化クエリ、検索、あるいはオープンエンド分析を主に分離している。
データエージェントが検証可能な表形式の結果を生成するベンチマークであるDataSpaceを紹介する。
論文 参考訳(メタデータ) (2026-08-04T10:48:11Z) - Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark [0.0]
本稿では,タスクテキストからヘテロジニアスな操作を構成する,実行可能ベンチマークと予算対応メタルータを紹介する。
結果: 学習成功率は75.9%、静的ルーティングは93.5%、残る49%が安価で34.3ポイントを超える。
論文 参考訳(メタデータ) (2026-07-31T07:00:49Z) - OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks [98.07146747892239]
OSWorld 2.0は、日常的および専門的なタスクにまたがる108の長い水平コンピュータ使用のベンチマークである。
各タスクは現実的なエンド・ツー・エンドのワークフローを表しており、人間のユーザーの中央値は1.6時間である。
論文 参考訳(メタデータ) (2026-06-28T17:59:17Z) - Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study [0.0]
分析の単位は、研究者、エージェント、メモリ層、ツール、リポジトリ、スケジュールされたジョブ、特殊なエージェントロール、ガバナンスルールといった、永続的なヒューマンエージェント環境であった。
2026年5月、厳格なトラジェクトリ・サブセットが627のモデル関連イベントと7395万のトークンをキャプチャし、そのうち82.9%がキャッシュ読み取りだった。
論文 参考訳(メタデータ) (2026-05-26T11:28:36Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - HippoCamp: Benchmarking Contextual Agents on Personal Computers [71.97629614361549]
HippoCampは、マルチモーダルファイル管理におけるエージェントの能力を評価するために設計された新しいベンチマークである。
本ベンチマークでは,2K以上の実世界のファイルにまたがる42.4GBのデータを含む,多種多様なモダリティにまたがる実世界のプロファイルに対して,デバイススケールのファイルシステムをインスタンス化する。
論文 参考訳(メタデータ) (2026-04-01T17:58:33Z) - EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments [0.10934862523101825]
我々は,高忠実度強化学習環境におけるAIエージェントの訓練が,トレーニング分布を超えて一般化する能力を生み出すことを示す。
私たちは、Surge AIのエージェントRL環境スイートであるEnterpriseBenchの最初の環境であるCoreCraftを紹介します。
論文 参考訳(メタデータ) (2026-02-18T04:35:46Z) - ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization [1.580774794371876]
本稿では,高精度な回答抽出と信頼性のある空間的接地を実現するために,専門的なツールを編成するフレームワークであるARIALを提案する。
テキスト精度 (ANLS) と空間精度 (空間精度) を用いて, ARIAL を 4 つのベンチマーク (DocVQA, FUNSD, CORD, SROIE) で評価した。
我々の研究は、特殊ツールのエージェント的オーケストレーションが、パフォーマンスと解釈可能性を同時に改善できることを示す。
論文 参考訳(メタデータ) (2025-11-22T21:09:28Z) - Agent READMEs: An Empirical Study of Context Files for Agentic Coding [8.019313057979522]
我々は1,925のリポジトリから2,303のエージェントコンテキストファイルを調べ、それらの構造、保守、およびコンテンツを特徴付ける。
これらのファイルは静的なドキュメントではなく、コンフィグレーションコードのように進化し、頻繁で小さな追加によって維持される複雑で読みにくいアーティファクトであることが分かりました。
これらの結果は、開発者がコンテキストファイルを使用してエージェントを機能させる一方で、エージェント記述コードの安全性やパフォーマンスを保証するためのガードレールはほとんど提供せず、ツールやプラクティスの改善の必要性を強調していることを示している。
論文 参考訳(メタデータ) (2025-11-17T02:18:55Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments [2.184775414778289]
環境ブートストラップスキルを分離するベンチマークである setupbench を導入する。
私たちのタスクは7つの言語エコシステム、5つのデータベースエンジン、マルチサービスオーケストレーションシナリオにまたがっています。
特にリポジトリのセットアップ(38.9-57.4%)とローカルデータベースの設定(20.0-53.3%)に課題がある。
論文 参考訳(メタデータ) (2025-07-11T22:45:07Z) - FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks [52.47895046206854]
FieldWorkArenaは、現実世界のフィールドワークをターゲットにしたエージェントAIのベンチマークである。
本稿では、エージェントAIが現実世界の作業環境ベンチマークのために持つべき新しいアクション空間を定義する。
論文 参考訳(メタデータ) (2025-05-26T08:21:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。