論文の概要: DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
- arxiv url: http://arxiv.org/abs/2608.10366v1
- Date: Tue, 11 Aug 2026 01:45:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.862061
- Title: DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
- Title(参考訳): DSAgentBench:エージェントは実際のコンピュータ環境でエンドツーエンドのデータサイエンスワークフローを自動化できるか?
- Authors: Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince,
- Abstract要約: DSAgentBenchは、エージェントが実際のコンピュータ環境内で完全なデータサイエンスを自動化できるかを評価する最初のベンチマークである。
実験の結果,最強のエージェントであるClaude-4.6-Sonnetでさえ56.70%のタスク成功しか達成できないことがわかった。
これらの結果から、現在のエージェントシステムと実際のデータサイエンスの間には、相当な能力ギャップがあることが明らかになった。
- 参考スコア(独自算出の注目度): 40.322111941653134
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world data science involves long-horizon workflows that span data wrangling, exploration, modeling, visualization, and validation, and require coordinated use of tools such as notebooks, IDEs, terminals, browsers, and databases within real operating environments. Yet existing benchmarks lack real-computer interaction and do not evaluate whether agents can execute complete end-to-end data-science workflows in realistic computing environments, failing to capture the multi-stage, multi-tool nature of data-science practice. We introduce DSAgentBench, the first benchmark to evaluate whether agents can automate full data-science workflows inside real computer environments. DSAgentBench contains 275 diverse tasks covering the entire data-science life-cycle, reflecting the complexity and tool coordination required in practice. Each task requires grounding decisions in intermediate outputs and coordinated tool use, and includes a deterministic evaluator that verifies analytical correctness, visual outputs, and model performance rather than code-only execution. Our extensive experiments with 15 closed- and open-source models show that even the strongest agent, Claude-4.6-Sonnet, achieves only 56.70% task success, while all open-source agents remain below 1%, frequently failing at tool orchestration, OS grounding, and multi-step reasoning. These results reveal a substantial capability gap between current agentic systems and real data-science workflows, positioning DSAgentBench as a foundation for developing grounded, verifiable, autonomous data-science agents. We release DSAgentBench at https://github.com/vis-nlp/DSAgentBench.
- Abstract(参考訳): 実世界のデータサイエンスは、データラングリング、探索、モデリング、可視化、バリデーションにまたがる長い水平ワークフローを含み、ノートブック、IDE、端末、ブラウザ、および実際の運用環境内のデータベースなどのツールを協調的に使用する必要がある。
しかし、既存のベンチマークでは実際のコンピュータインタラクションが欠如しており、エージェントが現実的なコンピューティング環境で完全なエンドツーエンドのデータサイエンスワークフローを実行できるかどうか評価していない。
DSAgentBenchは、エージェントが実際のコンピュータ環境内で完全なデータサイエンスワークフローを自動化できるかを評価する最初のベンチマークである。
DSAgentBenchには、データサイエンスライフサイクル全体をカバーする275の多様なタスクが含まれており、実際に必要とされる複雑さとツール調整を反映している。
各タスクは、中間出力とコーディネートされたツールの使用に関する決定を下す必要があり、コードのみの実行ではなく、分析的正確性、視覚的出力、モデルパフォーマンスを検証する決定論的評価器を含む。
15のクローズドおよびオープンソースモデルによる大規模な実験では、最強のエージェントであるClaude-4.6-Sonnetでさえ56.70%のタスク成功しか達成せず、すべてのオープンソースエージェントは1%以下にとどまり、ツールオーケストレーション、OS基盤、マルチステップ推論に失敗することが示されている。
これらの結果から、現在のエージェントシステムと実際のデータサイエンスワークフローの間には、実質的かつ検証可能な、自律的なデータサイエンスエージェントを開発する基盤として、DSAgentBenchが位置づけられていることが分かる。
DSAgentBenchはhttps://github.com/vis-nlp/DSAgentBench.comでリリースします。
関連論文リスト
- AgenticDataBench: A Comprehensive Benchmark for Data Agents [26.292243502468335]
大規模言語モデル(MLL)データエージェントは、データサイエンスを自動化するための有望なソリューションとして登場した。
我々は,粒度の細かい多様な領域にまたがる現実的なタスクを特徴とする総合的なベンチマークであるAgenticDataを提案する。
これにより、データサイエンスの多様性と複雑さ、エージェントの詳細なパフォーマンスを評価できる。
論文 参考訳(メタデータ) (2026-07-02T03:18:59Z) - AgentHijack: Benchmarking Computer Use Agent Robustness to Common Environment Corruptions [78.49000936275773]
我々は、一般的な汚職下でのコンピュータ利用エージェントの堅牢性を評価するために設計されたベンチマークであるAgentHijackを紹介する。
MLLMをベースとした各種デスクトップタスクを評価し, 汚職の小さな事例であっても, 大幅な性能劣化が生じることを確認した。
本稿では,動作の要約と環境チェックに責任を負う見物人として,アクションジェネレータと接地機能を統合したフレームワークであるAgent Hijack-Agentを提案する。
論文 参考訳(メタデータ) (2026-05-25T11:09:22Z) - Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning [62.499592503950026]
大規模言語モデル(LLM)は、ツールや環境とのマルチターンインタラクションを必要とする複雑なタスクを実行するために、自律エージェントに権限を与えている。
完全合成環境生成パイプラインであるエージェント・ワールド・モデル(AWM)を提案する。
私たちは、エージェントがリッチなツールセットと対話できる、毎日のシナリオをカバーする1,000の環境にスケールします。
論文 参考訳(メタデータ) (2026-02-10T18:55:41Z) - AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis [30.512393568258105]
大規模言語モデルエージェントは、ツールを介して現実世界の問題を解決する可能性を実証するが、汎用的な知性は、質の低い長期データによってボトルネックとなる。
本稿では,現実的なセマンティックなドメイン間でのマルチターンインタラクションデータを合成する,完全に自動化されたフレームワークであるAgentSkillerを提案する。
論文 参考訳(メタデータ) (2026-02-10T03:21:42Z) - DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation [10.390461679868197]
我々は、適応的で堅牢なデータサイエンス自動化のためのノートブック中心の大規模言語モデル(LLM)エージェントフレームワークであるDatawiseAgentを紹介する。
人間のデータサイエンティストが計算ノートブックでどのように機能するかに触発されたDatawiseAgentは、統一された相互作用表現とマルチステージアーキテクチャを導入した。
論文 参考訳(メタデータ) (2025-03-10T08:32:33Z) - Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows? [73.81908518992161]
我々は、プロのデータサイエンスとエンジニアリングに焦点を当てた最初のマルチモーダルエージェントベンチマークであるSpider2-Vを紹介する。
Spider2-Vは、本物のコンピュータ環境における現実世界のタスクを特徴とし、20のエンタープライズレベルのプロフェッショナルアプリケーションを組み込んでいる。
これらのタスクは、エンタープライズデータソフトウェアシステムにおいて、コードを書き、GUIを管理することで、マルチモーダルエージェントがデータ関連のタスクを実行する能力を評価する。
論文 参考訳(メタデータ) (2024-07-15T17:54:37Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。