論文の概要: AgenticDataBench: A Comprehensive Benchmark for Data Agents
- arxiv url: http://arxiv.org/abs/2607.01647v1
- Date: Thu, 02 Jul 2026 03:18:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.649116
- Title: AgenticDataBench: A Comprehensive Benchmark for Data Agents
- Title(参考訳): AgenticDataBench: データエージェントの総合ベンチマーク
- Authors: Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan, Peng Zhang, Yu Su, Xiang Qi, Baolin Sun, Chengyuan Yang, Tao Fang, Huaiyu Ruan,
- Abstract要約: 大規模言語モデル(MLL)データエージェントは、データサイエンスを自動化するための有望なソリューションとして登場した。
我々は,粒度の細かい多様な領域にまたがる現実的なタスクを特徴とする総合的なベンチマークであるAgenticDataを提案する。
これにより、データサイエンスの多様性と複雑さ、エージェントの詳細なパフォーマンスを評価できる。
- 参考スコア(独自算出の注目度): 26.292243502468335
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Data science aims to derive actionable insights from heterogeneous raw data, unlocking the value of the massive amounts of data generated in modern society. Automating this process is essential to reducing labor-intensive efforts for data scientists and enabling scalable data-driven applications. Recently, large language model (LLM)-based data agents have emerged as a promising solution to automate data science workflows. However, the field lacks comprehensive benchmarks to rigorously evaluate these agents across diverse scenarios with fine-grained granularity. To address this gap, we propose AgenticDataBench, a comprehensive benchmark featuring realistic tasks spanning diverse domains with fine-grained ground-truth labels. This enables evaluations to capture the diversity and complexity of data science workflows and the detailed performance of agents. First, to cover diverse domains, we collect real datasets and tasks from 15 vertical domains, including 5 real-world B2B use cases from a leading fintech company. Second, to remove redundancy in real-world tasks and generate high-quality tasks for domains lacking real data, we introduce data science skills, recurring data-centric operational patterns, and quantify benchmark coverage by the number of skills included. Representative skills are extracted from large-scale task solutions on Stack Overflow using skill-aligned hierarchical clustering. Third, for real-world business tasks, we select task-solution pairs that maximize diversity in skill composition, ensuring broad coverage of practical scenarios. Fourth, to generate realistic tasks for devise domains without real tasks, we propose a systematic LLM-based task generation approach to create workflows and tasks based on these skills. Finally, we evaluate state-of-the-art data agents using our annotated benchmark and open-sourced testbed, providing detailed skill-level insights.
- Abstract(参考訳): データサイエンスは、異質な生データから実行可能な洞察を導き、現代の社会で生成された大量のデータの価値を解き放つことを目的としている。
このプロセスの自動化は、データサイエンティストの労働集約的な労力削減と、スケーラブルなデータ駆動アプリケーションの実現に不可欠である。
近年、大規模言語モデル(LLM)ベースのデータエージェントが、データサイエンスワークフローを自動化するための有望なソリューションとして登場した。
しかし、この分野は、粒度の細かい様々なシナリオでこれらのエージェントを厳格に評価するための包括的なベンチマークを欠いている。
このギャップに対処するため,AgenticDataBenchを提案する。
これにより、データサイエンスワークフローの多様性と複雑さ、エージェントの詳細なパフォーマンスを評価できる。
まず、さまざまなドメインをカバーするために、15の垂直ドメインから、主要なフィンテック企業から5つの実世界のB2Bユースケースを含む、実際のデータセットとタスクを収集します。
第二に、実世界のタスクの冗長性を排除し、実際のデータを持たないドメインに対して高品質なタスクを生成するために、データサイエンスのスキルを導入し、データ中心の運用パターンを繰り返し導入し、そのスキルの数によってベンチマークカバレッジを定量化する。
Stack Overflow上の大規模タスクソリューションから,スキル整合型の階層クラスタリングを使用して,代表的スキルを抽出する。
第3に、実世界のビジネスタスクでは、スキル構成の多様性を最大化し、実践シナリオの広範なカバレッジを確保するタスク-ソリューションペアを選択します。
第4に、実際のタスクを伴わないドメインを設計するための現実的なタスクを生成するために、これらのスキルに基づいたワークフローやタスクを作成するための体系的なLCMベースのタスク生成手法を提案する。
最後に、アノテーション付きベンチマークとオープンソースのテストベッドを用いて最先端のデータエージェントを評価し、詳細なスキルレベルの洞察を提供する。
関連論文リスト
- Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories [15.512057716487517]
ビジネスエージェントを複雑な環境で強化する新しいアプローチであるCRMWeaverを提案する。
我々は、学習中に合成データ生成とRLに基づくパラダイムを採用し、複雑なデータを扱うモデルの能力を大幅に改善する。
CRMArena-Proデータセットに対する我々のアプローチの有効性を検証する。
論文 参考訳(メタデータ) (2025-10-29T09:47:40Z) - Scaling Generalist Data-Analytic Agents [95.05161133349242]
DataMindは、汎用データ分析エージェントを構築するために設計されたスケーラブルなデータ合成およびエージェントトレーニングレシピである。
DataMindは、オープンソースのデータ分析エージェントを構築する上で重要な3つの課題に取り組む。
論文 参考訳(メタデータ) (2025-09-29T17:23:08Z) - DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation [10.390461679868197]
我々は、適応的で堅牢なデータサイエンス自動化のためのノートブック中心の大規模言語モデル(LLM)エージェントフレームワークであるDatawiseAgentを紹介する。
人間のデータサイエンティストが計算ノートブックでどのように機能するかに触発されたDatawiseAgentは、統一された相互作用表現とマルチステージアーキテクチャを導入した。
論文 参考訳(メタデータ) (2025-03-10T08:32:33Z) - Making Sense of Data in the Wild: Data Analysis Automation at Scale [0.1747623282473278]
本稿では,インテリジェントエージェントと検索拡張生成を組み合わせることで,データ解析,データセットキュレーション,インデックス作成を大規模に自動化する手法を提案する。
提案手法により,より詳細なデータセット記述,より高いヒット率,データセット検索タスクの多様性が得られた。
論文 参考訳(メタデータ) (2025-01-27T10:04:10Z) - Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach [56.55633052479446]
Webスケールのビジュアルエンティティ認識は、クリーンで大規模なトレーニングデータがないため、重大な課題を呈している。
本稿では,ラベル検証,メタデータ生成,合理性説明に多モーダル大言語モデル(LLM)を活用することによって,そのようなデータセットをキュレートする新しい手法を提案する。
実験により、この自動キュレートされたデータに基づいてトレーニングされたモデルは、Webスケールの視覚的エンティティ認識タスクで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2024-10-31T06:55:24Z) - DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? [58.330879414174476]
現実的なタスクでデータサイエンスエージェントを評価するためのベンチマークであるDSBenchを紹介する。
このベンチマークには、466のデータ分析タスクと、EloquenceとKaggleのコンペからソースされた74のデータモデリングタスクが含まれている。
現状のLLM, LVLM, エージェントを評価したところ, 最高のエージェントはデータ解析タスクの34.12%しか解決できず, RPG(Relative Performance Gap)は34.74%であった。
論文 参考訳(メタデータ) (2024-09-12T02:08:00Z) - Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows? [73.81908518992161]
我々は、プロのデータサイエンスとエンジニアリングに焦点を当てた最初のマルチモーダルエージェントベンチマークであるSpider2-Vを紹介する。
Spider2-Vは、本物のコンピュータ環境における現実世界のタスクを特徴とし、20のエンタープライズレベルのプロフェッショナルアプリケーションを組み込んでいる。
これらのタスクは、エンタープライズデータソフトウェアシステムにおいて、コードを書き、GUIを管理することで、マルチモーダルエージェントがデータ関連のタスクを実行する能力を評価する。
論文 参考訳(メタデータ) (2024-07-15T17:54:37Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z) - CMDBench: A Benchmark for Coarse-to-fine Multimodal Data Discovery in Compound AI Systems [10.71630696651595]
知識集約的なタスクを達成するエージェントとしてLLMを使用する複合AIシステム(CAS)は、データベースやAIコミュニティにおいて大きな関心を集めている。
マルチモーダルデータソースのサイロは、そのタスクを達成するための適切なデータソースを特定するのを困難にしている。
我々はエンタープライズデータプラットフォームの複雑さをモデル化したベンチマークであるCMDBenchを提案する。
論文 参考訳(メタデータ) (2024-06-02T01:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。