論文の概要: DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness
- arxiv url: http://arxiv.org/abs/2607.28033v1
- Date: Thu, 30 Jul 2026 11:17:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.523065
- Title: DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness
- Title(参考訳): DataClawEval: 実業界におけるデータエンジニアリングエージェントのベンチマーク
- Abstract要約: 我々は,実世界のデータエンジニアリングシナリオにおいて,自律エージェントのエンドツーエンドタスク完了を評価するために設計された,最初の包括的なベンチマークであるDataClawEvalを紹介する。
PySpark、Hive、Presto/Trino、Flinkの5つの実行エンジンにまたがる100の厳格なエンドツーエンドタスクで構成されている。
決定論的アズ・ア・ジャッジスコアではなく、各タスクはケース固有で独立したサンドボックス内で実行され、ルールベースのスクリプトによってグレードされる。
- 参考スコア(独自算出の注目度): 8.716755570427184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) and LLM-based agents are increasingly being deployed to automate complex workflows, promising to revolutionize data management and processing. However, existing benchmarks predominantly focus on simplified Text-to-SQL translation or data analysis, leaving the critical and complex domain of end-to-end data engineering largely unexplored. To bridge this gap, we introduce DataClawEval, the first comprehensive benchmark designed specifically to evaluate the end-to-end task completion capabilities of autonomous agents in real-world data engineering scenarios. Built upon production-grade code authored by professional enterprise data engineers, it comprises 100 rigorous, end-to-end tasks spanning five execution engines: PySpark, MySQL, HiveSQL, PrestoSQL/Trino, and FlinkSQL. Rather than non-deterministic LLM-as-a-judge scoring, each task is executed within a case-specific, isolated sandbox and graded by deterministic, rule-based scripts. Evaluating 16 frontier agents exposes critical limitations: The strongest model attains only 74.9 overall, and no single model dominates, as each excels on a different engine, revealing strict domain specialization rather than omnipotent proficiency. Thus, autonomous data engineering remains a formidable, unresolved challenge. We release our dataset, containerized environments, and deterministic evaluation scripts at https://github.com/Dicemy/DataClawEval/tree/master
- Abstract(参考訳): 大規模言語モデル(LLM)とLLMベースのエージェントは、複雑なワークフローを自動化するためにデプロイされ、データ管理と処理に革命をもたらすことを約束している。
しかし、既存のベンチマークは主にテキストからSQLへの翻訳やデータ分析に重点を置いており、エンドツーエンドのデータエンジニアリングの重要かつ複雑な領域はほとんど探索されていない。
このギャップを埋めるために、私たちは、実世界のデータエンジニアリングシナリオにおいて自律エージェントのエンドツーエンドタスク補完能力を評価するために設計された、最初の包括的なベンチマークであるDataClawEvalを紹介します。
PySpark、MySQL、HiveSQL、PrestoSQL/Trino、FlinkSQLの5つの実行エンジンにまたがる100の厳格でエンドツーエンドのタスクで構成されている。
非決定論的LCM-as-a-judgeスコアではなく、各タスクはケース固有で独立したサンドボックス内で実行され、決定論的でルールベースのスクリプトによってグレードされる。
16のフロンティアエージェントを評価すると、重要な制限が示される: 最強のモデルは総じて74.9で、それぞれが異なるエンジンで排他的であり、全能性よりも厳密なドメイン特殊化が示されるため、単一のモデルが支配的になることはない。
このように、自律的なデータエンジニアリングは、恐ろしい、未解決の課題である。
データセット、コンテナ化された環境、決定論的評価スクリプトをhttps://github.com/Dicemy/DataClawEval/tree/masterでリリースしています。
関連論文リスト
- Environment-free Synthetic Data Generation for API-Calling Agents [68.95520739708304]
API呼び出し大型言語モデル(LLM)エージェントの訓練には、大量の高品質なトラジェクトリが必要である。
本研究では,LLMをオンザフライデジタルワールドモデルとして活用する環境不要な合成データ生成手法を提案する。
我々は,情報検索タスクと状態変更タスクの両方を含む,挑戦的なAppWorldとOfficeBenchベンチマークに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-07-18T17:36:44Z) - Data Intelligence Agents: Interpreting, Modeling, and Querying Enterprise Data via Autonomous Coding Agents [1.0674604700001966]
データインテリジェンスエージェント(DIA)は3つのエージェント(Data Interpreter, Creator, Query Generator)からなるシステムである。
テキストを出力する代わりに、エージェントは具体的なアーティファクトを生成し、実行し、検証し、修復する。
論文 参考訳(メタデータ) (2026-06-17T17:45:32Z) - Exploring Autonomous Agentic Data Engineering for Model Specialization [37.35310287793494]
大規模言語モデル (LLM) は一般的なタスクにおいて高いパフォーマンスを示し、特殊なドメインへの適応に苦慮することが多い。
我々は、LSMを自律データエンジニアとして評価するための新しいタスクである textbf Autonomous Agentic Data Engineering を定式化した。
GPT-5.2 は textbf57.29% で学生モデルを改善する訓練カリキュラムを構築している。
論文 参考訳(メタデータ) (2026-05-28T17:50:10Z) - AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents [12.7922877987936]
EntWorldは6つの代表的なエンタープライズドメインにわたる1,756タスクからなる大規模なベンチマークである。
基礎となるデータベーススキーマからビジネスロジックを直接リバースエンジニアリングするスキーマ基底タスク生成フレームワークを提案する。
現状のモデルでは,EntWorldで47.61%の成功率を達成した。
論文 参考訳(メタデータ) (2026-01-25T06:58:15Z) - DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle [41.576417987200074]
実世界のエンタープライズデータインテリジェンスには、ソースを分析可能なテーブルに変換するデータエンジニアリングや、これらのテーブルを意思決定指向の洞察に変換するデータ分析が含まれる。
複雑な機能を反映した210タスクのベンチマークであるDACompを紹介します。
論文 参考訳(メタデータ) (2025-12-03T23:21:28Z) - LLM-Driven Data Generation and a Novel Soft Metric for Evaluating Text-to-SQL in Aviation MRO [0.6374763930914525]
そこで本研究では,F1スコアベースの'ソフト'メトリクスを新たに導入し,実測値と実測値の重なりを定量化する。
我々は,MROデータベース上での実証的な評価を通じて,我々の貢献を実証する。
論文 参考訳(メタデータ) (2025-06-11T04:04:13Z) - MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark [51.30875219634243]
MMTUは、25の現実世界のテーブルタスクに30万以上の質問がある大規模なベンチマークである。
MMTUは、専門家レベルで実際のテーブルを理解し、推論し、操作できるモデルを包括的に評価するように設計されている。
MMTUはテーブル理解、推論、コーディングといった、今日のフロンティアモデルにとって困難なスキルの組み合わせを必要としています。
論文 参考訳(メタデータ) (2025-06-05T21:05:03Z) - DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation [10.390461679868197]
我々は、適応的で堅牢なデータサイエンス自動化のためのノートブック中心の大規模言語モデル(LLM)エージェントフレームワークであるDatawiseAgentを紹介する。
人間のデータサイエンティストが計算ノートブックでどのように機能するかに触発されたDatawiseAgentは、統一された相互作用表現とマルチステージアーキテクチャを導入した。
論文 参考訳(メタデータ) (2025-03-10T08:32:33Z) - MMAU: A Holistic Benchmark of Agent Capabilities Across Diverse Domains [54.117238759317004]
大規模マルチタスクエージェント理解(MMAU)ベンチマークは、複雑な環境設定を必要としない包括的なオフラインタスクを特徴としている。
ツールユース、DAG(Directed Acyclic Graph)QA、データサイエンスと機械学習コーディング、コンテストレベルのプログラミング、数学の5分野にわたるモデルを評価する。
3K以上の異なるプロンプトを含む20の精巧に設計されたタスクにより、MMAUはLLMエージェントの強度と限界を評価するための包括的なフレームワークを提供する。
論文 参考訳(メタデータ) (2024-07-18T00:58:41Z) - Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows? [73.81908518992161]
我々は、プロのデータサイエンスとエンジニアリングに焦点を当てた最初のマルチモーダルエージェントベンチマークであるSpider2-Vを紹介する。
Spider2-Vは、本物のコンピュータ環境における現実世界のタスクを特徴とし、20のエンタープライズレベルのプロフェッショナルアプリケーションを組み込んでいる。
これらのタスクは、エンタープライズデータソフトウェアシステムにおいて、コードを書き、GUIを管理することで、マルチモーダルエージェントがデータ関連のタスクを実行する能力を評価する。
論文 参考訳(メタデータ) (2024-07-15T17:54:37Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。