論文の概要: Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
- arxiv url: http://arxiv.org/abs/2610.02122v1
- Date: Thu, 01 Oct 2026 17:35:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.336628
- Title: Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows
- Title(参考訳): Argo-Bench: エンタープライズ規模のワークフローにおけるデータエージェントの評価
- Abstract要約: Argo-Benchは210のデータサイエンスと分析タスクで構成される評価フレームワークである。
2024年には8100万件の注文があり、経済、詐欺パターン、市場インセンティブが根付いています。
シミュレーターの地味な状態は、エージェントが見る倉庫のものであるため、作業は倉庫を操作する前に操作することで事実を再構築する必要がある。
- 参考スコア(独自算出の注目度): 0.06829740714734366
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world enterprise data science and analytics workflows require reasoning across dozens of tables, performing statistical analyses, and acting on the results. Established text-to-SQL benchmarks evaluate query generation alone, and audits have found their answer keys frequently wrong. Because real enterprise warehouses are too sensitive to release, these benchmarks are built on public datasets where a business event fits in a single table. We introduce Argo-Bench, an evaluation framework comprising 210 data science and analytics tasks. Drawing on public data, peer-reviewed industry literature, and regulatory filings, we simulate a food delivery platform in New York City at true scale, with 81 million orders in 2024, grounded economics, fraud patterns, and marketplace incentives. We export this world to an ERP warehouse of 235 tables and 7.5 billion rows, modeled on the Oracle E-Business Suite schema. The simulator's ground-truth state is withheld from the warehouse the agent sees, so tasks require reconstructing facts by navigating the warehouse before acting on them. Argo-Bench goes beyond text-to-SQL: the agent files actions such as banning fraudulent accounts, allocating courier incentive budgets, or issuing back pay, and the grader scores each by its consequences in the simulator. Every task has an executable reference solution that demonstrates solvability using only the warehouse. The strongest of 14 frontier and open-weight models scores 95 or higher on only 34.8% of tasks and averages 59.5 points. We hope Argo-Bench drives progress toward agents that understand, navigate, and act within real data environments.
- Abstract(参考訳): 実世界のエンタープライズデータサイエンスと分析のワークフローには、数十のテーブルをまたいで推論し、統計分析を行い、結果に対処する必要がある。
確立されたテキスト-SQLベンチマークでは、クエリ生成のみを評価し、監査では、回答キーが頻繁に誤っていることが判明した。
実際のエンタープライズウェアハウスはリリースに敏感すぎるため、これらのベンチマークは、ビジネスイベントが単一のテーブルに収まるパブリックデータセット上に構築されている。
210個のデータサイエンスおよび分析タスクからなる評価フレームワークであるArgo-Benchを紹介する。
公開データ、査読された業界文献、および規制書類に基づいて、私たちはニューヨーク市のフードデリバリープラットフォームを、2024年に8100万件の注文、基礎経済、詐欺パターン、および市場インセンティブでシミュレートしました。
Oracle E-Business Suiteスキーマをモデルとした235テーブルと75億行のERPウェアハウスに、この世界をエクスポートしています。
シミュレーターの地味な状態は、エージェントが見る倉庫から保持されないため、作業は倉庫を操作する前にナビゲートすることで事実を再構築する必要がある。
Argo-BenchはテキストからSQLに留まらない: エージェントは不正なアカウントの禁止、クーリエインセンティブ予算の配分、返金などのアクションを処理し、グルーパーはシミュレータでそれぞれの結果のスコアを出力する。
すべてのタスクには、倉庫のみを使用して可解性を示す実行可能な参照ソリューションがある。
14のフロンティアとオープンウェイトで最強のモデルは、タスクの34.8%で95点以上、平均59.5点である。
Argo-Benchは、実際のデータ環境を理解し、ナビゲートし、行動するエージェントに向かって前進することを期待しています。
関連論文リスト
- The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents [0.0]
Era by Eon Benchmarkは、完全なフィクション会社を中心に作られている。
製品シミュレータ、企業固有の内部データベース、ベンチマーク質問、計算された回答キーが含まれている。
23社中の平均リアリズムスコアは61.8から97.0に上昇し、ゼロレコードは合成された。
論文 参考訳(メタデータ) (2026-09-09T08:06:46Z) - DI-Bench: Systematically Generating In-Domain Data Intelligence Benchmarks for Enterprise Agents [9.592889418944608]
データインテリジェンス(DI)のための現実的なベンチマークを生成するパイプラインであるDI-Benchを紹介する。
パイプラインは知識検索、解析計算、ルール基底推論をカバーする731タスクのベンチマークを生成する。
検索したビジネスルールが計算を変更する計算処理を行う場合、モデルは32%の精度しか達成できない。
論文 参考訳(メタデータ) (2026-09-04T23:53:21Z) - Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning [0.13999481573773073]
Hedge-Bench 1.0は、プロのヘッジファンドアナリストの明確な理由に基づく102件の実際の業務のベンチマークである。
Frontier Model.com/Trata-Inc/trata-hedge-benchでデータセットと評価ハーネスを公開する。
論文 参考訳(メタデータ) (2026-06-02T17:11:56Z) - DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows [22.16698382751559]
大規模言語モデル(LLM)は、ユーザの意図をコードに変換することによって、データガバナンスを自動化するための有望なソリューションとして登場した。
既存の自動データサイエンスのベンチマークでは、スニペットレベルのコーディングや高レベルの分析が強調されることが多い。
データGovBenchは、実際のケースのデータに基づいて構築された、現実世界のシナリオに基盤を置く150の多様なタスクを特徴とするベンチマークです。
論文 参考訳(メタデータ) (2025-12-04T03:25:12Z) - DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle [41.576417987200074]
実世界のエンタープライズデータインテリジェンスには、ソースを分析可能なテーブルに変換するデータエンジニアリングや、これらのテーブルを意思決定指向の洞察に変換するデータ分析が含まれる。
複雑な機能を反映した210タスクのベンチマークであるDACompを紹介します。
論文 参考訳(メタデータ) (2025-12-03T23:21:28Z) - DRBench: A Realistic Benchmark for Enterprise Deep Research [81.49694432639406]
DRBenchは、エンタープライズ環境で複雑でオープンなディープリサーチタスクでAIエージェントを評価するためのベンチマークである。
セールス、サイバーセキュリティ、コンプライアンスなど10のドメインにわたる15のディープリサーチタスクをリリースしています。
論文 参考訳(メタデータ) (2025-09-30T18:47:20Z) - T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables [65.12524437711737]
本稿では,テーブル・ツー・レポーティングタスクを提案し,T2R-benchというバイリンガルベンチマークを構築した。
ベンチマークは457の産業用テーブルで構成されており、すべて現実世界のシナリオから導かれ、19の産業ドメインを含んでいる。
25台のLLMでの実験では、Deepseek-R1のような最先端のモデルでさえ62.71のスコアでしかパフォーマンスが得られないことがわかった。
論文 参考訳(メタデータ) (2025-08-27T11:55:40Z) - DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? [58.330879414174476]
現実的なタスクでデータサイエンスエージェントを評価するためのベンチマークであるDSBenchを紹介する。
このベンチマークには、466のデータ分析タスクと、EloquenceとKaggleのコンペからソースされた74のデータモデリングタスクが含まれている。
現状のLLM, LVLM, エージェントを評価したところ, 最高のエージェントはデータ解析タスクの34.12%しか解決できず, RPG(Relative Performance Gap)は34.74%であった。
論文 参考訳(メタデータ) (2024-09-12T02:08:00Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。