論文の概要: DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
- arxiv url: http://arxiv.org/abs/2608.03451v1
- Date: Tue, 04 Aug 2026 10:48:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.14537
- Title: DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
- Title(参考訳): DataSpace: 異種ワークスペース上での検証可能な分析のためのベンチマークデータエージェント
- Abstract要約: データエージェントは、組織ワークスペース上の自然言語分析を可能にする。
既存のベンチマークは、構造化クエリ、検索、あるいはオープンエンド分析を主に分離している。
データエージェントが検証可能な表形式の結果を生成するベンチマークであるDataSpaceを紹介する。
- 参考スコア(独自算出の注目度): 25.28248447900504
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data agents enable natural-language analytics over organizational workspaces, where relevant evidence may be scattered across databases, structured files, long documents, and multimedia. Existing benchmarks largely isolate structured querying, retrieval, or open-ended analysis, leaving heterogeneous evidence discovery, complete tabular outputs, and deterministic evaluation insufficiently unified. We introduce DataSpace, a benchmark in which data agents produce verifiable tabular results from task-local heterogeneous workspaces. It contains 410 cross-language tasks and 7,439 artifacts totaling 15.01 GB across CSV, JSON, SQLite, Markdown, PDF, and video. DataSpace also served as the official evaluation benchmark for the KDD Cup 2026 Data Agents for Complex Data Analysis competition. Each agent receives only a question and workspace and returns the complete requested tabular result. We construct DataSpace with DataSpace-Builder, an execution-grounded framework comprising cross-language transformation, constraint-aware relational sampling, modality routing and artifact rendering, and human review and task repair by 11 domain experts. A deterministic evaluator performs header-invariant column alignment, type- and precision-aware normalization, and order-aware row comparison. Across six recently released frontier multimodal models and five widely used agent harnesses, the best accuracy reaches 66.34%, while harness choice creates a 15.36-point spread with the backbone fixed. Multimodal evidence integration and joins consistently reduce accuracy across all six backbones. These results show that DataSpace remains unsaturated and identify key challenges for improving data-agent reliability.
- Abstract(参考訳): データエージェントは、データベース、構造化ファイル、長いドキュメント、マルチメディアに関連性のある証拠が散在する可能性のある、組織ワークスペース上の自然言語分析を可能にする。
既存のベンチマークは、構造化クエリ、検索、またはオープンエンド分析を主に分離し、不均一な証拠発見、完全な表出力、決定論的評価が不十分に統一されたままである。
データエージェントがタスクローカルな異種ワークスペースから検証可能な表形式の結果を生成するベンチマークであるDataSpaceを紹介する。
410のクロスランゲージタスクと、CSV、JSON、SQLite、Markdown、PDF、ビデオで合計15.01GBの7,439のアーティファクトが含まれている。
DataSpaceはまた、KDD Cup 2026 Data Agents for Complex Data Analysisコンペティションの公式評価ベンチマークとしても機能した。
各エージェントは質問とワークスペースのみを受け取り、要求された完全な表結果を返す。
我々はDataSpaceをDataSpace-Builderで構築する。DataSpaceは言語間変換、制約対応リレーショナルサンプリング、モダリティルーティングとアーティファクトレンダリング、11のドメインエキスパートによるヒューマンレビューとタスク修復を含む実行基盤フレームワークである。
決定論的評価器は、ヘッダ不変列アライメント、タイプ・アンド・精度・正規化、順序・認識行比較を行う。
最近リリースされた6つのフロンティア・マルチモーダルモデルと5つの広く使われているエージェントハーネスで、最良の精度は66.34%に達し、ハーネスの選択はバックボーンを固定した15.36ポイントのスプレッドを作る。
マルチモーダルエビデンスの統合と結合は、6つのバックボーン全体の精度を一貫して低下させる。
これらの結果は、DataSpaceが未飽和のままであり、データエージェントの信頼性を改善する上で重要な課題を特定していることを示している。
関連論文リスト
- Extracting Dataset Mentions in Forced Displacement and FCV Documents: A Weakly Supervised Framework with LLM-Based Label Refinement [0.0]
本稿では,データセット抽出を強制変位,Fragile,Conflict, Violence(FCV)文書に適用するためのフレームワークを提案する。
一般的な研究文献に基づいて訓練された軽量モデルは、ラベルのないドメイン文書から候補データセットの言及を生成する。
我々は、研究、人道、運用文書にまたがる1,706本のテキストパスの独立したゴールドスタンダード・ベンチマークで、結果のモデルを評価した。
論文 参考訳(メタデータ) (2026-09-10T18:34:08Z) - What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents [81.23160457293714]
LLMエージェントは、外部環境とのインタラクションの方法を学ぶために、生成されるインタラクションデータにますます依存している。
既存の作業は多くのエージェントドメインにまたがっているが、ドメイン中心の組織と不均一な評価はしばしば共通生成機構を曖昧にしている。
この研究は、この分野のための2段階のフレームワークを開発する。
論文 参考訳(メタデータ) (2026-08-27T15:43:50Z) - Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning [0.41942958779358674]
既存の評価は、孤立した単一プラットフォーム環境に焦点を当てている。
我々は、50個のデータ基底タスクのプロダクショングレードベンチマークであるCross-Vendor Sola ISPMベンチマークを紹介する。
また、最終回答の正当性だけでなく、明らかな根拠も測定する評価フレームワークにも貢献する。
論文 参考訳(メタデータ) (2026-06-01T12:41:00Z) - Do Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval [3.6202634353482352]
構造化されていないWebをナビゲートできるLarge Language Models(LLM)の台頭は、根本的な疑問を提起する。
オープンウェブ文書を検索するベースラインエージェントと、スキーマ.orgを用いて9000万のデータセットのコーパスを利用するセマンティックエージェントの2つの異なる環境におけるエージェントデータ検索の比較分析を行う。
セマンティック・エージェントは動作可能なデータを抽出し、メタデータ豊富なレジストリの44.9%の精度と、返却された結果の中で機械可読なダウンロードを持つページの46.6%の精度を達成する。
論文 参考訳(メタデータ) (2026-05-27T17:46:43Z) - DataClaw: A Process-Oriented Agent Benchmark for Exploratory Real-World Data Analysis [76.98578575566184]
DataClawは、探索的実世界のデータ分析のためのプロセス指向のベンチマークである。
企業、産業、および政策ドメイン全体で約2億6600万の現実世界の記録がある。
DataClawは、エージェントがどこまで進歩し、その推論がどこで壊れるかを測定する。
論文 参考訳(メタデータ) (2026-05-04T11:57:09Z) - TADI: Tool-Augmented Drilling Intelligence via Agentic LLM Orchestration over Heterogeneous Wellsite Data [0.0]
TADI(Tool-Augmented Drilling Intelligence)は、ドリル操作データをエビデンスベースの分析インテリジェンスに変換するエージェントAIシステムである。
TADIは、毎日1,759件の掘削レポート、選択されたWITリアルタイムオブジェクト、15,634件の生産記録、生成トップ、穴を二重ストアアーキテクチャに統合している。
論文 参考訳(メタデータ) (2026-04-30T03:19:39Z) - DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis [8.171937411588015]
我々は、統合された洞察駆動分析のための新しいベンチマークと協調エージェントフレームワークであるDataCrossを紹介する。
DataCrossBenchには、ファイナンス、ヘルスケア、その他のドメインにわたる200のエンドツーエンド分析タスクが含まれている。
また、人間アナリストの「分割合成」ワークフローにインスパイアされたDataCrossAgentフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T08:40:45Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - From Questions to Queries: An AI-powered Multi-Agent Framework for Spatial Text-to-SQL [0.4499833362998488]
単一エージェントアプローチは、空間的クエリのセマンティックおよび構文的複雑さにしばしば苦労する。
本稿では,自然言語質問を空間的クエリに正確に翻訳するためのマルチエージェントフレームワークを提案する。
我々は,非空間的KaggleDBQAベンチマークと包括的SpatialQAベンチマークを用いて,本システムの評価を行った。
論文 参考訳(メタデータ) (2025-10-23T22:58:17Z) - Scaling Generalist Data-Analytic Agents [95.05161133349242]
DataMindは、汎用データ分析エージェントを構築するために設計されたスケーラブルなデータ合成およびエージェントトレーニングレシピである。
DataMindは、オープンソースのデータ分析エージェントを構築する上で重要な3つの課題に取り組む。
論文 参考訳(メタデータ) (2025-09-29T17:23:08Z) - Benchmarking Deep Search over Heterogeneous Enterprise Data [73.55304268238474]
検索強化生成(RAG)の形式を評価するための新しいベンチマークを提案する。
RAGは、多種多様な、しかし関連するソースに対して、ソースを意識したマルチホップ推論を必要とする。
製品計画、開発、サポートステージをまたいだビジネスをシミュレートする合成データパイプラインを使用して構築します。
論文 参考訳(メタデータ) (2025-06-29T08:34:59Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z) - AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning [98.26836657967162]
textbfAgentOhanaは、さまざまなシナリオにまたがって、異なる環境からエージェントのトラジェクトリを集約する。
AIエージェント用に調整された大規模なアクションモデルである textbfxLAM-v0.1 は、さまざまなベンチマークで例外的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-02-23T18:56:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。