論文の概要: Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- arxiv url: http://arxiv.org/abs/2607.06482v1
- Date: Tue, 07 Jul 2026 16:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.590751
- Title: Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- Title(参考訳): 野生におけるデータ分析: 実世界のデータ複雑さに対する大規模言語モデルのベンチマーク
- Abstract要約: 我々は,大規模言語モデルを評価するためのベンチマークであるDataGovBenchを紹介する。
最先端のLLMによる総合的な実験では、両方のタスク間で大きなパフォーマンスギャップが示される。
DataGovBenchは、分析クエリの応答とデータからの洞察の発見の両方が可能なLLMの研究を進める上で、困難なベンチマークを提供する。
- 参考スコア(独自算出の注目度): 16.09389994769264
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current benchmarks for evaluating Large Language Models (LLMs) in data analysis often fail to reflect real-world settings. They typically focus on fact retrieval from small tables and overlook the challenges of large multi-tabular datasets, external knowledge integration, and exploratory insight discovery. We introduce DataGovBench, a benchmark derived from governmental open data designed to evaluate LLMs in practical scenarios. The benchmark includes two tasks: Table QA that requires solving complex decomposable questions and producing textual answers or visualizations, and Table Insight that evaluates the ability of models to generate expert-level findings through exploratory data analysis. Comprehensive experiments with state-of-the-art LLMs, both with and without agentic frameworks, reveal significant performance gaps across both tasks. These results suggest that current LLM-based systems remain far from satisfying the demands of real-world data analytics. DataGovBench provides a challenging benchmark for advancing research on LLMs capable of both answering analytical queries and discovering insights from data. Code and sample data are available at https://github.com/SoHasegawa/datagovbench.
- Abstract(参考訳): データ分析において、LLM(Large Language Models)を評価するための現在のベンチマークは、現実世界の設定を反映しないことが多い。
彼らは通常、小さなテーブルから事実を検索することに集中し、大規模なマルチタブラルデータセット、外部知識の統合、探索的洞察発見の課題を見落としている。
我々は,LLMを実用シナリオで評価するために設計された政府のオープンデータから得られたベンチマークであるDataGovBenchを紹介する。
このベンチマークには2つのタスクが含まれている: 複雑な分解可能な質問を解決し、テキストによる回答や視覚化を生成するテーブルQAと、探索データ分析を通じて専門家レベルの結果を生成するモデルの能力を評価するテーブルInsightである。
エージェントフレームワークと非エージェントフレームワークの両方で、最先端のLLMによる総合的な実験は、両方のタスク間で大きなパフォーマンスギャップを明らかにします。
これらの結果は、現在のLLMベースのシステムは、実世界のデータ分析の要求を満たすには程遠いことを示唆している。
DataGovBenchは、分析クエリの応答とデータからの洞察の発見の両方が可能なLLMの研究を進める上で、困難なベンチマークを提供する。
コードとサンプルデータはhttps://github.com/SoHasegawa/datagovbench.comで公開されている。
関連論文リスト
- Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets [0.03683202928838612]
本稿では,大規模言語モデル(LLM)の有効性について検討する。
難易度の異なる質問を含む2つのデータセットで実験を行った。
その結果,より小型でコスト効率のよいモデルの限界を浮き彫りにしながら,大型LLMの強い性能を示した。
論文 参考訳(メタデータ) (2026-05-11T11:54:47Z) - LLM/Agent-as-Data-Analyst: A Survey [54.08761322298559]
大規模言語モデル(LLM)とエージェント技術は、データ分析タスクの機能と開発パラダイムに根本的な変化をもたらした。
LLMは複雑なデータ理解、自然言語、意味分析機能、自律パイプラインオーケストレーションを可能にする。
論文 参考訳(メタデータ) (2025-09-28T17:31:38Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data [61.936320820180875]
大規模言語モデル(LLM)は、様々な領域でますます重要になっている。
BabelBenchは、コード実行によるマルチモーダルなマルチ構造化データ管理におけるLLMの熟練度を評価する革新的なベンチマークフレームワークである。
BabelBenchの実験結果から,ChatGPT 4のような最先端モデルでさえ,大幅な改善の余地があることが示唆された。
論文 参考訳(メタデータ) (2024-10-01T15:11:24Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z) - DARG: Dynamic Evaluation of Large Language Models via Adaptive Reasoning Graph [70.79413606968814]
本稿では,適応推論グラフ展開(DARG)によるLCMの動的評価を導入し,複雑性と多様性を制御した現在のベンチマークを動的に拡張する。
具体的には、まず現在のベンチマークでデータポイントの推論グラフを抽出し、それから推論グラフを摂動させて新しいテストデータを生成する。
このような新しく生成されたテストサンプルは、元のベンチマークと同様の言語的多様性を維持しながら、複雑さのレベルが異なる可能性がある。
論文 参考訳(メタデータ) (2024-06-25T04:27:53Z) - Can Long-Context Language Models Subsume Retrieval, RAG, SQL, and More? [54.667202878390526]
長文言語モデル(LCLM)は、従来、検索システムやデータベースといった外部ツールに依存していたタスクへのアプローチに革命をもたらす可能性がある。
実世界のタスクのベンチマークであるLOFTを導入し、文脈内検索と推論においてLCLMの性能を評価するために設計された数百万のトークンを出力する。
以上の結果からLCLMは,これらのタスクを明示的に訓練したことがないにも関わらず,最先端の検索システムやRAGシステムと競合する驚くべき能力を示した。
論文 参考訳(メタデータ) (2024-06-19T00:28:58Z) - DCA-Bench: A Benchmark for Dataset Curation Agents [9.60250892491588]
不完全なドキュメンテーション、不正確なラベル、倫理的懸念、時代遅れの情報といったデータ品質問題は、広く使われているデータセットで共通している。
大きな言語モデル(LLM)の急増する能力により、LLMエージェントによる隠れデータセット問題の発見の合理化が約束されている。
本研究では,この課題に対処するLLMエージェントの能力を評価するためのベンチマークを確立する。
論文 参考訳(メタデータ) (2024-06-11T14:02:23Z) - CMDBench: A Benchmark for Coarse-to-fine Multimodal Data Discovery in Compound AI Systems [10.71630696651595]
知識集約的なタスクを達成するエージェントとしてLLMを使用する複合AIシステム(CAS)は、データベースやAIコミュニティにおいて大きな関心を集めている。
マルチモーダルデータソースのサイロは、そのタスクを達成するための適切なデータソースを特定するのを困難にしている。
我々はエンタープライズデータプラットフォームの複雑さをモデル化したベンチマークであるCMDBenchを提案する。
論文 参考訳(メタデータ) (2024-06-02T01:10:41Z) - Investigating Table-to-Text Generation Capabilities of LLMs in
Real-World Information Seeking Scenarios [32.84523661055774]
タブラルデータは様々な産業で広く使われており、ユーザが情報検索の目的を理解し、操作するのにかなりの時間と労力を要する。
テーブル情報探索における大規模言語モデル (LLM) の現実的応用は, いまだに実証されていない。
本稿では,2つの実世界情報探索シナリオ内の4つのデータセットを用いて,異なるLLMのテーブル・トゥ・テキスト機能について検討する。
論文 参考訳(メタデータ) (2023-05-24T10:22:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。