論文の概要: CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- arxiv url: http://arxiv.org/abs/2607.08093v1
- Date: Thu, 09 Jul 2026 04:03:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.409308
- Title: CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- Title(参考訳): CausalDS: データサイエンスエージェントにおける因果推論のベンチマーク
- Authors: Andrej Leban, Yuekai Sun,
- Abstract要約: CausalDSはエージェントデータサイエンスにおける因果推論を評価するためのベンチマークである。
実世界のデータセットから得られた経験的分布にベンチマークの構成を基礎づける。
このベンチマークは、象徴的な因果推論、データサイエンス、不確実性、棄権、ツールの使用/コーディングを共同で評価する。
- 参考スコア(独自算出の注目度): 21.447650293970458
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) increasingly act as integrated data-science agents, combining abstract reasoning with advanced tool use. Yet the relevant benchmark landscape largely divides into symbolic causal reasoning benchmarks without realistic data analysis or data analysis benchmarks without a principled causal data-generating structure. Furthermore, existing causal evaluation datasets are often restricted to curated examples from existing sources, with diversity coming from limited templatized variations rather than from systematic generation of novel synthetic causal structures. We introduce CausalDS, a benchmark for evaluating causal reasoning in agentic data-science workflows. Each benchmark instance is a scene consisting of a sampled structural causal model (SCM) with generated observational data and an accompanying synthetic natural-language story grounded in a realistic domain. We optionally ground the composition of the benchmark components in empirical distributions obtained from real-world datasets, thus retaining empirical structure while reducing the "causal parrot" risk through completely synthetic generation. From each scene, we then derive tasks spanning all three of Pearl's rungs, with typical data-science prediction tasks appearing as Rung 1. Most tasks include a data science coding component, where the model typically needs to use several tools to arrive at the final answer due to the frequent presence of imperfect observations, which are generated by an observation model. Additionally, recognizing when a question admits no warranted answer and abstaining is treated as a first-class scored outcome. The benchmark thus jointly evaluates symbolic causal reasoning, data science, uncertainty quantification, abstention, and tool use/coding.
- Abstract(参考訳): 大規模言語モデル(LLM)は、抽象推論と高度なツールの使用を組み合わせた統合データサイエンスエージェントとしての役割をますます高めている。
しかし、関連するベンチマークのランドスケープは、現実的なデータ分析やデータ分析のベンチマークのない、原則化された因果データ生成構造のないシンボリック因果推論ベンチマークに大きく分けられている。
さらに、既存の因果評価データセットは、しばしば既存のソースからのキュレートされた例に制限される。
エージェントデータサイエンスワークフローにおける因果推論を評価するためのベンチマークであるCausalDSを紹介する。
それぞれのベンチマークインスタンスは、サンプル化された構造因果モデル(SCM)と、実際の領域に根ざした合成自然言語の物語からなるシーンである。
実世界のデータセットから得られた経験的分布にベンチマーク成分の組成を任意に固定し, 完全合成生成による「因果オウム」リスクを低減しつつ, 経験的構造を維持する。
各シーンからパールラングの3つすべてにまたがるタスクが導出され、典型的なデータサイエンス予測タスクがRung 1として現れる。
ほとんどのタスクには、データサイエンスコーディングコンポーネントが含まれており、一般的に、観測モデルによって生成される不完全な観測が頻繁に存在するため、最終回答に到達するために、モデルがいくつかのツールを使用する必要がある。
さらに、質問が保証された回答を認めず、棄権が第一級評価結果として扱われることを認識する。
このベンチマークは、象徴的な因果推論、データサイエンス、不確実な定量化、棄権、ツールの使用/コーディングを共同で評価する。
関連論文リスト
- Causal Ensemble Agent: Hierarchical Causal Discovery with LLM-guided Expert Reweighting [95.24017293537025]
Causal Ensemble Agent (CEA) は、さまざまなグラフレベルにわたる統計発見の専門家による構造的洞察を集約する新しいフレームワークである。
CEAは、幅広い因果発見手法において、最も優れた総合的なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-06-09T09:09:07Z) - CALM: A Causal Analysis Language Model for Tabular Data in Complex Systems with Local Scores, Conditional Independence Tests, and Relation Attributes [15.298086464296235]
観測データからの因果発見は生物学のような科学分野に不可欠である。
制約ベースのアプローチやスコアベースのアプローチを含む既存の手法は、重大な制限に直面している。
本稿では,表データに特化して設計された新しい因果解析言語CALMを紹介する。
論文 参考訳(メタデータ) (2025-10-10T20:19:20Z) - Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination [77.69093448529455]
本稿では,arXiv論文から直接研究レベルのQAを合成するために,無限にスケーラブルなフレームワークを用いて実証的研究を行う。
各種サイズ,開発者,リリース日といったモデルについて,知識カットオフ日に近い性能劣化の欠如を評価した。
合成パイプラインで要求される多段階の推論は、浅い記憶よりも深い複雑さをもたらしたと仮定する。
論文 参考訳(メタデータ) (2025-08-26T16:41:37Z) - Valid Inference with Imperfect Synthetic Data [39.10587411316875]
モーメントの一般化法に基づく新しい推定器を提案する。
合成データのモーメント残差と実データのモーメント間の相互作用は、対象パラメータの推定を大幅に改善できることがわかった。
論文 参考訳(メタデータ) (2025-08-08T18:32:52Z) - Temporal Causal-based Simulation for Realistic Time-series Generation [1.49201581313345]
因果発見(Causal Discovery)は、観察された変数間の関係を明らかにする上で、特に時間的設定において重要な役割を果たす。
因果構造、効果、時間に関する簡易な仮定に基づく生成技術は、シミュレーションデータの品質と多様性を制限する。
本稿では,実時間時系列データとその関連する時間因果グラフを生成するための堅牢なフレームワークである時間因果シミュレーション(TCS)を紹介する。
論文 参考訳(メタデータ) (2025-06-02T10:59:48Z) - CAnDOIT: Causal Discovery with Observational and Interventional Data from Time-Series [4.008958683836471]
CAnDOITは、観測データと介入データの両方を用いて因果モデルを再構築する因果発見手法である。
因果解析における介入データの利用は、ロボット工学のような現実世界の応用には不可欠である。
CAnDOITのPython実装も開発され、GitHubで公開されている。
論文 参考訳(メタデータ) (2024-10-03T13:57:08Z) - Discovering Mixtures of Structural Causal Models from Time Series Data [23.18511951330646]
基礎となる因果モデルを推測するために, MCD と呼ばれる一般的な変分推論に基づくフレームワークを提案する。
このアプローチでは、データ可能性のエビデンス-ローバウンドを最大化するエンドツーエンドのトレーニングプロセスを採用しています。
本研究では,本手法が因果発見タスクにおける最先端のベンチマークを上回ることを実証する。
論文 参考訳(メタデータ) (2023-10-10T05:13:10Z) - Amortized Inference for Causal Structure Learning [72.84105256353801]
因果構造を学習することは、通常、スコアまたは独立テストを使用して構造を評価することを伴う探索問題を引き起こす。
本研究では,観測・干渉データから因果構造を予測するため,変分推論モデルを訓練する。
我々のモデルは、実質的な分布シフトの下で頑健な一般化能力を示す。
論文 参考訳(メタデータ) (2022-05-25T17:37:08Z) - A comprehensive comparative evaluation and analysis of Distributional
Semantic Models [61.41800660636555]
我々は、静的DSMによって生成されたり、BERTによって生成された文脈化されたベクトルを平均化して得られるような、型分布ベクトルの包括的評価を行う。
その結果、予測ベースモデルの優越性は現実よりも明らかであり、ユビキタスではないことが明らかとなった。
我々は認知神経科学からRepresentational similarity Analysis(RSA)の方法論を借りて、分布モデルによって生成された意味空間を検査する。
論文 参考訳(メタデータ) (2021-05-20T15:18:06Z) - CausalVAE: Structured Causal Disentanglement in Variational Autoencoder [52.139696854386976]
変分オートエンコーダ(VAE)の枠組みは、観測から独立した因子をアンタングルするために一般的に用いられる。
本稿では, 因果内因性因子を因果内因性因子に変換する因果層を含むVOEベースの新しいフレームワークCausalVAEを提案する。
その結果、CausalVAEが学習した因果表現は意味論的に解釈可能であり、DAG(Directed Acyclic Graph)としての因果関係は精度良く同定された。
論文 参考訳(メタデータ) (2020-04-18T20:09:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。