論文の概要: Benchmarking Language Models for Statistical Problem Formulation
- arxiv url: http://arxiv.org/abs/2609.01982v1
- Date: Wed, 02 Sep 2026 01:37:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.025921
- Title: Benchmarking Language Models for Statistical Problem Formulation
- Title(参考訳): 統計的問題定式化のための言語モデルのベンチマーク
- Authors: Chen Wang, Junzhe Zhao, Xin Cong, Wanlu Deng, Ke Deng,
- Abstract要約: StatFormBenchは5つのクロスドメイン統計教科書とデータサイエンスケースライブラリから構築されたベンチマークである。
20の粗い粒度と85の微粒な統計問題にまたがる1,013のサンプルを含んでいる。
モデルが2つのサブタスクで常に最善を尽くすことはないが、強化されたプロンプト戦略は限られた利得または一貫性のない利得しか得られない。
- 参考スコア(独自算出の注目度): 15.739640186203474
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly used as assistants for statistical and data science work, yet existing evaluations largely assume the analysis target is already specified. In practice, users arrive with informal goals and heterogeneous data, leaving the model to decide what statistical task is implied and which data are relevant. We first formalize this upstream step as Statistical Problem Formulation and decompose it into two subtasks: (1) Statistical Problem Classification and (2) Variable Identification & Role Assignment. We then introduce StatFormBench, a benchmark built from five cross-domain statistics textbooks and a data science case library, covering diverse problem types, data representations, and scenario styles. It contains 1,013 samples spanning 20 coarse-grained and 85 fine-grained statistical problem categories. Across 14 open- and closed-source LLMs, the best zero-shot models reach only 72.0 fine-grained classification accuracy and 63.2 variable set overlap. No model performs consistently best across the two subtasks, while enhanced prompting strategies yield only limited or inconsistent gains. We release the benchmark data on Hugging Face at https://huggingface.co/datasets/THU-CongLab/StatFormBench and the evaluation code on GitHub at https://github.com/THU-CongLab/StatFormBench.
- Abstract(参考訳): 大規模言語モデル (LLMs) は統計学やデータサイエンス研究のアシスタントとしてますます使われているが、既存の評価では分析対象がすでに特定されていると推定されている。
実際には、ユーザは非公式な目標と異種データを持って到着し、どの統計タスクが暗示されているか、どのデータが関連しているかを決定するためのモデルを残します。
まず、この上流ステップを統計的問題定式化として定式化し、(1)統計的問題分類と(2)変数識別と役割割り当ての2つのサブタスクに分解する。
次に,5つのクロスドメイン統計教科書とデータサイエンスケースライブラリから構築されたベンチマークStatFormBenchを紹介し,さまざまな問題タイプ,データ表現,シナリオスタイルについて紹介する。
20の粗い粒度と85の微粒な統計問題にまたがる1,013のサンプルを含んでいる。
14のオープンソースおよびクローズドソース LLM で、最高のゼロショットモデルは72.0きめ細かい分類精度と63.2変数セットオーバーラップにしか達しない。
モデルが2つのサブタスクで常に最善を尽くすことはないが、強化されたプロンプト戦略は限られた利得または一貫性のない利得しか得られない。
We release the benchmark data on Hugging Face at https://huggingface.co/datasets/THU-CongLab/StatFormBench and the evaluation code on GitHub at https://github.com/THU-CongLab/StatFormBench。
関連論文リスト
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs [26.57002473586959]
本稿では,大規模言語モデルの統計的解析能力を評価するためのベンチマークであるStatABenchを紹介する。
Stat-Closedは18の統計トピックにまたがる404の質問を複数のフォーマットで含む。
我々は,LangChain MCP フレームワークと複数のデータサイエンスエージェントを用いて多様な LLM を評価し,検証された LLM-as-Judge プロトコルを用いてStat-Open ソリューションを評価する。
論文 参考訳(メタデータ) (2026-06-22T07:57:53Z) - StatEval: A Comprehensive Benchmark for Large Language Models in Statistics [18.64342811887586]
StatEvalは統計学に特化した最初の総合ベンチマークであり、難易度をまたいだ幅と深さの両方にまたがる。
学部と大学院のカリキュラムに関する13,817の基本的な問題と、主要な雑誌から抽出された2374の研究レベルの証明タスクで構成されている。
本稿では,算術的タスクと証明的タスクの両方に適したロバストな評価フレームワークを提案し,推論能力のきめ細かい評価を可能にする。
論文 参考訳(メタデータ) (2025-10-10T16:28:43Z) - LimiX: Unleashing Structured-Data Modeling Capability for Generalist Intelligence [61.46575527504109]
LimiX-16MとLimiX-2Mは、構造化されたデータを変数と欠落に対する共同分布として扱う。
サンプルサイズ,特徴次元,クラス数,カテゴリ間特徴比,欠落度,サンプル-特徴比の広い11種類の大規模構造化データベンチマークを対象としたLimiXモデルの評価を行った。
論文 参考訳(メタデータ) (2025-09-03T17:39:08Z) - Training on the Benchmark Is Not All You Need [52.01920740114261]
本稿では,複数選択肢の内容に基づいた簡易かつ効果的なデータ漏洩検出手法を提案する。
本手法は,モデルトレーニングデータや重みを使用せずに,グレーボックス条件下で動作可能である。
4つのベンチマークデータセットから35個の主要なオープンソースLCMのデータ漏洩度を評価する。
論文 参考訳(メタデータ) (2024-09-03T11:09:44Z) - Variance Alignment Score: A Simple But Tough-to-Beat Data Selection
Method for Multimodal Contrastive Learning [17.40655778450583]
本稿では、Sigma_texttest, Sigma_irangle$という形式を持つVariance Alignment Score(VAS)という原則付き計量を提案する。
VASとCLIPのスコアを合わせると、ノイズの多いデータセットDataCompの38評価セットに1.3%、高品質なデータセットCC12MのVTABに2.5%の差でベースラインを上回ります。
論文 参考訳(メタデータ) (2024-02-03T06:29:04Z) - A Statistical View of Column Subset Selection [47.65143789184956]
大規模データセットから代表変数の小さなサブセットを選択することの問題点を考察する。
提案手法では,(1)元のデータセットからの要約統計データのみを用いてCSSを効率的に実行する方法,(2)欠落データや検閲データの存在下でCSSを実行する方法,(3)仮説テストフレームワークでCSSのサブセットサイズを選択する方法を示す。
論文 参考訳(メタデータ) (2023-07-24T15:42:33Z) - RIFLE: Imputation and Robust Inference from Low Order Marginals [10.082738539201804]
我々は,不備なデータの存在下での回帰と分類のための統計的推論フレームワークを開発する。
我々のフレームワークであるRIFLEは、基礎となるデータ分布の低次モーメントを対応する信頼区間で推定し、分布的に堅牢なモデルを学ぶ。
実験の結果,RIFLEは,欠落値の割合が高い場合や,データポイント数が比較的小さい場合には,他のベンチマークアルゴリズムよりも優れていることがわかった。
論文 参考訳(メタデータ) (2021-09-01T23:17:30Z) - Examining and Combating Spurious Features under Distribution Shift [94.31956965507085]
我々は、最小限の統計量という情報理論の概念を用いて、ロバストで刺激的な表現を定義し、分析する。
入力分布のバイアスしか持たない場合でも、モデルはトレーニングデータから急激な特徴を拾い上げることができることを証明しています。
分析から着想を得た結果,グループDROは,グループ同士の相関関係を直接考慮しない場合に失敗する可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-14T05:39:09Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。