論文の概要: DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
- arxiv url: http://arxiv.org/abs/2607.20465v1
- Date: Tue, 19 May 2026 02:23:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.183206
- Title: DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
- Title(参考訳): DataPrep-Bench: LLMをトレーニングデータプレパレータとしてベンチマークする
- Abstract要約: データ構築とデータ品質評価を共同で評価する最初の統合ベンチマークであるDataPrep-Benchを紹介する。
データ構築には、同一の原料を消費し、Dlly-15kと共同で出力のベースモデルを微調整する。
データ品質評価において、スコアリング関数は、共有候補プールの下流性能とピアソン相関によりスコアされる。
- 参考スコア(独自算出の注目度): 35.76000147244654
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The quality of training data fundamentally determines the capabilities of large language models (LLMs), yet no unified benchmark exists to measure how well LLMs, agents, and data-centric workflows actually prepare training data end to end. We view LLM-driven data preparation as comprising two complementary capabilities: data construction, which transforms raw sources into supervised training data, and data quality evaluation, which predicts the training value of candidate datasets before downstream training; throughout, "quality" refers to downstream training utility rather than surface-level textual properties. We introduce DataPrep-Bench, the first unified benchmark that jointly evaluates both capabilities under a shared downstream-grounded protocol over six domains and multiple base models. For data construction, methods consume identical raw sources and are scored by fine-tuning a base model on their outputs jointly with Dolly-15k; alongside this track we release Data-Construction-Skill, a skill-guided agent that lifts the Dolly-only baseline by nearly 20 points absolute on Llama-3.1-8B Finance and is competitive with the strongest agent- and DataFlow-based methods in knowledge-extraction-dense domains. For data quality evaluation, scoring functions are scored by Pearson correlation with downstream performance on a shared candidate pool; we release the Distributional Alignment Score (DAS), a distribution-based evaluator that uses MMD between a candidate dataset and a domain proxy. DAS attains the strongest cross-model correlation in four of six domains and is the only metric clearing r > 0.70 simultaneously in Math, Science, and Medical, outperforming existing quality-, diversity-, and heuristic-based evaluators. DataPrep-Bench provides a unified, downstream-grounded framework for measuring progress on both capabilities as co-equal targets of LLM-driven data preparation.
- Abstract(参考訳): トレーニングデータの質は、大規模言語モデル(LLM)の能力を根本的に決定するが、LLM、エージェント、データ中心のワークフローが実際にトレーニングデータをエンドツーエンドに準備するかどうかを測定するための統一されたベンチマークは存在しない。
我々は,LLMによるデータ作成を,原資料を教師付きトレーニングデータに変換するデータ構築と,下流トレーニングの前に候補データセットのトレーニング値を予測するデータ品質評価の2つの相補的な機能とみなす。
DataPrep-Benchは、6つのドメインと複数のベースモデルで共有されたダウンストリームグラウンドプロトコルの下で、両方の機能を共同で評価する最初の統一ベンチマークである。
データ構築には、同一のソースを消費し、Dlly-15kと共同でアウトプットのベースモデルを微調整し、このトラックと共に、Llama-3.1-8Bファイナンス上で、Dllyのみのベースラインを20ポイント近く持ち上げ、知識抽出ドメインにおける最強のエージェントとDataFlowベースのメソッドと競合する、スキル誘導エージェントであるData-Construction-Skillをリリースする。
データ品質評価では、ピアソン相関と共有候補プールの下流性能によりスコアリング関数が評価され、候補データセットとドメインプロキシの間でMDDを使用する分布型評価器である分散アライメントスコア(DAS)がリリースされる。
DASは6つの領域のうち4つの領域で最強のクロスモデル相関を達成し、数学、科学、医学において同時に r > 0.70 をクリアし、既存の品質、多様性、ヒューリスティックに基づく評価器よりも優れている。
DataPrep-Benchは、LLM駆動のデータ準備の同等なターゲットとして両方の能力の進捗を測定する、統一された下流の基盤となるフレームワークを提供する。
関連論文リスト
- DataMaster: Data-Centric Autonomous AI Research [51.95819363392062]
タスク条件付き自律データエンジニアリングについて検討し、エージェントがデータ側のみを最適化することで、固定学習アルゴリズムを改善する。
木構造検索,共有候補データ,累積メモリを統合したデータエージェントフレームワークであるDataMasterを提案する。
MLE-Bench LiteとPostTrainBenchの2種類のベンチマークでDataMasterを評価する。
論文 参考訳(メタデータ) (2026-05-11T17:46:24Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance [29.94723846950853]
我々は、Tulu-3-SFT-MixとSmolTalkという2つの著名なオープントレーニング後のデータセットを総合的に分析した。
構造的および質的な類似点と2つのデータセットの違いを明らかにする統計を導出する。
我々の発見は、より効果的なトレーニング後のデータセットを構築するための実用的な洞察を提供する。
論文 参考訳(メタデータ) (2025-06-06T20:34:06Z) - DataMan: Data Manager for Pre-training Large Language Models [39.677609311769146]
既存の方法は限定的な直観に依存しており、包括的で明確なガイドラインを欠いている。
テキストパープレキシティ異常の原因から14の品質基準を導出し、ドメイン混合をサポートするために15の共通アプリケーションドメインを導入する。
実験では、DataManを使って30Bトークンを選択し、1.3B-パラメータ言語モデルをトレーニングし、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2025-02-26T18:01:19Z) - Improving Pretraining Data Using Perplexity Correlations [56.41097718862742]
我々は,LLM学習を必要とせず,高品質な事前学習データを選択するフレームワークを提案する。
我々は,パープレキシティ-ベンチマーク相関の推定を中心に,データ選択のための新しい統計フレームワークを構築した。
提案手法は,DataComp-LMで見つかった最高のデータセレクタをマッチングしながら,各ベンチマークでDSIRより優れている。
論文 参考訳(メタデータ) (2024-09-09T17:23:29Z) - Training on the Benchmark Is Not All You Need [52.01920740114261]
本稿では,複数選択肢の内容に基づいた簡易かつ効果的なデータ漏洩検出手法を提案する。
本手法は,モデルトレーニングデータや重みを使用せずに,グレーボックス条件下で動作可能である。
4つのベンチマークデータセットから35個の主要なオープンソースLCMのデータ漏洩度を評価する。
論文 参考訳(メタデータ) (2024-09-03T11:09:44Z) - How to Train Data-Efficient LLMs [56.41105687693619]
事前学習言語モデル(LLM)に対するデータ効率のアプローチについて検討する。
Ask-LLMと密度サンプリングがそれぞれのカテゴリで最適であることがわかった。
何百もの評価タスクと事前学習作業を含む19個のサンプルを比較したところ,Ask-LLMと密度がそれぞれのカテゴリで最適な方法であることが判明した。
論文 参考訳(メタデータ) (2024-02-15T02:27:57Z) - DataComp: In search of the next generation of multimodal datasets [179.79323076587255]
DataCompは、Common Crawlの128億の画像テキストペアの候補プールを中心にしたデータセット実験用のテストベッドである。
我々のベンチマークは、複数の計算スケールから成っている。
特に、最良のベースラインであるDataComp-1Bは、ImageNetでCLIP ViT-L/14をスクラッチから79.2%のゼロショット精度でトレーニングすることが可能です。
論文 参考訳(メタデータ) (2023-04-27T11:37:18Z) - Fairness-Aware Data Valuation for Supervised Learning [4.874780144224057]
本研究では,Fairness-Aware Data vauatiOn (FADO)を提案する。
FADOを不公平化前処理技術の基礎として活用する方法を示す。
提案手法は,最大40ppの公正度を,ベースラインに比べて性能が1pp以下で向上することを示す。
論文 参考訳(メタデータ) (2023-03-29T18:51:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。