論文の概要: MaDI-Bench: An End-to-End Data Integration Benchmark
- arxiv url: http://arxiv.org/abs/2606.30371v1
- Date: Mon, 29 Jun 2026 14:34:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.281533
- Title: MaDI-Bench: An End-to-End Data Integration Benchmark
- Title(参考訳): MaDI-Bench: エンドツーエンドのデータ統合ベンチマーク
- Abstract要約: 本稿では,Mannheim Data Integration Benchmark(MaDI-Bench)を紹介する。
MaDI-Benchは、統合プロセスの全ステップをカバーするリレーショナルテーブルのエンドツーエンド統合のための最初のベンチマークである。
我々は,人間工学的パイプライン,ベストオブブレッドパイプライン,LLMに基づくパイプラインを用いてベンチマークを検証した。
- 参考スコア(独自算出の注目度): 3.1427994341585688
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Data integration combines heterogeneous data sets into a single, coherent representation. Data integration involves a sequence of interdependent tasks including schema matching, value normalization, entity blocking, entity matching, and data fusion. Existing benchmarks either evaluate these steps in isolation or cover only incomplete versions of the data integration pipeline, omitting specific steps. The lack of public end-to-end data integration benchmarks hinders research on data integration methods that address the integration process as a whole. This paper fills this gap by introducing the Mannheim Data Integration Benchmark (MaDI-Bench), the first benchmark for the end-to-end integration of relational tables covering all steps of the integration process. MaDI-Bench contributes (i) a set of base end-to-end data integration tasks spanning several application domains, each requiring the full schema matching, value normalization, entity matching, and conflict resolution pipeline; and (ii) a generic method for deriving task variants that mitigates rapid benchmark saturation as data integration systems advance. We validate the benchmark using human-engineered pipelines, a best-of-breed pipeline, and an LLM-based pipeline. The validation demonstrates the utility of the benchmark for measuring the step-wise as well as the end-to-end performance of data integration pipelines. All benchmark artifacts are available for public download.
- Abstract(参考訳): データ統合は、異種データセットを単一の一貫性のある表現に結合する。
データ統合には、スキーママッチング、値正規化、エンティティブロッキング、エンティティマッチング、データ融合など、一連の相互依存タスクが含まれる。
既存のベンチマークは、これらのステップを分離して評価するか、データ統合パイプラインの不完全なバージョンのみをカバーし、特定のステップを省略する。
パブリックなエンドツーエンドのデータ統合ベンチマークの欠如は、統合プロセス全体に対処するデータ統合方法の研究を妨げる。
本稿では、統合プロセスの全ステップをカバーする関係表のエンドツーエンド統合のための最初のベンチマークであるMannheim Data Integration Benchmark (MaDI-Bench)を導入することで、このギャップを埋める。
MaDI-Benchが貢献
i)複数のアプリケーションドメインにまたがる基本的なエンドツーエンドのデータ統合タスクのセット。それぞれに完全なスキーママッチング、値正規化、エンティティマッチング、コンフリクト解決パイプラインが必要である。
(II)データ統合システムが進むにつれて、ベンチマーク飽和を緩和するタスク変種を導出する汎用的な手法。
我々は,人間工学的パイプライン,ベストオブブレッドパイプライン,LLMに基づくパイプラインを用いてベンチマークを検証した。
この検証では、データ統合パイプラインのステップワイドとエンドツーエンドのパフォーマンスを測定するためのベンチマークの有用性が実証されている。
すべてのベンチマークアーティファクトは、パブリックダウンロードが可能である。
関連論文リスト
- Environment-free Synthetic Data Generation for API-Calling Agents [68.95520739708304]
API呼び出し大型言語モデル(LLM)エージェントの訓練には、大量の高品質なトラジェクトリが必要である。
本研究では,LLMをオンザフライデジタルワールドモデルとして活用する環境不要な合成データ生成手法を提案する。
我々は,情報検索タスクと状態変更タスクの両方を含む,挑戦的なAppWorldとOfficeBenchベンチマークに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-07-18T17:36:44Z) - BDIViz in Action: Interactive Curation and Benchmarking for Schema Matching Methods [12.444984647326024]
BDIViz は LLM による検証とスキーママッチングのためのインタラクティブな可視化システムである。
BDIVizへの新たな拡張は、Human-in-the-loopベンチマークと反復型マーカ開発という、データ統合研究における重要なニーズに対処する。
論文 参考訳(メタデータ) (2026-04-12T18:16:30Z) - CUBE: A Standard for Unifying Agent Benchmarks [138.9831263189749]
MCPとGymをベースとしたユニバーサルプロトコル標準CUBE(Common Unified Benchmark Environments)を提案する。
CUBEは、任意の準拠プラットフォームがカスタム統合なしで、評価、RLトレーニング、データ生成のための準拠ベンチマークにアクセスできるようにする。
論文 参考訳(メタデータ) (2026-03-16T18:31:37Z) - Automatic End-to-End Data Integration using Large Language Models [3.188426002064626]
我々は、GPT-5.2を使用して、パイプラインを特定のユースケースに適応させるために必要なすべてのアーティファクトを生成する自動データ統合パイプラインを提案する。
このLLMパイプラインの性能と人間設計パイプラインの性能を3つのケーススタディで比較した。
我々の実験によると、LLMベースのパイプラインは、人間設計のパイプラインのように、いくつかのタスクでさらに良い結果をもたらすことができる。
論文 参考訳(メタデータ) (2026-03-11T08:56:55Z) - Nimbus: A Unified Embodied Synthetic Data Generation Framework [51.55989844555466]
データボリュームと多様性のスケーリングは、インボディードインテリジェンスを一般化するために重要である。
我々は、異種ナビゲーションと操作パイプラインを統合するために設計された統合合成データ生成フレームワークであるNimbusを紹介する。
評価の結果,Nimbusは最適化されていないベースラインに比べてエンドツーエンドのスループットが2~3倍向上していることがわかった。
論文 参考訳(メタデータ) (2026-01-29T09:27:31Z) - KGpipe: Generation and Evaluation of Pipelines for Data Integration into Knowledge Graphs [1.5397834466394758]
多様な情報源から高品質な知識グラフ(KG)を構築するには、情報抽出、データ変換、オントロジーマッピング、エンティティマッチング、データ融合の手法を組み合わせる必要がある。
既存のツールやLLM(Large Language Model)機能を組み合わせてパイプラインを定義し実行するための新しいフレームワークであるKGpipeを提案する。
論文 参考訳(メタデータ) (2025-11-23T09:21:14Z) - WikiDBGraph: A Data Management Benchmark Suite for Collaborative Learning over Database Silos [48.88393315169039]
協調学習(CL)技術により、複数のパーティが生データを共有せずにモデルを共同でトレーニングできる。
現在のCLベンチマークとアルゴリズムは、主に、分離、アライメント、結合可能なデータベースの仮定の下で学習ステップを目標としています。
我々は1700万の重み付きエッジでリンクされた10万の現実世界のリレーショナルデータベースから構築された大規模なデータセットを構築した。
論文 参考訳(メタデータ) (2025-05-22T13:07:06Z) - Fuzzy Integration of Data Lake Tables [9.758870410954271]
本稿では,Flull Disjunction内での近似やファジィマッチングの接合を可能にする新しいデータ駆動方式を提案する。
ファジィフル・ディジャンクションは、最先端のフル・ディジャンクション実装にかなりの時間的オーバーヘッドを与えないことを示す。
論文 参考訳(メタデータ) (2025-01-16T00:06:33Z) - Matchmaker: Self-Improving Large Language Model Programs for Schema Matching [60.23571456538149]
本稿では,スキーママッチングのための合成言語モデルプログラムを提案する。
Matchmakerは、ラベル付きデモを必要とせずに、ゼロショットで自己改善する。
実証的に、Matchmakerが以前のMLベースのアプローチより優れている実世界の医療スキーママッチングベンチマークを実証する。
論文 参考訳(メタデータ) (2024-10-31T16:34:03Z) - Interpetable Target-Feature Aggregation for Multi-Task Learning based on Bias-Variance Analysis [53.38518232934096]
マルチタスク学習(MTL)は、タスク間の共有知識を活用し、一般化とパフォーマンスを改善するために設計された強力な機械学習パラダイムである。
本稿では,タスククラスタリングと特徴変換の交点におけるMTL手法を提案する。
両段階において、鍵となる側面は減った目標と特徴の解釈可能性を維持することである。
論文 参考訳(メタデータ) (2024-06-12T08:30:16Z) - A sequence-to-sequence approach for document-level relation extraction [4.906513405712846]
文書レベルの関係抽出(DocRE)は、文内および文間の情報の統合を必要とする。
Seq2relはDocREのエンドツーエンドのサブタスクを学習し、タスク固有のコンポーネントのパイプラインを置き換える。
論文 参考訳(メタデータ) (2022-04-03T16:03:19Z) - Bellamy: Reusing Performance Models for Distributed Dataflow Jobs Across
Contexts [52.9168275057997]
本稿では、スケールアウト、データセットサイズ、ランタイムをデータフロージョブの記述的特性と組み合わせた新しいモデリング手法であるBelamyを提案する。
我々は,異なる環境で実行される各種データフロージョブの実行データからなる2つの公開データセットに対するアプローチを評価した。
論文 参考訳(メタデータ) (2021-07-29T11:57:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。