論文の概要: Lightning Fast Matching Dependency Discovery with Desbordante
- arxiv url: http://arxiv.org/abs/2607.10771v1
- Date: Sun, 12 Jul 2026 13:59:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.526236
- Title: Lightning Fast Matching Dependency Discovery with Desbordante
- Title(参考訳): Desbordanteによるライトニング高速マッチング依存性発見
- Authors: Alexey Shlyonskikh, Michael Sinelnikov, Daniil Nikolaev, Yurii Litvinov, George Chernishev,
- Abstract要約: 本稿では,HyMDの最適化手法について述べる。
中でも最も重要なものは,1)新しいサンプリング手法,2)より高速な一般化検索手法,3)依存性の表現の改善である。
実験により、平均的な最先端の実装よりも40倍以上のスピードアップが可能であり、場合によっては170倍以上のスピードアップに達することが実証された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Matching dependency is a generalization of the functional dependency concept, which allows users to apply custom similarity functions for matching individual attributes. Matching dependencies have a wide range of applications for solving various data quality problems, such as entity resolution, data deduplication, data integration, schema matching, and many more. However, their discovery is a very computationally intensive problem, which limits their practical application. In this paper, we describe a number of optimization techniques for HyMD - currently the state-of-the-art algorithm for the discovery of matching dependencies. These optimizations belong to both technical and scientific domains. The most important of them are: 1) a new sampling technique, 2) a faster generalization lookup technique, and 3) an improved representation of a dependency. The first one aims to raise the efficiency of inference from record pairs, while the last two are designed to speed up lattice-related operations. To evaluate our optimizations, we implemented our version of HyMD in Desbordante, an open-source high-performance data profiler. Experiments demonstrated that they allow for a speedup of more than 40x over the state-of-the-art implementation on average, reaching a speedup greater than 170x in some cases. Finally, the improved version of HyMD is ready to use by anyone. It comes with bidirectional Python integration, which allows calling the C++ algorithm implementation from Python programs while allowing users to supply their custom matching functions.
- Abstract(参考訳): 依存関係のマッチングは機能的依存関係の概念の一般化であり、個々の属性のマッチングに独自の類似関数を適用することができる。
マッチング依存関係は、エンティティ解決、データ重複、データ統合、スキーママッチングなど、さまざまなデータ品質問題を解決するための幅広いアプリケーションを持っています。
しかし、それらの発見は非常に計算集約的な問題であり、実用的応用を制限している。
本稿では,HyMDのいくつかの最適化手法について述べる。
これらの最適化は、技術分野と科学分野の両方に属する。
最も重要なものは次のとおりである。
1)新しいサンプリング手法。
2)より高速な一般化検索技術、及び
3) 依存関係の表現が改善された。
最初のものはレコードペアからの推論の効率を上げることを目的としており、最後の2つは格子関連操作の高速化を目的としている。
最適化を評価するため,オープンソースの高性能データプロファイラであるDesbordanteにHyMDを実装した。
実験により、平均的な最先端の実装よりも40倍以上のスピードアップが可能であり、場合によっては170倍以上のスピードアップに達することが実証された。
最後に、改良されたHyMDは誰でも使えるようになる。
これは、PythonプログラムからC++アルゴリズムの実装を呼び出し、ユーザが独自のマッチング関数を供給できるようにする。
関連論文リスト
- optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - Optimization-Aware Test Generation for Deep Learning Compilers [18.99078574014009]
OATestは最適化対応の計算グラフを合成するための新しいアプローチである。
より多くのバグを検出し、TVMとONNXRutimesでより高いコードカバレッジを達成することができる。
OATestは58の既知のバグを明らかにし、そのうち36のバグが開発者によって確認または修正されている。
論文 参考訳(メタデータ) (2025-11-24T09:27:59Z) - e-boost: Boosted E-Graph Extraction with Adaptive Heuristics and Exact Solving [14.658242244274687]
Eグラフは多くの分野、特に論理合成と形式的検証に興味を寄せている。
このギャップを3つの重要なイノベーションで埋める新しいフレームワークであるe-boostを紹介します。
e-boostは、従来の正確なアプローチ(ILP)よりも58倍のランタイムスピードアップを示し、最先端の抽出フレームワーク(SmoothE)よりも19.04%パフォーマンスが改善された。
論文 参考訳(メタデータ) (2025-08-18T15:38:12Z) - Bag of Tricks for Inference-time Computation of LLM Reasoning [10.366475014241407]
複雑度の異なる推論タスクに対して,様々な推論時間計算戦略を検証・ベンチマークする。
我々のアブレーション研究は、これまで見過ごされていた戦略が性能を大幅に向上させることができることを示している。
我々は,8つの推論タスクにまたがる6つの代表的手法を体系的に評価することにより,推論時間計算の標準ベンチマークを確立する。
論文 参考訳(メタデータ) (2025-02-11T02:31:11Z) - AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs [57.12929098407975]
既存の因果探索法を効率的に並列化することにより,数千次元まで拡張可能であることを示す。
具体的には、DirectLiNGAMの因果順序付けサブプロデューサに着目し、GPUカーネルを実装して高速化する。
これにより、遺伝子介入による大規模遺伝子発現データに対する因果推論にDirectLiNGAMを適用することで、競争結果が得られる。
論文 参考訳(メタデータ) (2024-03-06T15:06:11Z) - Decreasing the Computing Time of Bayesian Optimization using
Generalizable Memory Pruning [56.334116591082896]
本稿では,任意のサロゲートモデルと取得関数で使用可能なメモリプルーニングとバウンダリ最適化のラッパーを示す。
BOを高次元または大規模データセット上で実行することは、この時間の複雑さのために難解になる。
すべてのモデル実装はMIT Supercloudの最先端コンピューティングハードウェア上で実行される。
論文 参考訳(メタデータ) (2023-09-08T14:05:56Z) - FaDIn: Fast Discretized Inference for Hawkes Processes with General
Parametric Kernels [82.53569355337586]
この研究は、有限なサポートを持つ一般パラメトリックカーネルを用いた時間点プロセス推論の効率的な解を提供する。
脳磁図(MEG)により記録された脳信号からの刺激誘発パターンの発生をモデル化し,その有効性を評価する。
その結果,提案手法により,最先端技術よりもパターン遅延の推定精度が向上することが示唆された。
論文 参考訳(メタデータ) (2022-10-10T12:35:02Z) - HyperImpute: Generalized Iterative Imputation with Automatic Model
Selection [77.86861638371926]
カラムワイズモデルを適応的かつ自動的に構成するための一般化反復計算フレームワークを提案する。
既製の学習者,シミュレータ,インターフェースを備えた具体的な実装を提供する。
論文 参考訳(メタデータ) (2022-06-15T19:10:35Z) - Simple Stochastic and Online Gradient DescentAlgorithms for Pairwise
Learning [65.54757265434465]
ペアワイズ学習(Pairwise learning)とは、損失関数がペアインスタンスに依存するタスクをいう。
オンライン降下(OGD)は、ペアワイズ学習でストリーミングデータを処理する一般的なアプローチである。
本稿では,ペアワイズ学習のための手法について,シンプルでオンラインな下降を提案する。
論文 参考訳(メタデータ) (2021-11-23T18:10:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。