論文の概要: MosaicJoin: Compact Semantic Sketches for Value-Level Join Discovery
- arxiv url: http://arxiv.org/abs/2607.21781v1
- Date: Thu, 23 Jul 2026 19:55:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.993227
- Title: MosaicJoin: Compact Semantic Sketches for Value-Level Join Discovery
- Title(参考訳): MosaicJoin: バリューレベルジョイン発見のためのコンパクトなセマンティックスケッチ
- Authors: Grace Fan, Eden Wu, Majid Daliri, Juliana Freire,
- Abstract要約: ジョインディスカバリは、データセット検索における中核的なタスクであり、ユーザが所定のクエリ列と結合可能な列を見つけることができる。
最近のアプローチでは意味的に結合可能な列を見つけるが、基本的なトレードオフに直面している。
本稿では,このトレードオフのバランスをとる値レベルの意味結合探索手法であるMosaicJoinを紹介する。
- 参考スコア(独自算出の注目度): 8.85894971478123
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Join discovery is a core task in dataset search, enabling users to find columns that can be joined with a given query column. Early approaches focused on equi-joins, but data lakes and open-data repositories often contain columns whose values refer to the same entity but use different syntactic representations. To address this challenge, recent approaches discover semantically joinable columns but face a fundamental trade-off: methods that perform value-level comparisons accurately identify joinable columns but scale poorly to columns with high cardinality; column-level methods that encode an entire column into a single embedding are efficient but do not capture the fine-grained value alignment that determines whether a join is possible. We present MosaicJoin, a value-level semantic join discovery method that balances this trade-off. MosaicJoin achieves scalability through a novel sketching strategy that approximates the joinability of a column pair without having to compare all values. At query time, MosaicJoin scores each candidate sketch using a joinability score at a cost bounded by the sketch size, making retrieval efficient even for high-cardinality columns. A query subsampling operator further reduces online search time with provable accuracy guarantees, enabling robust retrieval for large query columns. Extensive experiments show that MosaicJoin outperforms previously published methods across all benchmarks while running up to 66 times faster than other value-level methods. MosaicJoin requires no training or fine-tuning, and it scales robustly to query columns containing up to 57K values and data lake columns containing up to 1M values.
- Abstract(参考訳): ジョインディスカバリは、データセット検索における中核的なタスクであり、ユーザが所定のクエリ列と結合可能な列を見つけることができる。
初期のアプローチは等結合に重点を置いていたが、データレイクとオープンデータレポジトリは、しばしば同じエンティティを参照するが、異なる構文表現を使用する列を含む。
この課題に対処するために、近年のアプローチでは、意味的に結合可能な列を発見するが、基本的なトレードオフに直面している: 値レベルの比較を行うメソッドは、結合可能な列を正確に識別するが、高い濃度の列にはスケールしにくい; カラム全体を単一の埋め込みにエンコードする列レベルのメソッドは効率的だが、結合が可能であるかどうかを判断する微粒な値アライメントを捕捉しない。
本稿では,このトレードオフのバランスをとる値レベルの意味結合探索手法であるMosaicJoinを紹介する。
MosaicJoinは、すべての値を比較することなくカラムペアの結合性を近似する、新しいスケッチ戦略を通じてスケーラビリティを実現する。
クエリ時にMosaicJoinは、そのスケッチサイズに縛られたコストで、結合可能性スコアを使用して、各候補のスケッチをスコアする。
クエリサブサンプリング演算子は、証明可能な精度保証でオンライン検索時間を短縮し、大きなクエリ列の堅牢な検索を可能にする。
大規模な実験によると、MosaicJoinは以前のすべてのベンチマークでメソッドを上回り、他のバリューレベルのメソッドよりも66倍高速である。
MosaicJoinはトレーニングや微調整を必要とせず、最大57Kの値を含むクエリ列と最大100Mの値を含むデータレイク列に堅牢にスケールする。
関連論文リスト
- CORE-T: COherent REtrieval of Tables for Text-to-SQL [91.76918495375384]
CORE-Tはスケーラブルでトレーニング不要なフレームワークで、テーブルに目的のメタデータを付加し、軽量なテーブル互換キャッシュをプリコンプリートする。
バード、スパイダー、MMQAを越えて、CORE-Tはテーブル選択F1を最大22.7ポイント改善し、最大42%のテーブルを検索する。
論文 参考訳(メタデータ) (2026-01-19T14:51:23Z) - HyperJoin: LLM-augmented Hypergraph Link Prediction for Joinable Table Discovery [27.204701078044252]
本稿では,結合テーブル探索のための大規模言語モデル (LLM) 拡張ハイパーグラフフレームワークを提案する。
具体的には、まずテーブル内ハイパーエッジとLLM拡張テーブル間ハイパーエッジの両方を用いてテーブルをモデル化するハイパーグラフを構築する。
そして、カラムとハイパーエッジを渡る双方向メッセージを通して、表現力のある列表現を学習する階層的相互作用ネットワークであるHINを設計する。
論文 参考訳(メタデータ) (2026-01-03T00:54:55Z) - QJoin: Transformation-aware Joinable Data Discovery Using Reinforcement Learning [11.61186748860627]
私たちは、ジョインタスク間の変換戦略を学習し再利用する強化学習フレームワークであるQJoinを紹介します。
NYC+Chicagoの19,990のジョインタスクでは、再利用を使用することで、ランタイムを最大7.4%削減する(13,747データセット)。
論文 参考訳(メタデータ) (2025-12-02T06:05:48Z) - Tailoring Table Retrieval from a Field-aware Hybrid Matching Perspective [70.13748256886288]
表検索はテキスト検索に比べて少ない。
異なるテーブルフィールドは、異なるマッチングの好みを持つ。
テーブル調整ハイブリドマッチングrEtriever(THYME)について紹介する。
論文 参考訳(メタデータ) (2025-03-04T03:57:10Z) - Snoopy: Effective and Efficient Semantic Join Discovery via Proxy Columns [26.053055662905283]
本稿では,コラムレベルのセマンティック結合発見フレームワークであるSnoopyを提案する。
4つの実世界のデータセットの実験では、SnoopyがSOTAカラムレベルのメソッドをRecall@25で16%、NDCG@25で10%上回っている。
論文 参考訳(メタデータ) (2025-02-24T03:48:00Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z) - Learnable Pillar-based Re-ranking for Image-Text Retrieval [119.9979224297237]
画像テキスト検索は、モダリティギャップを埋め、意味的類似性に基づいてモダリティコンテンツを検索することを目的としている。
一般的なポストプロセッシング手法であるリグレードは, 単一モダリティ検索タスクにおいて, 隣り合う関係を捕捉する優位性を明らかにしている。
本稿では,画像テキスト検索のための新しい学習可能な柱型リグレードパラダイムを提案する。
論文 参考訳(メタデータ) (2023-04-25T04:33:27Z) - DeepJoin: Joinable Table Discovery with Pre-trained Language Models [10.639106014582756]
既存のアプローチは、統一されたビューを作成するためのテーブルを組み合わせる最も一般的な方法である、等結合をターゲットにしている。
Deepjoinは、正確で効率的な結合可能なテーブルディスカバリのためのディープラーニングモデルである。
Deepjoinは、専門家のラベルで評価した場合、セマンティック結合の正確なソリューションよりもはるかに正確です。
論文 参考訳(メタデータ) (2022-12-15T02:40:57Z) - Align then Fusion: Generalized Large-scale Multi-view Clustering with
Anchor Matching Correspondences [53.09276639185084]
マルチビューアンカーグラフクラスタリングは、完全なペアワイド類似性を避けるために代表アンカーを選択する。
既存のアプローチでは、ビューをまたいだアンカーセット間の正しい対応を確立するのに十分な注意を払わない。
論文 参考訳(メタデータ) (2022-05-30T13:07:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。