論文の概要: Alignment-Guided Largest Table Overlap Size Estimation
- arxiv url: http://arxiv.org/abs/2607.03049v1
- Date: Fri, 03 Jul 2026 07:38:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.505753
- Title: Alignment-Guided Largest Table Overlap Size Estimation
- Title(参考訳): 配向誘導型最大テーブルオーバーラップサイズ推定
- Abstract要約: テーブル間の最大のオーバーラップサイズを高速に推定することで、大きなテーブルリポジトリにおけるブロッキングとクエリ・バイ・テーブル検索が可能になる。
ALOREは3つの原理に基づいて構築された,スケーラブルでドメイン・ロバストなオーバーラップ比推定器である。
さまざまなドメインとスケールにまたがる複数のデータセットの実験は、以前のベンチマーク以上の大規模な実世界のコーパスを含む、ALOREが芸術の状態を上回ることを示している。
- 参考スコア(独自算出の注目度): 11.275866569459502
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fast estimation of the size of the largest overlap between tables enables blocking and query-by-table retrieval in large table repositories. The first and the state-of-the-art estimator Armadillo improves efficiency by embedding each table independently and approximating overlap ratio via embedding similarity. However, accurate estimation in heterogeneous repositories remains limited by three challenges: (C1) overlap depends on row-column structure, i.e., each matched cell must preserve both its row and column membership under a joint alignment of the two tables, but existing encodings leave this structure to be inferred indirectly; (C2) independent encoding provides no explicit channel for inter-table alignment signals, biasing prediction toward global similarity; (C3) naive value encodings overfit to corpus-specific distributions, causing cross-domain degradation. Hence, we propose ALORE, a scalable and domain-robust overlap ratio estimator built on three principles: (P1) explicitly represent row-column structure; (P2) expose inter-table alignment signals during training without expensive alignment search; (P3) reduce sensitivity to corpus-specific value distributions. ALORE instantiates these principles with a Two-View Row-Column Hypergraph encoder, alignment-guided objectives with inexpensive interaction signals, and a domain-robust value mapping. Experiments on multiple datasets spanning diverse domains and scales, including a large real-world corpus beyond prior benchmarks, show that ALORE outperforms the state of the art. ALORE reduces MAE by up to 55% overall and 69% in zero-shot transfer, while achieving up to 89x speedup. We further validate its effectiveness for query-by-table retrieval.
- Abstract(参考訳): テーブル間の最大のオーバーラップサイズを高速に推定することで、大きなテーブルリポジトリにおけるブロッキングとクエリ・バイ・テーブル検索が可能になる。
第1および第1の最先端推定器Armandilloは、各テーブルを個別に埋め込み、類似性を埋め込むことで重なり比を近似することにより効率を向上する。
しかし、不均一なレポジトリの正確な推定は、3つの課題によって制限されている: (C1) 重なり合いは行列構造に依存する、すなわち、各マッチしたセルは2つのテーブルのジョイントアライメントの下で行と列のメンバーシップの両方を保たなければならないが、既存のエンコーディングはこの構造を間接的に推測しなければならない; (C2) 独立エンコーディングは、テーブル間のアライメント信号に対する明示的なチャネルを提供し、大域的類似性へのバイアスを与える; (C3) 単純値エンコーディングはコーパス固有の分布に過度に適合し、クロスドメイン分解を引き起こす。
したがって、ALOREは、(P1)行列構造を明示的に表現すること、(P2)高価なアライメント探索なしでトレーニング中にテーブル間アライメント信号を公開すること、(P3)コーパス固有の値分布に対する感度を低下させることである。
ALOREはこれらの原理を2ビューローコラムハイパーグラフエンコーダ、安価な相互作用信号を用いたアライメント誘導目標、ドメイン-ロバスト値マッピングでインスタンス化する。
さまざまなドメインとスケールにまたがる複数のデータセットの実験は、以前のベンチマーク以上の大規模な実世界のコーパスを含む、ALOREが最先端のモデルよりも優れていることを示している。
ALOREは、MAEを最大で55%、ゼロショット転送で69%削減し、最大89倍のスピードアップを達成する。
さらに,クエリ・バイ・テーブル検索の有効性を検証した。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Learning Auditable Classifier Models: Source-Disjoint Tree Ensembles [0.0]
臨床および規制された設定における予測モデルは正確で、完全に監査可能である必要がある。
本稿では,3段階学習手法であるResidual Pattern Tree Ensemble(RPTE)を紹介する。
RPTEは、有界特徴予算(bounded feature budget)、ソースの不整合(source disjointness)、別個の係数推定という3つの重要な原則に基づいている。
論文 参考訳(メタデータ) (2026-08-16T12:56:49Z) - ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition [1.645616881459713]
表構造認識(TSR)は、文書画像から表の行と列のレイアウトを復元することを目的としている。
テーブル要素をジェネリックオブジェクトとして扱う検出ベースのアプローチは、テーブルレイアウトの基本的な特性を無視している。
本稿では,テーブル固有の幾何学的先行をトレーニング対象に符号化することで,この構造的非対称性を定式化するエッジ制約きめ細粒度局所化損失(EFL)を提案する。
論文 参考訳(メタデータ) (2026-07-01T10:18:12Z) - Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation [54.74045834035952]
視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
論文 参考訳(メタデータ) (2026-06-28T15:41:31Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - SEED: Targeted Data Selection by Weighted Independent Set [76.68391670109433]
我々はSEEDと呼ばれる堅牢でスケーラブルなデータ選択パイプラインを開発した。
SEEDは、命令チューニング、視覚的命令チューニング、セマンティックセグメンテーションにおける最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2026-05-15T07:26:54Z) - SEMv3: A Fast and Robust Approach to Table Separation Line Detection [48.75713662571455]
テーブル構造認識(TSR)は、テーブル固有の構造を入力画像から解析することを目的としている。
スプリット・アンド・マージ(Split-and-merge)パラダイムは、テーブル分離線検出が不可欠であるテーブル構造を解析するための重要なアプローチである。
本稿では, SEMv3 (Split, Embed, Merge) を提案する。
論文 参考訳(メタデータ) (2024-05-20T08:13:46Z) - RTF: Region-based Table Filling Method for Relational Triple Extraction [17.267920424291372]
本稿では,知識グラフからトリプルを抽出する領域ベースのテーブルフィリング手法を提案する。
そこで我々は,各トリプルを関係特化テーブル上の領域とみなし,各領域の2つのエンドポイントを決定することで3つを識別する,新しい領域ベースのタグ付け手法と双方向デコーディング戦略を考案した。
提案手法は,2つの広く使用されているベンチマークデータセットの3変種に対して,より優れた一般化を実現することを示す実験結果を得た。
論文 参考訳(メタデータ) (2024-04-29T23:36:38Z) - Robust Table Structure Recognition with Dynamic Queries Enhanced
Detection Transformer [15.708108572696062]
本稿では,TSRFormerと呼ばれる新しいテーブル構造認識手法を提案する。
これらの新しい手法により、我々のTSRFormerは、SciTSR、PubTabNet、WTW、FinTabNetなど、いくつかのベンチマークデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-03-21T06:20:49Z) - TRUST: An Accurate and End-to-End Table structure Recognizer Using
Splitting-based Transformers [56.56591337457137]
本稿では,TRUSTと呼ばれるテーブル構造認識手法を提案する。
変換器は、大域的な計算、完全メモリ、並列計算のためにテーブル構造認識に適している。
我々はPubTabNetやSynthTableなど,いくつかの人気のあるベンチマークで実験を行い,新しい最先端の結果を得た。
論文 参考訳(メタデータ) (2022-08-31T08:33:36Z) - TSRFormer: Table Structure Recognition with Transformers [15.708108572696064]
本稿では,TSRFormerと呼ばれる新しいテーブル構造認識手法を提案する。
新たな2段階DETRに基づくセパレータ予測手法である textbfSeparator textbfREgression textbfTRansformer (SepRETR) を提案する。
我々は、SciTSR、PubTabNet、WTWなど、いくつかのベンチマークデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-08-09T17:36:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。