論文の概要: ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition
- arxiv url: http://arxiv.org/abs/2607.00734v1
- Date: Wed, 01 Jul 2026 10:18:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.847102
- Title: ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition
- Title(参考訳): ConRTF:リアルタイム変圧器テーブル構造認識のためのエッジ制約境界分布制限
- Abstract要約: 表構造認識(TSR)は、文書画像から表の行と列のレイアウトを復元することを目的としている。
テーブル要素をジェネリックオブジェクトとして扱う検出ベースのアプローチは、テーブルレイアウトの基本的な特性を無視している。
本稿では,テーブル固有の幾何学的先行をトレーニング対象に符号化することで,この構造的非対称性を定式化するエッジ制約きめ細粒度局所化損失(EFL)を提案する。
- 参考スコア(独自算出の注目度): 1.645616881459713
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Table Structure Recognition (TSR) aims to recover the row and column layout of tables from document images, a key step in document understanding pipelines. Accurate TSR depends on precise boundary localization: small errors in row or column boundaries can propagate into incorrect cell assignments and structural inconsistencies. Yet detection-based approaches treat table elements as generic objects, ignoring a fundamental property of table layout: rows and columns play structurally distinct roles and their boundaries carry unequal importance. We propose an Edge-constrained Fine-grained Localization loss (EFL) that formalizes this structural asymmetry by encoding table-specific geometric priors into the training objective: row-like elements are supervised with emphasis on their horizontal boundaries, while column-like elements prioritize vertical boundaries. Implemented within a real-time detector with distribution-based boundary refinement (D-FINE), EFL operates during training only and guides boundary refinement toward structurally meaningful adjustments with no change to the inference pipeline. The proposed approach, ConRTF, is also data-efficient, maintaining robust accuracy with as few as 2k--3k annotated tables. Experiments on PubTables-1M and two private datasets show consistent improvements over the optimized baseline and several real-time detectors including RT-DETRv2 and YOLOv10-11, with gains of up to +1.6 GriTS points at equal inference speed.
- Abstract(参考訳): 表構造認識(TSR)は、文書理解パイプラインの重要なステップである文書画像からテーブルの行と列のレイアウトを復元することを目的としている。
行や列の境界における小さなエラーは、誤ったセル割り当てや構造上の不整合へと伝播する。
しかし、テーブル要素をジェネリックオブジェクトとして扱う検出ベースのアプローチは、テーブルレイアウトの基本的な特性を無視している。
テーブル固有の幾何学的前提をトレーニング対象に符号化することで,この構造的非対称性を定式化するエッジ制約きめ細かい局所化損失(EFL)を提案する。
EFLは、分散ベースの境界精錬(D-FINE)を備えたリアルタイム検出器内に実装され、訓練中のみ動作し、推論パイプラインを変更することなく、構造的に意味のある調整に向けて境界精錬を誘導する。
提案手法であるConRTFは、データ効率も高く、2k--3kのアノテートテーブルで頑健な精度を維持している。
PubTables-1Mと2つのプライベートデータセットの実験では、最適化されたベースラインとRT-DETRv2やYOLOv10-11を含む複数のリアルタイム検出器に対して一貫した改善が見られ、推論速度は+1.6 GriTSポイントまで向上した。
関連論文リスト
- Alignment-Guided Largest Table Overlap Size Estimation [11.275866569459502]
テーブル間の最大のオーバーラップサイズを高速に推定することで、大きなテーブルリポジトリにおけるブロッキングとクエリ・バイ・テーブル検索が可能になる。
ALOREは3つの原理に基づいて構築された,スケーラブルでドメイン・ロバストなオーバーラップ比推定器である。
さまざまなドメインとスケールにまたがる複数のデータセットの実験は、以前のベンチマーク以上の大規模な実世界のコーパスを含む、ALOREが芸術の状態を上回ることを示している。
論文 参考訳(メタデータ) (2026-07-03T07:38:43Z) - Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines [0.4433315630787158]
ビジネス文書からのテーブル抽出は、テーブル検出(TD)が最初にテーブルをローカライズし、テーブル構造認識(TSR)が内部レイアウトを復元するカスケードパイプラインに依存する。
本稿では,元来画像分類のために提案されていたハイブリッドカバレッジ不確実性サンプリング手法であるUncertainty Herding (UHerding) をケースドオブジェクト検出パイプラインに適用する。
そこで我々は,TD-to-TSR依存性を利用するパイプライン対応拡張を2つ提案する: RankFusionは検出空間と構造表現空間の両方に2次元のカバレッジを追加し,CAPAはさらにステージ依存のゲーティングとタスクごとの不確実性キャリブレーションを取り入れている。
論文 参考訳(メタデータ) (2026-07-01T10:30:05Z) - Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation [54.74045834035952]
視覚言語データセット蒸留(VLDD)は、大きな画像テキストのペア化されたデータセットを小さな合成ペアに圧縮する。
階層幾何学と明示的なアライメント・キャパシティ制御を組み合わせたランク認識型双曲アライメント(RAHA)を提案する。
RAHAは、競争力のあるクロスモーダル検索と、固定予算下での転送インジケータの改善を示す。
論文 参考訳(メタデータ) (2026-06-28T15:41:31Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment [70.83664203825235]
TDATR(Table Detail-Aware Table Recognition)は、テーブルの詳細学習とセルレベルの視覚アライメントにより、エンドツーエンドのTRを改善する。
データセット固有の微調整なしで、7つのベンチマークで最先端または高い競争性能を達成する。
論文 参考訳(メタデータ) (2026-03-24T05:45:02Z) - SEMv3: A Fast and Robust Approach to Table Separation Line Detection [48.75713662571455]
テーブル構造認識(TSR)は、テーブル固有の構造を入力画像から解析することを目的としている。
スプリット・アンド・マージ(Split-and-merge)パラダイムは、テーブル分離線検出が不可欠であるテーブル構造を解析するための重要なアプローチである。
本稿では, SEMv3 (Split, Embed, Merge) を提案する。
論文 参考訳(メタデータ) (2024-05-20T08:13:46Z) - SEMv2: Table Separation Line Detection Based on Instance Segmentation [96.36188168694781]
SEMv2(SEM: Split, Embed, Merge)と呼ばれるテーブル構造認識器を提案する。
本稿では,テーブル分離ラインのインスタンスレベルの識別問題に対処し,条件付き畳み込みに基づくテーブル分離ライン検出戦略を提案する。
SEMv2を包括的に評価するために、iFLYTABと呼ばれるテーブル構造認識のためのより困難なデータセットも提示する。
論文 参考訳(メタデータ) (2023-03-08T05:15:01Z) - TRUST: An Accurate and End-to-End Table structure Recognizer Using
Splitting-based Transformers [56.56591337457137]
本稿では,TRUSTと呼ばれるテーブル構造認識手法を提案する。
変換器は、大域的な計算、完全メモリ、並列計算のためにテーブル構造認識に適している。
我々はPubTabNetやSynthTableなど,いくつかの人気のあるベンチマークで実験を行い,新しい最先端の結果を得た。
論文 参考訳(メタデータ) (2022-08-31T08:33:36Z) - TSRFormer: Table Structure Recognition with Transformers [15.708108572696064]
本稿では,TSRFormerと呼ばれる新しいテーブル構造認識手法を提案する。
新たな2段階DETRに基づくセパレータ予測手法である textbfSeparator textbfREgression textbfTRansformer (SepRETR) を提案する。
我々は、SciTSR、PubTabNet、WTWなど、いくつかのベンチマークデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-08-09T17:36:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。