論文の概要: Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines
- arxiv url: http://arxiv.org/abs/2607.00747v1
- Date: Wed, 01 Jul 2026 10:30:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.85398
- Title: Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines
- Title(参考訳): カスケード物体検出のためのアクティブラーニング:表抽出パイプラインにおけるカバーと不確かさのバランス
- Abstract要約: ビジネス文書からのテーブル抽出は、テーブル検出(TD)が最初にテーブルをローカライズし、テーブル構造認識(TSR)が内部レイアウトを復元するカスケードパイプラインに依存する。
本稿では,元来画像分類のために提案されていたハイブリッドカバレッジ不確実性サンプリング手法であるUncertainty Herding (UHerding) をケースドオブジェクト検出パイプラインに適用する。
そこで我々は,TD-to-TSR依存性を利用するパイプライン対応拡張を2つ提案する: RankFusionは検出空間と構造表現空間の両方に2次元のカバレッジを追加し,CAPAはさらにステージ依存のゲーティングとタスクごとの不確実性キャリブレーションを取り入れている。
- 参考スコア(独自算出の注目度): 0.4433315630787158
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Table extraction from business documents relies on a cascaded pipeline where Table Detection (TD) first localizes tables and Table Structure Recognition (TSR) then recovers their internal layout. Building task-specific training sets for this pipeline is costly, particularly for TSR which requires fine-grained structural annotations. Active learning (AL) can reduce this annotation burden, yet most AL strategies are designed for single-model tasks and do not account for inter-stage dependencies in cascaded architectures. In this work, we present the first adaptation of Uncertainty Herding (UHerding), a hybrid coverage-uncertainty sampling method originally proposed for image classification, to cascaded object detection pipelines. We propose two pipeline-aware extensions that exploit the TD-to-TSR dependency: RankFusion adds dual-manifold coverage over both detection and structure representation spaces, while CAPA further incorporates stage-dependent gating and per-task uncertainty calibration. Extensive experiments across two public (PubTables-1M and FinTabNet) and two private table extraction datasets, with various annotation budgets (from 71 to 500 documents) show that UHerding generalizes well to table extraction, outperforming each baseline. Among pipeline-aware variants, RankFusion achieves higher expected gains but at the cost of greater variance, while CAPA emerges as the most consistent strategy, outperforming standard UHerding on three out of four datasets.
- Abstract(参考訳): ビジネス文書からのテーブル抽出は、テーブル検出(TD)が最初にテーブルをローカライズし、テーブル構造認識(TSR)が内部レイアウトを復元するカスケードパイプラインに依存する。
このパイプラインのためにタスク固有のトレーニングセットを構築するのはコストがかかる。
アクティブラーニング(AL)はこのアノテーションの負担を軽減することができるが、ほとんどのAL戦略は単一モデルタスク用に設計されており、ケースドアーキテクチャにおけるステージ間の依存関係を考慮しない。
本研究では,元来画像分類のために提案されていたハイブリッドカバレッジ不確実性サンプリング手法であるUncertainty Herding (UHerding) を,ケースドオブジェクト検出パイプラインに適応させる。
そこで我々は,TD-to-TSR依存性を利用するパイプライン対応拡張を2つ提案する: RankFusionは検出空間と構造表現空間の両方に2次元のカバレッジを追加し,CAPAはさらにステージ依存のゲーティングとタスクごとの不確実性キャリブレーションを取り入れている。
2つの公開(PubTables-1MとFinTabNet)と2つのプライベートテーブル抽出データセット(71から500ドキュメント)にわたる大規模な実験は、UHerdingがテーブル抽出を一般化し、各ベースラインを上回っていることを示している。
パイプライン対応の変種の中では、RangeFusionは期待以上のゲインを達成しているが、分散のコストが高い。CAPAは最も一貫性のある戦略として登場し、4つのデータセットのうち3つで標準のUHerdingを上回っている。
関連論文リスト
- IntHQ: Task-Interactive Hierarchical Query on Dual-Stream Representations for Generative Recommendation [20.546679348797905]
既存のマルチタスクは本質的に3倍の崩壊を起こしやすいことを示す。
InHQは3つのコンポーネントを持つマルチタスク生成レコメンデータで、1つの崩壊を緩和する。
オフライン評価では、InHQは4つの代表的なタスクヘッド構成の下で、競争力のあるバックボーンを一貫して上回っている。
論文 参考訳(メタデータ) (2026-08-10T14:13:47Z) - ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition [1.645616881459713]
表構造認識(TSR)は、文書画像から表の行と列のレイアウトを復元することを目的としている。
テーブル要素をジェネリックオブジェクトとして扱う検出ベースのアプローチは、テーブルレイアウトの基本的な特性を無視している。
本稿では,テーブル固有の幾何学的先行をトレーニング対象に符号化することで,この構造的非対称性を定式化するエッジ制約きめ細粒度局所化損失(EFL)を提案する。
論文 参考訳(メタデータ) (2026-07-01T10:18:12Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Relatron: Automating Relational Machine Learning over Relational Databases [50.94254514286021]
本稿では, RDL と DFS を共有設計空間に統合し, 多様な RDB タスクを対象としたアーキテクチャ中心の検索を行う。
RDLはDFSを一貫して上回り、高いタスク依存性を持つ。(2)タスク全体において単一のアーキテクチャが支配的であり、タスク認識モデル選択の必要性を強調し、精度は選択アーキテクチャの信頼性の低いガイドである。
論文 参考訳(メタデータ) (2026-02-26T02:45:22Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - Relational Deep Dive: Error-Aware Queries Over Unstructured Data [9.0236658372663]
ReDD(Relational Deep Dive)は、クエリ固有のスキーマを動的に発見し、リレーショナルテーブルをポップアップさせ、証明可能な保証でエラー認識抽出を保証するフレームワークである。
主な貢献は、カバレッジ保証付きエラー検出の統計的校正手法であるSCAPEと、精度と人的補正コストのトレードオフを最適化するハイブリッドアプローチであるSCAPE-HYBである。
論文 参考訳(メタデータ) (2025-11-04T16:30:55Z) - A Tale of Two Experts: Cooperative Learning for Source-Free Unsupervised Domain Adaptation [59.88864205383671]
Source-Free Unsupervised Domain Adaptation (SFUDA)は、ソースデータにアクセスすることなく、ターゲットドメインにソース学習モデルを適用するという現実的な課題に対処する。
既存のSFUDA手法は、ソースモデルの予測のみを利用するか、大きなマルチモーダルモデルを微調整する。
本稿では、補完的な洞察と対象データの潜在構造を利用するためのエキスパート協調学習(EXCL)を提案する。
論文 参考訳(メタデータ) (2025-09-26T11:39:50Z) - A Closer Look at TabPFN v2: Understanding Its Strengths and Extending Its Capabilities [51.08999772842298]
Tabular Prior-data Fitted Network v2 (TabPFN v2)は、さまざまな下流データセット間で、前例のないコンテキスト内学習性能を達成する。
本研究では,TabPFN v2が属性トークンをランダムに入力しても属性関係を推測可能であることを示す。
我々はTabPFN v2の制限がテスト時間分割・コンテキスト戦略によって対処できることを実証した。
論文 参考訳(メタデータ) (2025-02-24T17:38:42Z) - PPN: Parallel Pointer-based Network for Key Information Extraction with
Complex Layouts [29.73609439825548]
キー情報抽出は、ドキュメントから構造化された値セマンティックエンティティを抽出することを目的とした課題である。
既存の手法は2段階のパイプライン戦略に従っており、エラー伝搬問題につながる可能性がある。
ゼロショットおよび少数ショットシナリオに適用可能なエンドツーエンドモデルであるParallel Pointer-based Network (PPN)を紹介する。
論文 参考訳(メタデータ) (2023-07-20T03:29:09Z) - SEMv2: Table Separation Line Detection Based on Instance Segmentation [96.36188168694781]
SEMv2(SEM: Split, Embed, Merge)と呼ばれるテーブル構造認識器を提案する。
本稿では,テーブル分離ラインのインスタンスレベルの識別問題に対処し,条件付き畳み込みに基づくテーブル分離ライン検出戦略を提案する。
SEMv2を包括的に評価するために、iFLYTABと呼ばれるテーブル構造認識のためのより困難なデータセットも提示する。
論文 参考訳(メタデータ) (2023-03-08T05:15:01Z) - Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation [103.90033029330527]
FSIS(Few-Shot Instance)は、サポート例が限定された新しいクラスの検出とセグメンテーションを必要とする。
我々は、FSISのサポートとクエリ機能の関係を利用するための統合フレームワーク、Reference Twice(RefT)を導入する。
論文 参考訳(メタデータ) (2023-01-03T15:33:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。