論文の概要: DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation
- arxiv url: http://arxiv.org/abs/2607.24745v1
- Date: Fri, 08 May 2026 07:43:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.032541
- Title: DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation
- Title(参考訳): DocAnnot -- GenAIによる自動アノテーションによるキー情報抽出データセット作成の高速化
- Authors: Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina,
- Abstract要約: KIEデータセット生成を大幅に高速化するフレームワークであるDocAnnotを紹介する。
DocAnnotはラベル値抽出にLVLM(Large Vision Language Model)、テキスト/バウンディングボックス検出にOCR、新しいSpatially Informed Contextual Matching (SICM)アルゴリズムを利用する。
我々はCORDベンチマークとSROIEベンチマークのフレームワークを評価し、それぞれ0.679と0.846のF1スコアでアノテーションを自動生成できることを実証した。
- 参考スコア(独自算出の注目度): 1.934036432603761
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Key Information Extraction (KIE) is vital for many document applications, but creating training datasets is traditionally a time-consuming manual process. We introduce DocAnnot, a framework that significantly accelerates KIE dataset generation. DocAnnot leverages a Large Vision Language Model (LVLM) for label value extraction, OCR for text/bounding box detection, and a novel Spatially Informed Contextual Matching (SICM) algorithm. SICM improves label-value association by combining spatial relationships and proximity analysis with textual matching. We evaluate our framework on the CORD and SROIE benchmarks, demonstrating its ability to auto-generate annotations with F1-scores of 0.679 and 0.846, respectively. Furthermore, we investigate the effectiveness of using auto-annotated data for fine-tuning downstream KIE models. While human-annotated data remains superior, models trained exclusively on DocAnnot's outputs attain respectable performance (e.g., LayoutLMv3 achieving an F1-score of 0.6765 on CORD). These results show that while our framework significantly reduces reliance on manual effort, it does not yet fully eliminate the need for human intervention. However, by automating the process to a point where reviewers can efficiently refine outputs, our system enables near-perfect annotations with much greater efficiency than manual annotation from scratch. This approach offers substantial time and cost savings, making it valuable for resource-constrained settings and rapid model prototyping.
- Abstract(参考訳): キー情報抽出(KIE)は多くのドキュメントアプリケーションにとって不可欠だが、トレーニングデータセットの作成は伝統的に時間を要する手作業である。
KIEデータセット生成を大幅に高速化するフレームワークであるDocAnnotを紹介する。
DocAnnotはラベル値抽出にLVLM(Large Vision Language Model)、テキスト/バウンディングボックス検出にOCR、新しいSpatially Informed Contextual Matching (SICM)アルゴリズムを利用する。
SICMは、空間関係と近接解析とテキストマッチングを組み合わせることにより、ラベル値の関連性を改善する。
我々はCORDベンチマークとSROIEベンチマークのフレームワークを評価し、それぞれ0.679と0.846のF1スコアでアノテーションを自動生成できることを実証した。
さらに、下流KIEモデルの微調整における自動注釈付きデータの有効性について検討する。
人間の注釈付きデータは依然として優れているが、DocAnnotの出力に特化して訓練されたモデルは、優れたパフォーマンスが得られる(例えば、LayoutLMv3はCORDで0.6765のF1スコアを達成する)。
これらの結果から,我々の枠組みは手作業への依存を著しく軽減するが,人間の介入の必要性を完全に排除するものではないことが示唆された。
しかし,レビュアーが効率よくアウトプットを洗練できる点までプロセスを自動化することで,手作業のアノテーションよりもはるかに効率の良いほぼ完璧なアノテーションをスクラッチから実現する。
このアプローチは時間とコストを大幅に削減し、リソース制約のある設定と迅速なモデルプロトタイピングに価値がある。
関連論文リスト
- DECSELFMASK: Leveraging Unlabeled Text via Self-Relevance-Guided Masking for Decoder-Only Classification [4.08655791259336]
DecSelfMaskは、分類タスクにおけるデコーダのみのパフォーマンスを向上させるアプローチである。
モデルを活用して、ラベルのないデータからトレーニング例を作成することで、一般的な自己学習アプローチを構築します。
イタリア病院の1.9万件の診療ノートから136件の業務に対してアプローチを検証した。
論文 参考訳(メタデータ) (2026-06-08T13:21:42Z) - ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links [57.514511353084565]
我々は、最高のパフォーマンスのアプローチを選択し、文書間リンクに注釈を付けるための新しいドメインに依存しないフレームワークを提案する。
当社のフレームワークを2つの異なるドメイン – ピアレビューとニュース – に適用しています。
結果として得られた新しいデータセットは、メディアフレーミングやピアレビューなど、数多くのクロスドキュメントタスクの基礎を築いた。
論文 参考訳(メタデータ) (2025-09-01T11:32:24Z) - DocMamba: Efficient Document Pre-training with State Space Model [56.84200017560988]
本稿では,状態空間モデルに基づく新しいフレームワークDocMambaを紹介する。
グローバルなモデリング能力を保ちながら、計算複雑性を線形に減らすように設計されている。
HRDocの実験では、DocMambaの長さ外挿の可能性が確認された。
論文 参考訳(メタデータ) (2024-09-18T11:34:28Z) - Long-Span Question-Answering: Automatic Question Generation and QA-System Ranking via Side-by-Side Evaluation [65.16137964758612]
大規模言語モデルにおける長文文の活用について検討し,本書全体の読解データを作成する。
我々の目的は、長いテキストの詳細な理解を必要とする問題を分析し、理解し、推論するLLMの能力をテストすることである。
論文 参考訳(メタデータ) (2024-05-31T20:15:10Z) - Distantly Supervised Morpho-Syntactic Model for Relation Extraction [0.27195102129094995]
テキストから制約のない関係の集合を抽出し分類する手法を提案する。
ウィキデータとウィキペディア上に構築された6つのデータセットに対するアプローチを評価した。
論文 参考訳(メタデータ) (2024-01-18T14:17:40Z) - Long Document Summarization with Top-down and Bottom-up Inference [113.29319668246407]
本稿では、2つの側面の要約モデルを改善するための原則的推論フレームワークを提案する。
我々のフレームワークは、トップレベルが長距離依存性をキャプチャするドキュメントの階層的な潜在構造を前提としています。
本稿では,様々な要約データセットに対して提案手法の有効性を示す。
論文 参考訳(メタデータ) (2022-03-15T01:24:51Z) - Assisted Text Annotation Using Active Learning to Achieve High Quality
with Little Effort [9.379650501033465]
研究者は、手動の注釈だけで、大規模で高品質な注釈付きデータセットを作成できるツールを提案する。
我々は、アクティブラーニング(AL)アプローチと事前訓練された言語モデルを組み合わせて、アノテーションカテゴリを半自動で識別する。
予備的な結果から,ALを用いることで,複雑なフレームや微妙なフレームを正しく分類するアノテーションの数が大幅に削減されることがわかった。
論文 参考訳(メタデータ) (2021-12-15T13:14:58Z) - One-shot Key Information Extraction from Document with Deep Partial
Graph Matching [60.48651298832829]
ドキュメントからキー情報抽出(KIE)は、多くの産業シナリオにおいて効率、生産性、セキュリティを改善する。
KIEタスクのための既存の教師付き学習手法は、多数のラベル付きサンプルを供給し、異なる種類の文書の別々のモデルを学ぶ必要がある。
部分グラフマッチングを用いたワンショットKIEのためのディープエンド・ツー・エンド・トレーニング可能なネットワークを提案する。
論文 参考訳(メタデータ) (2021-09-26T07:45:53Z) - Document-level Entity-based Extraction as Template Generation [13.110360825201044]
本稿では2つの文書レベルEEタスクのための生成フレームワークを提案する: 役割充足者エンティティ抽出(REE)と関係抽出(RE)である。
まず、テンプレート生成問題として定式化し、モデルが依存性を効率的にキャプチャできるようにする。
キー情報の識別能力を高めるために、新しいクロスアテンションガイド付きコピー機構であるTopK Copyを事前訓練されたシーケンス・ツー・シーケンスモデルに組み込む。
論文 参考訳(メタデータ) (2021-09-10T14:18:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。