論文の概要: ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- arxiv url: http://arxiv.org/abs/2607.29677v2
- Date: Wed, 05 Aug 2026 17:48:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.001301
- Title: ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- Title(参考訳): ExtractBench: スキーマガイドによるエンタープライズドキュメント抽出のためのベンチマーク
- Authors: Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo,
- Abstract要約: 本稿では,スキーマ誘導抽出のベンチマークであるExtractBenchを紹介する。
ExtractBenchは、値の正確性、スケールでの完全性の記録、接地、測定コストを同時にスコアする。
評価システムは、370のエンタープライズドキュメント、8のビジネスドメイン、67のドキュメントタイプで4,869ページである。
- 参考スコア(独自算出の注目度): 5.372861244667072
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprise workflows increasingly rely on agents for \emph{schema-guided extraction}: given a document and a user-defined schema, the agent faithfully follows the schema to produce the correct output with source evidence as grounding metadata. We present ExtractBench, a benchmark for schema-guided extraction and, to our knowledge, the first to score value accuracy, record completeness at scale, grounding, and measured cost together. The evaluation system contains 4,869 pages across 370 enterprise documents, 8 business domains, and 67 document types, with clear tags differentiating their challenge scenarios. The scalable schema and ground-truth curation pipeline combines independent-system agreement for real documents, known values for synthetic lists, and human verification for forms. We report order-insensitive value F1 for value accuracy, plus two grounding metrics for source traceability: word- and page-level F1. Commercial VLMs perform well on short documents but often truncate record lists on long ones, while coding agents retain higher accuracy at much higher cost. LlamaExtract Agentic Plus ranks first on all three metrics, with accuracy comparable to coding agents at a fraction of the cost. Dataset and evaluation code are available on \href{https://huggingface.co/datasets/llamaindex/ExtractBench}{HuggingFace} and \href{https://github.com/run-llama/ExtractBench}{GitHub}.
- Abstract(参考訳): ドキュメントとユーザ定義スキーマが与えられたら、エージェントは忠実にスキーマに従い、ソースエビデンスを基底メタデータとして正しい出力を生成する。
本稿では,スキーマ誘導抽出のためのベンチマークであるExtractBenchについて述べる。
評価システムは370のエンタープライズドキュメントに4,869ページ,8つのビジネスドメイン,67のドキュメントタイプを含む。
スケーラブルなスキーマとグランドトラストキュレーションパイプラインは、実際のドキュメントの独立系契約、合成リストの既知の値、フォームの人間の検証を組み合わせたものだ。
本報告では, 順序不感な値F1と, ソーストレーサビリティの基準として, 単語レベルF1とページレベルF1の2つについて報告する。
商用のVLMは短い文書ではよく機能するが、長い文書ではレコードリストが途切れることが多い。
LlamaExtract Agentic Plusは、コーディングエージェントに匹敵する精度で、コストのごく一部で3つの指標で第1位である。
データセットと評価コードは \href{https://huggingface.co/datasets/llamaindex/ExtractBench}{HuggingFace} と \href{https://github.com/run-llama/ExtractBench}{GitHub} で利用可能である。
関連論文リスト
- RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction [11.272127170490059]
エンタープライズ規模のスキーマ幅でPDF-to-JSON抽出を評価するエンドツーエンドベンチマークはない。
ネスト抽出のセマンティクスを捉える原則的手法は存在しない。
ExtractBenchはPDFからJSONへの構造化抽出のためのオープンソースのベンチマークと評価フレームワークである。
論文 参考訳(メタデータ) (2026-02-12T18:31:37Z) - ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links [57.514511353084565]
我々は、最高のパフォーマンスのアプローチを選択し、文書間リンクに注釈を付けるための新しいドメインに依存しないフレームワークを提案する。
当社のフレームワークを2つの異なるドメイン – ピアレビューとニュース – に適用しています。
結果として得られた新しいデータセットは、メディアフレーミングやピアレビューなど、数多くのクロスドキュメントタスクの基礎を築いた。
論文 参考訳(メタデータ) (2025-09-01T11:32:24Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - Document Attribution: Examining Citation Relationships using Large Language Models [62.46146670035751]
そこで本研究では,帰属を簡単なテキスト・エンタテインメント・タスクとみなすゼロショット・アプローチを提案する。
また,アトリビューションプロセスの強化におけるアテンションメカニズムの役割についても検討する。
論文 参考訳(メタデータ) (2025-05-09T04:40:11Z) - PEneo: Unifying Line Extraction, Line Grouping, and Entity Linking for End-to-end Document Pair Extraction [28.205723817300576]
ドキュメントペア抽出は、キーエンティティとバリューエンティティの識別と、視覚的に豊富なドキュメントからの関連性の実現を目的としている。
既存のほとんどのメソッドは、セマンティックエンティティ認識(SER)と関係抽出(RE)の2つのタスクに分割している。
本稿では,統一パイプラインで文書ペア抽出を行う新しいフレームワークであるPEneoを紹介する。
論文 参考訳(メタデータ) (2024-01-07T12:48:07Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。