論文の概要: Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction
- arxiv url: http://arxiv.org/abs/2608.08459v1
- Date: Sun, 09 Aug 2026 03:58:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.834481
- Title: Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction
- Title(参考訳): Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction
- Abstract要約: 本稿ではDoc2DB-Benchについて紹介する。
42のスキーマと7つのドメイングループにまたがる203の長いドキュメントインスタンスがあり、117のエンティティテーブル、132のリレーションテーブル、7,341の行、41,935のセルがある。
- 参考スコア(独自算出の注目度): 4.062546658033461
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Practical AI systems increasingly need to turn long, heterogeneous documents into queryable relational databases, not isolated spreadsheets. In domains such as finance, healthcare, education, transportation, and enterprise operations, downstream workflows rely on normalized schemas, entity identities, keys, cross-table relationships, and integrity constraints for analytics, compliance, auditing, and SQL-backed decision making. Existing Document-to-Table benchmarks are insufficient for this setting: flattening evidence into single tables can duplicate entities, obscure many-to-many relationships, create sparse records, and avoid testing whether extracted facts form a valid database instance. This creates an urgent need to evaluate document understanding as database construction rather than field extraction. We introduce Doc2DB-Bench, a benchmark for Document-to-Database construction, containing 203 long-document instances across 42 schemas and seven domain groups, with 117 entity tables, 132 relationship tables, 7,341 rows, and 41,935 cells. Built through a controllable DB-to-Doc synthesis pipeline and organized by a taxonomy of intra-table extraction and inter-table reasoning, the generated documents undergo authenticity verification, proving indistinguishable from real-world references. Doc2DB-Bench thus provides a testbed for reliable, auditable, and relationally faithful LLM-based data systems. The benchmark is publicly available at https://github.com/SetonLiang/Doc2DB-Bench.
- Abstract(参考訳): 現実的なAIシステムは、長い異質なドキュメントを独立したスプレッドシートではなく、クエリ可能なリレーショナルデータベースに変換する必要がある。
金融、医療、教育、交通、エンタープライズオペレーションといったドメインでは、ダウンストリームワークフローは、正常化されたスキーマ、エンティティのアイデンティティ、キー、テーブル間の関係、分析、コンプライアンス、監査、SQLベースの意思決定のための整合性制約に依存しています。
既存のDocument-to-Tableベンチマークは、この設定では不十分である。単一のテーブルにエビデンスをフラット化することで、エンティティを重複させ、多くのto-Many関係を曖昧にし、スパースレコードを作成し、抽出された事実が有効なデータベースインスタンスを形成するかどうかをテストする。
これにより、文書理解をフィールド抽出よりもデータベース構築として評価する必要がある。
Doc2DB-Benchは、42のスキーマと7つのドメイングループにまたがる203の長いドキュメントインスタンスを含み、117のエンティティテーブル、132のリレーションテーブル、7,341の行、41,935のセルを含むドキュメントデータベース構築のためのベンチマークである。
制御可能なDB-to-Doc合成パイプラインを通じて構築され、テーブル内抽出とテーブル間推論の分類によって組織化され、生成されたドキュメントは認証検証され、現実世界の参照と区別できないことが証明される。
したがってDoc2DB-Benchは信頼性、監査性、リレーショナルに忠実なLCMベースのデータシステムのためのテストベッドを提供する。
ベンチマークはhttps://github.com/SetonLiang/Doc2DB-Benchで公開されている。
関連論文リスト
- ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering [42.15843879644805]
本稿では,日常的な文書から監査対象の企業世界を再構築するベンチマーク構築フレームワークであるENTLOREを紹介する。
バージョン管理された組織規約は、真理グラフで派生関係を認証し、完全な黄金の回答と証明証明書を可能にする。
ENTLOREには3つのソースタイプから2,341のドキュメントと907の質問が含まれており、明示的なルックアップ、クロスソースな構成、潜伏した組織的推論を含んでいる。
論文 参考訳(メタデータ) (2026-08-11T09:00:43Z) - FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition [3.879207672674058]
本稿では,テーブル形式の文書構造認識を評価する階層的および診断的ベンチマークであるFormStruct-Benchを紹介する。
オーディショナブルな地上真実を大規模に構築するために、70の再利用可能なテンプレートを注釈付けし、7000の検証済みインスタンスに拡張する。
14以上のAPIがホストされ、ローカルにデプロイ可能なシステムと2つのSFT版があり、最高の文書レベルスコアは83.85%に達し、報告されている最も詳細な構造スコアは18%以下である。
論文 参考訳(メタデータ) (2026-08-11T02:44:34Z) - DocAtlas: Long-Document Understanding as Mutable-State Interaction [67.90400271544678]
本稿では,長期文書理解を可変状態情報探索プロセスとして扱うDocAtlasを提案する。
ドキュメントと質問が与えられた後、DocAtlasは検索、読み取り、メモ取り、レビューツールを公開し、階層的なツリーとノートストアを維持し、エージェントが証拠を記録するように更新する。
GPT-5.4では、DocAtlasはMMLongBench-Docで71.4%に達し、65.8%という人間の専門的基準を超えた。
論文 参考訳(メタデータ) (2026-07-21T09:45:34Z) - DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering [11.177470565638666]
マルチドキュメント マルチエンティティ 回答 本質的には、複数のエンティティ間の暗黙のロジックを、散在するドキュメント間で追跡するようモデルに要求する。
既存のLarge Language Models (LLM) とRetrieval-Augmented Generation (RAG) フレームワークは、限界に悩まされている。
動的スキーマ発見、構造化情報抽出、エラー保証付きスキーマ対応リレーショナル推論を統合したエンドツーエンドのエージェントフレームワークであるDocSageを提案する。
論文 参考訳(メタデータ) (2026-03-12T11:00:09Z) - DTBench: A Synthetic Benchmark for Document-to-Table Extraction [19.499877109720945]
Document-to-table (Doc2Table) 抽出は、ターゲットスキーマの下で非構造化ドキュメントから構造化テーブルを導出する。
既存のベンチマークでは、Doc2Table抽出に必要なさまざまな機能を明確に区別することも、包括的にカバーすることもできない。
本稿では、Doc2Tableの機能の2段階の分類法を提案する合成ベンチマークDTBenchを紹介する。
論文 参考訳(メタデータ) (2026-02-14T14:52:36Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links [57.514511353084565]
我々は、最高のパフォーマンスのアプローチを選択し、文書間リンクに注釈を付けるための新しいドメインに依存しないフレームワークを提案する。
当社のフレームワークを2つの異なるドメイン – ピアレビューとニュース – に適用しています。
結果として得られた新しいデータセットは、メディアフレーミングやピアレビューなど、数多くのクロスドキュメントタスクの基礎を築いた。
論文 参考訳(メタデータ) (2025-09-01T11:32:24Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - Multi-Field Adaptive Retrieval [39.38972160512916]
MFAR(Multi-Field Adaptive Retrieval)は、構造化データ上の任意の文書インデックスに対応するフレキシブルなフレームワークである。
本フレームワークは,(1) 既存の文書のフィールドへの分解,(2) 文書クエリの条件付けによるフィールドの重要性を適応的に予測するモデル学習,という2つのステップから構成される。
提案手法により,フィールドタイプ間での濃密表現と語彙表現の最適化が実現され,既存の検索者よりも文書のランク付けが大幅に向上し,マルチフィールド構造における最先端の性能が向上することがわかった。
論文 参考訳(メタデータ) (2024-10-26T03:07:22Z) - PDFTriage: Question Answering over Long, Structured Documents [60.96667912964659]
構造化文書をプレーンテキストとして表現することは、これらの文書をリッチな構造でユーザ精神モデルと矛盾する。
本稿では,構造や内容に基づいて,モデルがコンテキストを検索できるPDFTriageを提案する。
ベンチマークデータセットは,80以上の構造化文書に900以上の人間が生成した質問からなる。
論文 参考訳(メタデータ) (2023-09-16T04:29:05Z) - DocBank: A Benchmark Dataset for Document Layout Analysis [114.81155155508083]
文書レイアウト解析のための詳細なトークンレベルのアノテーションを備えた500Kドキュメントページを含むベンチマークデータセットである textbfDocBank を提示する。
実験の結果,DocBankでトレーニングされたモデルは,さまざまなドキュメントのレイアウト情報を正確に認識することがわかった。
論文 参考訳(メタデータ) (2020-06-01T16:04:30Z) - Pairwise Multi-Class Document Classification for Semantic Relations
between Wikipedia Articles [5.40541521227338]
2つの文書間の関係をペアワイズ文書分類タスクとして検索する問題をモデル化する。
文書間の意味的関係を見つけるために,GloVe, paragraph-s,BERT,XLNetなどの一連の手法を適用する。
我々は,新たに提案された32,168のウィキペディア記事ペアと,セマンティックドキュメントの関係を定義するウィキデータプロパティに関する実験を行った。
論文 参考訳(メタデータ) (2020-03-22T12:52:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。