論文の概要: GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
- arxiv url: http://arxiv.org/abs/2607.11192v1
- Date: Mon, 13 Jul 2026 07:44:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.366197
- Title: GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
- Title(参考訳): GDP.pdf: プロフェッショナルなPDFドキュメントに対するマルチモーダル推論のベンチマーク
- Authors: Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen,
- Abstract要約: GDP.pdfは、ドキュメントAI機能を直接測定するベンチマークである。
これは10分野の作業専門家によって書かれた質問文書対で構成されている。
100-itemベンチマークで7つのフロンティアモデルを評価した。
- 参考スコア(独自算出の注目度): 0.12430801435092285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A large share of day-to-day work in professional domains happens inside PDF files: benefits packets, leases, datasheets, clinical guidelines, construction plans. Benchmarks for document AI have generally measured the required capabilities in isolation: OCR, layout analysis, chart reasoning, table QA, document VQA. A high score on any one of them does not necessarily reveal whether a model can answer a realistic question that someone in the field would actually ask about a specific PDF. GDP.pdf is a benchmark built to measure this directly. It consists of question-document pairs authored by working professionals in ten fields, and a candidate question was kept only when at least two frontier multimodal models failed it in a way that mattered: a wrong answer, missed decisive evidence, or a fabricated claim, rather than a superficial difference such as style. Each item comes with a rubric of atomic criteria, so we can report a graded rubric score as well as a strict task-level pass rate, and each item is tagged against a taxonomy of eleven capabilities in three tiers, spanning text extraction and grounding, table and chart comprehension, cross-referencing, spatial reasoning, and abstention on unsupported queries. We evaluated seven frontier models on the 100-item benchmark. The best model passed only 15% of the items and the worst passed 1%. Most errors trace back to a small set of recurring loss patterns: misaligned tables, misread charts, skipped footnotes and exclusions, miscounted floor-plan symbols, scan noise, and amendments that supersede earlier text. The full 100-item benchmark is publicly available at https://huggingface.co/datasets/surgeai/GDP.pdf
- Abstract(参考訳): プロのドメインにおける日々の作業の多くはPDFファイル内で行われ、パケット、リース、データシート、臨床ガイドライン、建設計画などに役立ちます。
ドキュメントAIのベンチマークは一般的に、OCR、レイアウト分析、チャート推論、テーブルQA、ドキュメントVQAなど、必要な機能を分離して測定している。
いずれのモデルでも高いスコアは、フィールドにいる誰かが実際に特定のPDFについて尋ねるという現実的な疑問にモデルが答えられるかどうかを必ずしも明らかにしない。
GDP.pdfは直接測定するためのベンチマークである。
それは10の分野の作業専門家によって書かれた質問文書のペアで構成されており、少なくとも2つのフロンティアのマルチモーダルモデルが失敗すると、それは問題であった:誤った答え、決定的な証拠の欠如、または、スタイルのような表面的な違いではなく、偽造されたクレームである。
各項目は,テキスト抽出と接地,表とチャートの理解,相互参照,空間的推論,無意味なクエリにまたがる11の能力の分類に対してタグ付けされる。
100-itemベンチマークで7つのフロンティアモデルを評価した。
ベストモデルは15%に過ぎず、最悪のものは1%に留まった。
ほとんどのエラーは、ミスアライメントテーブル、ミスリードチャート、スキップされたフットノートと除外、フロアプラン記号の誤算、スキャンノイズ、以前のテキストに取って代わる修正といった小さな損失パターンに遡る。
完全な100itemベンチマークはhttps://huggingface.co/datasets/surgeai/GDP.pdfで公開されている。
関連論文リスト
- RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - Office Comprehension Benchmark [5.899398660180204]
Office Bench(OCB)は、Word、Excel、PowerPointのネイティブファイルフォーマットに対する理解を共同で評価する最初の公開ベンチマークである。
ファイルフィデリティQ&Aテスト オフィスアーティファクトの構造と視覚的認識 - テーブル、チャート、埋め込み画像、公式、およびヘッダ、スピーカーノート、名前付き範囲といったアプリ固有の要素。
デフォルトの推論モードで最強のフロンティアシステムでさえ、ドメインQ&Aで約59.3%に達する。
論文 参考訳(メタデータ) (2026-05-29T03:19:32Z) - What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema [0.0]
筆者らは、よく知られた12のLSMエージェントベンチマーク論文を読み、各論文が実際にどのように評価されたか、寸法によって記録した。
私たちは、小さな監査スキーマを設計しました(5つのフィールド:ベンチマークアイデンティティ、ハーネス仕様、推論設定、コストレポート、障害の分解)。
我々はエージェントランの開示を正当性ではなくスコア付けし、開示が信頼できる結果を意味するという主張をしない。
論文 参考訳(メタデータ) (2026-05-20T17:02:36Z) - DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding [29.270128057512284]
本稿では,長期文書QAを構造化推論軌道予測問題として定式化するベンチマークであるDocScopeを紹介する。
軌道の各レベルを独立に監査する4段階評価プロトコルを設計する。
6つのプロプライエタリなモデル、12のオープンウェイトモデル、いくつかのドメイン固有のシステムをベンチマークします。
論文 参考訳(メタデータ) (2026-05-09T11:12:59Z) - ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge [50.93758649363798]
Impliretは、推論の課題をドキュメント側処理にシフトするベンチマークである。
我々は,この環境下で苦戦している,疎水・密集したレトリバーの幅を評価した。
論文 参考訳(メタデータ) (2025-06-17T11:08:29Z) - PDFTriage: Question Answering over Long, Structured Documents [60.96667912964659]
構造化文書をプレーンテキストとして表現することは、これらの文書をリッチな構造でユーザ精神モデルと矛盾する。
本稿では,構造や内容に基づいて,モデルがコンテキストを検索できるPDFTriageを提案する。
ベンチマークデータセットは,80以上の構造化文書に900以上の人間が生成した質問からなる。
論文 参考訳(メタデータ) (2023-09-16T04:29:05Z) - Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text
Documents via Semantic-Oriented Hierarchical Graphs [79.0426838808629]
視覚的にリッチなテーブルテキスト文書に答えるTAT-DQAを提案する。
具体的には、離散推論機能を強化した新しいDoc2SoarGraphフレームワークを提案する。
我々は,TAT-DQAデータセットに関する広範な実験を行い,提案したフレームワークは,テストセット上でのエクサクティマッチ(EM)とF1スコアでそれぞれ17.73%,F1スコアで16.91%の最高のベースラインモデルを上回る結果を得た。
論文 参考訳(メタデータ) (2023-05-03T07:30:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。