論文の概要: GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
- arxiv url: http://arxiv.org/abs/2607.11192v3
- Date: Wed, 15 Jul 2026 07:47:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.391205
- Title: GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents
- Title(参考訳): GDP.pdf: プロフェッショナルなPDFドキュメントに対するマルチモーダル推論のベンチマーク
- Abstract要約: GDP_pdfは、ドキュメントAI機能を直接測定するベンチマークである。
これは10分野の作業専門家によって書かれた質問文書対で構成されている。
100-itemベンチマークで17のフロンティアモデルの結果を報告する。
- 参考スコア(独自算出の注目度): 0.12430801435092285
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A large share of day-to-day work in professional domains happens inside PDF files: benefits packets, leases, datasheets, clinical guidelines, construction plans. Benchmarks for document AI have generally measured the required capabilities in isolation: OCR, layout analysis, chart reasoning, table QA, document VQA. A high score on any one of them does not necessarily reveal whether a model can answer a realistic question that someone in the field would actually ask about a specific PDF. GDP_pdf is a benchmark built to measure this directly. It consists of question-document pairs authored by working professionals in ten fields, and a candidate question was kept only when at least two frontier multimodal models failed it in a way that mattered: a wrong answer, missed decisive evidence, or a fabricated claim, rather than a superficial difference such as style. Each item comes with a rubric of atomic criteria, so we can report a graded rubric score as well as a strict task-level pass rate, and each item is tagged against a taxonomy of eleven capabilities in three tiers, spanning text extraction and grounding, table and chart comprehension, cross-referencing, spatial reasoning, and abstention on unsupported queries. We report results for seventeen frontier models on the 100-item benchmark: the best model passes only 30.7% of the items and the worst passes 2%. Most errors trace back to a small set of recurring loss patterns: misaligned tables, misread charts, skipped footnotes and exclusions, miscounted floor-plan symbols, scan noise, and amendments that supersede earlier text.
- Abstract(参考訳): プロのドメインにおける日々の作業の多くはPDFファイル内で行われ、パケット、リース、データシート、臨床ガイドライン、建設計画などに役立ちます。
ドキュメントAIのベンチマークは一般的に、OCR、レイアウト分析、チャート推論、テーブルQA、ドキュメントVQAなど、必要な機能を分離して測定している。
いずれのモデルでも高いスコアは、フィールドにいる誰かが実際に特定のPDFについて尋ねるという現実的な疑問にモデルが答えられるかどうかを必ずしも明らかにしない。
GDP_pdfは、これを直接測定するベンチマークである。
それは10の分野の作業専門家によって書かれた質問文書のペアで構成されており、少なくとも2つのフロンティアのマルチモーダルモデルが失敗すると、それは問題であった:誤った答え、決定的な証拠の欠如、または、スタイルのような表面的な違いではなく、偽造されたクレームである。
各項目は,テキスト抽出と接地,表とチャートの理解,相互参照,空間的推論,無意味なクエリにまたがる11の能力の分類に対してタグ付けされる。
100itemベンチマークで17のフロンティアモデルの結果を報告する: 最高のモデルが30.7%、最悪のモデルが2%である。
ほとんどのエラーは、ミスアライメントテーブル、ミスリードチャート、スキップされたフットノートと除外、フロアプラン記号の誤算、スキャンノイズ、以前のテキストに取って代わる修正といった小さな損失パターンに遡る。
関連論文リスト
- XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding [66.6175918865927]
XL-DocBenchは、超長期文書理解のための完全に人間検証されたベンチマークである。
1,519人は6つの専門ドメインと2,303ページまでのコンテキストからの質問を保持した。
各質問には、12の推論ラベル、専門家による注釈付きエビデンスページ、型付き検証ルール、回答フォーマットの1つがある。
論文 参考訳(メタデータ) (2026-07-21T09:38:24Z) - SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows [14.11925465537949]
スプレッドシートエージェントの分類レベルベンチマークであるtextscSpreadsheetBench 2 を紹介する。
このベンチマークは、財務報告や企業書類を含む、本物のビジネスデータから構築されている。
その結果、現在のシステムは現実世界での使用には程遠いことが判明した。
論文 参考訳(メタデータ) (2026-06-29T08:33:52Z) - RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - Office Comprehension Benchmark [5.899398660180204]
Office Bench(OCB)は、Word、Excel、PowerPointのネイティブファイルフォーマットに対する理解を共同で評価する最初の公開ベンチマークである。
ファイルフィデリティQ&Aテスト オフィスアーティファクトの構造と視覚的認識 - テーブル、チャート、埋め込み画像、公式、およびヘッダ、スピーカーノート、名前付き範囲といったアプリ固有の要素。
デフォルトの推論モードで最強のフロンティアシステムでさえ、ドメインQ&Aで約59.3%に達する。
論文 参考訳(メタデータ) (2026-05-29T03:19:32Z) - What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema [0.0]
筆者らは、よく知られた12のLSMエージェントベンチマーク論文を読み、各論文が実際にどのように評価されたか、寸法によって記録した。
私たちは、小さな監査スキーマを設計しました(5つのフィールド:ベンチマークアイデンティティ、ハーネス仕様、推論設定、コストレポート、障害の分解)。
我々はエージェントランの開示を正当性ではなくスコア付けし、開示が信頼できる結果を意味するという主張をしない。
論文 参考訳(メタデータ) (2026-05-20T17:02:36Z) - DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding [29.270128057512284]
本稿では,長期文書QAを構造化推論軌道予測問題として定式化するベンチマークであるDocScopeを紹介する。
軌道の各レベルを独立に監査する4段階評価プロトコルを設計する。
6つのプロプライエタリなモデル、12のオープンウェイトモデル、いくつかのドメイン固有のシステムをベンチマークします。
論文 参考訳(メタデータ) (2026-05-09T11:12:59Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - Team "better_call_claude": Style Change Detection using a Sequential Sentence Pair Classifier [5.720553544629197]
PAN 2025では、共有タスクは参加者に対して、最もきめ細かいレベルでスタイルを検出するよう呼びかけている。
本稿では,Sentence Pair Pair (SSPC)アーキテクチャを用いて各インスタンスの内容をモデル化し,この問題に対処することを提案する。
EASY媒体でそれぞれ0.92328、0.724、HARDデータで強いマクロスコアを得る。
論文 参考訳(メタデータ) (2025-08-01T14:48:17Z) - MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks [56.350173737493215]
環境・社会・ガバナンス(ESG)報告は、持続可能性の実践の評価、規制コンプライアンスの確保、財務透明性の促進に不可欠である。
MMESGBenchは、マルチモーダル理解と複雑な推論を、構造的に多種多様なマルチソースESG文書間で評価するための、最初のベンチマークデータセットである。
MMESGBenchは、45のESG文書から得られた933の検証済みQAペアで構成され、7つの異なるドキュメントタイプと3つの主要なESGソースカテゴリにまたがる。
論文 参考訳(メタデータ) (2025-07-25T03:58:07Z) - ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge [50.93758649363798]
Impliretは、推論の課題をドキュメント側処理にシフトするベンチマークである。
我々は,この環境下で苦戦している,疎水・密集したレトリバーの幅を評価した。
論文 参考訳(メタデータ) (2025-06-17T11:08:29Z) - MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations [105.10376440302076]
MMLongBench-Doc は 1,062 のエキスパート注釈付き質問を含む長文マルチモーダルベンチマークである。
130の長いPDFフォーマットの文書の上に構築されており、平均49.4ページと20,971のテキストトークンがある。
14個のLVLMの実験により、長いコンテキストのDUが現在のモデルに大きく挑戦することを示した。
論文 参考訳(メタデータ) (2024-07-01T17:59:26Z) - PDFTriage: Question Answering over Long, Structured Documents [60.96667912964659]
構造化文書をプレーンテキストとして表現することは、これらの文書をリッチな構造でユーザ精神モデルと矛盾する。
本稿では,構造や内容に基づいて,モデルがコンテキストを検索できるPDFTriageを提案する。
ベンチマークデータセットは,80以上の構造化文書に900以上の人間が生成した質問からなる。
論文 参考訳(メタデータ) (2023-09-16T04:29:05Z) - Doc2SoarGraph: Discrete Reasoning over Visually-Rich Table-Text
Documents via Semantic-Oriented Hierarchical Graphs [79.0426838808629]
視覚的にリッチなテーブルテキスト文書に答えるTAT-DQAを提案する。
具体的には、離散推論機能を強化した新しいDoc2SoarGraphフレームワークを提案する。
我々は,TAT-DQAデータセットに関する広範な実験を行い,提案したフレームワークは,テストセット上でのエクサクティマッチ(EM)とF1スコアでそれぞれ17.73%,F1スコアで16.91%の最高のベースラインモデルを上回る結果を得た。
論文 参考訳(メタデータ) (2023-05-03T07:30:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。