論文の概要: Office Comprehension Benchmark
- arxiv url: http://arxiv.org/abs/2607.01245v1
- Date: Fri, 29 May 2026 03:19:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.633094
- Title: Office Comprehension Benchmark
- Title(参考訳): Office Comprehension Benchmark
- Abstract要約: Office Bench(OCB)は、Word、Excel、PowerPointのネイティブファイルフォーマットに対する理解を共同で評価する最初の公開ベンチマークである。
ファイルフィデリティQ&Aテスト オフィスアーティファクトの構造と視覚的認識 - テーブル、チャート、埋め込み画像、公式、およびヘッダ、スピーカーノート、名前付き範囲といったアプリ固有の要素。
デフォルトの推論モードで最強のフロンティアシステムでさえ、ドメインQ&Aで約59.3%に達する。
- 参考スコア(独自算出の注目度): 5.899398660180204
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Office Comprehension Bench (OCB), the first public benchmark to jointly evaluate LLM systems on Word, Excel, and PowerPoint comprehension over native file formats (.docx, .xlsx, .pptx) and their variants. OCB consists of two tracks. File Fidelity Q&A tests structural and visual perception of office artifacts - tables, charts, embedded images, formulas, and app-specific elements such as headers, speaker notes, and named ranges. Domain Q&A tests expert-level reasoning grounded in real-world industry documents across 12 professional domains, with queries requiring multi-step analysis and synthesis across documents. Each reference answer is decomposed into atomic, binary-gradable claims, and an ensemble of LLM judges scores responses against each claim independently. Even the strongest frontier system in its default reasoning mode reaches only about 59.3% on Domain Q&A; increasing thinking depth within a tier does not move performance materially, while moving to a higher product tier yields modest gains. We release the dataset, evaluation tooling, judge prompt, and a public leaderboard.
- Abstract(参考訳): 我々は、Word、Excel、PowerPoint上のLLMシステム(.docx、.xlsx、.pptx)とその変種を共同で評価する最初の公開ベンチマークであるOffice Comprehension Bench(OCB)を紹介した。
OCBは2つの線路からなる。
File Fidelity Q&Aは、テーブル、チャート、埋め込み画像、公式、およびヘッダ、スピーカーノート、名前付き範囲といったアプリ固有の要素の構造と視覚的認識をテストします。
ドメインQ&Aは、12の専門ドメインにわたる現実世界の業界文書に根ざした専門家レベルの推論をテストする。
各基準回答は原子的二項分解可能なクレームに分解され、LLM審査員のアンサンブルは各クレームに対するレスポンスを独立してスコアする。
デフォルトの推論モードにおける最強のフロンティアシステムでさえ、ドメインQ&Aでは59.3%にしか達しない。
データセット、評価ツール、判断プロンプト、公開リーダボードをリリースしています。
関連論文リスト
- XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding [66.6175918865927]
XL-DocBenchは、超長期文書理解のための完全に人間検証されたベンチマークである。
1,519人は6つの専門ドメインと2,303ページまでのコンテキストからの質問を保持した。
各質問には、12の推論ラベル、専門家による注釈付きエビデンスページ、型付き検証ルール、回答フォーマットの1つがある。
論文 参考訳(メタデータ) (2026-07-21T09:38:24Z) - RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing [53.41293908252118]
我々は、エキスパートレベルの文書解析のための困難を意識したベンチマークであるDocBench博士を紹介する。
Dr. DocBenchは52のBISACドメインにまたがり、障害ベースのサンプリングによってドキュメントを選択する。
約100ページにわたる長いドキュメントから4,514ページの注釈付きページが含まれており、レイアウト、読み込み順序、階層的関係、ドメイン固有のビジュアルコンテンツなど、65kの高品質なアノテーションがある。
本分析では,文書インテリジェンスを診断・進展するための総合的なテストベッドとしてDocBench博士が注目されている。
論文 参考訳(メタデータ) (2026-05-31T18:35:30Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters [55.34921520578968]
視覚言語モデル(VLM)は、テキストと公式の統一的な認識を実現している。
パラメータが0.1Bしか持たない統一認識モデルUniRec-0.1Bを提案する。
文字、単語、行、段落、文書など、複数のレベルでテキストや公式の認識を行うことができる。
論文 参考訳(メタデータ) (2025-12-24T10:35:21Z) - DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections [23.428084176322866]
本稿では,マルチモーダル,マルチドキュメント,マルチホップ質問応答のための大規模ベンチマークであるDocHop-QAを提案する。
DocHop-QAはドメインに依存しないもので、テキストパス、テーブル、構造的なレイアウトキューなど、さまざまな情報フォーマットが組み込まれている。
我々は,構造化インデックス予測,生成応答,マルチモーダル統合の4つのタスクを通してDocHop-QAを評価した。
論文 参考訳(メタデータ) (2025-08-20T08:17:45Z) - MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks [56.350173737493215]
環境・社会・ガバナンス(ESG)報告は、持続可能性の実践の評価、規制コンプライアンスの確保、財務透明性の促進に不可欠である。
MMESGBenchは、マルチモーダル理解と複雑な推論を、構造的に多種多様なマルチソースESG文書間で評価するための、最初のベンチマークデータセットである。
MMESGBenchは、45のESG文書から得られた933の検証済みQAペアで構成され、7つの異なるドキュメントタイプと3つの主要なESGソースカテゴリにまたがる。
論文 参考訳(メタデータ) (2025-07-25T03:58:07Z) - DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems [99.17123445211115]
本稿では,大規模言語モデル(LLM)に基づく文書読解システムを評価するベンチマークであるDocBenchを紹介する。
我々のベンチマークには、人間のアノテーションの募集と、合成質問の生成が含まれる。
実際の文書は229件、質問は1,102件で、5つのドメインにまたがって4種類の質問がある。
論文 参考訳(メタデータ) (2024-07-15T13:17:42Z) - UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-world Document Analysis [7.952225508086861]
学術文献やファイナンスによる質問応答では、データはHTMLやPDF形式の生のテキストや表によく見られる。
2,965の現実世界の文書と29,590のエキスパート注釈付きQ&AペアからなるベンチマークスイートであるUnstructured Document Analysis (UDA)を導入する。
論文 参考訳(メタデータ) (2024-06-21T14:29:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。