論文の概要: OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
- arxiv url: http://arxiv.org/abs/2501.00321v2
- Date: Thu, 05 Jun 2025 02:59:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-06-06 19:24:15.916991
- Title: OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
- Title(参考訳): OCRBench v2: ビジュアルテキストのローカライゼーションと推論に基づく大規模マルチモーダルモデル評価のための改良されたベンチマーク
- Abstract要約: OCRBench v2は、大規模なバイリンガルテキスト中心のベンチマークである。
さまざまなシナリオ31、人間検証された質問回答ペア1万、詳細な評価指標をカバーしている。
LMMのスコアは50未満(合計100点)で、5種類の制限に悩まされている。
- 参考スコア(独自算出の注目度): 72.57452266982642
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scoring the Optical Character Recognition (OCR) capabilities of Large Multimodal Models (LMMs) has witnessed growing interest. Existing benchmarks have highlighted the impressive performance of LMMs in text recognition; however, their abilities in certain challenging tasks, such as text localization, handwritten content extraction, and logical reasoning, remain underexplored. To bridge this gap, we introduce OCRBench v2, a large-scale bilingual text-centric benchmark with currently the most comprehensive set of tasks (4x more tasks than the previous multi-scene benchmark OCRBench), the widest coverage of scenarios (31 diverse scenarios), and thorough evaluation metrics, with 10,000 human-verified question-answering pairs and a high proportion of difficult samples. Moreover, we construct a private test set with 1,500 manually annotated images. The consistent evaluation trends observed across both public and private test sets validate the OCRBench v2's reliability. After carefully benchmarking state-of-the-art LMMs, we find that most LMMs score below 50 (100 in total) and suffer from five-type limitations, including less frequently encountered text recognition, fine-grained perception, layout perception, complex element parsing, and logical reasoning. The project website is at: https://99franklin.github.io/ocrbench_v2/
- Abstract(参考訳): LMM(Large Multimodal Models)の光学文字認識(OCR)能力が注目されている。
既存のベンチマークでは、テキスト認識におけるLMMの印象的なパフォーマンスが強調されているが、テキストのローカライゼーション、手書きコンテンツ抽出、論理的推論といった特定の課題におけるそれらの能力は、いまだに未熟である。
このギャップを埋めるために、私たちはOCRBench v2という大規模なバイリンガルテキスト中心のベンチマークを導入しました。これは、現在最も包括的なタスクセット(以前のマルチシーンベンチマークであるOCRBenchより4倍多いタスク)、シナリオの広範なカバレッジ(31の多様なシナリオ)、そして詳細な評価メトリクスを持ち、1万の人間検証された質問回答ペアと、高い割合の難しいサンプルを持ちます。
さらに,1500枚の手動アノテート画像を用いたプライベートテストセットを構築した。
OCRBench v2の信頼性は、パブリックテストとプライベートテストの両方で一貫した評価傾向が検証されている。
最先端のLMMを慎重にベンチマークした結果,ほとんどのLMMは50点未満(合計100点)で,テキスト認識や微粒化認識,レイアウト認識,複雑な要素解析,論理的推論といった5種類の制限を被っていることがわかった。
プロジェクトのWebサイトは以下の通り。
関連論文リスト
- LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs [52.79503055897109]
大規模マルチモーダル画像生成評価のための総合的データセットとベンチマークであるEvalMi-50Kを提案する。
複数の次元から大きなマルチモーダルT2Iを生成するためのLMM4LMMを提案する。
論文 参考訳(メタデータ) (2025-04-11T08:46:49Z) - Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models [10.828419851213528]
人間の生活の一般的な6つのシナリオをカバーする500以上の画像を含む多次元インサイト(Multi-dimensional Insights)ベンチマークを提案する。
この設計により、異なる年齢集団の好みやニーズを満たすLMMの能力を詳細に評価することができる。
今後、MDI-BenchmarkがLMMにおける現実のパーソナライゼーションを整合させる新たな経路を開拓することを期待している。
論文 参考訳(メタデータ) (2024-12-17T07:06:10Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios [60.492736455572015]
複雑な多視点都市シナリオにおけるLMM評価のためのベンチマークであるUrBenchを提案する。
UrBenchには、リージョンレベルとロールレベルの両方で、厳密にキュレートされた11.6Kの質問が含まれている。
21のLMMに対する評価は、現在のLMMが都市環境においていくつかの面で苦戦していることを示している。
論文 参考訳(メタデータ) (2024-08-30T13:13:35Z) - MMR: Evaluating Reading Ability of Large Multimodal Models [52.953316772123586]
大規模マルチモーダルモデル (LMM) は、テキストリッチな画像を含む様々な種類の画像を理解する能力を示す。
現在のベンチマークでは、異なるモデルのパフォーマンスを正確に反映することができない。
テキストリッチ画像理解のためのLMMを評価するために,11種類のタスクでMulti-Modal Reading (MMR)ベンチマークを提案する。
論文 参考訳(メタデータ) (2024-08-26T19:26:50Z) - Benchmarking Large Multimodal Models against Common Corruptions [45.26424202601339]
大規模マルチモーダルモデル(LMM)の評価における欠陥を補うことを目的とした技術報告
テキスト,画像,音声間の相互モーダルな相互作用について検討し,本質的な4つのタスクを包含する。
MMCBenchという名前のベンチマークを作成し、100以上のLMMをカバーしています。
論文 参考訳(メタデータ) (2024-01-22T13:33:53Z) - OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models [122.27878464009181]
テキスト関連視覚タスクにおいて, GPT4V や Gemini などの大規模マルチモーダルモデルの包括的評価を行った。
OCRBenchには29のデータセットがあり、最も包括的なOCR評価ベンチマークが利用できる。
論文 参考訳(メタデータ) (2023-05-13T11:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。