論文の概要: When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study
- arxiv url: http://arxiv.org/abs/2608.22366v1
- Date: Sun, 23 Aug 2026 11:12:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.734003
- Title: When Do VLMs Help Arabic Manuscript OCR? A Cross-Dataset Study
- Title(参考訳): VLMはアラビア文字のOCRにいつ役立つのか? クロスデータセットによる研究
- Abstract要約: 従来のOCR, 汎用VLM, アラビア特化VLM, および8つのアラビアテキストデータセット間でのOCR条件付きVLM補正を評価した。
OCR-priorリカバリは、OCR出力が視覚的かつテキスト的にリカバリ可能である場合に有効であり、VLMが画像に対して洗練できるアンカーを提供する。
追加の診断では、アラビアのVLM-OCRデータセットは、ダイアクリティカルス、前処理、生成予算、繰り返しループに敏感であることが示されている。
- 参考スコア(独自算出の注目度): 9.108791469266345
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) are increasingly being used for document understanding, yet their role in Arabic and Islamic manuscript recognition remains underexplored. To address such a gap in this paper, we evaluate traditional OCR, general-purpose VLMs, Arabic-specialized VLMs, and OCR-conditioned VLM correction across eight Arabic text datasets spanning historical manuscripts, aged printed books, clean print, multi-domain documents, and handwriting. The results show that no single approach dominates across setups. On line-level historical manuscripts, VLMs are close to Tesseract; on page-level manuscript images, they perform better; and in several settings, an OCR-conditioned corrector improves over both standalone OCR and standalone VLMs. The central finding is an OCR-prior recoverability principle: OCR conditioning helps when the OCR output remains visually and textually recoverable, providing anchors that the VLM can refine against the image. It improves recognition on aged print, clean print, mixed-domain Arabic, and some Naskh manuscripts, but degrades performance when the prior is script-mismatched or systematically misleading, as in Maghribi manuscripts and realistic student handwriting. Additional diagnostics show that Arabic VLM-OCR is sensitive to diacritics, preprocessing, generation budget, and repetition loops. These findings support an adaptive OCR-VLM workflow that routes pages according to script, OCR-prior recoverability, length diagnostics, and failure-mode indicators.
- Abstract(参考訳): ヴィジュアル言語モデル(VLM)は文書理解にますます使われてきているが、アラビア文字やイスラム教の写本認識におけるその役割はいまだ解明されていない。
本稿では,従来のOCR,汎用VLM,アラビア特化VLM,およびOCR対応VLM補正を,歴史写本,古版印刷本,クリーンプリント,マルチドメイン文書,手書きの8つのアラビアテキストデータセットにわたって評価する。
結果は、セットアップ全体において単一のアプローチが支配的でないことを示している。
行レベルの歴史写本では、VLM は Tesseract に近く、ページレベルの原稿画像ではパフォーマンスが良く、いくつかの設定では、OCR 条件付き修正器はスタンドアロンの OCR とスタンドアロンの VLM の両方よりも改善されている。
OCR条件付けは、OCR出力が視覚的にもテキスト的にも回復可能であり、VLMが画像に対して洗練できるアンカーを提供する。
古い印刷物、清潔な印刷物、混合領域のアラビア文字、いくつかのナスクの写本の認識を改善するが、マグリビの写本や写実的な学生の筆跡のように、前者が脚本のミスマッチや体系的に誤解を招く場合のパフォーマンスは低下する。
追加診断では、アラビアのVLM-OCRはダイアクリティカルス、前処理、生成予算、反復ループに敏感であることが示されている。
これらの発見は、スクリプトに従ってページをルーティングする適応型OCR-VLMワークフロー、OCR-priorリカバリ性、長さ診断、障害モードインジケータをサポートする。
関連論文リスト
- OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios [15.793450444852455]
OmniHandwriting OCRは手書きOCR上でMLLMとOCRシステムを評価するための診断ベンチマークである。
6つのサブタスクと12のサブセットにまたがる手書きのテキスト認識と手書きの数学的表現認識をカバーし、合計77.57Kのラベル付き画像である。
我々は,統一プロトコルの下で5つの相補的なメトリクスを持つ13のオープンソースおよびクローズドソースシステムを評価する。
論文 参考訳(メタデータ) (2026-08-19T06:27:05Z) - TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents [6.6457932580691015]
VLM(Vision-Language Models)は、従来のOCRシステムに代わる強力な代替手段として登場した。
本研究では,従来のOCRシステムとVLMに基づくアプローチをBerruttiデータセット上でベンチマークする。
論文 参考訳(メタデータ) (2026-07-27T07:19:00Z) - Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions [16.43811675687955]
光文字認識のための視覚言語モデル(VLM)は、可視だが視覚的にサポートされていないテキストを生成することができる。
我々は、VLMエラーが間違った場合でも流用し続け、もっともらしいギリシャの代替品を産出することを示す。
この結果は,OCR言語が低リソースの史料に依存しているという以前の証拠を延長するものである。
論文 参考訳(メタデータ) (2026-05-26T22:57:01Z) - FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing [51.905216364362325]
我々は2つの相補的なモジュールを持つトレーニングフリーフレームワークであるFastOCRを提案する。
FastOCRは未実行モデルの精度の98%を保持し、デコードステップあたりの視覚トークンの5%にしか到達しない。
論文 参考訳(メタデータ) (2026-05-17T13:39:47Z) - GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts [58.92151016423978]
我々は100以上のUnicodeスクリプトでOCRを評価する総合ベンチマークであるGlotOCR Benchを紹介する。
我々のベンチマークは、実際の多言語テキストからレンダリングされたクリーンで劣化した画像の変種で構成されている。
オープンウェイトでプロプライエタリなビジョン言語モデルを幅広く評価した結果,ほとんどの場合,10文字未満でうまく動作することがわかった。
論文 参考訳(メタデータ) (2026-04-14T17:12:41Z) - KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR [0.0]
カザフ語は、アラビア語、キリル文字、ラテン文字を用いており、光学文字認識(OCR)の点でユニークである。
低リソースのKazakhスクリプトのためのOCRの開発は非常に少なく、アラビア語とラテン文字のOCRベンチマークや画像は存在しない。
実OCRタスクを模倣するために,フォント,色,雑音の3つのスクリプトに対して,合成した7,219のOCRデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-17T14:24:49Z) - Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR [1.7590081165362783]
本稿では,アラビア語文書OCR用に微調整された視覚言語モデルであるBaseerを紹介する。
合成と実世界のドキュメントを組み合わせた大規模なデータセットを活用することで、Baseerはデコーダのみの微調整戦略を使用してトレーニングされる。
実験の結果,Baseer は既存のオープンソースおよび商用ソリューションを著しく上回り,WER は 0.25 であることがわかった。
論文 参考訳(メタデータ) (2025-09-17T15:07:29Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z) - Structured Multimodal Attentions for TextVQA [57.71060302874151]
上述の2つの問題を主に解決するために,終端から終端までの構造化マルチモーダルアテンション(SMA)ニューラルネットワークを提案する。
SMAはまず、画像に現れるオブジェクト・オブジェクト・オブジェクト・テキスト・テキストの関係を符号化するために構造グラフ表現を使用し、その後、それを推論するためにマルチモーダルグラフアテンションネットワークを設計する。
提案モデルでは,テキストVQAデータセットとST-VQAデータセットの2つのタスクを事前学習ベースTAP以外のモデルで比較した。
論文 参考訳(メタデータ) (2020-06-01T07:07:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。