論文の概要: Persian Pixel: A large-scale synthetic OCR dataset for Persian language
- arxiv url: http://arxiv.org/abs/2607.20385v1
- Date: Wed, 22 Jul 2026 17:13:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.165213
- Title: Persian Pixel: A large-scale synthetic OCR dataset for Persian language
- Title(参考訳): ペルシャ・Pixel:ペルシア語のための大規模合成OCRデータセット
- Authors: Pouria Mahdi, Haq Nawaz Malik,
- Abstract要約: 本稿では,これらの課題に対処するための総合的なOCRデータセットであるペルシャ・Pixelを紹介する。
データセットはセンテンス、段落、そして700万ワードのペルシャ語コーパスから生成される全ページの文書レイアウトにまたがる。
生成パイプラインは、文脈的な文字の接合、位置的グリフの変種、ダイアクリティカルな配置、複数のペルシャ文字の代表的な書体など、ペルシャ文字の文字特性を忠実にモデル化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Optical Character Recognition (OCR) for Persian remains substantially less mature than for Latin-script languages despite Persian being spoken by more than 110 million people across multiple countries. This gap arises from two fundamental challenges: the intrinsic complexity of the Perso-Arabic writing system and the limited availability of large-scale, high-quality annotated datasets. Persian script exhibits obligatory cursive connectivity, context-dependent glyph shaping, extensive ligatures, diacritic placement, and stylistic variation across writing forms such as Naskh and Nastaliq, all of which significantly complicate text recognition. At the same time, the high cost and labor-intensive nature of manual annotation have created a persistent data bottleneck, limiting the development of robust OCR systems and slowing progress in Persian document digitization.In this paper, we introduce Persian Pixel, a comprehensive synthetic OCR dataset specifically designed to address these challenges. Comprising over 343,000 high-fidelity image text pairs, the dataset spans sentence, paragraph, and full-page document layouts generated from a carefully curated seven-million-word Persian corpus using the SynthOCR-Gen rendering framework. The generation pipeline faithfully models the typographic characteristics of Persian script, including contextual character joining, positional glyph variants, diacritic placement, and multiple representative Persian typefaces. To bridge the synthetic-to-real domain gap, the rendered images are further enriched with more than twenty-five stochastic degradation models that emulate realistic document acquisition artifacts, including ink bleed, paper aging, blur, illumination variation, scanner imperfections, compression artifacts, and multiple noise processes.By overcoming the long-standing scarcity of annotated Persian OCR data, Persian Pixel provides a scalable and openly available resource for training and fine-tuning modern OCR architectures, including transformer-based models such as TrOCR and Donut. The dataset establishes a strong foundation for research in Persian document analysis, historical manuscript digitization, and end-to-end document understanding, while demonstrating that programmatic synthetic data generation offers a practical, cost-effective, and scalable alternative to manual annotation for advancing OCR in low-resource and typographically complex scripts.
- Abstract(参考訳): ペルシア語のための光学文字認識(OCR)は、複数の国で1億1000万人以上の人々がペルシア語を話されているにもかかわらず、ラテン文字言語よりもかなり成熟していない。
このギャップは、ペルソ・アラビア文字体系の本質的な複雑さと、大規模で高品質な注釈付きデータセットの可用性の制限という2つの根本的な課題から生じる。
ペルシャ文字は、義務的カーシブな接続性、文脈に依存したグリフの整形、広範なリグチュア、ダイアクリティカルな配置、ナスクやナスタリクのような書体にまたがるスタイリスティックなバリエーションを示しており、これらは全てテキスト認識を著しく複雑にしている。
同時に、手動アノテーションの高コストかつ労働集約的な性質は、堅牢なOCRシステムの開発を制限し、ペルシア文書のデジタル化の進行を遅らせる永続的なデータボトルネックを生み出した。
データセットは343,000以上の高忠実度画像テキストペアを補完し、SynthOCR-Genレンダリングフレームワークを使用して700万ワードのペルシャ語コーパスを慎重にキュレートした文、段落、全ページのドキュメントレイアウトを生成する。
生成パイプラインは、文脈的な文字の接合、位置的グリフの変種、ダイアクリティカルな配置、複数のペルシャ文字の代表的な書体など、ペルシャ文字の文字特性を忠実にモデル化する。
合成と現実のドメインギャップを埋めるために、レンダリングされた画像は、インクの出血、紙の老朽化、ぼかし、照明の変化、スキャナの欠陥、圧縮アーティファクト、および複数のノイズプロセスを含む、現実的な文書取得アーティファクトをエミュレートする、25以上の確率的劣化モデルでさらに強化される。ペルシャのOCRデータの長年の不足を克服する中で、ペルシアのPixelは、TrOCRやDonutといったトランスフォーマーベースのモデルを含む、モダンなOCRアーキテクチャのトレーニングと微調整のためのスケーラブルでオープンなリソースを提供する。
このデータセットは、ペルシアの文書分析、歴史文書のデジタル化、およびエンドツーエンドの文書理解における研究の強力な基盤を確立し、一方、プログラム的な合成データ生成は、低リソースでタイポグラフィ的に複雑なスクリプトでOCRを前進させるための手動アノテーションの実用的な、費用効率、スケーラブルな代替手段を提供することを示した。
関連論文リスト
- Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri [0.0]
我々は、Kashmiriのための最初の大規模合成OCRデータセットであるKoshur Pixelを紹介する。
Koshur Pixelは、SynthOCR-Genフレームワークを使用してKS-PRET-5Mコーパスから生成された613,078の画像テキストペアで構成されている。
論文 参考訳(メタデータ) (2026-06-22T10:42:36Z) - TextSculptor: Training and Benchmarking Scene Text Editing [88.11688559021628]
データ構築とシーンテキスト編集評価のための総合的なフレームワークであるTextSculptorを提案する。
TextSculptorはオープンソースのテキスト編集性能を改善し、プロプライエタリなモデルとのギャップを狭める。
論文 参考訳(メタデータ) (2026-05-20T12:22:26Z) - synthocr-gen: A synthetic ocr dataset generator for low-resource languages- breaking the data barrier [0.0]
我々は低リソース言語用に特別に設計されたオープンソースのOCRデータセットジェネレータであるSynthOCR-Genを提案する。
我々のツールは、デジタルUnicodeテキストコーパスを準備可能なトレーニングデータセットに変換することで、OCR開発における根本的なボトルネックに対処する。
我々は,600,000サンプルの単語分割型Kashmiri OCRデータセットを作成した。
論文 参考訳(メタデータ) (2026-01-22T17:01:33Z) - Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding [3.587092806938212]
Cross-Lingual SynthDocsは、光学文字認識(OCR)と文書理解(DU)のためのアラビア語リソースの不足に対処するために設計された大規模な合成コーパスである。
データセットは、150万のテキストデータ、270万の注釈付きテーブル、数十万の実際のデータベースチャートを含む、250万以上のサンプルで構成されている。
論文 参考訳(メタデータ) (2025-11-01T04:54:58Z) - Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach [51.95266411355865]
自己回帰言語モデルは、正書法攻撃に弱い。
この脆弱性は、サブワードトークン化器とその埋め込みに固有の語彙外問題に起因している。
本稿では,単語を個々の画像としてレンダリングすることで,テキストベースの埋め込みをピクセルベースの表現に置き換える,画素ベースの生成言語モデルを提案する。
論文 参考訳(メタデータ) (2025-08-28T20:48:38Z) - QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation [0.8944616102795021]
本稿では、アラビア語に段階的に最適化された視覚言語モデルであるQari-OCRを紹介する。
Qari-OCRは、ワード誤り率(WER)0.0160、文字誤り率(CER)0.061、BLEUスコア0.737の新たなオープンソースステート・オブ・ザ・アートを確立している。
論文 参考訳(メタデータ) (2025-06-02T22:21:06Z) - SARD: A Large-Scale Synthetic Arabic OCR Dataset for Book-Style Text Recognition [0.995313069446686]
SARDは、書籍スタイルのドキュメントをシミュレートするための、大規模で合成的に生成されたデータセットである。
6億9千万の単語を含む843,622の文書画像からなり、10の異なるアラビア語のフォントに散らばって、タイポグラフィーのカバー範囲を広く確保している。
スキャンされた文書から得られたデータセットとは異なり、SARDは現実世界のノイズや歪みをなくし、モデルトレーニングのためのクリーンで制御された環境を提供する。
論文 参考訳(メタデータ) (2025-05-30T13:47:54Z) - Discourse Features Enhance Detection of Document-Level Machine-Generated Content [53.41994768824785]
機械生成コンテンツは、学術プラジャリズムや誤報の拡散といった課題を提起する。
既存のMGC検出器は、しばしば表面レベルの情報のみに焦点を当て、暗黙的かつ構造的な特徴を見渡す。
これらの課題を克服するために、新しい方法論とデータセットを導入します。
論文 参考訳(メタデータ) (2024-12-17T08:47:41Z) - Boosting Modern and Historical Handwritten Text Recognition with
Deformable Convolutions [52.250269529057014]
自由進化ページにおける手書き文字認識(HTR)は難しい画像理解課題である。
本稿では,手入力に応じて変形し,テキストの幾何学的変化に適応できる変形可能な畳み込みを導入することを提案する。
論文 参考訳(メタデータ) (2022-08-17T06:55:54Z) - Scaling Autoregressive Models for Content-Rich Text-to-Image Generation [95.02406834386814]
Partiは、テキスト・ツー・イメージ生成をシーケンス・ツー・シーケンス・モデリング問題として扱う。
PartiはTransformerベースの画像トークンライザViT-VQGANを使用して、画像を離散トークンのシーケンスとしてエンコードする。
PartiPrompts (P2)は1600以上の英語のプロンプトの総合的なベンチマークである。
論文 参考訳(メタデータ) (2022-06-22T01:11:29Z) - Rethinking Text Line Recognition Models [57.47147190119394]
2つのデコーダファミリー(コネクショニスト時間分類と変換器)と3つのエンコーダモジュール(双方向LSTM、自己認識、GRCL)を考える。
広く使用されているシーンと手書きテキストの公開データセットの精度とパフォーマンスを比較します。
より一般的なTransformerベースのモデルとは異なり、このアーキテクチャは任意の長さの入力を処理できる。
論文 参考訳(メタデータ) (2021-04-15T21:43:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。