論文の概要: How Far Can Synthetic Data Take Thai OCR?
- arxiv url: http://arxiv.org/abs/2609.03595v1
- Date: Thu, 03 Sep 2026 09:46:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.006325
- Title: How Far Can Synthetic Data Take Thai OCR?
- Title(参考訳): タイのOCRの合成データはどこまでかかるのか?
- Abstract要約: 我々は、実際のタイ語文書ページのOCRラベルを使わずに適合したタイ語OCRモデルを構築した。
合成データは正確なラベルを提供するが、"現実主義"はソースドメイン、ページコンテキスト、タイポグラフィー、空間構造、グリフ変動を融合させる。
印刷および手書きタイ語文書のページレベルおよび作物レベルでの訓練において,各変種を評価する。
- 参考スコア(独自算出の注目度): 3.8641218447429657
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate what makes synthetic OCR supervision transfer to real Thai documents and use the resulting insights to build Wayu-Paxa-OCR-Zero, a Thai OCR model adapted without OCR labels from real Thai document pages. Synthetic data provide exact labels at scale, but "realism" conflates source domain, page context, typography, spatial structure, and glyph variation. We disentangle these factors with a controlled document-reconstruction pipeline and evaluate each variant under page- and crop-level training on printed and handwritten Thai documents. Non-text context has little consistent effect, whereas typeface diversity, two-dimensional structure, and real handwriting glyphs improve transfer; moreover, source-domain matching depends on training granularity, with in-domain reconstruction approaching real printed supervision under page-level training (1.82% versus 1.31% median character error rate) but underperforming out-of-domain reconstruction under crop-level training (15.59% versus 5.52%). Guided by these findings, we adapt the 0.9B-parameter PaddleOCR-VL-1.6 into Wayu-Paxa-OCR-Zero using 45,723 synthetic pages: relative to its base checkpoint, it reduces median character error rate from 6.64% to 1.24% on printed pages and from 74.87% to 20.55% on handwriting and outperforms Typhoon OCR v1 7B on all five evaluation sets, showing that synthetic-only training can be competitive.
- Abstract(参考訳): タイの文書ページからOCRラベルを含まないタイのOCRモデルであるWayu-Paxa-OCR-Zeroを開発した。
合成データは正確なラベルを提供するが、"現実主義"はソースドメイン、ページコンテキスト、タイポグラフィー、空間構造、グリフ変動を融合させる。
我々はこれらの因子を制御された文書再構成パイプラインで切り離し、印刷および手書きタイ語文書のページレベルおよび作物レベルでのトレーニングにおいて、各変種を評価する。
非テクストコンテキストは一貫した効果はほとんどないが、顔の多様性、二次元構造、実際の手書きのグリフは転写を改善するが、ソースドメインマッチングはトレーニングの粒度に依存し、ドメイン内再構成はページレベルのトレーニングで実際の印刷監督(1.82%対1.31%中央値文字誤り率)に近づくが、作物レベルのトレーニングではドメイン外の再構築(15.59%対5.52%)を行う。
これらの結果から, 0.9BパラメータのPaddleOCR-VL-1.6を, 45,723 個の合成ページを用いてWayu-Paxa-OCR-Zeroに適用した。
関連論文リスト
- TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - LV-ROVER-MLT: Low-Resource Maltese OCR by Multi-Stream Voting [0.0]
本稿では,文字誤り率0.0234の微調整Tesseractベースラインに対するベンチマーク結果について報告する。
アンサンブル認識のみは、ベースラインと同じラベルの慣例で行われ、文字エラー率を44%改善して0.01317に向上する。
Tesseractのストレートクォートとダッシュ出力をベンチマークのキュリークォート規則に合わせる後処理チェーンと、誤読ダイアクリティカルを回復する1つのステージは、完全なパイプラインを文字エラー率0.00700に導く。
論文 参考訳(メタデータ) (2026-06-30T22:58:41Z) - Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis [0.0]
ページレベルのSinhala OCR用の実世界のデータセットは公開されていない。
我々は1010ページレベルの画像とその転写の注釈付きデータセットである sinhala-ocr-lk-acts-1010 を導入した。
深層学習に基づく視覚言語処理に基づく3つのモデルをQLoRAを用いて微調整する。
論文 参考訳(メタデータ) (2026-06-28T13:01:54Z) - DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - GutenOCR: A Grounded Vision-Language Front-End for Documents [0.42776193697639947]
我々はQwen2.5-VL-3BとQwen2.5-VL-7Bを微調整して得られた接地型OCRフロントエンド群を紹介する。
結果として得られる単一チェックポイントビジョン言語モデルは、読み出し、検出、グラウンド化を、統一されたプロンプトベースのインターフェースを通じて公開する。
グッテンOCR-7Bは,Qwen2.5-VL-7Bバックボーンの複合接地OCRスコアを10.5Kの保留ビジネスページと科学ページの2倍以上に向上させることを示した。
論文 参考訳(メタデータ) (2026-01-20T21:26:15Z) - Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu [0.0]
危険に晒された言語である満州には、現実世界の歴史的文書を扱うことができる効果的なOCRシステムがない。
本研究では,3つのオープンソースビジョン言語モデルを微調整し,高性能なOCRシステムを構築する。
LLaMA-3.2-11Bは98.3%の単語精度と0.0024文字誤り率で優れた性能を達成した。
論文 参考訳(メタデータ) (2025-07-09T11:38:20Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - CLOCR-C: Context Leveraging OCR Correction with Pre-trained Language Models [0.0]
本稿では、コンテキストレバレッジOCR補正(CLOCR-C)を紹介する。
トランスフォーマーベースの言語モデル(LM)の組み込みとコンテキスト適応能力を使用して、OCRの品質を向上する。
本研究の目的は, LMがOCR後の修正を行うことができるか, 下流のNLPタスクを改善するか, 補正プロセスの一部として社会文化的文脈を提供する価値を判断することである。
論文 参考訳(メタデータ) (2024-08-30T17:26:05Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z) - Toward Real Text Manipulation Detection: New Dataset and New Solution [58.557504531896704]
プロフェッショナルなテキスト操作に関連する高コストは、現実世界のデータセットの可用性を制限する。
本稿では,14,250枚のテキスト画像を含むリアルテキスト操作データセットを提案する。
我々のコントリビューションは、実世界のテキスト改ざん検出の進歩を促進することを目的としている。
論文 参考訳(メタデータ) (2023-12-12T02:10:16Z) - PART: Pre-trained Authorship Representation Transformer [52.623051272843426]
文書を書く著者は、自分のテキストに識別情報を印字する。
以前の作品では、手作りの機能や分類タスクを使って著者モデルを訓練していた。
セマンティクスの代わりにテキストの埋め込みを学習するために、対照的に訓練されたモデルを提案する。
論文 参考訳(メタデータ) (2022-09-30T11:08:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。