論文の概要: Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images
- arxiv url: http://arxiv.org/abs/2608.28248v1
- Date: Fri, 28 Aug 2026 12:09:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.311324
- Title: Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images
- Title(参考訳): Synth-JDoc: 横レイアウトと埋め込み画像を用いたOCR用日本語文書画像データセットの合成
- Authors: Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara,
- Abstract要約: 高品質なOCRデータセットは、LVLMのテキスト読取能力を高めるために不可欠である。
現在のLVLMは、水平テキストよりも垂直テキストの方がかなり低い性能を示している。
テキストから直接文書画像を合成することで,OCRデータセットを構築する。
- 参考スコア(独自算出の注目度): 18.775629936667105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The ability of Large Vision Language Models (LVLMs) to read text within document images is crucial, as it enables various applications such as Document Visual Question Answering. To enhance the text-reading capabilities of LVLMs, high-quality OCR datasets are essential. This need is particularly critical for Japanese documents, which often feature vertically written text alongside horizontally written text. Current LVLMs demonstrate considerably lower performance on vertically written Japanese text than on horizontally written text, necessitating specialized OCR datasets to bridge this gap. However, manually constructing OCR datasets is expensive and difficult to scale. Alternatively, constructing datasets by extracting text from existing document images using OCR models introduces challenges, such as text recognition errors and the prerequisite of sourcing document images. To address these issues, we construct an OCR dataset by synthesizing document images directly from text. Leveraging HTML and CSS, we generate multi-column documents that incorporate both vertical and horizontal writing styles. Furthermore, to ensure the visual realism of the documents, we embed images generated by text-to-image models within the layout. Additionally, to foster model robustness, we apply noise and degradation filters to the synthesized document images. In our experiments, we compared the performance of models fine-tuned on our synthetic dataset against baselines fine-tuned on synthetic datasets from prior work and those generated by a high-performance text-to-image model. Evaluation results demonstrate that our synthetic dataset is the most effective approach for improving LVLM performance on reading vertically written Japanese text. Our dataset and code are publicly available (https://github.com/llm-jp/synth-jdoc).
- Abstract(参考訳): 文書画像内のテキストを読み取るLVLM(Large Vision Language Models)の機能は非常に重要である。
LVLMのテキスト読取能力を高めるために、高品質なOCRデータセットが不可欠である。
この必要性は、垂直に書かれたテキストと水平に書かれたテキストを兼ね備えた日本の文書にとって特に重要である。
現在のLVLMは、水平テキストよりも垂直テキストの方がかなり低い性能を示し、このギャップを埋めるために特殊なOCRデータセットを必要とする。
しかし、手動でOCRデータセットを構築するのは高価でスケールが難しい。
あるいは、OCRモデルを用いて既存の文書画像からテキストを抽出してデータセットを構築すると、テキスト認識エラーや文書画像のソーシングの前提条件といった課題が発生する。
これらの問題に対処するため、テキストから直接文書イメージを合成することにより、OCRデータセットを構築する。
HTMLとCSSを活用することで、垂直および水平の両方の書き込みスタイルを組み込んだマルチカラムドキュメントを生成します。
さらに,文書の視覚的リアリズムを確実にするために,テキスト・ツー・イメージ・モデルによって生成された画像をレイアウト内に埋め込む。
さらに, モデルロバスト性を高めるため, 合成文書画像にノイズフィルタと劣化フィルタを適用した。
実験では, 合成データセットに微調整されたモデルの性能を, 先行作業から得られた合成データセットに微調整されたベースラインと, 高性能テキスト・画像モデルで生成されたモデルと比較した。
評価結果から,テキストの垂直読み上げにおけるLVLMの性能向上には,我々の合成データセットが最も有効な手法であることが示唆された。
私たちのデータセットとコードは公開されています(https://github.com/llm-jp/synth-jdoc)。
関連論文リスト
- An Effective Data Augmentation Method by Asking Questions about Scene Text Images [5.189562992500781]
本稿では,構造化質問応答タスクによるOCRトレーニングを強化するVQAにインスパイアされたデータ拡張フレームワークを提案する。
各画像テキストペアに対して、存在、位置、頻度といった文字レベルの属性を探索する自然言語質問を生成する。
これらの補助的なタスクはよりきめ細かい推論を奨励し、OCRモデルは視覚的特徴をテキストクエリと整列させ、画像と質問を共同で推論する。
論文 参考訳(メタデータ) (2026-03-03T23:18:53Z) - When Vision Meets Texts in Listwise Reranking [1.2691047660244335]
Rank-Nexusは、画像とテキストの両方を組み込んだ検索リスト上で、リストワイズで定性的な再ランクを行うマルチモーダルな画像テキスト文書再ランカである。
私たちはまず、大量のテキストを再ランク付けしたデータを活用して、知識をテキストブランチに抽出する、という、モダリティを個別にトレーニングします。
データが少ない画像に対しては,画像検索ベンチマーク上で,マルチモーダル大言語モデル(MLLM)キャプションから蒸留ペアを構築する。
論文 参考訳(メタデータ) (2026-01-28T13:57:14Z) - Evaluating Multimodal Large Language Models on Vertically Written Japanese Text [18.775629936667105]
日本語テキストにおけるMLLM(Multimodal Large Language Models)の読み出し能力について検討した。
我々は,日本語テキストを画像に描画することで,合成日本語OCRデータセットを生成し,それをモデル微調整と評価の両方に利用する。
また,縦書き日本語テキストを含む実世界の文書画像から得られた評価データセットを作成する。
論文 参考訳(メタデータ) (2025-11-19T03:04:22Z) - Towards Visual Text Grounding of Multimodal Large Language Model [74.22413337117617]
本稿では,テキストリッチな画像グラウンドのベンチマークを行うための命令データセットを新たに設計した新しいタスクであるTRIGを紹介する。
具体的には,OCR-LLM-ヒューマンインタラクションパイプラインを提案し,800の注釈付き質問応答ペアをベンチマークとして作成する。
提案したベンチマークによる各種MLLMの包括的評価は,テキストリッチな画像上でのグラウンド化能力の大幅な制限を明らかにする。
論文 参考訳(メタデータ) (2025-04-07T12:01:59Z) - TextDiffuser: Diffusion Models as Text Painters [118.30923824681642]
我々は、背景に忠実な視覚的に魅力的なテキストで画像を生成することに焦点を当てたTextDiffuserを紹介した。
我々は,OCRアノテーションを用いた最初の大規模テキスト画像データセットであるMARIO-10Mに,1000万の画像テキストペアをコントリビュートする。
テキストプロンプトのみまたはテキストテンプレート画像と併用して高品質なテキスト画像を作成し,テキストによる不完全な画像の再構成を行う,テキストディフューザは柔軟かつ制御可能であることを示す。
論文 参考訳(メタデータ) (2023-05-18T10:16:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。