論文の概要: ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents
- arxiv url: http://arxiv.org/abs/2607.08143v1
- Date: Thu, 09 Jul 2026 06:26:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.425277
- Title: ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents
- Title(参考訳): ICDAR 2026 LLM-Assisted OCR Post-Correction for Historical Documents(英語)
- Abstract要約: LLM 支援 OCR における ICDAR コンペである HIPE-OCRepair-2026 の結果を報告する。
4つのチームがゼロショットのプロンプトから、事前訓練と微調整の継続まで、システムを提出した。
その結果,現代のLCM支援システムはOCRの品質を著しく向上させることができるが,性能はデータセット,言語,騒音レベルによって異なることがわかった。
- 参考スコア(独自算出の注目度): 8.746127489275747
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present the results of HIPE-OCRepair-2026, an ICDAR competition on LLM-assisted OCR post-correction of historical documents. OCR post-correction remains a long-standing challenge in digital heritage: large-scale collections of digitized documents are affected by legacy OCR errors, while re-digitization at scale remains impractical. Large language models (LLMs) offers a major opportunity to revisit this challenge, yet their effectiveness across languages, document types, and noise conditions - and their tendency to hallucinate - remains insufficiently understood. HIPE-OCRepair-2026 pursues two objectives: (i) to evaluate the capabilities of modern OCR post-correction systems, and (ii) to provide a reproducible evaluation framework anchored in the HIPE-OCRepair-2026 dataset, a harmonized multilingual resource consolidating existing and newly curated historical datasets. Participants were tasked with correcting noisy OCR transcripts from historical newspapers and printed works in English, French, and German (17th-20th century), working at the level of coherent transcription units (paragraphs or articles) without access to source images. The evaluation adopts a retrieval-oriented rather than diplomatic scoring approach, reflecting the practical use case of search and access over digitized collections. Four teams submitted systems ranging from zero-shot prompting to continued pre-training and fine-tuning, offering insights into the merits of different adaptation strategies. Results show that modern LLM-assisted systems can significantly improve OCR quality, but performance varies across datasets, languages, and noise levels. Over-correction on low-noise inputs emerges as a recurring challenge, highlighting the importance of evaluation beyond character error reduction. The dataset, scorer, and evaluation pipeline are publicly released to support future research.
- Abstract(参考訳): LLM 支援 OCR における ICDAR コンペである HIPE-OCRepair-2026 の結果を報告する。
デジタル化されたドキュメントの大規模なコレクションはレガシーなOCRエラーの影響を受け、大規模な再デジタル化は実用的ではない。
大規模言語モデル(LLM)は、この課題を再考する大きな機会を提供するが、言語、文書タイプ、騒音条件 – および幻覚の傾向 – での有効性は、まだ十分に理解されていない。
HIPE-OCRepair-2026は2つの目標を追求する。
一 現代のOCRポスト補正システムの能力を評価すること、及び
二 HIPE-OCRepair-2026データセットに固定された再現可能な評価フレームワークを提供すること。
参加者は歴史的新聞や英語、フランス語、ドイツ語の印刷物からノイズの多いOCRの写本を訂正すること(17世紀から20世紀)が義務付けられ、ソース画像にアクセスせずにコヒーレントな転写単位(パラグラフや記事)のレベルで働くようになった。
評価は外交的なスコアリングではなく、検索指向のアプローチを採用し、デジタルコレクションよりも検索とアクセスの実践的なユースケースを反映している。
4つのチームがゼロショットのプロンプトから、事前訓練と微調整の継続まで、さまざまな適応戦略のメリットに関する洞察を提供するシステムを提案しました。
その結果,現代のLCM支援システムはOCRの品質を著しく向上させることができるが,性能はデータセット,言語,騒音レベルによって異なることがわかった。
低雑音入力に対する過度な補正は繰り返し挑戦として現れ、文字誤りの低減を超えて評価の重要性を強調している。
データセット、スコア、評価パイプラインは、将来の研究をサポートするために公開されている。
関連論文リスト
- TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents [6.6457932580691015]
VLM(Vision-Language Models)は、従来のOCRシステムに代わる強力な代替手段として登場した。
本研究では,従来のOCRシステムとVLMに基づくアプローチをBerruttiデータセット上でベンチマークする。
論文 参考訳(メタデータ) (2026-07-27T07:19:00Z) - Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation [51.55755193937205]
提案するQREAMは,検索した文書を事実を保存しながら質問指向のスタイルで整列するスタイル制御リライタである。
本フレームワークは,(1) 反復的書き換え探索にスタイリスティックシードを用いたQREAM-ICL,(2) ICL出力から抽出した軽量学生モデルQREAM-FTの2段階からなる。
論文 参考訳(メタデータ) (2026-04-19T08:39:21Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data [26.34532500908141]
我々は,OCRによる雑音が多言語QAシステムの性能に与える影響を包括的に分析する。
この分析を支援するために,多言語QAデータセットであるMultiOCR-QAを導入する。
データセットは、OCRの異なるレベルと種類のOCRノイズを含む、OCRが編集した歴史文書からキュレートされる。
次に、3つの主要なOCRエラータイプに着目し、異なるエラー条件下で、異なる最先端の大規模言語モデル(LLM)がどのように機能するかを評価する。
論文 参考訳(メタデータ) (2025-02-24T02:16:37Z) - OCR Error Post-Correction with LLMs in Historical Documents: No Free Lunches [10.979024723705173]
本研究は,英語およびフィンランド語データセットのOCR誤り訂正にオープンウェイトLLMを用いたことを評価する。
その結果,現代のLLMでは英語の文字誤り率(CER)の低減が期待できるが,フィンランド語では実用上有用な性能は得られなかった。
論文 参考訳(メタデータ) (2025-02-03T09:55:31Z) - Reference-Based Post-OCR Processing with LLM for Precise Diacritic Text in Historical Document Recognition [1.6941039309214678]
コンテンツ中心の電子書籍を参照ベースとして活用し、不完全なOCR生成テキストを訂正する手法を提案する。
この技術は、ダイアクリティカル言語のための高精度な擬似ページ・ツー・ページラベルを生成する。
パイプラインは、古いドキュメントから様々な種類のノイズを排除し、欠落した文字、単語、乱れたシーケンスといった問題に対処する。
論文 参考訳(メタデータ) (2024-10-17T08:05:02Z) - Enhancing Legal Case Retrieval via Scaling High-quality Synthetic Query-Candidate Pairs [67.54302101989542]
判例検索は、ある事実記述の参照として類似した事例を提供することを目的としている。
既存の作業は主に、長いクエリを使ったケース・ツー・ケースの検索に重点を置いている。
データスケールは、既存のデータハングリーニューラルネットワークのトレーニング要件を満たすには不十分である。
論文 参考訳(メタデータ) (2024-10-09T06:26:39Z) - CLOCR-C: Context Leveraging OCR Correction with Pre-trained Language Models [0.0]
本稿では、コンテキストレバレッジOCR補正(CLOCR-C)を紹介する。
トランスフォーマーベースの言語モデル(LM)の組み込みとコンテキスト適応能力を使用して、OCRの品質を向上する。
本研究の目的は, LMがOCR後の修正を行うことができるか, 下流のNLPタスクを改善するか, 補正プロセスの一部として社会文化的文脈を提供する価値を判断することである。
論文 参考訳(メタデータ) (2024-08-30T17:26:05Z) - Benchmarking Large Language Models in Retrieval-Augmented Generation [53.504471079548]
大規模言語モデルに対する検索拡張生成の影響を系統的に検討する。
我々は、RAGに必要な4つの基本能力で、異なる大規模言語モデルの性能を解析する。
RGB(Retrieval-Augmented Generation Benchmark)は、英語と中国語の両方でRAG評価を行うための新しいコーパスである。
論文 参考訳(メタデータ) (2023-09-04T08:28:44Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。