論文の概要: When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents
- arxiv url: http://arxiv.org/abs/2607.24077v1
- Date: Mon, 27 Jul 2026 07:19:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.343054
- Title: When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents
- Title(参考訳): 低CERが不十分な場合:歴史的ウルグアイ文書における視覚言語OCRシステムにおける幻覚の分析
- Authors: Marina Gardella, Camilo Mari{ñ}o, Diego Belzarena, Ignacio Ram{í}rez, Gregory Randall, Jean-Michel Morel,
- Abstract要約: VLM(Vision-Language Models)は、従来のOCRシステムに代わる強力な代替手段として登場した。
本研究では,従来のOCRシステムとVLMに基づくアプローチをBerruttiデータセット上でベンチマークする。
- 参考スコア(独自算出の注目度): 6.6457932580691015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optical Character Recognition (OCR) is a key component in the digitization of historical archives. Recently, Vision-Language Models (VLMs) have emerged as strong alternatives to traditional OCR systems, achieving state-of-the-art performance on standard benchmarks. However, their suitability for archival transcription remains insufficiently understood. In this work, we benchmark traditional OCR systems and VLM-based approaches on the Berrutti dataset, a challenging collection of Uruguayan dictatorship-era documents derived from microfilm scans. While VLMs consistently outperform traditional methods in terms of Character Error Rate (CER) and Word Error Rate (WER), we show that these improvements hide a more complex picture. Through a detailed qualitative analysis, we uncover systematic failure modes that are invisible to standard metrics, including orthographic normalization, spurious content generation, and semantic substitutions that preserve fluency while altering meaning. Errors affecting named entities are particularly critical, as they can introduce substantial semantic distortions with minimal impact on CER and WER. These findings reveal a critical gap between quantitative OCR performance and transcription fidelity in real-world archival settings, and highlight the need for evaluation frameworks that go beyond character-level accuracy to capture the semantic reliability of generated transcriptions.
- Abstract(参考訳): 光文字認識(OCR)は、歴史的アーカイブのデジタル化において重要な要素である。
近年、ビジョン・ランゲージ・モデル (VLM) が従来のOCRシステムに代わる強力な代替品として登場し、標準ベンチマークで最先端のパフォーマンスを実現している。
しかし、そのアーカイブ転写への適合性はまだ十分に理解されていない。
本研究では,従来のOCRシステムとVLMベースのアプローチを,マイクロフィルムスキャンから派生したウルグアイ独裁時代の文書コレクションであるBerruttiデータセット上でベンチマークする。
VLMは文字誤り率 (CER) とワード誤り率 (WER) の点で従来の手法より一貫して優れているが、これらの改善によりより複雑な画像が隠蔽されることを示す。
詳細な質的分析を通じて、正書法正規化、刺激的なコンテンツ生成、意味を変えながら流布を保った意味的な置換など、標準的な指標に見えない系統的な障害モードを明らかにする。
名前付きエンティティに影響を及ぼすエラーは特に重要であり、CERとWERに最小限の影響を伴って意味的な歪みを生じさせる可能性がある。
これらの結果から、実世界のアーカイブ設定における定量的OCR性能と転写忠実度の間に重要なギャップが見られ、生成した転写のセマンティックな信頼性を捉えるために、文字レベルの精度を超える評価フレームワークの必要性が浮き彫りになった。
関連論文リスト
- Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions [16.43811675687955]
光文字認識のための視覚言語モデル(VLM)は、可視だが視覚的にサポートされていないテキストを生成することができる。
我々は、VLMエラーが間違った場合でも流用し続け、もっともらしいギリシャの代替品を産出することを示す。
この結果は,OCR言語が低リソースの史料に依存しているという以前の証拠を延長するものである。
論文 参考訳(メタデータ) (2026-05-26T22:57:01Z) - When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation [2.8437065210971872]
産業検索・拡張生成(RAG)システムは、視覚文書をテキストに変換するために光学文字認識(OCR)に依存している。
既存のOCRベンチマークは、実際の条件下で下流RAGの有効性を不適切に測定する文字レベルメトリクスに依存している。
本稿では,産業用RAGシステムを対象としたOCRベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-04-29T09:42:42Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z) - Error Patterns in Historical OCR: A Comparative Analysis of TrOCR and a Vision-Language Model [0.07874708385247352]
18世紀の印刷テキストのOCRは、劣化した印刷品質、古式グリフ、標準化されていない正書法のために、依然として困難である。
我々は,OCRトランス (TrOCR) と汎用視覚言語モデル (Qwen) を比較した。
TrOCRは、より一貫して正書法的忠実性を維持するが、カスケードエラー伝播の傾向が強い。
論文 参考訳(メタデータ) (2026-02-16T07:17:52Z) - Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation [57.97548022208733]
キー値抽出における表面的選択が精度と安定性のシフトを引き起こすことを示す。
生成前の文脈表現を適応的に標準化する戦略であるコンテキスト正規化を導入する。
論文 参考訳(メタデータ) (2025-10-15T06:28:25Z) - Layout-Aware OCR for Black Digital Archives with Unsupervised Evaluation [0.0]
我々は,ブラック新聞アーカイブに適したレイアウト対応OCRパイプラインを提案する。
提案手法は, 合成レイアウト生成, 拡張データに基づくモデル事前学習, 最先端のYou Only Look Once(YOLO)検出器の融合と統合する。
この結果は,AIによる文書理解において,文化的なレイアウトロジックを尊重することの重要性を強調した。
論文 参考訳(メタデータ) (2025-09-16T16:43:34Z) - Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval [38.569818461453394]
Retrieval-Augmented Generation (RAG)は、外部文書の応答をグラウンド化するための技術である。
従来のRAGシステムは、スキャンされた文書をテキストに最初に処理するために光学文字認識(OCR)に依存していた。
ColPaliのような近年の視覚言語アプローチでは、ドキュメントの直接的な視覚的埋め込みを提案しており、OCRの必要性を排除している。
論文 参考訳(メタデータ) (2025-05-08T21:54:02Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - Oracle Character Recognition using Unsupervised Discriminative
Consistency Network [65.64172835624206]
オラクル文字認識(OrCR)のための新しい教師なしドメイン適応手法を提案する。
擬似ラベルを利用して意味情報を適応と制約強化の整合性に組み込む。
提案手法は,Oracle-241データセットの最先端結果を実現し,最近提案した構造・テクスチャ分離ネットワークを15.1%向上させる。
論文 参考訳(メタデータ) (2023-12-11T02:52:27Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。