論文の概要: How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
- arxiv url: http://arxiv.org/abs/2606.26041v1
- Date: Wed, 24 Jun 2026 17:15:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.401378
- Title: How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
- Title(参考訳): OCR推論はどのようにロバストか? 視覚摂動下での視覚言語モデルのOCR推論ロバスト性の評価
- Authors: Yuxing Cheng, Yuan Wu, Yi Chang,
- Abstract要約: 視覚言語モデル(VLM)はOCRベースのベンチマークでは高い性能を達成しているが、制御された視覚劣化下での頑健さは十分に理解されていない。
視覚的摂動下でのOCR推論の堅牢性を評価するためのベンチマークであるOCR-Robustを紹介する。
我々は18以上の候補摂動のパイロットスタディを行い、その影響とモデル間識別性に基づいて、それぞれ3つの重度レベルに5つの代表型を選択した。
- 参考スコア(独自算出の注目度): 17.186250064889887
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) have achieved strong performance on OCR-based benchmarks and increasingly focused on text-rich understanding, but their robustness under controlled visual degradation remains insufficiently understood. This gap is critical for OCR reasoning, where visual corruption can induce OCR errors and structural distortions, thereby introducing uncertainty into the reasoning task. To systematically study this problem, we introduce OCR-Robust, a benchmark designed for evaluating OCR reasoning robustness under visual perturbations. It contains 812 samples across two complementary subsets: OCR1.0, covering documents, scene text, receipts, handwriting, and mathematical content, and OCR2.0, focusing on charts, geometry diagrams, and tables. To enable efficient yet informative evaluation, we conduct a pilot study over 18 candidate perturbations and select 5 representative types at 3 severity levels each based on their impact and cross-model discriminability. We evaluate robustness using clean accuracy, Relative Corruption Retention (RCR), Worst-Case Retention (WCR), and a composite Corruption Robustness Index (CRI), and benchmark 18 models spanning proprietary systems, open-source VLMs, and OCR+LLM pipelines. Our results show that higher clean accuracy does not necessarily imply stronger robustness, and that models can suffer pronounced degradation in the worst case on OCR tasks that are sensitive to structure, and charts and tables are substantially more fragile than document-like inputs under perturbation.
- Abstract(参考訳): 視覚言語モデル(VLM)は、OCRベースのベンチマークで強いパフォーマンスを達成し、テキストに富んだ理解に重点を置いているが、制御された視覚劣化下での頑健さは、まだ十分に理解されていない。
このギャップは、視覚的破損がOCRの誤りや構造的歪みを誘発し、したがって推論タスクに不確実性をもたらすOCR推論にとって重要である。
この問題を体系的に研究するために,視覚摂動下でのOCR推論堅牢性を評価するためのベンチマークであるOCR-Robustを導入する。
OCR1.0には、文書、シーンテキスト、レシート、手書き、数学的内容を含む812のサンプルと、チャート、幾何学図、テーブルに焦点を当てたOCR2.0が含まれている。
本研究は,18の候補摂動に対するパイロット実験を行い,その影響とモデル間識別性に基づいて,それぞれ3つの重度レベルに5つの代表型を選択した。
クリーンな精度、RCR(Relative Corruption Retention)、WCR(Worst-Case Retention)、CRI(Composite Corruption Robustness Index)を用いてロバスト性を評価し、プロプライエタリなシステム、オープンソースのVLM、OCR+LLMパイプラインにまたがるベンチマーク18モデルを評価した。
以上の結果から, 構造に敏感なOCRタスクにおいて, モデルが顕著に劣化する可能性があり, グラフやテーブルは文書的な入力よりもかなり脆弱であることが示唆された。
関連論文リスト
- When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation [2.8437065210971872]
産業検索・拡張生成(RAG)システムは、視覚文書をテキストに変換するために光学文字認識(OCR)に依存している。
既存のOCRベンチマークは、実際の条件下で下流RAGの有効性を不適切に測定する文字レベルメトリクスに依存している。
本稿では,産業用RAGシステムを対象としたOCRベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-04-29T09:42:42Z) - From Plausibility to Verifiability: Risk-Controlled Generative OCR for Vision-Language Models [13.2889725132666]
現代の視覚言語モデル(VLM)は、生成型OCRエンジンとして機能するが、オープンエンドの復号化は希少な失敗を露呈する。
我々は、生成型OCRにおける中核配置ミスアライメントを特定し、モデルに依存しない幾何リスクコントローラを提案する。
凍結したVLMバックボーンと標準OCRベンチマークの実験では、予測可能なカバレッジコストにおいて、極端なエラーリスクと破滅的なオーバージェネレーションが一貫した減少を示す。
論文 参考訳(メタデータ) (2026-03-20T09:28:09Z) - Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding [54.05243949024302]
既存の堅牢なMLLMは、視覚エンコーダの一般化にのみ焦点をあてた暗黙のトレーニング/適応に依存している。
本稿では,構造的推論連鎖による視覚的劣化を明示的にモデル化する新しいフレームワークであるRobust-R1を提案する。
提案手法は, (i) 劣化を考慮した推論基盤の微調整, (ii) 劣化パラメータを正確に知覚するための報酬駆動アライメント, (iii) 劣化強度に適応した動的推論深度スケーリングの2つを統合した。
論文 参考訳(メタデータ) (2025-12-19T12:56:17Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation [39.83221375597683]
Retrieval-augmented Generation (RAG)は、幻覚を抑えるために外部知識を統合することで、言語モデル(LLM)を強化する。
RAGの本質的な部分として、光学文字認識(OCR)を用いて構造化されていないPDF文書から構造化されたデータを抽出して外部知識ベースを構築することが一般的である。
本稿では,RAGシステムにおけるOCRのカスケード効果を理解するための最初のベンチマークであるOHRBenchを紹介する。
論文 参考訳(メタデータ) (2024-12-03T17:23:47Z) - Cross-modal Active Complementary Learning with Self-refining
Correspondence [54.61307946222386]
既存手法のロバスト性を改善するために,クロスモーダルなロバスト補完学習フレームワーク(CRCL)を提案する。
ACLは、誤った監視を行うリスクを減らすために、アクティブで補完的な学習損失を利用する。
SCCは、モーメント補正を備えた複数の自己精製プロセスを使用して、対応を補正するために受容場を拡大する。
論文 参考訳(メタデータ) (2023-10-26T15:15:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。