論文の概要: ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.20122v1
- Date: Thu, 20 Aug 2026 14:52:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.614466
- Title: ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
- Title(参考訳): ArmorOCR:観察透過型自己蒸留による対側視知覚
- Authors: Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun,
- Abstract要約: 我々は,テキストbfgrounded OCR知覚タスクとして対向性OCRを定式化し,対向性OCR評価のための最初のベンチマークである textbfAdvSpot を導入する。
ArmorOCRは、強力な敵OCR知覚のための2段階のトレーニングフレームワークである。
我々のAdvSpot、その他の逆OCRベンチマーク、および一般的なOCRベンチマークの実験は、ArmorOCRが常に逆OCR知覚を改善することを示した。
- 参考スコア(独自算出の注目度): 29.744176697656147
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large multimodal models (LMMs) have demonstrated strong OCR recognition capabilities, yet remain vulnerable to adversarial visual text that is readable to humans but challenging for models to localize and recognize. Existing OCR benchmarks mainly focus on natural or document-style text, while adversarial OCR evaluations remain limited in scale, task coverage, or region-aware evaluation. In this paper, we formulate adversarial OCR as a \textbf{grounded OCR perception} task and introduce \textbf{AdvSpot}, the first benchmark for grounded adversarial OCR evaluation. AdvSpot comprises 390 images with region-level annotations, spanning 5 primary categories and 13 fine-grained adversarial OCR types. To address this challenge, we propose \textbf{ArmorOCR}, a two-stage training framework for robust adversarial OCR perception. ArmorOCR first acquires missing adversarial OCR perception from privileged transformed observations through On-Policy Self-Distillation (OPSD), and then refines grounded OCR perception through Group Relative Policy Optimization (GRPO) with task-conditioned rewards for localization, recognition, full spotting, and visual question answering (VQA). Experiments on our AdvSpot, other adversarial OCR benchmarks, and general OCR benchmarks demonstrate that ArmorOCR consistently improves adversarial OCR perception while preserving competitive general OCR capability.
- Abstract(参考訳): 大規模マルチモーダルモデル(LMM)は強力なOCR認識能力を示してきたが、人間にとって読みやすいが、モデルのローカライズと認識に挑戦する敵対的な視覚テキストには弱いままである。
既存のOCRベンチマークは、主に自然言語や文書スタイルのテキストに重点を置いているが、敵OCR評価は、スケール、タスクカバレッジ、地域対応評価に限られている。
本稿では, 対向OCR を \textbf{grounded OCR perception} タスクとして定式化し, 対向OCR 評価のための最初のベンチマークである \textbf{AdvSpot} を導入する。
AdvSpotは、リージョンレベルのアノテーションを備えた390のイメージで構成されており、5つのプライマリカテゴリと13のきめ細かいOCRタイプにまたがっている。
この課題に対処するために,頑健な対人OCR知覚のための2段階のトレーニングフレームワークである‘textbf{ArmorOCR} を提案する。
ArmorOCRはまず、On-Policy Self-Distillation (OPSD) を通じて、特権化された変換された観察から、敵対的なOCR知覚を入手し、その後、グループ相対ポリシー最適化 (GRPO) を通じて、ローカライゼーション、認識、完全スポッティング、視覚的質問応答 (VQA) のためのタスク条件付報酬によって、基礎となるOCR知覚を洗練する。
我々のAdvSpot、その他の逆OCRベンチマーク、および一般OCRベンチマークの実験は、ArmorOCRが競合する一般OCR能力を保ちながら、常に敵OCRの知覚を改善することを示した。
関連論文リスト
- Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance [62.560024755525546]
Cross-Resolution Semantic Transfer (CRST)はCLIPスタイルの3つのモジュールを持つフレームワークである。
実験により、CRSTは高解像度の精度を犠牲にすることなく混合分解能検索を安定化させながら、平均5.7%と5.3%で超低解像度のランク1とmAPを改善することが示された。
論文 参考訳(メタデータ) (2026-06-29T15:24:03Z) - How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations [17.186250064889887]
視覚言語モデル(VLM)はOCRベースのベンチマークでは高い性能を達成しているが、制御された視覚劣化下での頑健さは十分に理解されていない。
視覚的摂動下でのOCR推論の堅牢性を評価するためのベンチマークであるOCR-Robustを紹介する。
我々は18以上の候補摂動のパイロットスタディを行い、その影響とモデル間識別性に基づいて、それぞれ3つの重度レベルに5つの代表型を選択した。
論文 参考訳(メタデータ) (2026-06-24T17:15:42Z) - When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation [2.8437065210971872]
産業検索・拡張生成(RAG)システムは、視覚文書をテキストに変換するために光学文字認識(OCR)に依存している。
既存のOCRベンチマークは、実際の条件下で下流RAGの有効性を不適切に測定する文字レベルメトリクスに依存している。
本稿では,産業用RAGシステムを対象としたOCRベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-04-29T09:42:42Z) - Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues? [73.35232225256968]
Reasoning-OCRは、リッチビジュアルテキストから抽出できるキューに基づいて複雑な推論問題を解決するためにLMMに挑戦する。
我々の評価は、異なる理由付けの課題において、プロプライエタリでオープンソースのLMMにいくつかの洞察を与えます。
論文 参考訳(メタデータ) (2025-05-19T06:45:18Z) - Lost in OCR Translation? Vision-Based Approaches to Robust Document Retrieval [38.569818461453394]
Retrieval-Augmented Generation (RAG)は、外部文書の応答をグラウンド化するための技術である。
従来のRAGシステムは、スキャンされた文書をテキストに最初に処理するために光学文字認識(OCR)に依存していた。
ColPaliのような近年の視覚言語アプローチでは、ドキュメントの直接的な視覚的埋め込みを提案しており、OCRの必要性を排除している。
論文 参考訳(メタデータ) (2025-05-08T21:54:02Z) - Ocean-OCR: Towards General OCR Application via a Vision-Language Model [6.70908296002235]
textbfOcean-OCRは3B MLLMで、様々なOCRシナリオにおける最先端性能と、一般的なタスクにおける同等の理解能力を持つ。
我々は、オープンソースのOCRベンチマークや様々なOCRシナリオにおける包括的な実験を通じて、Ocean-OCRの優位性を実証する。
論文 参考訳(メタデータ) (2025-01-26T15:20:39Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - Adversarial Training with OCR Modality Perturbation for Scene-Text Visual Question Answering [8.382903851560595]
Scene-Text Visual Question Answering (ST-VQA) は、画像中のシーンテキストを理解し、テキストコンテンツに関連する質問に答えることを目的としている。
既存の手法の多くは光学文字認識(OCR)システムの精度に大きく依存している。
本研究では,空間認識機能を備えたマルチモーダル対向学習アーキテクチャを提案する。
論文 参考訳(メタデータ) (2024-03-14T11:22:06Z) - User-Centric Evaluation of OCR Systems for Kwak'wala [92.73847703011353]
OCRを利用すると、文化的に価値ある文書の書き起こしに費やした時間を50%以上削減できることを示す。
この結果から,OCRツールが下流言語ドキュメントや再生作業において持つ潜在的なメリットが示された。
論文 参考訳(メタデータ) (2023-02-26T21:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。