論文の概要: NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- arxiv url: http://arxiv.org/abs/2608.12898v2
- Date: Tue, 18 Aug 2026 06:14:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.821531
- Title: NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- Title(参考訳): NaviDC-OCR: デジタルおよびカメラでキャプチャされた文書を解析するドキュメントのナビゲート
- Abstract要約: 文書解析のための統一フレームワークであるNaviDC-OCRを提案する。
NaviDC-OCRは、幾何学的知覚をVLMに組み込む変形認識学習を導入している。
さまざまな文書解析ベンチマークで最先端のパフォーマンスを実現する。
- 参考スコア(独自算出の注目度): 18.60763757268658
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Document parsing aims to transform unstructured documents into structured and machine-readable representations. Recent advances in Vision-Language Models (VLMs) have significantly advanced document parsing. However, existing approaches still face two major challenges. First, decoupled VLM-based methods heavily rely on accurate layout analysis, where geometric distortions in camera-captured documents can introduce cascading errors. Second, although end-to-end VLM-based methods alleviate the dependence on explicit layout detection, they often suffer from redundant generation, hallucinations, and insufficient structural reasoning in high-resolution scenarios. To address these challenges, we propose NaviDC-OCR, a unified framework for document parsing. NaviDC-OCR introduces deformation-aware learning to incorporate geometric perception into VLMs and proposes an adaptive sampling mechanism for complex layout representation. Furthermore, a content-structure decoupled learning strategy is developed to explicitly model formula grammars and table structures, enabling more effective structured representation learning. Extensive experiments demonstrate that NaviDC-OCR achieves state-of-the-art performance across diverse document parsing benchmarks. It obtains overall scores of 96.87, 88.53 and 78.41 on OmniDocBench v1.6, Wild-OmniDocBench, and PureDocBench, respectively, and ranks first in the ICDAR 2026 Sci-ImageMiner Challenge. These results validate the effectiveness and generalization capability of NaviDC-OCR in complex document parsing scenarios.
- Abstract(参考訳): 文書解析は、構造化されていない文書を構造化され機械可読な表現に変換することを目的としている。
近年のVLM(Vision-Language Models)の進歩は文書解析に大きく進歩している。
しかし、既存のアプローチは依然として2つの大きな課題に直面している。
第一に、分離されたVLMベースの手法は正確なレイアウト解析に大きく依存しており、カメラキャプチャード文書の幾何学的歪みはカスケードエラーをもたらす可能性がある。
第二に、エンドツーエンドのVLMベースの手法は明示的なレイアウト検出への依存を緩和するが、高解像度シナリオでは冗長な生成、幻覚、構造的推論に悩まされることが多い。
これらの課題に対処するため,文書解析のための統一フレームワークであるNaviDC-OCRを提案する。
NaviDC-OCRは、幾何学的知覚をVLMに組み込む変形認識学習を導入し、複雑なレイアウト表現のための適応サンプリング機構を提案する。
さらに、式文法と表構造を明示的にモデル化し、より効果的な構造化表現学習を可能にするコンテンツ構造分離学習戦略を開発した。
大規模な実験により、NaviDC-OCRは様々な文書解析ベンチマークで最先端のパフォーマンスを達成した。
OmniDocBench v1.6、Wild-OmniDocBench、PureDocBenchの合計スコアは96.87、88.53、78.41で、ICDAR 2026 Sci- ImageMiner Challengeで1位となった。
これらの結果は、複雑な文書解析シナリオにおけるNaviDC-OCRの有効性と一般化能力を検証する。
関連論文リスト
- RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild [14.715243408844058]
文書レイアウト解析のための高効率なエンドツーエンドフレームワークRT-Docを提案する。
提案モデルは,レイアウト要素の分類,画素レベルのセグメンテーション,幾何学的順序順予測を統一する。
RT-Docは、フルドキュメントの再構築品質を大幅に改善し、現実世界の文書インテリジェンスシステムのスケーラブルで実用的な基盤を提供する。
論文 参考訳(メタデータ) (2026-06-22T13:48:39Z) - DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth [24.056193540937144]
我々は,多種多様なOCRエンジンと最先端MLLMを用いて,テキスト認識性能の体系的評価を行う。
多くのOCRエンジンのコンテキスト推論機能に制限があり,手動アノテーションのコストが高いことから,DocOCR-Evalを提案する。
論文 参考訳(メタデータ) (2026-05-05T10:59:34Z) - DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding [63.257540233507626]
本稿では、構造化解析、局所化、推論のワークフローを実行するためにモデルを必要とするパラダイムを提案する。
ショートページトレーニングから超長文書への堅牢な一般化を示し、視覚的検索・拡張生成システムと自然に相乗効果を示す。
論文 参考訳(メタデータ) (2026-04-14T14:39:26Z) - Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training [23.87978106727431]
本稿では、堅牢なエンドツーエンド文書解析のためのデータ学習協調設計フレームワークを提案する。
本手法は,スキャン・デジタル・実世界の両方のシナリオにおいて,精度とロバスト性を向上する。
論文 参考訳(メタデータ) (2026-03-25T03:19:09Z) - Training-Free Acceleration for Document Parsing Vision-Language Model with Hierarchical Speculative Decoding [102.88996030431662]
本稿では,文書解析タスクの学習自由かつ高効率な高速化手法を提案する。
投機的復号化にインスパイアされた私たちは、将来のトークンのバッチを予測するために、ドラフトモデルとして軽量な文書解析パイプラインを使用します。
汎用OmniDocBenchに対するアプローチの有効性を示す。
論文 参考訳(メタデータ) (2026-02-13T14:22:10Z) - PARL: Position-Aware Relation Learning Network for Document Layout Analysis [23.497081928689525]
効果的なレイアウト解析は,テキストと視覚の融合ではなく,文書の本質的な視覚構造を深く理解することに依存する。
位置感度とリレーショナル構造を用いてレイアウトをモデル化する新しいOCRフリー・ビジョンオンリーのフレームワークを提案する。
実験により、PARL (65M) は大規模マルチモーダルモデルより約4倍少ないパラメータを用いて非常に効率的であることが示されている。
論文 参考訳(メタデータ) (2026-01-12T15:05:35Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents [99.62178668680578]
本稿では,単一の視覚変換器を用いてテキスト,画像,それらの組み合わせをモデル化する統合フレームワークであるビジョン中心コントラスト学習(VC2L)を提案する。
VC2Lは完全にピクセル空間で動作し、テキスト、ビジュアル、または組み合わせのいずれでも、すべての入力を画像として描画する。
ウェブ文書における複雑なクロスモーダル関係を捉えるため、VC2Lは連続するマルチモーダルセグメントを整列するスニペットレベルのコントラスト学習目標を採用している。
論文 参考訳(メタデータ) (2025-10-21T14:59:29Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding [53.69841526266547]
トレーニング済みのVision-Language Modelを新しいデータセットで微調整することは、ビジョンエンコーダの最適化に不足することが多い。
視覚エンコーダにクエリの埋め込みを統合する,新しい,合理化されたアーキテクチャ保存アプローチであるQIDを導入する。
論文 参考訳(メタデータ) (2025-04-03T18:47:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。