論文の概要: Infinity-Parser2 Technical Report
- arxiv url: http://arxiv.org/abs/2607.07836v2
- Date: Tue, 14 Jul 2026 03:14:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.427431
- Title: Infinity-Parser2 Technical Report
- Title(参考訳): Infinity-Parser2テクニカルレポート
- Abstract要約: Infinity-2は、制御可能なデータレイテンシパイプラインとマルチタスク強化学習を組み合わせた、エンドツーエンドの文書解析のための大規模なマルチモーダルモデルである。
まず、制御可能なレンダリングフレームワークを反復的な洗練ループと組み合わせて、500万サンプルのバイリンガル(中国語/英語)コーパスであるInfinity-Doc2-5Mを構築し、オープンソースにする。
第2に,共同学習対象8種を対象に,共同強化学習を可能にする,検証可能なマルチタスク報酬システムを導入する。
第3に、Aの下で2つの変種をリリースします。
- 参考スコア(独自算出の注目度): 28.295466660564205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Infinity-Parser2, a large multimodal model that couples a controllable data-synthesis pipeline with multi-task reinforcement learning for end-to-end document parsing, addressing the persistent scarcity of faithfully annotated parsing corpora. Our contributions are threefold. First, we build a scalable synthesis engine, pairing a controllable rendering framework with an iterative refinement loop, and use it to construct and open-source Infinity-Doc2-5M: a 5-million-sample bilingual (Chinese/English) corpus spanning diverse document types, annotated with element bounding boxes, canonical content forms (Markdown, HTML, LaTeX, SMILES, structured charts), and full-page reading order. Second, we introduce a verifiable, multi-task reward system that enables Joint Reinforcement Learning across eight co-trained objectives (document parsing, layout analysis, table parsing, math formula parsing, chart parsing, chemical formula parsing, document VQA, and general multimodal understanding), unifying perception, structure, and reasoning in a single optimization signal. Third, we release two variants under a shared architecture: Infinity-Parser2-Flash, optimized for low-latency inference with a 3.68x throughput gain over Infinity-Parser-7B, and Infinity-Parser2-Pro, engineered for precision-critical settings. Infinity-Parser2-Pro reaches state-of-the-art 87.6% on olmOCR-Bench and 74.3% on ParseBench, surpassing DeepSeek-OCR-2, PaddleOCR-VL-1.5, and MinerU2.5, with strong generalization to charts, chemical formulas, and document VQA.
- Abstract(参考訳): Infinity-Parser2は、制御可能なデータ合成パイプラインとマルチタスク強化学習を組み合わせた大規模なマルチモーダルモデルであり、忠実に注釈付けされた構文解析コーパスの持続的不足に対処する。
私たちの貢献は3倍です。
まず、スケーラブルな合成エンジンを構築し、制御可能なレンダリングフレームワークを反復リファインメントループと組み合わせて、500万サンプルのバイリンガル(中国語/英語)コーパスの構築とオープンソース化に使用し、要素境界ボックス、標準コンテンツフォーム(Markdown、HTML、LaTeX、SMILES、構造化チャート)、フルページ読み込み順を記述した。
第2に,共同強化学習(文書解析,レイアウト解析,テーブル解析,数式解析,チャート解析,化学式解析,文書VQA,一般マルチモーダル理解),認識,構造,推論を1つの最適化信号で統一できる,検証可能なマルチタスク報酬システムを導入する。
Infinity-Parser2-Flashは、Infinity-Parser-7Bよりも3.68倍のスループットで低レイテンシの推論に最適化されており、Infinity-Parser2-Proは精度クリティカルな設定のために設計されています。
Infinity-Parser2-Proは、olmOCR-Benchで87.6%、ParseBenchで74.3%に達し、DeepSeek-OCR-2、PaddleOCR-VL-1.5、MinerU2.5を上回り、チャート、化学式、文書VQAに強く一般化されている。
関連論文リスト
- MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Multimodal OCR: Parse Anything from Documents [72.69545534962234]
dots.mocrは、チャート、ダイアグラム、テーブル、アイコンなどのビジュアル要素を第一級解析ターゲットとして扱う。
テキストとグラフィックの両方を構造化出力として再構築し、より忠実なドキュメント再構築を可能にする。
不均一なドキュメント要素に対するエンドツーエンドのトレーニングをサポートする。
論文 参考訳(メタデータ) (2026-03-13T14:42:21Z) - Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding [35.429403152845836]
Youtu-Parsingは、高性能コンテンツ抽出のために設計された、効率的で汎用的な文書解析モデルである。
このモデルは稀な文字、多言語テキスト、手書きコンテンツを扱う際に強い堅牢性を示す。
Youtu-ParsingはOmniDocBenchおよびolmOCR-benchベンチマーク上での最先端(SOTA)パフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-28T09:37:13Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing [46.14775667559124]
スキャンされた画像から文書を解析することは、テキストの段落、図形、公式、表などの複雑な要素が絡み合っているため、依然として重要な課題である。
既存の教師付き微調整手法は、様々なドキュメントタイプにまたがる一般化に苦慮し、特にアウト・オブ・ディストリビューションデータにおいて、パフォーマンスが低下する。
本稿では、正規化編集距離カウント精度と読み出し順序保存を統合した複合報酬によるレイアウト理解を最適化する強化学習フレームワークであるLayoutRLを紹介する。
Infinity-Benchは、幅広いドキュメントタイプ、言語、構造的複雑さに対して、常に最先端のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2025-10-17T06:26:59Z) - Zero-Shot Document Understanding using Pseudo Table of Contents-Guided Retrieval-Augmented Generation [4.875345207589195]
DocsRayは、トレーニング不要の文書理解システムである。
擬似コンテンツテーブル(TOC)生成と階層型検索拡張生成(RAG)を統合する
論文 参考訳(メタデータ) (2025-07-31T03:14:45Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing [46.14775667559124]
layoutRLは、レイアウトを明示的に認識するようにモデルをトレーニングするエンドツーエンドの強化学習フレームワークである。
堅牢なドキュメント理解の進歩を加速するために、コードとデータセットを公開します。
論文 参考訳(メタデータ) (2025-06-01T15:19:52Z) - T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation [55.16845189272573]
T2I-CompBench++は、合成テキスト・画像生成のための拡張ベンチマークである。
8000のコンポジションテキストプロンプトは、属性バインディング、オブジェクト関係、生成数、複雑なコンポジションの4つのグループに分類される。
論文 参考訳(メタデータ) (2023-07-12T17:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。