論文の概要: MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
- arxiv url: http://arxiv.org/abs/2604.04771v2
- Date: Thu, 09 Apr 2026 09:16:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 14:10:47.869014
- Title: MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
- Title(参考訳): MinerU2.5-Pro: 大規模データ中心のドキュメント解析の限界を押し上げる
- Abstract要約: 我々は、データエンジニアリングとトレーニング戦略設計を通じて、純粋に最先端の技術を進化させるMinerU2.5-Proを提案する。
コアとなるのは、カバレッジ、情報性、アノテーションの正確性を中心に設計されたData Engineだ。
我々は,MinerU2.5-Pro が OmniDocBench v1.6 上で 95.69 を達成することを示す。
- 参考スコア(独自算出の注目度): 92.09717763663873
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current document parsing methods advance primarily through model architecture innovation, while systematic engineering of training data remains underexplored. Yet state-of-the-art models spanning diverse architectures and parameter scales exhibit highly consistent failure patterns on the same set of hard samples, suggesting that the performance bottleneck stems from shared deficiencies in training data rather than from architectural differences. Building on this finding, we present MinerU2.5-Pro, which advances the state of the art purely through data engineering and training strategy design while retaining the 1.2B-parameter architecture of MinerU2.5 unchanged. At its core is a Data Engine co-designed around coverage, informativeness, and annotation accuracy: Diversity-and-Difficulty-Aware Sampling expands training data from under 10M to 65.5M samples while mitigating distribution shift; Cross-Model Consistency Verification leverages output consensus among heterogeneous models to assess sample difficulty and generate reliable annotations; the Judge-and-Refine pipeline improves annotation quality for hard samples through render-then-verify iterative correction. A three-stage progressive training strategy--large-scale pre-training, hard sample fine-tuning, and GRPO alignment--sequentially exploits these data at different quality tiers. On the evaluation front, we rectify element-matching biases in OmniDocBench v1.5 and introduce a Hard subset, establishing the more discriminative OmniDocBench v1.6 protocol. Without any architectural modification, MinerU2.5-Pro achieves 95.69 on OmniDocBench v1.6, improving over the same-architecture baseline by 2.71 points and surpassing all existing methods, including those based on models with over 200x more parameters.
- Abstract(参考訳): 現在の文書解析手法は、主にモデルアーキテクチャの革新を通じて進歩し、一方、トレーニングデータの体系的なエンジニアリングは、未解明のままである。
しかし、さまざまなアーキテクチャとパラメータスケールにまたがる最先端のモデルは、同じハードサンプルセット上で非常に一貫性のある障害パターンを示しており、パフォーマンスボトルネックは、アーキテクチャ上の違いではなく、トレーニングデータの共有欠陥に起因することを示唆している。
この発見に基づいてMinerU2.5-Proを提案する。MinerU2.5の1.2Bパラメータアーキテクチャを維持しつつ、データエンジニアリングとトレーニング戦略設計を通じて純粋に最先端の技術を進化させる。
分散シフトを緩和しながら、10M未満のサンプルから65.5Mまでトレーニングデータを拡大するDiversity-and-Difficulty-Aware Sampling; クロスモデル整合性検証は、サンプルの難易度を評価し、信頼できるアノテーションを生成するために異種モデル間の出力コンセンサスを活用する。
3段階のプログレッシブトレーニング戦略 – 大規模な事前トレーニング,ハードサンプルの微調整,GRPOアライメント – は,これらのデータをさまざまな品質レベルで順次活用する。
評価面では、OmniDocBench v1.5の要素マッチングバイアスを修正し、より差別的なOmniDocBench v1.6プロトコルを確立する。
MinerU2.5-Proはアーキテクチャの変更なしに、OmniDocBench v1.6で95.69を達成し、同じアーキテクチャのベースラインを2.71ポイント改善し、200倍以上のパラメータを持つモデルを含む既存のすべてのメソッドを上回った。
関連論文リスト
- FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry [52.232826445242644]
FoundationGeoは空間キャリブレーションと原則データ設計による相対的および計量的予測を橋渡しする。
ステージ1は DINOv3 で初期化することで高忠実なアフィン不変幾何モデルを学ぶ。
ステージ2は、メートル法推定のためのピクセルワイドキャリブレーションフィールドを導入することで、グローバルなスケーリングを越えている。
論文 参考訳(メタデータ) (2026-07-13T14:10:01Z) - SuperADD: Training-free Class-agnostic Anomaly Segmentation -- CVPR 2026 VAND 4.0 Workshop Challenge Industrial Track [13.401733929149877]
そこで本研究では,SuperADの動作に基づいた,学習不要でクラスに依存しない異常検出パイプラインを提案する。
本手法は,分散シフト下でのロバスト性向上を目的としたいくつかの改良によって一般化を改善する。
F1のセグメンテーションスコアは62.61%、57.42%、テスト用パブリック、プライベート、プライベートのMVTec AD 2で54.35%である。
論文 参考訳(メタデータ) (2026-05-14T13:22:02Z) - UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits [43.59555184340113]
マルチツールチェーンをエンド・ツー・エンドのモデルと統一された検証後のステージで置き換える軽量なデータパイプラインを導入する。
スケーラブルな品質管理のために、7Bのデュアルタスクエキスパートモデル textbfQwen-Verify をトレーニングし、効率的な故障検出と命令再カプセル化を行う。
このパイプラインは、さまざまな基本的な複雑な編集タスクにまたがる10Mスケールのデータセットである textbfUnicEdit-10M を生成する。
論文 参考訳(メタデータ) (2025-12-01T17:45:44Z) - Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation [109.13471554184554]
最適輸送(OT)距離最小化問題としてデータセット蒸留を再構成する。
OTは分布マッチングのための幾何学的に忠実なフレームワークを提供する。
提案手法は, 常に最先端の手法を効率よく上回っている。
論文 参考訳(メタデータ) (2025-11-29T04:04:05Z) - Pearl: A Foundation Model for Placing Every Atom in the Right Location [52.35027831422145]
タンパク質-リガンド共フォールディングの基礎モデルであるPearlを紹介した。
パールはタンパク質-リガンド結合における新しい最先端性能を確立している。
Pearlは、パブリックなRuns N' PosesとPoseBustersベンチマークでAlphaFold 3や他のオープンソースベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-28T17:36:51Z) - Nonparametric Data Attribution for Diffusion Models [57.820618036556084]
生成モデルのデータ属性は、個々のトレーニング例がモデル出力に与える影響を定量化する。
生成画像とトレーニング画像のパッチレベルの類似性によって影響を測定する非パラメトリック属性法を提案する。
論文 参考訳(メタデータ) (2025-10-16T03:37:16Z) - Composer: A Search Framework for Hybrid Neural Architecture Design [15.254101403488562]
計算プリミティブを異なる比率で組み合わせたハイブリッドモデルアーキテクチャは、トランスフォーマーを超える有望な性能を示している。
モジュール型ハイブリッドモデルアーキテクチャ検索フレームワークであるComposerの設計において、原則化されたアプローチを取ります。
Composer を用いて,Llama 3.2 より優れたハイブリッド LLM アーキテクチャを新たに発見する。
論文 参考訳(メタデータ) (2025-10-01T00:51:36Z) - MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing [117.58619053719251]
MinerU2.5は、例外的な計算効率を維持しつつ、最先端の認識精度を実現する文書解析モデルである。
提案手法では,局所的なコンテンツ認識からグローバルなレイアウト解析を分離する,粗大な2段階解析戦略を採用している。
論文 参考訳(メタデータ) (2025-09-26T10:45:48Z) - MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe [68.04078852416248]
MiniCPM-V 4.5は8Bパラメータモデルであり、高効率で高性能に設計されている。
本稿では,モデルアーキテクチャ,データストラテジー,トレーニング手法の3つの改良点を紹介する。
MiniCPM-V 4.5は30B以下のモデル間で最先端の性能を達成する。
論文 参考訳(メタデータ) (2025-09-16T19:41:48Z) - Automated Parsing of Engineering Drawings for Structured Information Extraction Using a Fine-tuned Document Understanding Transformer [0.352650106994433]
本稿では,構造化情報抽出のためのハイブリッドディープラーニングフレームワークを提案する。
オブジェクト指向バウンディングボックス(OBB)モデルと変換器ベースの文書解析モデル(Donut)を統合する。
提案するフレームワークは、精度を改善し、手作業の労力を削減するとともに、精度駆動型産業におけるスケーラブルなデプロイメントをサポートする。
論文 参考訳(メタデータ) (2025-05-02T18:33:21Z) - Hybrid-Segmentor: A Hybrid Approach to Automated Fine-Grained Crack Segmentation in Civil Infrastructure [52.2025114590481]
エンコーダ・デコーダをベースとした手法であるHybrid-Segmentorを導入する。
これにより、モデルは、様々な種類の形状、表面、き裂の大きさを区別する一般化能力を向上させることができる。
提案モデルは,5つの測定基準(精度0.971,精度0.804,リコール0.744,F1スコア0.770,IoUスコア0.630)で既存ベンチマークモデルより優れ,最先端の状態を達成している。
論文 参考訳(メタデータ) (2024-09-04T16:47:16Z) - Improved Techniques for Training Consistency Models [13.475711217989975]
本稿では, 蒸留なしでデータから直接一貫性モデルを学習する, 整合性トレーニングのための改良手法を提案する。
整合性学習目的のための対数正規雑音スケジュールを提案し、トレーニングの繰り返し回数毎に全離散化ステップを2倍にすることを提案する。
これらの修正により、一貫性モデルは1回のサンプリングステップでCIFAR-10で2.51と3.25のFIDスコア、ImageNetで64ドルをそれぞれ達成できる。
論文 参考訳(メタデータ) (2023-10-22T05:33:38Z) - Generative Multi-Stream Architecture For American Sign Language
Recognition [15.717424753251674]
複雑なアプリケーションのための機能豊かさの低いデータセットのトレーニングは、人間のパフォーマンスよりも最適な収束を制限します。
本稿では,非現実性を危険にさらすことなく機能収束を改善することを目的とした,新たなハードウェアの必要性を排除した生成型マルチストリームアーキテクチャを提案する。
提案手法は,従来のモデルよりも0.45%,5.53%の精度で,トレーニングから1.42%の精度で95.62%の精度を達成している。
論文 参考訳(メタデータ) (2020-03-09T21:04:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。